La IA quiere sustituir trabajadores, pero todavía fracasa en el 85% de los trabajos reales

La IA quiere sustituir trabajadores, pero todavía fracasa en el 85% de los trabajos reales
RESUMEN

La inteligencia artificial, a pesar de sus avances, todavía fracasa en la gran mayoría de trabajos reales. Los modelos más avanzados solo logran completar satisfactoriamente menos del 16% de las tareas evaluadas en entornos profesionales.

La brecha entre la demostración y la realidad

Cada cierto tiempo, asistimos al lanzamiento de nuevos modelos de inteligencia artificial que prometen revolucionar profesiones como la programación, el diseño o la arquitectura. Sin embargo, cuando se pasa de las demostraciones controladas por empresas como OpenAI o Google a la aplicación en encargos profesionales reales, la realidad dista mucho de la ficción. El Remote Labor Index (RLI), una iniciativa del Center for AI Safety (CAIS) junto a Scale Labs, ha puesto de manifiesto esta brecha.

El estudio no se basa en preguntas de examen o problemas matemáticos, sino en tareas concretas de diseño 3D, CAD, arquitectura, diseño gráfico, animación, audio, análisis de datos y desarrollo web. Evaluadores humanos comparan los resultados de la IA con trabajos entregados por profesionales. Los datos son contundentes: incluso el mejor modelo evaluado, Fable 5, solo consiguió completar satisfactoriamente el 15,8% de los trabajos. Otros modelos como Opus 4.8 alcanzaron un 8,3%, y GPT-5.5 se quedó en un 6,3%. Esto significa que, en más del 84% de los encargos, la IA actual fracasa.

El progreso es innegable, pero la calidad profesional aún lejos

Que estos modelos fallen en la mayoría de las tareas no significa que no estén avanzando. De hecho, el progreso es notable. Cuando el Remote Labor Index se lanzó inicialmente, el mejor sistema apenas automatizaba el 2,5% de los trabajos. Pasar al 15,8% en menos de un año demuestra la velocidad a la que evolucionan.

El problema reside en que generar algo que parezca correcto no es lo mismo que entregar un trabajo de calidad profesional. En un ejemplo, Fable 5 debía recrear un anillo de compromiso en CAD. Aunque el resultado mejoró respecto a modelos anteriores, los investigadores lo calificaron de poco profesional. GPT-5.5, en una tarea de arquitectura, generó planos y renders de un baño que parecían convincentes. Sin embargo, al examinar el proyecto 3D, se descubrió geometría defectuosa y la imagen del render no se correspondía con el modelo 3D entregado.

La supervisión humana, clave por ahora

La lectura más interesante de estos resultados es que, si bien la IA puede ahorrar tiempo y completar ciertas tareas, todavía existe una gran distancia entre generar una apariencia profesional y entregar un producto que realmente lo sea. La capacidad de la IA para producir resultados visualmente atractivos puede ser engañosa, como se vio en el caso del baño, donde la imagen final no reflejaba la calidad del modelo subyacente.

Por ahora, ese último vistazo y retoque humano sigue siendo indispensable para garantizar la calidad y la viabilidad de los proyectos. La IA avanza a pasos agigantados, pero la sutileza, la precisión y la comprensión profunda de los requisitos profesionales aún son dominios donde el ser humano mantiene su valor.

Datos clave
  • La IA fracasa en más del 85% de los trabajos reales evaluados.
  • El modelo Fable 5 completó satisfactoriamente el 15,8% de las tareas.
  • El Remote Labor Index evaluó tareas de diseño, arquitectura y desarrollo.
  • El progreso ha pasado del 2,5% al 15,8% de trabajos completados en menos de un año.
Resumen generado con inteligencia artificial a partir del primer mensaje del tema.
🔒 El debate completo es solo para registrados
Este tema tiene 1 respuestas con datos, fuentes y análisis. Crea tu cuenta gratis y accede a todo el debate en 30 segundos.
Crear cuenta gratis →
Sin tarjeta de crédito · Gratis para siempre

Estadísticas del foro

Temas
2.049.846
Mensajes
58.160.385
Miembros
190.840
Último miembro
pprroobbaannddoo

El blog de burbuja.info

Volver