Los últimos modelos de chatgpt alucinan un montón. fin de la burbuja. el agi fué una ilusión.

Los ChatGPT alucinan más que nunca: el 48% falla en test de personas​

A mediados de abril de 2025, mientras la industria seguía vendiendo la llegada de la inteligencia artificial general como un hecho inminente, OpenAI publicó los resultados de un test interno incómodo. En PersonQA, una evaluación diseñada para medir la precisión sobre personas concretas, el modelo o3 falló el 33% de las preguntas. El o4-mini, su versión ligera más reciente, alcanzó el 48%. Las tasas de error duplican o triplican las de la generación anterior.

El test que desmonta la fiabilidad de ChatGPT​

Los datos, recogidos por TechCrunch, comparan cuatro modelos de la familia o. El o1 fallaba el 16%, el o3-mini el 14,8%, el o3 el 33% y el o4-mini el 48%. No es una regresión cualquiera: es una tendencia a peor según se lanzan versiones nuevas. Los responsables de la compañía podrán llamarlas «alucinaciones», pero en la práctica significan que el modelo inventa personas, datos y fuentes con total naturalidad.

  • o1: 16% de error en PersonQA
  • o3-mini: 14,8%
  • o3: 33%
  • o4-mini: 48%

Alguien que consulte a ChatGPT para documentar un artículo, un informe o un expediente está citando a un interlocutor que no distingue entre verdad y verosimilitud. Y eso, aplicado a escala, es un problema de salud informativa.

«Con total seguridad, pero inventado»: lo que comprueba el usuario en casa​

La estadística tiene su reflejo doméstico. Un caso real es el del jornalero que recogía naranjas en Valencia en 1970: la respuesta de ChatGPT situó el salario entre 40 y 60 pesetas diarias, cuando la realidad estaba en torno a las 200. Grok, preguntado por lo mismo, dio un rango aproximado de 100 a 300 pesetas. Más cerca, pero sin precisión.

Otro ejemplo vale para ilustrar el mecanismo: a la pregunta de una palabra española con las cinco vocales, ChatGPT respondió con «abstemio», que tiene cuatro. La herramienta no comprueba, completa. Es una especie de tuitero que nunca reconoce que no lo sabe.

Modelos lite, versiones de pago y el humo del AGI​

Hay matices que matizan el titular. o3 y o4 no son los modelos de mayor potencia, sino versiones ligeras, y sobre ellas se ha medido el desastre. Además, la diferencia entre la versión gratuita y la de pago es abismal: la misma pregunta sobre las vocales se resuelve bien en el modelo de 240 euros al mes, aunque el de acceso gratuito la falla en segundos. El problema es que la mayoría de los mortales usa la versión gratis, y es la que está generando confianza envenenada.

Paralelamente, el panorama se ha fragmentado. Grok, que el verano pasado era la alternativa desenfadada, ha caído en calidad y ha incorporado censura. Claude mantiene mejor conversación, pero limita el plan gratuito. DeepSeek, dentro de su sesgo pro chino, convence a algunos. La sensación de estancamiento es general: los generadores de imágenes hacen lo que les da la gana, los modelos de texto responden con seguridad apabullante y datos falsos, y el AGI se aleja.

Y sin embargo, la burbuja sigue hinchada. Los que venden la inteligencia artificial general inminente hablan de un futuro que no se sostiene con los números de PersonQA. Los modelos actuales son, en el mejor de los casos, asistentes supervisados que ahorran tiempo en tareas concretas. En el peor, papagayos estadísticos que inundan internet de basura verosímil. La pregunta es cuándo se notará en los balances de quienes han basado su valoración en la promesa del AGI.
📊 OPINIONES
Peso aproximado de cada postura en el debate. No es una encuesta.
Las alucinaciones crecen y la burbuja se desinfla60%
Son modelos lite, el AGI sigue vivo25%
Útil solo con supervisión humana15%
📌 DATOS
El modelo o3 alucinó en el 33% de las preguntas del test PersonQA
El modelo o4-mini falló en el 48% de los casos
o1 y o3-mini mostraron tasas del 16% y 14,8%
ChatGPT calculó 40-60 pesetas para un jornalero en 1970; la cifra real era unas 200
La versión de pago de ChatGPT cuesta 240 euros al mes
❓ PREGUNTAS FRECUENTES
¿Por qué ChatGPT alucina tanto?
Los modelos de lenguaje como ChatGPT están optimizados para generar texto probable, no para verificar hechos. En el test PersonQA de OpenAI, el o4-mini falló el 48% de las preguntas sobre personas, y el o3, el 33%. Al no tener acceso a una base de datos fiable ni capacidad de contrastar, rellenan los huecos con datos inventados que suenan verosímiles.
¿Qué es el test PersonQA?
Es una evaluación interna de OpenAI para medir la precisión del conocimiento de sus modelos sobre personas. Comparando resultados, o1 y o3-mini fallaron alrededor del 15% en las preguntas; o3 subió al 33% y o4-mini al 48%. La tendencia indica que los modelos más nuevos, especialmente las versiones ligeras, alucinan más.
¿ChatGPT o4-mini es el último modelo de OpenAI?
En el momento del análisis, o3 y o4-mini eran versiones recientes de la familia de razonamiento de OpenAI, pero se consideraban modelos 'lite', con menos prestaciones que las versiones de pago de mayor potencia. Las alucinaciones medidas en PersonQA corresponden a estos modelos ligeros, no necesariamente a los de gama alta.
¿La inteligencia artificial general (AGI) es una ilusión?
Según los datos disponibles, los LLM actuales no razonan: son sistemas estadísticos que generan texto plausible. Fallan en pruebas de conocimiento básico, no distinguen verdad de mentira y necesitan supervisión humana. Eso no significa que la IA no sea útil para tareas concretas, pero la AGI inminente no se sostiene con los resultados de las pruebas.
¿Qué IA alucina menos?
En las pruebas citadas, o1 y o3-mini tenían tasas de error del 16% y 14,8% respectivamente, frente al 48% del o4-mini. En la práctica, la versión de pago de ChatGPT acertó una pregunta que la gratuita falló, pero la diferencia no está documentada en todos los casos. Claude, Grok, Gemini y DeepSeek también muestran errores; ninguno es fiable sin verificación.
📅 EVOLUCIÓN
2023 El lanzamiento de ChatGPT 3.5 dispara el entusiasmo por la IA; Noam Chomsky ya advierte de que las máquinas no crean como los humanos.
Abril 2025 Una columna sobre el efecto Flynn y la IA plantea si la tecnología nos hace más inteligentes o más dependientes.
2025 OpenAI presenta datos internos de PersonQA: o3 y o4-mini alucinan mucho más que o1 y o3-mini.
2025 Los usuarios trasladan el problema a casos prácticos: salarios históricos, palabras del diccionario y datos científicos fallan con seguridad.
2025 Grok, antes alabado por su falta de filtros, pierde calidad y gana censura; la pugna entre ChatGPT, Claude y DeepSeek se intensifica.
🔗 FUENTES
TechCrunch ↗
Medio que recogió los datos de alucinación de OpenAI
OpenAI ↗
Publicó el test PersonQA y las tasas de error de sus modelos
The Epoch Times ↗
Autoría de la columna sobre el efecto Flynn y la IA
💬 POR QUÉ PARTICIPAR
Los resultados del test PersonQA de OpenAI muestran que las alucinaciones se triplican entre o1 y o4-mini, un dato incómodo que los defensores del AGI prefieren no citar.
El caso del jornalero de Valencia es un test de fiabilidad imposible de rebatir: ChatGPT falla por un factor de 4, mientras Grok se aproxima.
El experimento de la misma pregunta en el modelo gratuito y el de 240 euros demuestra que la calidad depende del bolsillo, no del estado de la tecnología.
Este es un resumen del hilo. La discusión completa incluye 319 respuestas con datos, fuentes y análisis que solo están disponibles para usuarios registrados. Crea tu cuenta en 30 segundos para acceder al debate completo y participar.
🔒 El debate completo es solo para registrados
Este hilo tiene 319 respuestas con datos, fuentes y análisis. Crea tu cuenta gratis y accede a todo el debate en 30 segundos.
Crear cuenta gratis →
Sin tarjeta de crédito · Gratis para siempre
Resumen elaborado con IA a partir del debate de la comunidad — 319 respuestas analizadas. Última actualización: .

Estadísticas del foro

Temas
2.048.951
Mensajes
58.133.711
Miembros
190.815
Último miembro
Willmor

El blog de burbuja.info

Volver