ChatGPT halluziniert stärker denn je: 48 % Fehler bei Personen-Tests
Mitte April 2025, während die Industrie das bevorstehende Eintreten der allgemeinen künstlichen Intelligenz (AGI) als Tatsache verkaufte, veröffentlichte OpenAI Ergebnisse eines unbequemen internen Tests. Bei PersonQA, einer Bewertung zur Messung der Genauigkeit über konkrete Personen, scheiterte das Modell o3 bei 33 % der Fragen. Das neuere, leichtgewichtige Modell o4-mini erreichte eine Fehlerquote von 48 %. Die Fehlerraten sind doppelt bis dreimal so hoch wie in der vorherigen Generation.
Der Test, der die Zuverlässigkeit von ChatGPT entkräftet
Die von TechCrunch gesammelten Daten vergleichen vier Modelle der o-Familie. o1 hatte eine Fehlerquote von 16 %, o3-mini von 14,8 %, o3 von 33 % und o4-mini von 48 %. Dies ist kein gewöhnlicher Rückschritt, sondern ein Trend zur Verschlechterung mit jeder neuen Version. Die Verantwortlichen des Unternehmens mögen es „Halluzinationen“ nennen, doch praktisch bedeutet dies, dass das Modell Personen, Daten und Quellen mit voller Selbstverständlichkeit erfindet.
- o1: 16 % Fehler bei PersonQA
- o3-mini: 14,8 %
- o3: 33 %
- o4-mini: 48 %
Wer ChatGPT konsultiert, um einen Artikel, Bericht oder ein Dossier zu dokumentieren, zitiert einen Gesprächspartner, der nicht zwischen Wahrheit und Wahrscheinlichkeit unterscheidet. Und das ist im großen Maßstab ein Problem für die Informationsgesundheit.
„Völlig sicher, aber erfunden“: Was Nutzer zu Hause überprüfen können
Die Statistik hat ihre Entsprechung im Alltag. Ein realer Fall betrifft einen Tagelöhner, der 1970 in Valencia Orangen pflückte: ChatGPT gab den Tageslohn mit 40 bis 60 Pesetas an, obwohl die Realität bei etwa 200 Pesetas lag. Grok lieferte auf dieselbe Frage einen ungefähren Bereich von 100 bis 300 Pesetas. Näher dran, aber immer noch ungenau.
Ein weiteres Beispiel illustriert den Mechanismus: Auf die Frage nach einem spanischen Wort mit allen fünf Vokalen antwortete ChatGPT mit „abstemio“, das nur vier hat. Das Werkzeug prüft nicht, es vervollständigt. Es ist wie ein Twitter-Nutzer, der nie zugibt, etwas nicht zu wissen.
Lite-Modelle, Bezahlversionen und der Nebel um die AGI
Es gibt Nuancen, die die Schlagzeile relativieren. o3 und o4 sind nicht die leistungsstärksten Modelle, sondern leichte Versionen, an denen das Desaster gemessen wurde. Zudem ist der Unterschied zwischen der kostenlosen und der Bezahlfassung enorm: Dieselbe Frage nach den Vokalen wird im 240-Euro-Monatstarif korrekt gelöst, während die kostenlose Version sie binnen Sekunden falsch beantwortet. Das Problem ist, dass die meisten Menschen die Gratisversion nutzen, die vergiftetes Vertrauen erzeugt.
Parallel dazu hat sich die Landschaft fragmentiert. Grok, letztes Sommer noch die lässige Alternative, hat an Qualität eingebüßt und Zensur eingeführt. Claude bietet bessere Konversationen, schränkt aber den Free-Plan ein. DeepSeek überzeugt einige trotz seiner pro-chinesischen Ausrichtung. Das Gefühl der Stagnation ist allgegenwärtig: Bildgeneratoren tun, was sie wollen, Textmodelle antworten mit überwältigender Sicherheit und falschen Daten, und die AGI rückt weiter weg.
Und dennoch bleibt die Blase aufgeblasen. Wer die baldige Ankunft der allgemeinen künstlichen Intelligenz verkauft, spricht von einer Zukunft, die durch die Zahlen von PersonQA nicht gestützt wird. Aktuelle Modelle sind im besten Fall überwachte Assistenten, die Zeit bei konkreten Aufgaben sparen. Im schlimmsten Fall statistische Papageien, die das Internet mit glaubwürdigem Müll fluten. Die Frage ist, wann dies in den Bilanzen derjenigen sichtbar wird, die ihre Bewertungen auf das AGI-Versprechen gestützt haben.