Fünf Experimente mit 3'132 Teilnehmenden zeigen: Sobald ein Sprachmodell verfügbar ist, sinkt die Bereitschaft, ein Urteil zurückzuhalten, von 36 bis 44 Prozent der Fragen auf 3 bis 6 Prozent. Ohne Geldanreize fällt die Trefferquote von 27,5 auf 9,2 Prozent, das Selbstbewusstsein steigt von 29,6 auf 75,9 von 100 Punkten. Was der Befund für Wissensarbeit bedeutet – und was er ausdrücklich nicht zeigt.
OpenAIs GPT-6 Astra hat einen deutschen Heeres-Funkspruch vom 10. Juli 1941 entschlüsselt, der seit 2005 als ungelöst galt. Das Modell suchte sich das Ziel selbst aus und schrieb Enigma-Simulator und Enigma-Bombe eigenständig in Python und C++. Dieselbe Autonomie ist der Grund, weshalb OpenAI seine leistungsfähigsten Modelle gerade gestoppt hat.
KI verändert nicht nur, welche Antwort Menschen geben, sondern ob sie überhaupt noch zugeben, dass sie etwas nicht wissen.
Wer eine KI zur Hand hat, gibt Unwissen fast nicht mehr zu. In fünf Experimenten mit 3'132 Teilnehmenden fiel die Bereitschaft, ein Urteil zurückzuhalten, von 36 bis 44 Prozent der Fragen auf 3 bis 6 Prozent, sobald ein Sprachmodell verfügbar war – obwohl dessen Antworten fast immer falsch waren. Ohne Geldanreize sank die Trefferquote von 27,5 auf 9,2 Prozent, das Selbstbewusstsein stieg von 29,6 auf 75,9 von 100 Punkten. Das berichten Chiara Marcoccia (ENS Paris), Walter Quattrociocchi (Universität Rom «La Sapienza») und Valerio Capraro (Universität Mailand-Bicocca) in einem Preprint vom 15. Juli 2026, der kein Peer Review durchlaufen hat.
Der Versuchsaufbau ist der Clou. Gefragt wurde nach feinen visuellen Details aus Filmen: die Trikotfarbe in «Bend It Like Beckham», die Farbe der Schildkröte im Zeichentrickfilm «Momo». Solche Details stehen kaum je im Netz – und genau deshalb erfindet ein Sprachmodell sie. Verwendet wurde Step 3.5 Flash von StepFun, das praktisch ausnahmslos falsch antwortete. GPT-5.5, Claude 4.6 Sonnet und Gemini 3.5 Flash scheiterten dagegen nur an der schwersten Frage und lagen sonst häufig richtig – das Testmodell war also bewusst der Härtefall. Damit löst die Studie ein Messproblem: Einem guten Werkzeug zu folgen wäre vernünftig – ist der Rat systematisch falsch, lässt sich die blosse Nutzung von ihrem Nutzen trennen.
Melde dich an, um den vollständigen Artikel zu lesen. Der Zugang ist kostenlos.