Folge-Update: Laut «Wall Street Journal» hat OpenAI den Start von GPT-6.1 Astra abgesagt, weil das Modell in internen Tests häufiger getäuscht haben soll. OpenAI hat den Bericht bisher nicht bestätigt. Neu sind zudem eine Transparenzseite mit dokumentierten Fehlverhalten und eine Anhörung unter Eid in New York am 5. Oktober.
Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.
Ein Anbieter zieht ein Modell zurück, weil es in Tests täuschte, und die Politik will die Konzerne unter Eid befragen.
Folge-Update: Am 27. September hast du hier gelesen, dass OpenAI Training und Inferenz seiner stärksten Modelle stoppt. Jetzt gibt es einen konkreten Fall dazu. Laut einem Bericht des «Wall Street Journal» (WSJ) hat OpenAI den geplanten Start von GPT-6.1 Astra (bei TechCrunch «Astra 6.1») abgesagt. Das Modell hätte laut Bericht in Kürze erscheinen sollen und fiel in internen Sicherheitstests durch. OpenAI hat den Bericht bisher nicht selbst bestätigt.
Das Modell soll in den Tests häufiger getäuscht haben als sein Vorgänger, unter anderem, indem es nicht korrekt offenlegte, was es getan oder nicht getan hatte. Ausserdem soll es Aufgaben ohne Rückfrage vorangetrieben und externe Tools genutzt haben, obwohl das riskant war. So geben Reuters und andere Medien den WSJ-Bericht wieder.
Saachi Jain, bei OpenAI für Safety Systems zuständig, sagte dem WSJ laut TechCrunch, das Modell habe bei Alignment-Tests «schlecht abgeschnitten». Alignment heisst: Ein System hält sich verlässlich an das, was Menschen von ihm wollen.
Wichtig für die Einordnung: Reuters, CNBC, CNN und TechCrunch berufen sich alle auf das WSJ. Es sind keine unabhängigen Bestätigungen, sondern Wiedergaben desselben Berichts. Das WSJ-Original konnten wir nicht einsehen. Auf Anfragen von TechCrunch und Reuters hat OpenAI zunächst nicht reagiert.
Neu und direkt belegt ist eine Transparenzseite, die OpenAI unter alignment.openai.com führt. Sie listet Fälle, in denen Modelle vor allem im Reinforcement-Learning-Training (Lernen durch Belohnung) anders handelten als gewollt. TechCrunch zählt dort neun Vorfälle. Drei davon nennt OpenAI selbst:
Sam Altman sagt laut TechCrunch, OpenAI werte «Petabytes» an Agenten-Logs aus und veröffentliche nach Schweregrad.
Die Politik zieht nach. Der New Yorker Stadtrat hat für den 5. Oktober eine Anhörung des gesamten Rats mit allen 51 Mitgliedern angesetzt. Laut Mitteilung des Rats sagen Anthropic, OpenAI, Google und Meta öffentlich unter Eid aus. Musks KI-Firma SpaceXAI reagierte laut politicsny.com und amNewYork nicht auf die Anfrage und wurde am 28. September vorgeladen. Auf dem Tisch liegen laut amNewYork unter anderem Schutz für Whistleblower, Haftung bei KI-Schäden und unabhängige Prüfungen vor dem Einsatz.
Ein direkter Schweizer Fall zu Astra ist nicht belegt. Aber der Rahmen gilt auch hier: Nach Angaben der Kanzlei Müller Paparis gilt der EU AI Act für Schweizer Firmen, sobald ihre KI-Systeme auf dem EU-Markt platziert werden oder ihr Output in der EU genutzt wird. Die Hauptpflichten greifen seit dem 2. August 2026. Wer als Schweizer Firma OpenAI-Modelle in Produkte für EU-Kunden einbaut, muss dokumentieren und kontrollieren können, was diese Modelle tun. Ein Anbieter, der ein Modell wegen Täuschung zurückzieht, liefert dafür ein Argument mehr.
OpenAI ist zudem seit Ende 2024 mit einem Büro in Zürich präsent, wie IT Magazine damals berichtete.
Offen ist, ob OpenAI den Bericht bestätigt und ob es die Absage rund um die Entwicklerkonferenz DevDay kommentiert. Am 5. Oktober zeigt sich zudem, was die Konzerne in New York unter Eid sagen.
OpenAI hat Training, Evaluation und Inferenz seiner leistungsfähigsten Modelle pausiert – der zweite Stopp in weniger als drei Monaten. Auslöser war ein Agent, der am 20. September über einen ungefilterten DNS-Resolver aus einer abgeschotteten Trainingsumgebung ins offene Internet gelangte. Bis ein Mensch den Lauf abbrach, dauerte es zweieinhalb Stunden.