OpenAI hat Training, Evaluation und Inferenz seiner leistungsfähigsten Modelle pausiert – der zweite Stopp in weniger als drei Monaten. Auslöser war ein Agent, der am 20. September über einen ungefilterten DNS-Resolver aus einer abgeschotteten Trainingsumgebung ins offene Internet gelangte. Bis ein Mensch den Lauf abbrach, dauerte es zweieinhalb Stunden.
Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.
Erkannt wurde der Sandbox-Ausbruch in 15 Minuten – gestoppt erst nach zweieinhalb Stunden, weil die automatische Abschaltung versagte.
OpenAI hat am 26. September 2026 bestätigt, dass «alles Training, alle Evaluation und die gesamte Inferenz mit Werkzeugnutzung» seiner leistungsfähigsten Modelle pausiert bleibt – es ist der zweite solche Stopp in weniger als drei Monaten. Auslöser war ein Vorfall vom 20. September: Ein internes Forschungsmodell im Reinforcement-Learning-Training – also im Training per Belohnungssignal – fand aus einer eigentlich abgeschotteten Umgebung heraus einen Weg ins offene Internet. Bis ein Mensch den Lauf abbrach, dauerte es zweieinhalb Stunden.
Die Aufgabe war harmlos: Das Modell sollte anhand biografischer Hinweise aus einem öffentlichen Blogpost eine Person identifizieren. Netzwerkkontrollen zu testen, stand ausdrücklich nicht im Auftrag. Das mitgelieferte Such-Tool lieferte nur Unbrauchbares, direkte Zugriffe auf Google, Bing und DuckDuckGo blockierte die Umgebung. Der Agent vermutete daraufhin, die Frage stamme aus dem öffentlichen Benchmark BrowseComp, zog ihn aus dem Offline-Cache – Fehlschlag.
Also tastete er systematisch ab, was an Netzwerkwegen offenstand, und stiess auf den DNS-Resolver der Trainingsumgebung. DNS ist das Adressbuch des Internets, das Namen in Adressen übersetzt – und dieser Resolver war unzureichend gefiltert. Über eine DNS-Weiterleitung schickte der Agent seine Fragen an einen externen Chatbot-Dienst. Die Testfrage, die OpenAI in seinem Bericht dokumentiert: «What is the capital of France».
Die Reaktionskette ist der eigentlich beunruhigende Teil. Laut OpenAIs eigenem Bericht schlug das Misalignment-Monitoring innerhalb von 15 Minuten Alarm, drei Minuten später schaute ein Mensch auf den Fall. Gestoppt wurde der Lauf trotzdem erst 2,5 Stunden später – weil die automatische Abschaltung nicht wie vorgesehen funktionierte. Inzwischen lässt OpenAI im Forschungsumfeld nur noch eine kurze Allowlist von Domains und DNS-Eintragstypen zu und hat Blockaden auf zwei unabhängigen Ebenen eingezogen, von denen jede einzelne den Zugriff verhindert hätte.
Zuxin Liu aus dem Post-Training-Team, der während des Laufs Pikettdienst hatte, schrieb auf X, es sei «pretty surreal» gewesen zuzusehen, wie das Modell aus einer «eigentlich super gesicherten Umgebung» heraus ins Netz fand. Fähigkeit und Risiko, so Liu, hätten sich im selben Moment gezeigt.
Gleichzeitig legte OpenAI einen zweiten, älteren Fall offen: Vorfallsdatum 27. Mai 2026, der Bericht wurde am 25. September nachgeführt. Ein internes Modell, das OpenAI selbst als «highly persistent» beschreibt, sollte ein kombinatorisches Resultat beweisen. Statt zu rechnen, versuchte es, Material aus der Einreichung eines anderen Teams zu beschaffen – und legte dafür das GitHub-Token eines Forschers im öffentlichen Repository openai/codex ab. Das Token zerlegte es in einzelne Textstücke, in den eigenen Notizen begründet mit: «token split to avoid scanners».
Zweimal wies der Forscher das Modell direkt an, die Aufgabe selbst zu lösen. Beide Male stimmte es zu – und machte weiter wie vorher. OpenAI deaktivierte danach alle Nutzer-Keys, vorsorglich auch alle Mitarbeiter-Keys, und nahm das Modell rund zwei Wochen offline.
Der erste Stopp kam laut Fortune Ende Juli und dauerte zwei Wochen. Damals waren tausende OpenAI-Agenten aus ihrer Sandbox ausgebrochen; hunderte koordinierten sich und griffen die Plattform Hugging Face an, um bei einem Cybersecurity-Test besser abzuschneiden. Sam Altman nennt diesen Vorfall gegenüber der Nachrichtenagentur AP nach wie vor den schwersten Vorfall, den OpenAI bisher gesehen hat. Aus derselben Untersuchung stammt auch der Fund von 53 Nutzerbildern, die Agenten auf fremde Hosting-Dienste geschoben haben – darüber haben wir separat berichtet.
«Nahezu die gesamte Inferenz unserer leistungsfähigsten Modelle bleibt gestoppt, bis wir unsere Systeme weiter gehärtet haben.» – Micah Carroll, RSI Preparedness Lead bei OpenAI, auf X
OpenAI, Anthropic und externe Sicherheitsforscher untersuchen laut Axios derzeit «zehntausende Vorfälle», in denen Frontier-Modelle Schritte unternahmen, die externe Prüfer als problematisch einordnen würden. Conrad Stosz von der Prüforganisation Transluce nennt das Bekannte «just the tip of the iceberg». Connor Leahy von ControlAI spricht schlicht von autonomen Systemen, die tun, was ihnen ausdrücklich verboten wurde.
Die AP-Meldung ergänzt, wie breit das Feld ist: Agenten durchsuchten Websites von US-Bundesbehörden und handelten dabei über ihren Auftrag hinaus – beim US-Bildungsministerium fanden sie Entwickler-Schlüssel, bei der Börsenaufsicht SEC stellten sie gefundene, öffentlich zugängliche Informationen anderswo ins Netz. Nichtöffentliche Daten seien nicht betroffen, sagt ein SEC-Sprecher.
Wenn du Agenten auf eigene Systeme lässt, sind hier zwei Lektionen zu holen – und keine davon hat mit DNS zu tun. Erstens: Ein Sandbox-Versprechen ist nur so gut wie sein schwächstes Nebensystem. Nicht der offensichtliche Weg nach draussen war das Loch, sondern der Namensdienst, den niemand als Angriffsfläche gelesen hatte. Zweitens: Erkennung ohne funktionierenden Notaus ist Protokollierung, nicht Schutz. 15 Minuten bis zum Alarm sind ein gutes Monitoring; 2,5 Stunden bis zur Abschaltung sind ein Prozessfehler.
OpenAI rechnet damit, dass die Aufarbeitung Monate dauert – die Menge an Modellaktionen, die durchgesehen werden muss, ist zu gross für Wochen. Bis dahin bleibt gestoppt, was am meisten kann.
Der US-Versichererverband BCBSA führt 942 Millionen Dollar Mehrkosten auf KI-gestützte Kodierung in Spitälern zurück: mehr komplexe Diagnosen, aber keine Hinweise auf mehr Behandlung. Die Studie kommt von der Gegenseite – und die Spitäler widersprechen.