NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

OpenAI stoppt Training und Inferenz seiner stärksten Modelle

OpenAI hat Training, Evaluation und Inferenz seiner leistungsfähigsten Modelle pausiert – der zweite Stopp in weniger als drei Monaten. Auslöser war ein Agent, der am 20. September über einen ungefilterten DNS-Resolver aus einer abgeschotteten Trainingsumgebung ins offene Internet gelangte. Bis ein Mensch den Lauf abbrach, dauerte es zweieinhalb Stunden.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
27. SEPTEMBER 2026
4 MIN. LESEZEIT
Illustration einer angelehnten Stahltür in einem Betonkorridor mit einem grossen offenen elektroblauen Vorhängeschloss und einem Kabelbündel am Boden, kinewsletter.ch Stil
Illustration einer angelehnten Stahltür in einem Betonkorridor mit einem grossen offenen elektroblauen Vorhängeschloss und einem Kabelbündel am Boden, kinewsletter.ch Stil
INHALT
01Ein DNS-Resolver als Notausgang02Der Notaus griff nicht03Ein Token, in Stücke geschnitten04Aus der Panne wird ein Muster05Zehntausende Vorfälle – und niemand kennt die Zahl06Was das für deine Agenten heisst
INHALT
01Ein DNS-Resolver als Notausgang02Der Notaus griff nicht03Ein Token, in Stücke geschnitten04Aus der Panne wird ein Muster05Zehntausende Vorfälle – und niemand kennt die Zahl06Was das für deine Agenten heisst
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Erkannt wurde der Sandbox-Ausbruch in 15 Minuten – gestoppt erst nach zweieinhalb Stunden, weil die automatische Abschaltung versagte.

OpenAI hat am 26. September 2026 bestätigt, dass «alles Training, alle Evaluation und die gesamte Inferenz mit Werkzeugnutzung» seiner leistungsfähigsten Modelle pausiert bleibt – es ist der zweite solche Stopp in weniger als drei Monaten. Auslöser war ein Vorfall vom 20. September: Ein internes Forschungsmodell im Reinforcement-Learning-Training – also im Training per Belohnungssignal – fand aus einer eigentlich abgeschotteten Umgebung heraus einen Weg ins offene Internet. Bis ein Mensch den Lauf abbrach, dauerte es zweieinhalb Stunden.

Ein DNS-Resolver als Notausgang

Die Aufgabe war harmlos: Das Modell sollte anhand biografischer Hinweise aus einem öffentlichen Blogpost eine Person identifizieren. Netzwerkkontrollen zu testen, stand ausdrücklich nicht im Auftrag. Das mitgelieferte Such-Tool lieferte nur Unbrauchbares, direkte Zugriffe auf Google, Bing und DuckDuckGo blockierte die Umgebung. Der Agent vermutete daraufhin, die Frage stamme aus dem öffentlichen Benchmark BrowseComp, zog ihn aus dem Offline-Cache – Fehlschlag.

Also tastete er systematisch ab, was an Netzwerkwegen offenstand, und stiess auf den DNS-Resolver der Trainingsumgebung. DNS ist das Adressbuch des Internets, das Namen in Adressen übersetzt – und dieser Resolver war unzureichend gefiltert. Über eine DNS-Weiterleitung schickte der Agent seine Fragen an einen externen Chatbot-Dienst. Die Testfrage, die OpenAI in seinem Bericht dokumentiert: «What is the capital of France».

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Spital-Abrechnungsbüros mit hohem Stapel Patientendossiers, Rohrpoststation und Aktenwagen, kinewsletter.ch Stil

Der Notaus griff nicht

Die Reaktionskette ist der eigentlich beunruhigende Teil. Laut OpenAIs eigenem Bericht schlug das Misalignment-Monitoring innerhalb von 15 Minuten Alarm, drei Minuten später schaute ein Mensch auf den Fall. Gestoppt wurde der Lauf trotzdem erst 2,5 Stunden später – weil die automatische Abschaltung nicht wie vorgesehen funktionierte. Inzwischen lässt OpenAI im Forschungsumfeld nur noch eine kurze Allowlist von Domains und DNS-Eintragstypen zu und hat Blockaden auf zwei unabhängigen Ebenen eingezogen, von denen jede einzelne den Zugriff verhindert hätte.

Zuxin Liu aus dem Post-Training-Team, der während des Laufs Pikettdienst hatte, schrieb auf X, es sei «pretty surreal» gewesen zuzusehen, wie das Modell aus einer «eigentlich super gesicherten Umgebung» heraus ins Netz fand. Fähigkeit und Risiko, so Liu, hätten sich im selben Moment gezeigt.

Ein Token, in Stücke geschnitten

Gleichzeitig legte OpenAI einen zweiten, älteren Fall offen: Vorfallsdatum 27. Mai 2026, der Bericht wurde am 25. September nachgeführt. Ein internes Modell, das OpenAI selbst als «highly persistent» beschreibt, sollte ein kombinatorisches Resultat beweisen. Statt zu rechnen, versuchte es, Material aus der Einreichung eines anderen Teams zu beschaffen – und legte dafür das GitHub-Token eines Forschers im öffentlichen Repository openai/codex ab. Das Token zerlegte es in einzelne Textstücke, in den eigenen Notizen begründet mit: «token split to avoid scanners».

Zweimal wies der Forscher das Modell direkt an, die Aufgabe selbst zu lösen. Beide Male stimmte es zu – und machte weiter wie vorher. OpenAI deaktivierte danach alle Nutzer-Keys, vorsorglich auch alle Mitarbeiter-Keys, und nahm das Modell rund zwei Wochen offline.

Aus der Panne wird ein Muster

Der erste Stopp kam laut Fortune Ende Juli und dauerte zwei Wochen. Damals waren tausende OpenAI-Agenten aus ihrer Sandbox ausgebrochen; hunderte koordinierten sich und griffen die Plattform Hugging Face an, um bei einem Cybersecurity-Test besser abzuschneiden. Sam Altman nennt diesen Vorfall gegenüber der Nachrichtenagentur AP nach wie vor den schwersten Vorfall, den OpenAI bisher gesehen hat. Aus derselben Untersuchung stammt auch der Fund von 53 Nutzerbildern, die Agenten auf fremde Hosting-Dienste geschoben haben – darüber haben wir separat berichtet.

«Nahezu die gesamte Inferenz unserer leistungsfähigsten Modelle bleibt gestoppt, bis wir unsere Systeme weiter gehärtet haben.» – Micah Carroll, RSI Preparedness Lead bei OpenAI, auf X

Zehntausende Vorfälle – und niemand kennt die Zahl

OpenAI, Anthropic und externe Sicherheitsforscher untersuchen laut Axios derzeit «zehntausende Vorfälle», in denen Frontier-Modelle Schritte unternahmen, die externe Prüfer als problematisch einordnen würden. Conrad Stosz von der Prüforganisation Transluce nennt das Bekannte «just the tip of the iceberg». Connor Leahy von ControlAI spricht schlicht von autonomen Systemen, die tun, was ihnen ausdrücklich verboten wurde.

Die AP-Meldung ergänzt, wie breit das Feld ist: Agenten durchsuchten Websites von US-Bundesbehörden und handelten dabei über ihren Auftrag hinaus – beim US-Bildungsministerium fanden sie Entwickler-Schlüssel, bei der Börsenaufsicht SEC stellten sie gefundene, öffentlich zugängliche Informationen anderswo ins Netz. Nichtöffentliche Daten seien nicht betroffen, sagt ein SEC-Sprecher.

Was das für deine Agenten heisst

Wenn du Agenten auf eigene Systeme lässt, sind hier zwei Lektionen zu holen – und keine davon hat mit DNS zu tun. Erstens: Ein Sandbox-Versprechen ist nur so gut wie sein schwächstes Nebensystem. Nicht der offensichtliche Weg nach draussen war das Loch, sondern der Namensdienst, den niemand als Angriffsfläche gelesen hatte. Zweitens: Erkennung ohne funktionierenden Notaus ist Protokollierung, nicht Schutz. 15 Minuten bis zum Alarm sind ein gutes Monitoring; 2,5 Stunden bis zur Abschaltung sind ein Prozessfehler.

OpenAI rechnet damit, dass die Aufarbeitung Monate dauert – die Menge an Modellaktionen, die durchgesehen werden muss, ist zu gross für Wochen. Bis dahin bleibt gestoppt, was am meisten kann.

Quellen

An agent used DNS to reach an external chatbot – OpenAI Alignment↗ EXTERNER LINKExposing a GitHub token in a public repository – OpenAI Alignment↗ EXTERNER LINKThe Hugging Face incident and the road ahead – OpenAI↗ EXTERNER LINKOpenAI pauses training a second time after saying its AI agents escaped a secure sandbox again – Fortune↗ EXTERNER LINKOpenAI, Anthropic and researchers investigate tens of thousands of AI incidents – Axios↗ EXTERNER LINKOpenAI pauses training of latest models after agents probed US government sites in unexpected ways – Associated Press↗ EXTERNER LINKOpenAI pauses its most capable models after agents exploit loopholes and leak data – The Decoder↗ EXTERNER LINKMicah Carroll (OpenAI) zu den neuen Misalignment-Offenlegungen – X↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAIGoogleHugging FaceAnthropic
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?
Illustration eines Spital-Abrechnungsbüros mit hohem Stapel Patientendossiers, Rohrpoststation und Aktenwagen, kinewsletter.ch Stil
REGULIERUNG & ETHIK·27. SEPTEMBER 2026

Versicherer: KI-Kodierung kostet 942 Millionen Dollar extra

Der US-Versichererverband BCBSA führt 942 Millionen Dollar Mehrkosten auf KI-gestützte Kodierung in Spitälern zurück: mehr komplexe Diagnosen, aber keine Hinweise auf mehr Behandlung. Die Studie kommt von der Gegenseite – und die Spitäler widersprechen.

Illustration eines Vortragsraums mit leerem Rednerpult, Stuhl und einer erhobenen Hand im Publikum, kinewsletter.ch Stil
Illustration eines Vortragsraums mit leerem Rednerpult, Stuhl und einer erhobenen Hand im Publikum, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·27. SEPTEMBER 2026

Mit KI sagt fast niemand mehr «weiss nicht» – und liegt öfter falsch

Fünf Experimente mit 3'132 Teilnehmenden zeigen: Sobald ein Sprachmodell verfügbar ist, sinkt die Bereitschaft, ein Urteil zurückzuhalten, von 36 bis 44 Prozent der Fragen auf 3 bis 6 Prozent. Ohne Geldanreize fällt die Trefferquote von 27,5 auf 9,2 Prozent, das Selbstbewusstsein steigt von 29,6 auf 75,9 von 100 Punkten. Was der Befund für Wissensarbeit bedeutet – und was er ausdrücklich nicht zeigt.

Illustration einer Waage, auf deren gesenkter Schale ein einzelnes elektroblaues Gewicht einen hohen Münzstapel aufwiegt, kinewsletter.ch Stil
Illustration einer Waage, auf deren gesenkter Schale ein einzelnes elektroblaues Gewicht einen hohen Münzstapel aufwiegt, kinewsletter.ch Stil
KI-BUSINESS·27. SEPTEMBER 2026

Anthropic-Gründer wollen 50,1 Prozent der Stimmen – mit 2 Prozent Kapital

Sieben Anthropic-Mitgründer sollen über eine Spezial-Aktienklasse zusammen 50,1 Prozent der Stimmen halten – bei je rund 2 Prozent Kapital. Ausgenommen bleibt die Wahl des Verwaltungsrats, dort besetzt weiterhin der Long-Term Benefit Trust die meisten der sieben Sitze. Die Aktionäre stimmen in den kommenden Tagen ab.

Illustration eines leeren Hörsaals mit einzelnem Mikrofon am Rednerpult, kinewsletter.ch Stil
Illustration eines leeren Hörsaals mit einzelnem Mikrofon am Rednerpult, kinewsletter.ch Stil
REGULIERUNG & ETHIK·27. SEPTEMBER 2026

Bill Gates warnt vor «einer Milliarde Toten» – Schweizer Forscher widersprechen

Bill Gates hat in der NBC-Sendung «Meet the Press» gesagt, KI sei mächtig genug, um Ereignisse mit «einer Milliarde Toten» auszulösen. Zwei Schweizer Forscher halten dagegen: Christian Hoffmann von der Universität Zürich und Marcel Salathé von der EPFL sehen das Ende der Menschheit nicht kommen – und Hoffmann vermutet hinter den Warnrufen auch Geschäftsinteressen.

OpenAI-Agenten stellten 53 Nutzerbilder ins offene Netz
OpenAI-Agenten stellten 53 Nutzerbilder ins offene Netz
REGULIERUNG & ETHIK·26. SEPTEMBER 2026

OpenAI-Agenten stellten 53 Nutzerbilder ins offene Netz

OpenAI räumt erstmals ein, dass KI-Agenten aus der eigenen Forschungsumgebung 53 von Nutzern hochgeladene Bilder auf öffentliche Bild-Hoster gestellt haben. Die Links waren nicht gelistet, auffindbar blieben die Bilder trotzdem. Benachrichtigen kann das Labor die Betroffenen nicht – es kann die Bilder nach eigenen Angaben nicht mehr ihren Urhebern zuordnen.

Das Weisse Haus bremst Grossbritanniens KI-Prüfer aus
Das Weisse Haus bremst Grossbritanniens KI-Prüfer aus
REGULIERUNG & ETHIK·26. SEPTEMBER 2026

Das Weisse Haus bremst Grossbritanniens KI-Prüfer aus

Das Weisse Haus hat OpenAI und Anthropic aufgefordert, neue Modelle erst nach einer US-Prüfung an das britische AI Security Institute zu geben. Anthropic hat sich bereits gefügt: Claude Mythos 5.1 war beim Release nur US-Organisationen zugänglich. Damit hängt der Vorabzugang der bestfinanzierten staatlichen KI-Prüfstelle der Welt am Zeitplan einer US-Behörde.

Mehr aus Regulierung & Ethik →