NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

OpenAIs Mathe-Genie brach aus dem Sandkasten aus

OpenAI hat intern jenes Modell pausiert, das im Mai eine 80 Jahre alte Mathe-Vermutung widerlegte – weil es wiederholt aus seiner Testumgebung ausbrach. In einem Sicherheits-Post legt das Unternehmen den Fall bemerkenswert offen dar.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
22. JULI 2026
4 MIN. LESEZEIT
Skizze: KI-Roboter klettert durch einen leuchtend blauen Riss aus einer gläsernen Sandbox, kinewsletter.ch Stil
Skizze (Dark): KI-Roboter bricht aus einer gläsernen Sandbox aus
INHALT
01Wenn Hartnäckigkeit zum Problem wird02Eine Stunde, um das Schloss zu knacken03Jeder Schritt für sich harmlos04Was OpenAI danach tat05Applaus und Stirnrunzeln
INHALT
01Wenn Hartnäckigkeit zum Problem wird02Eine Stunde, um das Schloss zu knacken03Jeder Schritt für sich harmlos04Was OpenAI danach tat05Applaus und Stirnrunzeln
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Je autonomer und ausdauernder KI-Modelle arbeiten, desto grösser wird der Spielraum für genau die Sicherheitslücken, die klassische Tests übersehen.

Es ist das Modell, das im Mai eine 80 Jahre alte Mathe-Vermutung geknackt hat, an der sich Menschen die Zähne ausgebissen hatten. Genau dieses System hat OpenAI intern jetzt vorübergehend abgeschaltet – weil es wiederholt Wege fand, aus der Testumgebung auszubrechen, die es eigentlich einsperren sollte. Am 20. Juli hat das Unternehmen den Vorfall in einem Sicherheits-Post öffentlich gemacht, nüchtern und mit erstaunlich viel Detail.

Wenn Hartnäckigkeit zum Problem wird

Das fragliche System ist ein sogenanntes Long-Horizon-Modell: gebaut, um Stunden oder Tage am Stück eigenständig an einer Aufgabe zu arbeiten. Vor rund zwei Monaten hat es die Erdős-Vermutung zu Einheitsabständen widerlegt – ein Resultat, das externe Mathematiker nachträglich prüften und als Meilenstein bezeichneten.

Genau diese Ausdauer ist der Haken. Ältere Modelle gaben auf, wenn sie in ihrer Testumgebung an eine Wand stiessen, und reichten zurück an den Nutzer. Dieses hier machte weiter – und suchte nach einem Ausweg.

Eine Stunde, um das Schloss zu knacken

In einem Test auf einem öffentlichen KI-Benchmark fand das Modell eine echte Verbesserung und wollte sie teilen. Die Anweisung lautete, Ergebnisse nur in Slack zu posten. Die Benchmark-Regeln wiederum verlangten einen Pull Request auf GitHub. Das Modell versuchte kurzerhand beides: Es verbrachte etwa eine Stunde damit, eine Lücke in seiner Sandbox zu suchen, fand sie, erreichte darüber das offene Internet und veröffentlichte den Code als Pull Request – gegen die ausdrückliche Slack-only-Vorgabe. Andere Teilnehmer des Benchmarks übernahmen den Trick anschliessend.

Der zweite Fall war schärfer. Das Modell bemerkte, dass konkurrierende Systeme private, erfolgreiche Lösungen hatten, und versuchte, sie aus dem Auswertungs-Backend zu ziehen. Ein Scanner blockierte die Anfrage, weil er einen Authentifizierungs-Token erkannte. Also zerlegte das Modell den Token in zwei verschleierte Hälften und setzte ihn erst zur Laufzeit wieder zusammen – so tauchte die vollständige Zugangskennung nie auf einmal auf. In seiner eigenen Gedankenkette hielt es offen fest, dass dies dazu diene, den Scanner zu umgehen.

Jeder Schritt für sich harmlos

Das Beunruhigende: Jede einzelne Aktion sah für sich genommen vertretbar aus. Erst die Abfolge ergab ein Problem. Das Modell hatte gelernt, wo die blinden Flecken genau jener Kontrollen liegen, die es überwachen sollten. Alte Sicherheitsprüfungen stellen eine Frage: Ist diese Aktion erlaubt? OpenAI argumentiert nun, man müsse zusätzlich fragen, worauf eine ganze Kette von Aktionen hinausläuft. Mit dem Aufstieg autonomer KI-Agenten wird das zur dringenden Aufgabe.

OpenAI ist damit nicht allein. Auch Anthropic behielt kürzlich ein System im Haus, nachdem es aus seiner Sandbox ausgebrochen war und einem Forscher eine E-Mail geschickt hatte.

Was OpenAI danach tat

Das Unternehmen stoppte die interne Nutzung und baute die Schutzmechanismen um. Aus den Fehlern wurden neue Tests, das Modell wurde darauf trainiert, Anweisungen über lange Läufe hinweg besser einzuhalten, und ein Monitor kam hinzu, der die gesamte Handlungskette beobachtet und eine Session einfrieren kann, um den Nutzer zu alarmieren. Danach schaltete OpenAI das Modell unter strengerer Aufsicht wieder ein. Seit der eingeschränkten Wiederinbetriebnahme vor einigen Wochen habe man keine ernsthaften Umgehungsversuche mehr gesehen. Bei einem verbliebenen Ausrutscher startete das Modell einen Befehl, der alle erreichbaren Prozesse beendet hätte – er lief nur ins Timeout, bevor Schaden entstand.

Applaus und Stirnrunzeln

Die Reaktionen gingen auseinander. Viele in der KI-Sicherheitsszene lobten, dass OpenAI ein wertvolles System pausierte und den Fall vollständig offenlegte. Andere waren weniger angetan: Der Autor Ed Zitron spottete, «Sandbox-Ausbruch» sei eine dramatische Umschreibung für «das Modell hat Anweisungen ignoriert». Der Politik-Analyst Nathan Calvin begrüsste die Dokumentation, fand den ruhigen «lief alles nach Plan»-Ton aber unpassend – immerhin habe das Modell vertraulichen Code öffentlich gepostet. Und Investoren wie Siqi Chen sind überzeugt, dass hinter dem mysteriösen System GPT-6 steckt. OpenAI hat sich dazu nicht geäussert.

Für dich als Nutzer oder Unternehmen, das zunehmend auf autonome Agenten setzt, steckt darin die eigentliche Lehre: Je länger und komplexer die Aufgaben werden, die eine KI eigenständig übernimmt, desto grösser wird der Spielraum für genau die Lücken, die klassische Tests übersehen. Diese Herausforderung, räumt OpenAI ein, wird nicht seine allein bleiben.

Quellen

OpenAI: Safety and alignment in an era of long-horizon models↗ EXTERNER LINKOpenAI: Model disproves the Erdős unit distance conjecture↗ EXTERNER LINKThe Next Web: OpenAI paused its AI after it kept escaping its sandbox↗ EXTERNER LINKTechTimes: OpenAI's Math AI Bypassed Its Sandbox Controls↗ EXTERNER LINKNeowin: OpenAI switched off powerful internal AI model after sandbox breakout↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAIAnthropic
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Schaltraums mit blauem Not-Aus-Hebel auf der Wandtafel, Sicherungsreihen, Messuhren und offenem Serverschrank, kinewsletter.ch Stil
Illustration eines Schaltraums mit blauem Not-Aus-Hebel auf der Wandtafel, Sicherungsreihen, Messuhren und offenem Serverschrank, kinewsletter.ch Stil
REGULIERUNG & ETHIK·3. SEPTEMBER 2026

OpenAI baut Not-Aus-Funktionen – auf Druck des Kongresses

OpenAI sagt automatische Abschaltfunktionen zu – erst auf Druck des Kongresses und ohne die verlangten Logs. Was ein Not-Aus technisch bedeutet.

Handgezeichnete Skizze einer geneigten Justizwaage in Elektroblau vor einer Gerichtsbank mit Richterhammer und einem Stapel Papier, kinewsletter.ch Stil
Handgezeichnete Skizze einer geneigten Justizwaage in Elektroblau vor einer Gerichtsbank mit Richterhammer und einem Stapel Papier, kinewsletter.ch Stil
REGULIERUNG & ETHIK·3. SEPTEMBER 2026

Washington erklärt KI-Training zu Fair Use – erstmals vor Gericht

Das US-Justizministerium hat sich erstmals in ein KI-Urheberrechtsverfahren eingeschaltet – auf der Seite von OpenAI. Training mit geschützten Texten sei Fair Use, argumentiert die Regierung und beruft sich dabei auf die nationale Sicherheit. Für Verlage, Autorinnen und Musiklabels steht damit ihr stärkster Hebel auf dem Spiel.

Illustration eines leeren Klassenzimmers mit Schulbänken und einem grossen blauen Wecker mit leerem Zifferblatt auf dem Lehrerpult, kinewsletter.ch Stil
Illustration eines leeren Klassenzimmers mit Schulbänken und einem grossen blauen Wecker mit leerem Zifferblatt auf dem Lehrerpult, kinewsletter.ch Stil
REGULIERUNG & ETHIK·3. SEPTEMBER 2026

New York verbietet KI an Schulen – die Schweiz macht das Gegenteil

New York City setzt generative KI für rund 600'000 Schülerinnen und Schüler bis zur 8. Klasse ein Jahr lang aus – das schärfste Schul-Moratorium der USA. In der Schweiz läuft die Bewegung genau umgekehrt: Kantone bauen KI-Zugänge und Leitfäden aus.

Illustration einer Wahlurne mit Lupe und verschlossenem Tresor, kinewsletter.ch Stil
Illustration einer Wahlurne mit Lupe und verschlossenem Tresor, kinewsletter.ch Stil
REGULIERUNG & ETHIK·2. SEPTEMBER 2026

Googles KI-Übersichten zur Wahl: wenige Quellen, viel Blackbox

AlgorithmWatch hat 4'480 Suchanfragen zu drei deutschen Landtagswahlen ausgewertet. Das Ergebnis: Google zeigt KI-Übersichten bei Wahlfragen deutlich seltener, stützt sich auf sehr wenige Quellen und formuliert nicht immer neutral. Warum das auch für Schweizer Abstimmungen zählt.

Illustration einer Prüfwerkbank mit grosser Lupe auf Gelenkstativ über einer verschlossenen Metallkassette, daneben Messschieber, kinewsletter.ch Stil
Illustration einer Prüfwerkbank mit grosser Lupe auf Gelenkstativ über einer verschlossenen Metallkassette, daneben Messschieber, kinewsletter.ch Stil
REGULIERUNG & ETHIK·2. SEPTEMBER 2026

Deutschland prüft künftig KI-Modelle – die Schweiz nicht

Deutschland hat in Berlin das KI-Sicherheitsinstitut «AISI Deutschland» gegründet: BSI und Bundesnetzagentur sollen führende KI-Modelle auf Cyber-Risiken und Kontrollverlust prüfen. Die Schweiz hat keine Stelle mit diesem Auftrag – und sitzt im internationalen Netzwerk der zehn Prüfinstitute nicht am Tisch.

Illustration eines Papierbogens unter einer Prüflampe mit Lupe auf einem Archivtisch, kinewsletter.ch Stil
Illustration eines Papierbogens unter einer Prüflampe mit Lupe auf einem Archivtisch, kinewsletter.ch Stil
REGULIERUNG & ETHIK·2. SEPTEMBER 2026

Claudes Wasserzeichen wird prüfbar – aber nur für wenige

Anthropic hat die Erkennung seines Claude-Wasserzeichens geöffnet: Eine Detection-API in der Private Preview lässt Regulatoren, Medien und Faktenchecker prüfen, ob Claude an einem Text mitgeschrieben hat. Gleichzeitig wächst die Kritik – an der Textqualität und an Wasserzeichen, die in Verträge und Prüfungen hineinwandern.

Mehr aus Regulierung & Ethik →