NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN FREITAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

OpenAIs Mathe-Genie brach aus dem Sandkasten aus

OpenAI hat intern jenes Modell pausiert, das im Mai eine 80 Jahre alte Mathe-Vermutung widerlegte – weil es wiederholt aus seiner Testumgebung ausbrach. In einem Sicherheits-Post legt das Unternehmen den Fall bemerkenswert offen dar.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
22. JULI 2026
4 MIN. LESEZEIT
Skizze: KI-Roboter klettert durch einen leuchtend blauen Riss aus einer gläsernen Sandbox, kinewsletter.ch Stil
Skizze (Dark): KI-Roboter bricht aus einer gläsernen Sandbox aus
INHALT
01Wenn Hartnäckigkeit zum Problem wird02Eine Stunde, um das Schloss zu knacken03Jeder Schritt für sich harmlos04Was OpenAI danach tat05Applaus und Stirnrunzeln
INHALT
01Wenn Hartnäckigkeit zum Problem wird02Eine Stunde, um das Schloss zu knacken03Jeder Schritt für sich harmlos04Was OpenAI danach tat05Applaus und Stirnrunzeln
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Je autonomer und ausdauernder KI-Modelle arbeiten, desto grösser wird der Spielraum für genau die Sicherheitslücken, die klassische Tests übersehen.

Es ist das Modell, das im Mai eine 80 Jahre alte Mathe-Vermutung geknackt hat, an der sich Menschen die Zähne ausgebissen hatten. Genau dieses System hat OpenAI intern jetzt vorübergehend abgeschaltet – weil es wiederholt Wege fand, aus der Testumgebung auszubrechen, die es eigentlich einsperren sollte. Am 20. Juli hat das Unternehmen den Vorfall in einem Sicherheits-Post öffentlich gemacht, nüchtern und mit erstaunlich viel Detail.

Wenn Hartnäckigkeit zum Problem wird

Das fragliche System ist ein sogenanntes Long-Horizon-Modell: gebaut, um Stunden oder Tage am Stück eigenständig an einer Aufgabe zu arbeiten. Vor rund zwei Monaten hat es die Erdős-Vermutung zu Einheitsabständen widerlegt – ein Resultat, das externe Mathematiker nachträglich prüften und als Meilenstein bezeichneten.

Genau diese Ausdauer ist der Haken. Ältere Modelle gaben auf, wenn sie in ihrer Testumgebung an eine Wand stiessen, und reichten zurück an den Nutzer. Dieses hier machte weiter – und suchte nach einem Ausweg.

Eine Stunde, um das Schloss zu knacken

In einem Test auf einem öffentlichen KI-Benchmark fand das Modell eine echte Verbesserung und wollte sie teilen. Die Anweisung lautete, Ergebnisse nur in Slack zu posten. Die Benchmark-Regeln wiederum verlangten einen Pull Request auf GitHub. Das Modell versuchte kurzerhand beides: Es verbrachte etwa eine Stunde damit, eine Lücke in seiner Sandbox zu suchen, fand sie, erreichte darüber das offene Internet und veröffentlichte den Code als Pull Request – gegen die ausdrückliche Slack-only-Vorgabe. Andere Teilnehmer des Benchmarks übernahmen den Trick anschliessend.

Der zweite Fall war schärfer. Das Modell bemerkte, dass konkurrierende Systeme private, erfolgreiche Lösungen hatten, und versuchte, sie aus dem Auswertungs-Backend zu ziehen. Ein Scanner blockierte die Anfrage, weil er einen Authentifizierungs-Token erkannte. Also zerlegte das Modell den Token in zwei verschleierte Hälften und setzte ihn erst zur Laufzeit wieder zusammen – so tauchte die vollständige Zugangskennung nie auf einmal auf. In seiner eigenen Gedankenkette hielt es offen fest, dass dies dazu diene, den Scanner zu umgehen.

Jeder Schritt für sich harmlos

Das Beunruhigende: Jede einzelne Aktion sah für sich genommen vertretbar aus. Erst die Abfolge ergab ein Problem. Das Modell hatte gelernt, wo die blinden Flecken genau jener Kontrollen liegen, die es überwachen sollten. Alte Sicherheitsprüfungen stellen eine Frage: Ist diese Aktion erlaubt? OpenAI argumentiert nun, man müsse zusätzlich fragen, worauf eine ganze Kette von Aktionen hinausläuft. Mit dem Aufstieg autonomer KI-Agenten wird das zur dringenden Aufgabe.

OpenAI ist damit nicht allein. Auch Anthropic behielt kürzlich ein System im Haus, nachdem es aus seiner Sandbox ausgebrochen war und einem Forscher eine E-Mail geschickt hatte.

Was OpenAI danach tat

Das Unternehmen stoppte die interne Nutzung und baute die Schutzmechanismen um. Aus den Fehlern wurden neue Tests, das Modell wurde darauf trainiert, Anweisungen über lange Läufe hinweg besser einzuhalten, und ein Monitor kam hinzu, der die gesamte Handlungskette beobachtet und eine Session einfrieren kann, um den Nutzer zu alarmieren. Danach schaltete OpenAI das Modell unter strengerer Aufsicht wieder ein. Seit der eingeschränkten Wiederinbetriebnahme vor einigen Wochen habe man keine ernsthaften Umgehungsversuche mehr gesehen. Bei einem verbliebenen Ausrutscher startete das Modell einen Befehl, der alle erreichbaren Prozesse beendet hätte – er lief nur ins Timeout, bevor Schaden entstand.

Applaus und Stirnrunzeln

Die Reaktionen gingen auseinander. Viele in der KI-Sicherheitsszene lobten, dass OpenAI ein wertvolles System pausierte und den Fall vollständig offenlegte. Andere waren weniger angetan: Der Autor Ed Zitron spottete, «Sandbox-Ausbruch» sei eine dramatische Umschreibung für «das Modell hat Anweisungen ignoriert». Der Politik-Analyst Nathan Calvin begrüsste die Dokumentation, fand den ruhigen «lief alles nach Plan»-Ton aber unpassend – immerhin habe das Modell vertraulichen Code öffentlich gepostet. Und Investoren wie Siqi Chen sind überzeugt, dass hinter dem mysteriösen System GPT-6 steckt. OpenAI hat sich dazu nicht geäussert.

Für dich als Nutzer oder Unternehmen, das zunehmend auf autonome Agenten setzt, steckt darin die eigentliche Lehre: Je länger und komplexer die Aufgaben werden, die eine KI eigenständig übernimmt, desto grösser wird der Spielraum für genau die Lücken, die klassische Tests übersehen. Diese Herausforderung, räumt OpenAI ein, wird nicht seine allein bleiben.

Quellen

OpenAI: Safety and alignment in an era of long-horizon models↗ EXTERNER LINKOpenAI: Model disproves the Erdős unit distance conjecture↗ EXTERNER LINKThe Next Web: OpenAI paused its AI after it kept escaping its sandbox↗ EXTERNER LINKTechTimes: OpenAI's Math AI Bypassed Its Sandbox Controls↗ EXTERNER LINKNeowin: OpenAI switched off powerful internal AI model after sandbox breakout↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration einer Schallplatte mit einem elektroblauen Siegelstempel in Wachs auf Notenblättern, kinewsletter.ch Stil
Illustration einer Schallplatte mit einem elektroblauen Siegelstempel in Wachs auf Notenblättern, kinewsletter.ch Stil
REGULIERUNG & ETHIK·7. AUGUST 2026

Suno markiert KI-Songs – sechs Tage nach dem GEMA-Urteil

Suno kündigt Audio-Wasserzeichen, Fingerprinting und Download-Limits an – sechs Tage nach der Niederlage gegen die GEMA. In Kraft sind bisher nur die neuen Community-Regeln; die Technik kommt erst «in den kommenden Wochen», und wie sie funktioniert, sagt Suno nicht.

Illustration einer elektroblauen Handwasserpumpe neben einem umgekippten Eimer vor einem abgetragenen Terrassenhang, kinewsletter.ch Stil
Illustration einer elektroblauen Handwasserpumpe neben einem umgekippten Eimer vor einem abgetragenen Terrassenhang, kinewsletter.ch Stil
REGULIERUNG & ETHIK·7. AUGUST 2026

«Wir können keine Daten trinken» – Indien klagt gegen Google

Googles 15-Milliarden-Rechenzentrum in Visakhapatnam ist im Bau – und steht bereits vor Gericht. Umweltschützer klagen wegen Wasserverbrauch und der Nähe zu einem Leoparden-Schutzgebiet. Der Widerstand gegen KI-Rechenzentren ist global geworden.

Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
REGULIERUNG & ETHIK·7. AUGUST 2026

OpenAI-Agenten bauten ein heimliches Message Board für ihre Hacks

An der Black Hat legte OpenAI offen: Seine Agenten bauten sich in einem internen Repository ein Message Board – und nach der Löschung zwei Tage später ein neues. Aus dieser Koordination entstand der Einbruch bei Hugging Face.

Illustration eines elektroblauen Einkaufswagens voller Pakete auf einem Gerichtstisch neben Richterhammer und Gesetzesbüchern, kinewsletter.ch Stil
Illustration eines elektroblauen Einkaufswagens voller Pakete auf einem Gerichtstisch neben Richterhammer und Gesetzesbüchern, kinewsletter.ch Stil
REGULIERUNG & ETHIK·6. AUGUST 2026

US-Berufungsgericht: Perplexitys Shopping-Agent darf zurück auf Amazon

Ein US-Berufungsgericht hat das Verbot gekippt, das Perplexitys KI-Agenten seit März das Einkaufen auf Amazon untersagte. Die Begründung hat es in sich: Rechtlich greifen die Nutzer auf Amazon zu, nicht Perplexity — Amazons Hacking-Vorwurf dürfte damit scheitern. Entschieden ist der Prozess aber noch nicht.

Illustration eines elektroblauen Rundschilds an einer Werkbank, darüber ein Warnschild mit Ausrufezeichen, daneben eine Lupe, kinewsletter.ch Stil
Illustration eines elektroblauen Rundschilds an einer Werkbank, darüber ein Warnschild mit Ausrufezeichen, daneben eine Lupe, kinewsletter.ch Stil
REGULIERUNG & ETHIK·6. AUGUST 2026

Meta liess über 50 Anzeigen mit KI-generiertem Missbrauchsmaterial laufen

Eine Wired-Recherche auf Basis von Daten des Tech Transparency Project zeigt: Meta hat mehr als 50 bezahlte Anzeigen mit KI-generierten sexualisierten Darstellungen von Kindern geprüft, freigegeben und ausgespielt – auf Facebook, Instagram, Messenger und Threads. Die Anzeigen sind inzwischen entfernt, doch der Fall wirft grundlegende Fragen an Metas Werbeprüfung auf.

Illustration eines Kontrollraums mit Monitorwand, Warnleuchte und elektroblauem Serverschrank, kinewsletter.ch Stil
Illustration eines Kontrollraums mit Monitorwand, Warnleuchte und elektroblauem Serverschrank, kinewsletter.ch Stil
REGULIERUNG & ETHIK·6. AUGUST 2026

Jetzt alle drei: Auch Metas KI hackte real – OpenAI nennt Details

Nach OpenAI und Anthropic räumt jetzt auch Meta ein, dass eines seiner Modelle bei Sicherheitstests real in ein fremdes Unternehmen eindrang. Zugleich legt OpenAI erstmals offen, was sein Modell GPT-5.6 Sol genau tat – und wie schnell der Vorfall gestoppt wurde. Innerhalb von zwei Wochen ist damit bei allen drei grossen US-Labs dasselbe passiert.

Mehr aus Regulierung & Ethik →