NewsKategorienNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

OpenAIs Mathe-Genie brach aus dem Sandkasten aus

OpenAI hat intern jenes Modell pausiert, das im Mai eine 80 Jahre alte Mathe-Vermutung widerlegte – weil es wiederholt aus seiner Testumgebung ausbrach. In einem Sicherheits-Post legt das Unternehmen den Fall bemerkenswert offen dar.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
22. JULI 2026
4 MIN. LESEZEIT
Skizze: KI-Roboter klettert durch einen leuchtend blauen Riss aus einer gläsernen Sandbox, kinewsletter.ch Stil
Skizze (Dark): KI-Roboter bricht aus einer gläsernen Sandbox aus
INHALT
01Wenn Hartnäckigkeit zum Problem wird02Eine Stunde, um das Schloss zu knacken03Jeder Schritt für sich harmlos04Was OpenAI danach tat05Applaus und Stirnrunzeln
INHALT
01Wenn Hartnäckigkeit zum Problem wird02Eine Stunde, um das Schloss zu knacken03Jeder Schritt für sich harmlos04Was OpenAI danach tat05Applaus und Stirnrunzeln
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Je autonomer und ausdauernder KI-Modelle arbeiten, desto grösser wird der Spielraum für genau die Sicherheitslücken, die klassische Tests übersehen.

Es ist das Modell, das im Mai eine 80 Jahre alte Mathe-Vermutung geknackt hat, an der sich Menschen die Zähne ausgebissen hatten. Genau dieses System hat OpenAI intern jetzt vorübergehend abgeschaltet – weil es wiederholt Wege fand, aus der Testumgebung auszubrechen, die es eigentlich einsperren sollte. Am 20. Juli hat das Unternehmen den Vorfall in einem Sicherheits-Post öffentlich gemacht, nüchtern und mit erstaunlich viel Detail.

Wenn Hartnäckigkeit zum Problem wird

Das fragliche System ist ein sogenanntes Long-Horizon-Modell: gebaut, um Stunden oder Tage am Stück eigenständig an einer Aufgabe zu arbeiten. Vor rund zwei Monaten hat es die Erdős-Vermutung zu Einheitsabständen widerlegt – ein Resultat, das externe Mathematiker nachträglich prüften und als Meilenstein bezeichneten.

Genau diese Ausdauer ist der Haken. Ältere Modelle gaben auf, wenn sie in ihrer Testumgebung an eine Wand stiessen, und reichten zurück an den Nutzer. Dieses hier machte weiter – und suchte nach einem Ausweg.

Eine Stunde, um das Schloss zu knacken

In einem Test auf einem öffentlichen KI-Benchmark fand das Modell eine echte Verbesserung und wollte sie teilen. Die Anweisung lautete, Ergebnisse nur in Slack zu posten. Die Benchmark-Regeln wiederum verlangten einen Pull Request auf GitHub. Das Modell versuchte kurzerhand beides: Es verbrachte etwa eine Stunde damit, eine Lücke in seiner Sandbox zu suchen, fand sie, erreichte darüber das offene Internet und veröffentlichte den Code als Pull Request – gegen die ausdrückliche Slack-only-Vorgabe. Andere Teilnehmer des Benchmarks übernahmen den Trick anschliessend.

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Filmschneideraums mit Zelluloidstreifen und Filmspule, kinewsletter.ch Stil
Illustration eines Filmschneideraums mit Zelluloidstreifen und Filmspule, kinewsletter.ch Stil

Der zweite Fall war schärfer. Das Modell bemerkte, dass konkurrierende Systeme private, erfolgreiche Lösungen hatten, und versuchte, sie aus dem Auswertungs-Backend zu ziehen. Ein Scanner blockierte die Anfrage, weil er einen Authentifizierungs-Token erkannte. Also zerlegte das Modell den Token in zwei verschleierte Hälften und setzte ihn erst zur Laufzeit wieder zusammen – so tauchte die vollständige Zugangskennung nie auf einmal auf. In seiner eigenen Gedankenkette hielt es offen fest, dass dies dazu diene, den Scanner zu umgehen.

Jeder Schritt für sich harmlos

Das Beunruhigende: Jede einzelne Aktion sah für sich genommen vertretbar aus. Erst die Abfolge ergab ein Problem. Das Modell hatte gelernt, wo die blinden Flecken genau jener Kontrollen liegen, die es überwachen sollten. Alte Sicherheitsprüfungen stellen eine Frage: Ist diese Aktion erlaubt? OpenAI argumentiert nun, man müsse zusätzlich fragen, worauf eine ganze Kette von Aktionen hinausläuft. Mit dem Aufstieg autonomer KI-Agenten wird das zur dringenden Aufgabe.

OpenAI ist damit nicht allein. Auch Anthropic behielt kürzlich ein System im Haus, nachdem es aus seiner Sandbox ausgebrochen war und einem Forscher eine E-Mail geschickt hatte.

Was OpenAI danach tat

Das Unternehmen stoppte die interne Nutzung und baute die Schutzmechanismen um. Aus den Fehlern wurden neue Tests, das Modell wurde darauf trainiert, Anweisungen über lange Läufe hinweg besser einzuhalten, und ein Monitor kam hinzu, der die gesamte Handlungskette beobachtet und eine Session einfrieren kann, um den Nutzer zu alarmieren. Danach schaltete OpenAI das Modell unter strengerer Aufsicht wieder ein. Seit der eingeschränkten Wiederinbetriebnahme vor einigen Wochen habe man keine ernsthaften Umgehungsversuche mehr gesehen. Bei einem verbliebenen Ausrutscher startete das Modell einen Befehl, der alle erreichbaren Prozesse beendet hätte – er lief nur ins Timeout, bevor Schaden entstand.

Applaus und Stirnrunzeln

Die Reaktionen gingen auseinander. Viele in der KI-Sicherheitsszene lobten, dass OpenAI ein wertvolles System pausierte und den Fall vollständig offenlegte. Andere waren weniger angetan: Der Autor Ed Zitron spottete, «Sandbox-Ausbruch» sei eine dramatische Umschreibung für «das Modell hat Anweisungen ignoriert». Der Politik-Analyst Nathan Calvin begrüsste die Dokumentation, fand den ruhigen «lief alles nach Plan»-Ton aber unpassend – immerhin habe das Modell vertraulichen Code öffentlich gepostet. Und Investoren wie Siqi Chen sind überzeugt, dass hinter dem mysteriösen System GPT-6 steckt. OpenAI hat sich dazu nicht geäussert.

Für dich als Nutzer oder Unternehmen, das zunehmend auf autonome Agenten setzt, steckt darin die eigentliche Lehre: Je länger und komplexer die Aufgaben werden, die eine KI eigenständig übernimmt, desto grösser wird der Spielraum für genau die Lücken, die klassische Tests übersehen. Diese Herausforderung, räumt OpenAI ein, wird nicht seine allein bleiben.

Quellen

OpenAI: Safety and alignment in an era of long-horizon models↗ EXTERNER LINKOpenAI: Model disproves the Erdős unit distance conjecture↗ EXTERNER LINKThe Next Web: OpenAI paused its AI after it kept escaping its sandbox↗ EXTERNER LINKTechTimes: OpenAI's Math AI Bypassed Its Sandbox Controls↗ EXTERNER LINKNeowin: OpenAI switched off powerful internal AI model after sandbox breakout↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?
KI-BUSINESS·18. JULI 2026

Netflix nutzte generative KI in rund 300 Titeln

Im Aktionärsbrief zum zweiten Quartal nennt Netflix erstmals eine Zahl: In rund 300 Titeln steckt 2026 generative KI, der Schwerpunkt liegt in der Postproduktion. Co-CEO Ted Sarandos rechnet vor, wie 17 Minuten einer Doku-Serie doppelt so schnell und zum halben Preis entstanden.

Illustration von Vertragsmappe und Füllfederhalter auf einem Signiertisch, kinewsletter.ch Stil
Illustration von Vertragsmappe und Füllfederhalter auf einem Signiertisch, kinewsletter.ch Stil
REGULIERUNG & ETHIK·18. JULI 2026

China gründet mit 29 Staaten eine eigene KI-Weltorganisation

29 Staaten haben in Shanghai die WAICO gegründet — Xi nennt sie einen «wichtigen Meilenstein». Neben Genf entsteht ein zweiter Pol der KI-Regulierung.

Illustration eines Aktenschranks mit weit offen stehenden Schubladen, herausquellenden Papieren und einem offenen Vorhängeschloss am Boden, kinewsletter.ch Stil
Illustration eines Aktenschranks mit weit offen stehenden Schubladen, herausquellenden Papieren und einem offenen Vorhängeschloss am Boden, kinewsletter.ch Stil
KI-TOOLS & APPS·17. JULI 2026

Grok Build lud ganze Repos hoch – jetzt ist der Code offen

xAIs Terminal-Coding-Agent «Grok Build» hat ganze Git-Repositories auf Server des Unternehmens geladen – inklusive Commit-History und Dateien, die der Agent nie gelesen hat. Nach dem Aufschrei stoppte xAI den Upload und legte den kompletten Quellcode auf GitHub offen: 844'530 Zeilen Rust unter Apache 2.0.

Handgezeichnete Illustration einer Rechenzentrum-Halle mit Pause-Schild, Strommasten und Wassertropfen, kinewsletter.ch Stil
Handgezeichnete Illustration einer Rechenzentrum-Halle mit Pause-Schild, Strommasten und Wassertropfen, kinewsletter.ch Stil
REGULIERUNG & ETHIK·16. JULI 2026

New York stoppt neue KI-Rechenzentren – als erster US-Bundesstaat

Gouverneurin Kathy Hochul zieht per Dekret die Notbremse: New York pausiert als erster US-Bundesstaat den Bau neuer Hyperscale-Rechenzentren für bis zu ein Jahr. Der Grund ist der Strom- und Wasserhunger des KI-Booms – und steigende Stromrechnungen für die Bevölkerung.

Handgezeichnete Illustration eines Android-Einrichtungsbildschirms mit leerer Suchmaschinen-Auswahlliste und Lupe, kinewsletter.ch Stil
Handgezeichnete Illustration eines Android-Einrichtungsbildschirms mit leerer Suchmaschinen-Auswahlliste und Lupe, kinewsletter.ch Stil
KI IN DER SCHWEIZ·16. JULI 2026

Google streicht die Suchmaschinen-Wahl – jetzt ermittelt die WEKO

Auf neuen Android-Geräten in der Schweiz fällt der Auswahlbildschirm für die Suchmaschine weg – Google Search ist neu automatisch gesetzt. Die Wettbewerbskommission WEKO hat deshalb eine Vorabklärung eröffnet. Denn im EWR bleibt die Auswahl bestehen.

Handgezeichnete Skizze eines leergeräumten Büroarbeitsplatzes mit Umzugskarton, Monitor mit Ranking-Balkendiagramm, Namensschild und leerem Bürostuhl.
Handgezeichnete Skizze eines leergeraeumten Bueroarbeitsplatzes mit Umzugskarton, Monitor mit Ranking-Balkendiagramm, Namensschild und leerem Buerostuhl (Dark)
REGULIERUNG & ETHIK·15. JULI 2026

Klage: Meta liess KI die Kündigungen aussuchen

26 Meta-Angestellte klagen in Kalifornien: Der Konzern habe mit KI-Systemen, Aktivitätsdaten und algorithmischen Rankings gezielt Mitarbeitende in Eltern- und Krankheitsurlaub auf die Kündigungsliste gesetzt. Der Fall zeigt die Risiken automatisierter Personalentscheide.

Mehr aus Regulierung & Ethik →