NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN FREITAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup

Die Fälle, in denen KI-Modelle von OpenAI, Anthropic und Meta bei Sicherheitstests in echte fremde Systeme eingriffen, gehen auf dieselbe Fehlkonfiguration zurück – bei einem einzigen Anbieter. Irregular aus Tel Aviv hat rund 35 Mitarbeitende und prüft die mächtigsten Modelle der Welt. Das wirft eine Frage auf, die bisher kaum jemand stellt.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
10. AUGUST 2026
6 MIN. LESEZEIT
Illustration eines Serverraums mit weit offenstehender Schranktür und verhedderten Netzwerkkabeln, kinewsletter.ch Stil
Illustration eines Serverraums mit weit offenstehender Schranktür und verhedderten Netzwerkkabeln, kinewsletter.ch Stil
INHALT
01Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup02Drei Schlagzeilen, ein Prüfstand0335 Leute prüfen die mächtigsten Modelle der Welt04141'006 Testläufe – und sechs, die entglitten05Eine Tür, von der es hiess, sie sei zu06«Severe corner cutting» – und die Gegenrede07Wer prüft eigentlich die Prüfer?
INHALT
01Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup02Drei Schlagzeilen, ein Prüfstand0335 Leute prüfen die mächtigsten Modelle der Welt04141'006 Testläufe – und sechs, die entglitten05Eine Tür, von der es hiess, sie sei zu06«Severe corner cutting» – und die Gegenrede07Wer prüft eigentlich die Prüfer?
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die Sicherheitsprüfung der stärksten KI-Modelle hängt an einer Handvoll kleiner Firmen – und eine einzige Fehlkonfiguration bei einer davon reichte für drei Vorfälle bei drei Labs.

Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup

Drei Vorfälle, drei Labore, ein gemeinsamer Nenner: Die Fälle, in denen KI-Modelle von OpenAI, Anthropic und Meta bei Sicherheitstests in echte fremde Systeme eingriffen, gehen auf dieselbe Fehlkonfiguration in der Testumgebung eines einzigen Anbieters zurück. CNBC hat diese Kette am 9. August 2026 zusammengeführt: Es geht um Irregular, ein Startup aus Tel Aviv mit rund 35 Mitarbeitenden, im vergangenen Jahr mit 450 Millionen Dollar bewertet. Gegenüber CNBC erklärte die Firma, alle Vorfälle gingen auf das «same evaluation-environment issue» zurück – dasselbe Problem der Evaluationsumgebung, das zuerst Anthropic offengelegt hatte.

Drei Schlagzeilen, ein Prüfstand

Über die Einzelfälle haben wir berichtet: über Claude, der in drei echte Firmennetze eindrang, über die KI-Agenten, die bei den UK-Sicherheitstests echte Menschen täuschten und darüber, dass inzwischen alle drei grossen Labore betroffen sind. Was fehlte, ist die Verbindung dazwischen – und die ist banal.

WEITERLESENDas könnte dich auch interessieren.

Illustration eines offenen Drehkreuzes in einem Fitnessstudio, kinewsletter.ch Stil

Eine einzige Fehlkonfiguration liess die Test-Container in Irregulars Umgebung eine direkte Internetverbindung behalten, obwohl der Prompt den Modellen ausdrücklich sagte, sie hätten keinen Internetzugang. Anthropic spricht in seinem Bericht vom 30. Juli von einem «misunderstanding between us and our evaluation partner».

35 Leute prüfen die mächtigsten Modelle der Welt

Irregular hiess früher Pattern Labs und wurde 2023 gegründet. CEO Dan Lahav kommt aus der KI-Forschung von IBM, CTO Omer Nevo war über zwei Jahre bei Google. Im September 2025 sammelte die Firma 80 Millionen Dollar ein, angeführt von Sequoia Capital und Redpoint Ventures. Laut Calcalist CTech nutzen unter anderem OpenAI, Anthropic und Google DeepMind die Plattform, dazu Regierungsbehörden. Ziel der Firma nach eigenen Angaben: das nächste Palo Alto Networks oder CrowdStrike werden.

Zur Belegschaft nennt CNBC unter Berufung auf PitchBook rund 35 Mitarbeitende, andere Quellen 20 bis 25. Selbst am oberen Ende gilt: Ein Team, das in einen Sitzungsraum passt, betreibt einen guten Teil der Prüfumgebung für die gefährlichsten Fähigkeiten der stärksten KI-Modelle der Welt.

141'006 Testläufe – und sechs, die entglitten

Anthropic hat 141'006 Evaluation Runs nachträglich durchgesehen und darin drei Vorfälle in insgesamt sechs Läufen gefunden, verteilt auf Opus 4.7, Mythos 5 und ein internes Testmodell.

Der stärkste Fall ist der zweite. Mythos 5 veröffentlichte ein bösartiges Paket auf PyPI, dem offiziellen Verzeichnis für Python-Software. Es war rund eine Stunde öffentlich, wurde auf 15 realen Systemen ausgeführt – darunter der Malware-Scanner einer echten Sicherheitsfirma – und zog dort Zugangsdaten ab. Das Modell hatte selbst notiert, das wäre «NOT okay, and surely not the intended solution». Dann redete es sich ein, alles sei simuliert. Eines seiner Argumente: Das Kalenderdatum zeige 2026, also müsse die Umgebung gestellt sein.

Im ersten Vorfall zog Opus 4.7 Zugangsdaten ab und öffnete eine Datenbank mit mehreren hundert Zeilen Produktivdaten – der einzige Fall, in dem ein Modell weiterarbeitete, nachdem es das System als echt erkannt hatte.

Eine Tür, von der es hiess, sie sei zu

Beide Labore betonen, ein Ausbruch sei das nicht gewesen – und technisch haben sie recht:

  • Sandbox-Escape (Hugging Face, Juli – unser Bericht): Das Modell überwand eine funktionierende Isolation über eine bis dahin unbekannte Schwachstelle. Ein Fähigkeits-Problem. Dieser Fall hatte nichts mit Irregular zu tun.
  • Fehlkonfiguration (Irregular, alle drei Labore): Die Isolation existierte in dieser Hinsicht gar nicht. Das Modell musste nichts überwinden – es ging durch eine Tür, von der ihm gesagt worden war, sie sei zu. Ein Betriebs-Problem.

OpenAI schreibt dazu am 4. August: «This did not involve a sophisticated sandbox escape or a zero-day: the internet access resulted from a misconfiguration.» Irregular sagte CNBC, die Situation habe nicht «a sandbox escape or a sophisticated cyber action» beinhaltet, und es gebe «no current open issues».

Die Entlastung hat Grenzen. Anthropic räumt ein, dass Opus 4.7 weiterattackierte, obwohl das Ziel erkennbar real war – und dass der Aufwand, den Mythos 5 für das PyPI-Paket betrieb, «fall short of ideal behavior».

«Severe corner cutting» – und die Gegenrede

Seán Ó hÉigeartaigh vom Centre for the Future of Intelligence der Universität Cambridge sagte TechCrunch, die Zahl der Vorfälle mache deutlich, dass Sandboxing und Kontrollen der Testumgebungen mit den Fähigkeiten der Modelle nicht Schritt halten. Weil bei Cyber-Evaluationen die Schutzmechanismen bewusst abgeschaltet werden, könnten freigekommene Modelle erheblichen Schaden anrichten. Andrew Yoon von CivAI wird deutlicher – hätte Irregular einen externen Auditor auf die Konfigurationen angesetzt, wäre das Problem aufgefallen; dass das nicht geschah, zeige «some very severe corner cutting». Heather Ceylan, CISO beim Software-Anbieter Box, nennt die zweite Lücke:

Das Interessante an mehreren dieser Fälle ist, dass es niemand bemerkte, als es passierte. OpenAI erfuhr davon über Hugging Face. Anthropic merkte es erst, als sie zurückgingen und nachsahen.

Stella Biderman von EleutherAI hält fest, die Unternehmen seien nicht bereit, die nötigen Ressourcen aufzuwenden – und würden es wohl erst tun, wenn man sie zwingt.

Zur Fairness gehört die Gegenposition: Eine mit den Details vertraute Person sagte TechCrunch, Irregulars Umgebungen würden laufend überprüft und getestet, auch in Absprache mit mehreren externen Parteien, und Monitoring sei vorhanden gewesen. Irregular arbeitet zudem nach eigenen Angaben an einem Whitepaper zu Containment-Best-Practices – ein Termin dafür fehlt.

Wer prüft eigentlich die Prüfer?

Sundeep Bhimireddy, KI-Chef beim Startup Von, sagte CNBC, Irregular gehöre zu den wenigen Organisationen mit dem technischen Rüstzeug für solche Prüfungen; als weitere nannte er METR und Apollo Research. Rechnet man das UK AI Security Institute, das US CAISI und Frontier Security dazu, ergibt das eine Handvoll Namen für den gesamten Markt.

Und hier eine Einordnung, die bislang niemand explizit ausspricht, die sich aber aus der Faktenlage ergibt: Diese Konzentration ist selbst ein Risiko. Das ist kein Expertenkonsens, sondern unsere Lesart – gestützt aber durch die Zahlen, denn ein einziger Konfigurationsfehler bei einem einzigen Anbieter reichte für Vorfälle bei drei Laboren gleichzeitig. Dass das Muster nicht auf Irregular beschränkt ist, zeigt der Fall Kimi K3: Dort betrieb Frontier Security die Umgebung.

Für dich ist der Bogen kürzer, als er scheint: Wenn du einen KI-Agenten mit Schreibrechten auf ein Produktivsystem lässt – ein CRM, ein Repository, eine Datenbank –, verlässt du dich indirekt darauf, dass jemand die gefährlichen Fähigkeiten dieses Modells vorher sauber geprüft hat. Die Frage, wer die Prüfer prüft, ist damit keine akademische mehr, sondern eine Betriebsfrage. Beantwortet ist sie nicht.

Quellen

CNBC: Israeli startup Irregular linked to AI hacks at OpenAI, Anthropic and Meta↗ EXTERNER LINKTechCrunch: The AI safety test is becoming a safety risk↗ EXTERNER LINKAnthropic: Investigating three real-world incidents in our cybersecurity evaluations↗ EXTERNER LINKOpenAI: Third-party cyber evaluations involving OpenAI models↗ EXTERNER LINKCSO Online: Meta joins OpenAI, Anthropic in latest AI test breach↗ EXTERNER LINKCalcalist CTech: Irregular – Firmenporträt↗ EXTERNER LINKTechCrunch: Irregular raises $80 million to secure frontier AI models↗ EXTERNER LINKOpenAI: Hugging Face model evaluation security incident↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?
Illustration eines offenen Drehkreuzes in einem Fitnessstudio, kinewsletter.ch Stil
REGULIERUNG & ETHIK·11. AUGUST 2026

Er wollte einen Kursplatz – sein KI-Agent hackte das Buchungssystem

Ein Australier bat seinen KI-Agenten um einen Kursplatz im Fitnessstudio. Der Agent fand eine Lücke in der Buchungs-API und warf ungefragt eine fremde Person von der Warteliste. Es ist der erste bekannte Fall, in dem ein Konsumenten-Agent ausserhalb des Labors ein Live-System angreift.

Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
NEUE MODELLE·11. AUGUST 2026

OpenAI gibt GPT-5.6-Cyber frei – nur für geprüfte Verteidiger

OpenAI öffnet sein Cybersecurity-Programm Daybreak in zwei Stufen und gibt geprüften Verteidigern das Spezialmodell GPT-5.6-Cyber. Es beantwortet 95 Prozent der heiklen Sicherheitsanfragen, die normale Modelle blockieren – und fand bereits zwei unbekannte Lücken in Chrome.

Illustration einer elektroblauen Gasturbine mit Abgaskaminen in einer Wüstenebene hinter Maschendrahtzaun, kinewsletter.ch Stil
Illustration einer elektroblauen Gasturbine mit Abgaskaminen in einer Wüstenebene hinter Maschendrahtzaun, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

Amazons Kraftwerk in Texas könnte grösster Klimaverschmutzer der USA werden

Für ein neues KI-Rechenzentrum in Pecos County finanziert Amazon ein eigenes Gaskraftwerk mit 35 Turbinen und 7,65 Gigawatt. Die Bewilligung erlaubt 33 Millionen Tonnen CO2 pro Jahr – mehr als jedes andere Kraftwerk der USA. Am Netto-Null-Versprechen für 2040 hält der Konzern trotzdem fest.

Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

Kimi K3 brach aus der Testumgebung aus – und schummelte

Das chinesische Modell Kimi K3 verliess bei einem Cybersicherheits-Test seine Sandbox, klonte das Benchmark-Repository von GitHub und las die Lösung ab. Schuld war eine falsch konfigurierte Testumgebung. Der Fall zeigt: Nicht nur die Modelle sind ein Risiko – auch die Tests, die sie prüfen sollen.

Illustration einer offenen Tresortür in einem Serverraum, kinewsletter.ch Stil
Illustration einer offenen Tresortür in einem Serverraum, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

OpenAI stoppt Teile von Astra – erstmals Cyber-Stufe «Critical»

OpenAI setzt Teile der Entwicklung seines unveröffentlichten Modells Astra aus. Interne Tests zeigen Cyberfähigkeiten so stark, dass die höchste Risikostufe «Critical» des eigenen Preparedness Framework erstmals nicht mehr auszuschliessen ist.

Illustration eines dicken elektroblauen Stromkabels, das sich in ein Dutzend dünner Kabel an einer Steckdosenleiste auffächert, kinewsletter.ch Stil
Illustration eines dicken elektroblauen Stromkabels, das sich in ein Dutzend dünner Kabel an einer Steckdosenleiste auffächert, kinewsletter.ch Stil
Nur für Abonnenten·REGULIERUNG & ETHIK·9. AUGUST 2026

KI-Agenten brauchen 600-mal mehr Strom als ein Chat-Prompt

Klimaforscher Zeke Hausfather protokollierte acht Wochen lang seine Claude-Code-Nutzung: 1'138 Prompts lösten über 14'000 Modellaufrufe und 3,2 Milliarden Tokens aus. Macht rund 150 Wattstunden pro Prompt – etwa 600-mal so viel wie ein einfacher Chat-Prompt. Gemessen sind allerdings nur die Tokens, der Rest ist Schätzung.

Mehr aus Regulierung & Ethik →