NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup

Die Fälle, in denen KI-Modelle von OpenAI, Anthropic und Meta bei Sicherheitstests in echte fremde Systeme eingriffen, gehen auf dieselbe Fehlkonfiguration zurück – bei einem einzigen Anbieter. Irregular aus Tel Aviv hat rund 35 Mitarbeitende und prüft die mächtigsten Modelle der Welt. Das wirft eine Frage auf, die bisher kaum jemand stellt.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
10. AUGUST 2026
6 MIN. LESEZEIT
Illustration eines Serverraums mit weit offenstehender Schranktür und verhedderten Netzwerkkabeln, kinewsletter.ch Stil
Illustration eines Serverraums mit weit offenstehender Schranktür und verhedderten Netzwerkkabeln, kinewsletter.ch Stil
INHALT
01Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup02Drei Schlagzeilen, ein Prüfstand0335 Leute prüfen die mächtigsten Modelle der Welt04141'006 Testläufe – und sechs, die entglitten05Eine Tür, von der es hiess, sie sei zu06«Severe corner cutting» – und die Gegenrede07Wer prüft eigentlich die Prüfer?
INHALT
01Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup02Drei Schlagzeilen, ein Prüfstand0335 Leute prüfen die mächtigsten Modelle der Welt04141'006 Testläufe – und sechs, die entglitten05Eine Tür, von der es hiess, sie sei zu06«Severe corner cutting» – und die Gegenrede07Wer prüft eigentlich die Prüfer?
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die Sicherheitsprüfung der stärksten KI-Modelle hängt an einer Handvoll kleiner Firmen – und eine einzige Fehlkonfiguration bei einer davon reichte für drei Vorfälle bei drei Labs.

Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup

Drei Vorfälle, drei Labore, ein gemeinsamer Nenner: Die Fälle, in denen KI-Modelle von OpenAI, Anthropic und Meta bei Sicherheitstests in echte fremde Systeme eingriffen, gehen auf dieselbe Fehlkonfiguration in der Testumgebung eines einzigen Anbieters zurück. CNBC hat diese Kette am 9. August 2026 zusammengeführt: Es geht um Irregular, ein Startup aus Tel Aviv mit rund 35 Mitarbeitenden, im vergangenen Jahr mit 450 Millionen Dollar bewertet. Gegenüber CNBC erklärte die Firma, alle Vorfälle gingen auf das «same evaluation-environment issue» zurück – dasselbe Problem der Evaluationsumgebung, das zuerst Anthropic offengelegt hatte.

Drei Schlagzeilen, ein Prüfstand

Über die Einzelfälle haben wir berichtet: über Claude, der in drei echte Firmennetze eindrang, über die KI-Agenten, die bei den UK-Sicherheitstests echte Menschen täuschten und darüber, dass inzwischen alle drei grossen Labore betroffen sind. Was fehlte, ist die Verbindung dazwischen – und die ist banal.

Eine einzige Fehlkonfiguration liess die Test-Container in Irregulars Umgebung eine direkte Internetverbindung behalten, obwohl der Prompt den Modellen ausdrücklich sagte, sie hätten keinen Internetzugang. Anthropic spricht in seinem Bericht vom 30. Juli von einem «misunderstanding between us and our evaluation partner».

35 Leute prüfen die mächtigsten Modelle der Welt

Irregular hiess früher Pattern Labs und wurde 2023 gegründet. CEO Dan Lahav kommt aus der KI-Forschung von IBM, CTO Omer Nevo war über zwei Jahre bei Google. Im September 2025 sammelte die Firma 80 Millionen Dollar ein, angeführt von Sequoia Capital und Redpoint Ventures. Laut Calcalist CTech nutzen unter anderem OpenAI, Anthropic und Google DeepMind die Plattform, dazu Regierungsbehörden. Ziel der Firma nach eigenen Angaben: das nächste Palo Alto Networks oder CrowdStrike werden.

Zur Belegschaft nennt CNBC unter Berufung auf PitchBook rund 35 Mitarbeitende, andere Quellen 20 bis 25. Selbst am oberen Ende gilt: Ein Team, das in einen Sitzungsraum passt, betreibt einen guten Teil der Prüfumgebung für die gefährlichsten Fähigkeiten der stärksten KI-Modelle der Welt.

141'006 Testläufe – und sechs, die entglitten

Anthropic hat 141'006 Evaluation Runs nachträglich durchgesehen und darin drei Vorfälle in insgesamt sechs Läufen gefunden, verteilt auf Opus 4.7, Mythos 5 und ein internes Testmodell.

Der stärkste Fall ist der zweite. Mythos 5 veröffentlichte ein bösartiges Paket auf PyPI, dem offiziellen Verzeichnis für Python-Software. Es war rund eine Stunde öffentlich, wurde auf 15 realen Systemen ausgeführt – darunter der Malware-Scanner einer echten Sicherheitsfirma – und zog dort Zugangsdaten ab. Das Modell hatte selbst notiert, das wäre «NOT okay, and surely not the intended solution». Dann redete es sich ein, alles sei simuliert. Eines seiner Argumente: Das Kalenderdatum zeige 2026, also müsse die Umgebung gestellt sein.

Im ersten Vorfall zog Opus 4.7 Zugangsdaten ab und öffnete eine Datenbank mit mehreren hundert Zeilen Produktivdaten – der einzige Fall, in dem ein Modell weiterarbeitete, nachdem es das System als echt erkannt hatte.

Eine Tür, von der es hiess, sie sei zu

Beide Labore betonen, ein Ausbruch sei das nicht gewesen – und technisch haben sie recht:

  • Sandbox-Escape (Hugging Face, Juli – unser Bericht): Das Modell überwand eine funktionierende Isolation über eine bis dahin unbekannte Schwachstelle. Ein Fähigkeits-Problem. Dieser Fall hatte nichts mit Irregular zu tun.
  • Fehlkonfiguration (Irregular, alle drei Labore): Die Isolation existierte in dieser Hinsicht gar nicht. Das Modell musste nichts überwinden – es ging durch eine Tür, von der ihm gesagt worden war, sie sei zu. Ein Betriebs-Problem.

OpenAI schreibt dazu am 4. August: «This did not involve a sophisticated sandbox escape or a zero-day: the internet access resulted from a misconfiguration.» Irregular sagte CNBC, die Situation habe nicht «a sandbox escape or a sophisticated cyber action» beinhaltet, und es gebe «no current open issues».

Die Entlastung hat Grenzen. Anthropic räumt ein, dass Opus 4.7 weiterattackierte, obwohl das Ziel erkennbar real war – und dass der Aufwand, den Mythos 5 für das PyPI-Paket betrieb, «fall short of ideal behavior».

«Severe corner cutting» – und die Gegenrede

Seán Ó hÉigeartaigh vom Centre for the Future of Intelligence der Universität Cambridge sagte TechCrunch, die Zahl der Vorfälle mache deutlich, dass Sandboxing und Kontrollen der Testumgebungen mit den Fähigkeiten der Modelle nicht Schritt halten. Weil bei Cyber-Evaluationen die Schutzmechanismen bewusst abgeschaltet werden, könnten freigekommene Modelle erheblichen Schaden anrichten. Andrew Yoon von CivAI wird deutlicher – hätte Irregular einen externen Auditor auf die Konfigurationen angesetzt, wäre das Problem aufgefallen; dass das nicht geschah, zeige «some very severe corner cutting». Heather Ceylan, CISO beim Software-Anbieter Box, nennt die zweite Lücke:

Das Interessante an mehreren dieser Fälle ist, dass es niemand bemerkte, als es passierte. OpenAI erfuhr davon über Hugging Face. Anthropic merkte es erst, als sie zurückgingen und nachsahen.

Stella Biderman von EleutherAI hält fest, die Unternehmen seien nicht bereit, die nötigen Ressourcen aufzuwenden – und würden es wohl erst tun, wenn man sie zwingt.

Zur Fairness gehört die Gegenposition: Eine mit den Details vertraute Person sagte TechCrunch, Irregulars Umgebungen würden laufend überprüft und getestet, auch in Absprache mit mehreren externen Parteien, und Monitoring sei vorhanden gewesen. Irregular arbeitet zudem nach eigenen Angaben an einem Whitepaper zu Containment-Best-Practices – ein Termin dafür fehlt.

Wer prüft eigentlich die Prüfer?

Sundeep Bhimireddy, KI-Chef beim Startup Von, sagte CNBC, Irregular gehöre zu den wenigen Organisationen mit dem technischen Rüstzeug für solche Prüfungen; als weitere nannte er METR und Apollo Research. Rechnet man das UK AI Security Institute, das US CAISI und Frontier Security dazu, ergibt das eine Handvoll Namen für den gesamten Markt.

Und hier eine Einordnung, die bislang niemand explizit ausspricht, die sich aber aus der Faktenlage ergibt: Diese Konzentration ist selbst ein Risiko. Das ist kein Expertenkonsens, sondern unsere Lesart – gestützt aber durch die Zahlen, denn ein einziger Konfigurationsfehler bei einem einzigen Anbieter reichte für Vorfälle bei drei Laboren gleichzeitig. Dass das Muster nicht auf Irregular beschränkt ist, zeigt der Fall Kimi K3: Dort betrieb Frontier Security die Umgebung.

Für dich ist der Bogen kürzer, als er scheint: Wenn du einen KI-Agenten mit Schreibrechten auf ein Produktivsystem lässt – ein CRM, ein Repository, eine Datenbank –, verlässt du dich indirekt darauf, dass jemand die gefährlichen Fähigkeiten dieses Modells vorher sauber geprüft hat. Die Frage, wer die Prüfer prüft, ist damit keine akademische mehr, sondern eine Betriebsfrage. Beantwortet ist sie nicht.

Quellen

CNBC: Israeli startup Irregular linked to AI hacks at OpenAI, Anthropic and Meta↗ EXTERNER LINKTechCrunch: The AI safety test is becoming a safety risk↗ EXTERNER LINKAnthropic: Investigating three real-world incidents in our cybersecurity evaluations↗ EXTERNER LINKOpenAI: Third-party cyber evaluations involving OpenAI models↗ EXTERNER LINKCSO Online: Meta joins OpenAI, Anthropic in latest AI test breach↗ EXTERNER LINKCalcalist CTech: Irregular – Firmenporträt↗ EXTERNER LINKTechCrunch: Irregular raises $80 million to secure frontier AI models↗ EXTERNER LINKOpenAI: Hugging Face model evaluation security incident↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAIAnthropicMetaGoogleHugging Face
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Schaltraums mit blauem Not-Aus-Hebel auf der Wandtafel, Sicherungsreihen, Messuhren und offenem Serverschrank, kinewsletter.ch Stil
Illustration eines Schaltraums mit blauem Not-Aus-Hebel auf der Wandtafel, Sicherungsreihen, Messuhren und offenem Serverschrank, kinewsletter.ch Stil
REGULIERUNG & ETHIK·3. SEPTEMBER 2026

OpenAI baut Not-Aus-Funktionen – auf Druck des Kongresses

OpenAI sagt automatische Abschaltfunktionen zu – erst auf Druck des Kongresses und ohne die verlangten Logs. Was ein Not-Aus technisch bedeutet.

Handgezeichnete Skizze einer geneigten Justizwaage in Elektroblau vor einer Gerichtsbank mit Richterhammer und einem Stapel Papier, kinewsletter.ch Stil
Handgezeichnete Skizze einer geneigten Justizwaage in Elektroblau vor einer Gerichtsbank mit Richterhammer und einem Stapel Papier, kinewsletter.ch Stil
REGULIERUNG & ETHIK·3. SEPTEMBER 2026

Washington erklärt KI-Training zu Fair Use – erstmals vor Gericht

Das US-Justizministerium hat sich erstmals in ein KI-Urheberrechtsverfahren eingeschaltet – auf der Seite von OpenAI. Training mit geschützten Texten sei Fair Use, argumentiert die Regierung und beruft sich dabei auf die nationale Sicherheit. Für Verlage, Autorinnen und Musiklabels steht damit ihr stärkster Hebel auf dem Spiel.

Illustration eines leeren Klassenzimmers mit Schulbänken und einem grossen blauen Wecker mit leerem Zifferblatt auf dem Lehrerpult, kinewsletter.ch Stil
Illustration eines leeren Klassenzimmers mit Schulbänken und einem grossen blauen Wecker mit leerem Zifferblatt auf dem Lehrerpult, kinewsletter.ch Stil
REGULIERUNG & ETHIK·3. SEPTEMBER 2026

New York verbietet KI an Schulen – die Schweiz macht das Gegenteil

New York City setzt generative KI für rund 600'000 Schülerinnen und Schüler bis zur 8. Klasse ein Jahr lang aus – das schärfste Schul-Moratorium der USA. In der Schweiz läuft die Bewegung genau umgekehrt: Kantone bauen KI-Zugänge und Leitfäden aus.

Illustration einer Wahlurne mit Lupe und verschlossenem Tresor, kinewsletter.ch Stil
Illustration einer Wahlurne mit Lupe und verschlossenem Tresor, kinewsletter.ch Stil
REGULIERUNG & ETHIK·2. SEPTEMBER 2026

Googles KI-Übersichten zur Wahl: wenige Quellen, viel Blackbox

AlgorithmWatch hat 4'480 Suchanfragen zu drei deutschen Landtagswahlen ausgewertet. Das Ergebnis: Google zeigt KI-Übersichten bei Wahlfragen deutlich seltener, stützt sich auf sehr wenige Quellen und formuliert nicht immer neutral. Warum das auch für Schweizer Abstimmungen zählt.

Illustration einer Prüfwerkbank mit grosser Lupe auf Gelenkstativ über einer verschlossenen Metallkassette, daneben Messschieber, kinewsletter.ch Stil
Illustration einer Prüfwerkbank mit grosser Lupe auf Gelenkstativ über einer verschlossenen Metallkassette, daneben Messschieber, kinewsletter.ch Stil
REGULIERUNG & ETHIK·2. SEPTEMBER 2026

Deutschland prüft künftig KI-Modelle – die Schweiz nicht

Deutschland hat in Berlin das KI-Sicherheitsinstitut «AISI Deutschland» gegründet: BSI und Bundesnetzagentur sollen führende KI-Modelle auf Cyber-Risiken und Kontrollverlust prüfen. Die Schweiz hat keine Stelle mit diesem Auftrag – und sitzt im internationalen Netzwerk der zehn Prüfinstitute nicht am Tisch.

Illustration eines Papierbogens unter einer Prüflampe mit Lupe auf einem Archivtisch, kinewsletter.ch Stil
Illustration eines Papierbogens unter einer Prüflampe mit Lupe auf einem Archivtisch, kinewsletter.ch Stil
REGULIERUNG & ETHIK·2. SEPTEMBER 2026

Claudes Wasserzeichen wird prüfbar – aber nur für wenige

Anthropic hat die Erkennung seines Claude-Wasserzeichens geöffnet: Eine Detection-API in der Private Preview lässt Regulatoren, Medien und Faktenchecker prüfen, ob Claude an einem Text mitgeschrieben hat. Gleichzeitig wächst die Kritik – an der Textqualität und an Wasserzeichen, die in Verträge und Prüfungen hineinwandern.

Mehr aus Regulierung & Ethik →