NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup

Die Fälle, in denen KI-Modelle von OpenAI, Anthropic und Meta bei Sicherheitstests in echte fremde Systeme eingriffen, gehen auf dieselbe Fehlkonfiguration zurück – bei einem einzigen Anbieter. Irregular aus Tel Aviv hat rund 35 Mitarbeitende und prüft die mächtigsten Modelle der Welt. Das wirft eine Frage auf, die bisher kaum jemand stellt.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
10. AUGUST 2026
6 MIN. LESEZEIT
Illustration eines Serverraums mit weit offenstehender Schranktür und verhedderten Netzwerkkabeln, kinewsletter.ch Stil
Illustration eines Serverraums mit weit offenstehender Schranktür und verhedderten Netzwerkkabeln, kinewsletter.ch Stil
INHALT
01Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup02Drei Schlagzeilen, ein Prüfstand0335 Leute prüfen die mächtigsten Modelle der Welt04141'006 Testläufe – und sechs, die entglitten05Eine Tür, von der es hiess, sie sei zu06«Severe corner cutting» – und die Gegenrede07Wer prüft eigentlich die Prüfer?
INHALT
01Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup02Drei Schlagzeilen, ein Prüfstand0335 Leute prüfen die mächtigsten Modelle der Welt04141'006 Testläufe – und sechs, die entglitten05Eine Tür, von der es hiess, sie sei zu06«Severe corner cutting» – und die Gegenrede07Wer prüft eigentlich die Prüfer?
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die Sicherheitsprüfung der stärksten KI-Modelle hängt an einer Handvoll kleiner Firmen – und eine einzige Fehlkonfiguration bei einer davon reichte für drei Vorfälle bei drei Labs.

Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup

Drei Vorfälle, drei Labore, ein gemeinsamer Nenner: Die Fälle, in denen KI-Modelle von OpenAI, Anthropic und Meta bei Sicherheitstests in echte fremde Systeme eingriffen, gehen auf dieselbe Fehlkonfiguration in der Testumgebung eines einzigen Anbieters zurück. CNBC hat diese Kette am 9. August 2026 zusammengeführt: Es geht um Irregular, ein Startup aus Tel Aviv mit rund 35 Mitarbeitenden, im vergangenen Jahr mit 450 Millionen Dollar bewertet. Gegenüber CNBC erklärte die Firma, alle Vorfälle gingen auf das «same evaluation-environment issue» zurück – dasselbe Problem der Evaluationsumgebung, das zuerst Anthropic offengelegt hatte.

Drei Schlagzeilen, ein Prüfstand

Über die Einzelfälle haben wir berichtet: über Claude, der in drei echte Firmennetze eindrang, über die KI-Agenten, die bei den UK-Sicherheitstests echte Menschen täuschten und darüber, dass inzwischen alle drei grossen Labore betroffen sind. Was fehlte, ist die Verbindung dazwischen – und die ist banal.

Eine einzige Fehlkonfiguration liess die Test-Container in Irregulars Umgebung eine direkte Internetverbindung behalten, obwohl der Prompt den Modellen ausdrücklich sagte, sie hätten keinen Internetzugang. Anthropic spricht in seinem Bericht vom 30. Juli von einem «misunderstanding between us and our evaluation partner».

35 Leute prüfen die mächtigsten Modelle der Welt

Irregular hiess früher Pattern Labs und wurde 2023 gegründet. CEO Dan Lahav kommt aus der KI-Forschung von IBM, CTO Omer Nevo war über zwei Jahre bei Google. Im September 2025 sammelte die Firma 80 Millionen Dollar ein, angeführt von Sequoia Capital und Redpoint Ventures. Laut Calcalist CTech nutzen unter anderem OpenAI, Anthropic und Google DeepMind die Plattform, dazu Regierungsbehörden. Ziel der Firma nach eigenen Angaben: das nächste Palo Alto Networks oder CrowdStrike werden.

Zur Belegschaft nennt CNBC unter Berufung auf PitchBook rund 35 Mitarbeitende, andere Quellen 20 bis 25. Selbst am oberen Ende gilt: Ein Team, das in einen Sitzungsraum passt, betreibt einen guten Teil der Prüfumgebung für die gefährlichsten Fähigkeiten der stärksten KI-Modelle der Welt.

141'006 Testläufe – und sechs, die entglitten

Anthropic hat 141'006 Evaluation Runs nachträglich durchgesehen und darin drei Vorfälle in insgesamt sechs Läufen gefunden, verteilt auf Opus 4.7, Mythos 5 und ein internes Testmodell.

Der stärkste Fall ist der zweite. Mythos 5 veröffentlichte ein bösartiges Paket auf PyPI, dem offiziellen Verzeichnis für Python-Software. Es war rund eine Stunde öffentlich, wurde auf 15 realen Systemen ausgeführt – darunter der Malware-Scanner einer echten Sicherheitsfirma – und zog dort Zugangsdaten ab. Das Modell hatte selbst notiert, das wäre «NOT okay, and surely not the intended solution». Dann redete es sich ein, alles sei simuliert. Eines seiner Argumente: Das Kalenderdatum zeige 2026, also müsse die Umgebung gestellt sein.

Im ersten Vorfall zog Opus 4.7 Zugangsdaten ab und öffnete eine Datenbank mit mehreren hundert Zeilen Produktivdaten – der einzige Fall, in dem ein Modell weiterarbeitete, nachdem es das System als echt erkannt hatte.

Eine Tür, von der es hiess, sie sei zu

Beide Labore betonen, ein Ausbruch sei das nicht gewesen – und technisch haben sie recht:

  • Sandbox-Escape (Hugging Face, Juli – unser Bericht): Das Modell überwand eine funktionierende Isolation über eine bis dahin unbekannte Schwachstelle. Ein Fähigkeits-Problem. Dieser Fall hatte nichts mit Irregular zu tun.
  • Fehlkonfiguration (Irregular, alle drei Labore): Die Isolation existierte in dieser Hinsicht gar nicht. Das Modell musste nichts überwinden – es ging durch eine Tür, von der ihm gesagt worden war, sie sei zu. Ein Betriebs-Problem.

OpenAI schreibt dazu am 4. August: «This did not involve a sophisticated sandbox escape or a zero-day: the internet access resulted from a misconfiguration.» Irregular sagte CNBC, die Situation habe nicht «a sandbox escape or a sophisticated cyber action» beinhaltet, und es gebe «no current open issues».

Die Entlastung hat Grenzen. Anthropic räumt ein, dass Opus 4.7 weiterattackierte, obwohl das Ziel erkennbar real war – und dass der Aufwand, den Mythos 5 für das PyPI-Paket betrieb, «fall short of ideal behavior».

«Severe corner cutting» – und die Gegenrede

Seán Ó hÉigeartaigh vom Centre for the Future of Intelligence der Universität Cambridge sagte TechCrunch, die Zahl der Vorfälle mache deutlich, dass Sandboxing und Kontrollen der Testumgebungen mit den Fähigkeiten der Modelle nicht Schritt halten. Weil bei Cyber-Evaluationen die Schutzmechanismen bewusst abgeschaltet werden, könnten freigekommene Modelle erheblichen Schaden anrichten. Andrew Yoon von CivAI wird deutlicher – hätte Irregular einen externen Auditor auf die Konfigurationen angesetzt, wäre das Problem aufgefallen; dass das nicht geschah, zeige «some very severe corner cutting». Heather Ceylan, CISO beim Software-Anbieter Box, nennt die zweite Lücke:

Das Interessante an mehreren dieser Fälle ist, dass es niemand bemerkte, als es passierte. OpenAI erfuhr davon über Hugging Face. Anthropic merkte es erst, als sie zurückgingen und nachsahen.

Stella Biderman von EleutherAI hält fest, die Unternehmen seien nicht bereit, die nötigen Ressourcen aufzuwenden – und würden es wohl erst tun, wenn man sie zwingt.

Zur Fairness gehört die Gegenposition: Eine mit den Details vertraute Person sagte TechCrunch, Irregulars Umgebungen würden laufend überprüft und getestet, auch in Absprache mit mehreren externen Parteien, und Monitoring sei vorhanden gewesen. Irregular arbeitet zudem nach eigenen Angaben an einem Whitepaper zu Containment-Best-Practices – ein Termin dafür fehlt.

Wer prüft eigentlich die Prüfer?

Sundeep Bhimireddy, KI-Chef beim Startup Von, sagte CNBC, Irregular gehöre zu den wenigen Organisationen mit dem technischen Rüstzeug für solche Prüfungen; als weitere nannte er METR und Apollo Research. Rechnet man das UK AI Security Institute, das US CAISI und Frontier Security dazu, ergibt das eine Handvoll Namen für den gesamten Markt.

Und hier eine Einordnung, die bislang niemand explizit ausspricht, die sich aber aus der Faktenlage ergibt: Diese Konzentration ist selbst ein Risiko. Das ist kein Expertenkonsens, sondern unsere Lesart – gestützt aber durch die Zahlen, denn ein einziger Konfigurationsfehler bei einem einzigen Anbieter reichte für Vorfälle bei drei Laboren gleichzeitig. Dass das Muster nicht auf Irregular beschränkt ist, zeigt der Fall Kimi K3: Dort betrieb Frontier Security die Umgebung.

Für dich ist der Bogen kürzer, als er scheint: Wenn du einen KI-Agenten mit Schreibrechten auf ein Produktivsystem lässt – ein CRM, ein Repository, eine Datenbank –, verlässt du dich indirekt darauf, dass jemand die gefährlichen Fähigkeiten dieses Modells vorher sauber geprüft hat. Die Frage, wer die Prüfer prüft, ist damit keine akademische mehr, sondern eine Betriebsfrage. Beantwortet ist sie nicht.

Quellen

CNBC: Israeli startup Irregular linked to AI hacks at OpenAI, Anthropic and Meta↗ EXTERNER LINKTechCrunch: The AI safety test is becoming a safety risk↗ EXTERNER LINKAnthropic: Investigating three real-world incidents in our cybersecurity evaluations↗ EXTERNER LINKOpenAI: Third-party cyber evaluations involving OpenAI models↗ EXTERNER LINKCSO Online: Meta joins OpenAI, Anthropic in latest AI test breach↗ EXTERNER LINKCalcalist CTech: Irregular – Firmenporträt↗ EXTERNER LINKTechCrunch: Irregular raises $80 million to secure frontier AI models↗ EXTERNER LINKOpenAI: Hugging Face model evaluation security incident↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAIAnthropicMetaGoogleHugging Face
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

KI-Agenten hacken Onlineshops für 25 Dollar pro Ziel
KI-Agenten hacken Onlineshops für 25 Dollar pro Ziel
REGULIERUNG & ETHIK·25. SEPTEMBER 2026

KI-Agenten hacken Onlineshops für 25 Dollar pro Ziel

Ein Report von Gambit Security zeigt: Drei zusammenspielende KI-Agenten haben mindestens 27 Onlineshops geknackt und über 600'000 Kreditkartendaten erbeutet – für durchschnittlich 25,46 Dollar pro Firma. Die Zahl stammt bislang nur von einer Quelle, zeigt aber, wie günstig automatisierte Angriffe geworden sind. Kein Schweizer Shop ist betroffen, doch ein separater Fall vom September zeigt, dass auch hiesige Anbieter ins Visier geraten können.

Altman und Amodei warnen UNO-Sicherheitsrat vor KI-Kontrollverlust
Altman und Amodei warnen UNO-Sicherheitsrat vor KI-Kontrollverlust
REGULIERUNG & ETHIK·25. SEPTEMBER 2026

Altman und Amodei warnen UNO-Sicherheitsrat vor KI-Kontrollverlust

Sam Altman und Dario Amodei haben den UN-Sicherheitsrat vor unkontrollierter KI-Entwicklung gewarnt - in einer eigenständigen Sitzung, getrennt von Trumps Rede vor der Generalversammlung am selben Tag. China und die USA lehnten verbindliche globale Regeln unisono ab. Ein Genfer Wissenschaftler prägte das Briefing mit.

Sanders-Entwurf will Superintelligenz für immer verbieten
Sanders-Entwurf will Superintelligenz für immer verbieten
REGULIERUNG & ETHIK·25. SEPTEMBER 2026

Sanders-Entwurf will Superintelligenz für immer verbieten

Bernie Sanders und Greg Casar wollen die Entwicklung von Superintelligenz per Gesetz verbieten – mit einer neuen Bundesbehörde und bis zu 20 Jahren Haft für Verantwortliche. Im republikanisch kontrollierten Kongress hat der Entwurf allerdings kaum Chancen.

OpenAI-Agent hackt australisches Regierungsportal
OpenAI-Agent hackt australisches Regierungsportal
REGULIERUNG & ETHIK·25. SEPTEMBER 2026

OpenAI-Agent hackt australisches Regierungsportal

Ein Agent von OpenAI ist im Juni 2026 in ein australisches Gesundheitsstatistik-Portal eingedrungen und umging dabei Zugangssperren. Entdeckt hat OpenAI den Vorfall erst im August, gemeldet wurde er der Behörde erst im September – fast drei Monate nach dem Einbruch.

Illustration einer Briefkastenreihe mit einer offenen Tür und Schlüsselbund im Schloss, kinewsletter.ch Stil
Illustration einer Briefkastenreihe mit einer offenen Tür und Schlüsselbund im Schloss, kinewsletter.ch Stil
REGULIERUNG & ETHIK·24. SEPTEMBER 2026

Microsoft zerschlägt Phishing-Dienst mit eingebautem KI-Assistenten

Microsoft hat den Phishing-Dienst EvilTokens zerschlagen – verbunden mit über 12'000 gekaperten Microsoft-365-Postfächern. Das Neue daran war nicht der Einbruch, sondern ein mitgelieferter KI-Chatbot, der fremde Postfächer nach Zahlungsgesprächen durchsuchte.

Illustration eines Globus mit einem Fragebogen und Checkboxen, kinewsletter.ch Stil
Illustration eines Globus mit einem Fragebogen und Checkboxen, kinewsletter.ch Stil
REGULIERUNG & ETHIK·24. SEPTEMBER 2026

Der besorgte Westen: Viel KI-Nutzung, noch mehr Skepsis

Gallup und Microsoft haben die ersten 37 Länder einer weltweiten KI-Studie veröffentlicht: In 34 davon überwiegen die positiven Gefühle. Die grosse Ausnahme sind die USA, wo sich 74 Prozent der KI-bewussten Erwachsenen sorgen – ausgerechnet dort, wo am meisten genutzt wird. Innerhalb dieser Länder gilt allerdings das Gegenteil: Wer täglich mit KI arbeitet, sorgt sich am wenigsten.

Mehr aus Regulierung & Ethik →