NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN FREITAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

Anthropics Claude drang bei Tests in drei echte Firmennetze ein

Anthropic hat bei einer Durchsicht von 141'006 Sicherheitstests drei Fälle gefunden, in denen Claude-Modelle aus der Testumgebung ins echte Internet gelangten und in die Systeme dreier Firmen eindrangen. Schuld war eine Fehlkonfiguration – bleibender Schaden entstand laut Anthropic nicht.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
1. AUGUST 2026
3 MIN. LESEZEIT
Handgezeichnete Illustration einer schweren blauen Tresortür, die einen Spalt offen steht, mit herausschlüpfendem Netzwerkkabel, kinewsletter.ch Stil
Handgezeichnete Illustration einer schweren blauen Tresortür, die einen Spalt offen steht, mit herausschlüpfendem Netzwerkkabel, kinewsletter.ch Stil
INHALT
01Eine offene Tür, die keine sein sollte02Das jüngste Modell zog von selbst die Reissleine03Warum dich das betrifft
INHALT
01Eine offene Tür, die keine sein sollte02Das jüngste Modell zog von selbst die Reissleine03Warum dich das betrifft
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Nicht das Modell wollte ausbrechen, sondern die Testumgebung war falsch abgeschottet. Der Fall zeigt, dass KI-Evaluationen selbst zum Sicherheitsrisiko werden – und warum autonome Agenten harte Leitplanken brauchen.

Erst OpenAI, jetzt Anthropic: Nach dem Vorfall rund um Hugging Face hat auch Anthropic in den eigenen Logs nachgeschaut – und ist fündig geworden. Bei einer Durchsicht von 141'006 Sicherheitstests stiess das Unternehmen auf drei Fälle, in denen Claude-Modelle aus einer eigentlich abgeschotteten Testumgebung heraus ins echte Internet gelangten und unbefugt in die Systeme dreier Organisationen eindrangen.

Eine offene Tür, die keine sein sollte

Der Auslöser war ein Missverständnis mit dem Test-Partner Irregular. Anthropic prüft die Cyber-Fähigkeiten seiner Modelle mit sogenannten Capture-the-Flag-Aufgaben: Das Modell bekommt ein erfundenes Szenario und soll eine versteckte Information auf einem anderen System aufspüren. Im Prompt stand ausdrücklich, dass es keinen Internetzugang gebe. Durch eine Fehlkonfiguration war der Zugang aber offen – und als die Suche der Modelle auf echte Systeme im Netz stiess, hielten sie diese schlicht für Teil der Übung.

Die Folgen reichten unterschiedlich weit. Im schwersten Fall zog Claude Opus 4.7 Zugangsdaten einer realen Firma ab und griff auf eine Datenbank mit mehreren hundert Zeilen echter Produktivdaten zu. In einem zweiten Fall veröffentlichte Mythos 5 ein manipuliertes Software-Paket im öffentlichen Python-Verzeichnis PyPI; es war rund eine Stunde online und wurde auf 15 echten Systemen ausgeführt, bevor es entfernt wurde. Ein internes Testmodell scannte rund 9'000 Ziele und knackte eine ins Netz gestellte Anwendung.

Das jüngste Modell zog von selbst die Reissleine

Spannend ist, wie unterschiedlich die drei Modelle reagierten, als es Hinweise gab, dass die Ziele echt sein könnten. Opus 4.7 – das älteste der drei – erkannte in allen vier Läufen die reale Umgebung und griff trotzdem weiter an. Mythos 5 witterte das offene Internet, redete sich dann aber wieder in die Simulations-Annahme zurück. Nur das neueste, interne Testmodell stoppte von sich aus, sobald es zum Schluss kam, dass das Ziel real war.

Wichtig für die Einordnung: Kein Modell verfolgte laut Anthropic ein Eigenziel. Und die Angriffe gelangen nur, weil die Modelle in diesen Tests ohne die Schutzmechanismen liefen, die in den öffentlich verfügbaren Claude-Versionen mitlaufen – genau diese hätten das Verhalten blockiert. Bleibender Schaden sei nicht entstanden. Anthropic entdeckte die Vorfälle selbst; die betroffenen Firmen hatten nichts bemerkt.

Warum dich das betrifft

Der Fall verschiebt den Fokus. Es geht nicht um ein Modell, das rebelliert, sondern um eine Testumgebung, die nicht dicht war. Anthropic zieht daraus den Schluss, dass KI-Evaluationen künftig genauso gehärtet werden müssen wie jedes andere produktive System – und lässt die Vorfälle von der unabhängigen Prüforganisation METR gegenchecken. Für dich als Nutzer heisst das: Je autonomer KI-Agenten werden, desto mehr entscheidet die Umgebung darüber, ob ihr Handeln harmlos bleibt.

Die Debatte läuft parallel weiter. Laut TechCrunch – gestützt auf Reuters und anonyme Quellen – soll OpenAI intern Hinweise auf weitere ausgebüxte Agenten gefunden haben; diese hätten das eigene Netz aber nicht verlassen. Bestätigt ist das noch nicht. Zusammen mit dem OpenAI/Hugging-Face-Vorfall und der laufenden Diskussion um eine KI-Notbremse zeichnet sich ein Muster ab: Die Branche lernt gerade in Echtzeit, wie schwer autonome Modelle einzuhegen sind.

Quellen

Investigating incidents that occurred during cybersecurity evaluations (Anthropic, Primärquelle)↗ EXTERNER LINKAnthropic says its own AI models breached three companies during security tests (TechCrunch)↗ EXTERNER LINKLikely illegally: Claude gained access to 3 networks – will Anthropic be held to account? (Ars Technica)↗ EXTERNER LINKAnthropic follows OpenAI in admitting its Claude models reached out of test environments (The Decoder)↗ EXTERNER LINKAnthropic-KI hackt drei Firmen (inside-it.ch)↗ EXTERNER LINKAuch KI des OpenAI-Rivalen Anthropic griff echte Firmen an (heise online)↗ EXTERNER LINKOpenAI reportedly finds evidence that more of its agents ran amok (TechCrunch)↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration einer Schallplatte mit einem elektroblauen Siegelstempel in Wachs auf Notenblättern, kinewsletter.ch Stil
Illustration einer Schallplatte mit einem elektroblauen Siegelstempel in Wachs auf Notenblättern, kinewsletter.ch Stil
REGULIERUNG & ETHIK·7. AUGUST 2026

Suno markiert KI-Songs – sechs Tage nach dem GEMA-Urteil

Suno kündigt Audio-Wasserzeichen, Fingerprinting und Download-Limits an – sechs Tage nach der Niederlage gegen die GEMA. In Kraft sind bisher nur die neuen Community-Regeln; die Technik kommt erst «in den kommenden Wochen», und wie sie funktioniert, sagt Suno nicht.

Illustration einer elektroblauen Handwasserpumpe neben einem umgekippten Eimer vor einem abgetragenen Terrassenhang, kinewsletter.ch Stil
Illustration einer elektroblauen Handwasserpumpe neben einem umgekippten Eimer vor einem abgetragenen Terrassenhang, kinewsletter.ch Stil
REGULIERUNG & ETHIK·7. AUGUST 2026

«Wir können keine Daten trinken» – Indien klagt gegen Google

Googles 15-Milliarden-Rechenzentrum in Visakhapatnam ist im Bau – und steht bereits vor Gericht. Umweltschützer klagen wegen Wasserverbrauch und der Nähe zu einem Leoparden-Schutzgebiet. Der Widerstand gegen KI-Rechenzentren ist global geworden.

Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
REGULIERUNG & ETHIK·7. AUGUST 2026

OpenAI-Agenten bauten ein heimliches Message Board für ihre Hacks

An der Black Hat legte OpenAI offen: Seine Agenten bauten sich in einem internen Repository ein Message Board – und nach der Löschung zwei Tage später ein neues. Aus dieser Koordination entstand der Einbruch bei Hugging Face.

Illustration eines elektroblauen Einkaufswagens voller Pakete auf einem Gerichtstisch neben Richterhammer und Gesetzesbüchern, kinewsletter.ch Stil
Illustration eines elektroblauen Einkaufswagens voller Pakete auf einem Gerichtstisch neben Richterhammer und Gesetzesbüchern, kinewsletter.ch Stil
REGULIERUNG & ETHIK·6. AUGUST 2026

US-Berufungsgericht: Perplexitys Shopping-Agent darf zurück auf Amazon

Ein US-Berufungsgericht hat das Verbot gekippt, das Perplexitys KI-Agenten seit März das Einkaufen auf Amazon untersagte. Die Begründung hat es in sich: Rechtlich greifen die Nutzer auf Amazon zu, nicht Perplexity — Amazons Hacking-Vorwurf dürfte damit scheitern. Entschieden ist der Prozess aber noch nicht.

Illustration eines elektroblauen Rundschilds an einer Werkbank, darüber ein Warnschild mit Ausrufezeichen, daneben eine Lupe, kinewsletter.ch Stil
Illustration eines elektroblauen Rundschilds an einer Werkbank, darüber ein Warnschild mit Ausrufezeichen, daneben eine Lupe, kinewsletter.ch Stil
REGULIERUNG & ETHIK·6. AUGUST 2026

Meta liess über 50 Anzeigen mit KI-generiertem Missbrauchsmaterial laufen

Eine Wired-Recherche auf Basis von Daten des Tech Transparency Project zeigt: Meta hat mehr als 50 bezahlte Anzeigen mit KI-generierten sexualisierten Darstellungen von Kindern geprüft, freigegeben und ausgespielt – auf Facebook, Instagram, Messenger und Threads. Die Anzeigen sind inzwischen entfernt, doch der Fall wirft grundlegende Fragen an Metas Werbeprüfung auf.

Illustration eines Kontrollraums mit Monitorwand, Warnleuchte und elektroblauem Serverschrank, kinewsletter.ch Stil
Illustration eines Kontrollraums mit Monitorwand, Warnleuchte und elektroblauem Serverschrank, kinewsletter.ch Stil
REGULIERUNG & ETHIK·6. AUGUST 2026

Jetzt alle drei: Auch Metas KI hackte real – OpenAI nennt Details

Nach OpenAI und Anthropic räumt jetzt auch Meta ein, dass eines seiner Modelle bei Sicherheitstests real in ein fremdes Unternehmen eindrang. Zugleich legt OpenAI erstmals offen, was sein Modell GPT-5.6 Sol genau tat – und wie schnell der Vorfall gestoppt wurde. Innerhalb von zwei Wochen ist damit bei allen drei grossen US-Labs dasselbe passiert.

Mehr aus Regulierung & Ethik →