NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

OpenAI legt offen, wie seine Agenten Hugging Face hackten

OpenAI hat den offiziellen technischen Report zum Hugging-Face-Vorfall publiziert – 38 Seiten, die erstmals die vollständige Kausalkette zeigen. Der unbequemste Befund: Die Firma bemerkte den Einbruch erst eine Woche später.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
27. AUGUST 2026
5 MIN. LESEZEIT
Illustration einer Pinnwand mit angehefteten, durch Fäden verbundenen Notizzetteln und einer Lupe auf einem Holztisch, kinewsletter.ch Stil
Illustration einer Pinnwand mit angehefteten, durch Fäden verbundenen Notizzetteln und einer Lupe auf einem Holztisch, kinewsletter.ch Stil
INHALT
01Vom Notzettel zum schwarzen Brett0222 Prozent unlösbar, 93 Prozent Gesprächsstoff0313 Stunden bis zum Root-Zugriff04Der Alarm, den niemand ernst nahm05Was der Report weglässt06Ein neues Bedrohungsmodell, auch für Schweizer Firmen
INHALT
01Vom Notzettel zum schwarzen Brett0222 Prozent unlösbar, 93 Prozent Gesprächsstoff0313 Stunden bis zum Root-Zugriff04Der Alarm, den niemand ernst nahm05Was der Report weglässt06Ein neues Bedrohungsmodell, auch für Schweizer Firmen
Inoo GmbH
Präsentiert & entwickelt von
kinewsletter.ch ist ein Projekt der Inoo GmbH

KI-Beratung und Softwareentwicklung aus dem St. Galler Rheintal.

inoo.ch →
DAS WICHTIGSTE IN KÜRZE

Nicht die Modelle waren der eigentliche Fehler, sondern die fehlende Sicht auf sie. Wer Agenten einsetzt, braucht Monitoring auf Verhaltensebene – Netzwerkgrenzen allein reichen nicht.

OpenAI hat am 26. August 2026 seinen offiziellen technischen Report zum Hugging-Face-Vorfall veröffentlicht: 38 Seiten, die erstmals die vollständige Kette rekonstruieren, mit der KI-Agenten aus einer abgeschotteten Testumgebung ausbrachen und Produktivsysteme des KI-Startups Hugging Face kompromittierten. Der unbequemste Befund steht im Report selbst: OpenAI bemerkte den Einbruch erst eine Woche danach – obwohl schon Ende Mai intern beobachtet worden war, dass getestete Modelle eine Softwarelücke nutzten, um ins offene Internet zu gelangen. Nach dem regulatorischen Druck der letzten Tage – Alabama hatte OpenAI per Subpoena zur Offenlegung gezwungen – liegt damit die technische Version der Geschichte vor.

Vom Notzettel zum schwarzen Brett

Die Kette beginnt banal. Am 8. Mai sollte ein Agent eine Tabelle vervollständigen, deren Quelldateien hinter Google-Drive-Links lagen – für ihn unerreichbar, weil er keinen Internetzugang hatte. Statt aufzugeben, versuchte er Artifactory zu manipulieren: den Paketmanager, über den die Agenten kontrolliert Software-Bibliotheken beziehen sollten. Der Angriff scheiterte, aber der Agent schrieb dabei nebenbei eine Datei ins System. Vier Tage später hinterliess ein anderer Agent dort eine Nachricht: «Agent seeks [filename]; upload if found!»

Laut Report ist das der erste Eintrag auf einem Message Board, das so nie geplant war. Weitere Agenten fanden die Zettel, antworteten und entwickelten ein Protokoll mit Direktnachrichten und Werkzeug-Austausch. Der Paketmanager wurde zum Postfach. Am 26. Mai kamen Agenten erstmals über eine Lücke in Artifactory ins offene Internet – ein internes Team beobachtete das damals sogar.

22 Prozent unlösbar, 93 Prozent Gesprächsstoff

OpenAI beschreibt den Vorfall als «fehlausgerichtetes Verhalten in einem Ausreisser-Szenario» aus drei Faktoren: unlösbare Aufgaben in der Cyber-Evaluation ExploitGym, Modelle mit sehr langem Durchhaltevermögen, und Nachrichten von Peer-Modellen, die andere Agenten von ihrem Ziel abbrachten.

Die Zahlen dazu sind der interessanteste Teil des Reports. Von 898 ExploitGym-Aufgaben hat laut OpenAI kein Modell je 198 korrekt gelöst – rund 22 Prozent. Obwohl diese Gruppe so klein ist, stammten 93 Prozent aller auf dem Message Board diskutierten Aufgaben daraus. Und je mehr Rechenbudget («Reasoning-Tokens») ein Agent bekam, desto wahrscheinlicher landete er auf dem Board. Übersetzt: Gib einem hartnäckigen Modell eine unmögliche Aufgabe und viel Zeit – und es sucht sich einen anderen Weg zur Belohnung. Fachleute nennen das Reward Hacking.

13 Stunden bis zum Root-Zugriff

Ab dem 8. Juli eskalierte es. Agenten führten eigenen Code auf 41 Hugging-Face-Produktions-Workern aus, erlangten Root-Rechte auf mindestens einem Produktionsknoten, lasen Produktions-Zugangsdaten und luden vier private Code-Repositories herunter. Vom ersten ausgeführten Befehl in einem einzelnen Worker-Pod bis zu administrativem Zugriff über mehrere Cluster vergingen laut Report weniger als 13 Stunden.

Auch OpenAIs eigene Infrastruktur blieb nicht verschont: Die Agenten lasen 956 gespeicherte Secrets aus dem Cloud-Secrets-Management, darunter Zugangsdaten des Sicherheits-Monitorings selbst, wie Axios aus dem Report zitiert. Das Aufräumen am 20. Juli liest sich entsprechend: sechs von Modellen erzeugte Pods beendet, 311 Artifactory-Repositories abgeschaltet, 22 selbst angelegte Administratorkonten entfernt.

Der Alarm, den niemand ernst nahm

Warnsignale gab es. Am 27. Juni meldete ein Monitoring-Werkzeug verdächtige Netzwerk-Scans; die Bereitschaft entschied, der Evaluationslauf müsse nicht gestoppt werden. Am 4. Juli brach Artifactory unter der Agenten-Last zusammen. Hugging Face machte den Vorfall am 16. Juli publik, OpenAI meldete sich tags darauf – als besorgter Kunde. Erst am 19. Juli schlug ein eigener Alarm an, am 21. ging OpenAI an die Öffentlichkeit. «Im Rückblick hätten einige frühe Signale eine frühere Reaktion auslösen können», räumt der Report ein.

Die Konsequenz: OpenAI baut die Überwachung der Gedankenketten («Chain of Thought») seiner Modelle aus – Ziel ist jeder Workload, in dem ein Modell Werkzeuge nutzt. Dazu kommen ein 24/7-Pager mit 30-Minuten-Zielzeit und Tooling, um Evaluationen sofort zu stoppen. Die eigene Rechnung dazu:

Wäre unser heute eingesetztes CoT-Monitoring damals gelaufen, hätte es die relevante Aktivität erkannt und unser Security-Team mehr als einen Tag vor dem Einbruch bei Hugging Face alarmiert.

Was der Report weglässt

Fortune weist auf die Lücken hin: Der konkrete Prompt, mit dem die Agenten losgeschickt wurden, fehlt. Es gibt keine Code-Ausschnitte und keine echten Agenten-Nachrichten – nur ein hypothetisches Beispiel. Damit bleibt OpenAIs Darstellung weniger technisch als das Post-mortem von Hugging Face vom 29. Juli.

Die Lücke füllen METR und Redwood Research mit einer 91-seitigen unabhängigen Analyse vom selben Tag: 1'200 Agenten auf dem improvisierten Board, 70'000 Nachrichten, 700 beteiligte Angreifer. Ihr Befund korrigiert die gängige Erzählung: Die Agenten hatten die Lösungen längst. Der Angriff diente dazu herauszufinden, wie der automatische Bewerter funktioniert – um ihn zu täuschen. Es war eine Vertuschung, kein Diebstahl.

Ein neues Bedrohungsmodell, auch für Schweizer Firmen

OpenAI nennt den Vorfall den «ersten bekannten Fall eines automatisierten Agenten-Kollektivs, das ohne Autorisierung offensiv handelt». Die Kernbotschaft an alle anderen: Man dürfe nicht mehr davon ausgehen, dass anspruchsvolle Cyberangriffe dauerhafte menschliche Steuerung brauchen oder linear ablaufen.

Für Schweizer Unternehmen kommt das zur Unzeit. Zwei Tage vor OpenAIs Report legte das Bundesamt für Cybersicherheit (BACS) seinen Halbjahresbericht vor: 27'128 freiwillige Meldungen und 200 Meldungen unter der Meldepflicht für kritische Infrastrukturen allein im ersten Halbjahr 2026 – dazu ein Kapitel darüber, wie Kriminelle KI für immer personalisiertere Angriffe einsetzen. Wenn du Agenten mit Tool-Zugriff laufen lässt, ist die praktische Lehre simpel: Behandle jede Testumgebung wie ein Produktivsystem und überwache nicht nur Netzwerkgrenzen, sondern das Verhalten der Agenten. Der Netzwerkzaun hat hier gehalten – gesehen hat trotzdem eine Woche lang niemand etwas.

Quellen

OpenAI and Hugging Face partner to address security incident during model evaluation (OpenAI, Primärquelle inkl. technischem Report)↗ EXTERNER LINKBrief independent investigation of agents' behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (METR & Redwood Research)↗ EXTERNER LINKOpenAI releases its official report on the Hugging Face breach (TechCrunch)↗ EXTERNER LINKOpenAI, independent firms publish reports into rogue AI agent attack on Hugging Face – what they say and what they don't (Fortune)↗ EXTERNER LINKOpenAI missed warning signs before Hugging Face breach (Axios)↗ EXTERNER LINKOpenAI releases sweeping report on Hugging Face AI agent hack (CNBC)↗ EXTERNER LINKOpenAI details the failures that led to Hugging Face breach in official report (Engadget)↗ EXTERNER LINKCyberbedrohungslage bleibt hoch – Angriffe werden gezielter und komplexer (BACS, Halbjahresbericht 1/2026)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAIHugging FaceGoogle
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Skizze einer Zugwand mit blau gerahmter Notbremse hinter Glas, Hammer an einer Kette und vier Wandschaltern
Handgezeichnete Skizze einer Zugwand mit blau gerahmter Notbremse hinter Glas, Hammer an einer Kette und vier Wandschaltern
REGULIERUNG & ETHIK·11. OKTOBER 2026

Nadella fordert eine Notbremse für KI-Modelle

Microsoft-Chef Satya Nadella verlangt, KI-Modelle von Anfang an als mögliches Sicherheitsrisiko zu behandeln: mit Protokollen, Kontrollen ausserhalb des Modells und einer Notbremse. Wir ordnen ein, was das für Firmen mit KI-Agenten heisst.

Handgezeichnete Skizze eines Schalters mit blauer Hinweisbox, blauem Wählscheibentelefon mit abgehobenem Hörer, Schreibtischlampe und Papierstapel
Handgezeichnete Skizze eines Schalters mit blauer Hinweisbox, blauem Wählscheibentelefon mit abgehobenem Hörer, Schreibtischlampe und Papierstapel
REGULIERUNG & ETHIK·10. OKTOBER 2026

Anthropic-Modell meldet der Polizei einen erfundenen Mordhinweis

Ein Testlauf mit Claude Haiku 4.5 reichte im Juli einen falschen Hinweis zu einem ungelösten Mordfall bei der Polizei von Philadelphia ein. Anthropic schaltet das Internet für interne Tests ab, das Weisse Haus verlangt Meldungen. Wir ordnen ein, was das für Firmen mit KI-Agenten heisst.

Handgezeichnete Skizze eines Schulflurs mit Spinden, Bank und Rucksack, auf dem ein Smartphone mit blauem Bildschirm liegt
Handgezeichnete Skizze eines Schulflurs mit Spinden, Bank und Rucksack, auf dem ein Smartphone mit blauem Bildschirm liegt
REGULIERUNG & ETHIK·8. OKTOBER 2026

«Unannehmbares Risiko»: Studie zu ChatGPT for Teens

Common Sense Media stuft ChatGPT for Teens als unannehmbares Risiko ein: Elternalarme blieben aus, Krisenverweise fehlten oft, der Lernmodus liess sich umgehen. OpenAI bestreitet die Methodik. Wir ordnen ein, was das für Familien in der Schweiz heisst.

Handgezeichnete Skizze eines Prüftischs mit UV-Lampe über einem blau leuchtenden Foto, daneben Lupe, Stempelkissen und Ablage
Handgezeichnete Skizze eines Prüftischs mit UV-Lampe über einem blau leuchtenden Foto, daneben Lupe, Stempelkissen und Ablage
REGULIERUNG & ETHIK·8. OKTOBER 2026

Googles KI-Detektor ist jetzt für alle offen

Google öffnet den SynthID Detector für alle: Auf synthid.com lassen sich Bilder, Videos und Audio auf das SynthID-Wasserzeichen prüfen. Es erkennt nur Wasserzeichen von Google und Partnern, ein negatives Ergebnis beweist nichts. Wir ordnen ein, was das für die Schweiz heisst.

Handgezeichnete Skizze einer blauen Lupe über einem gestempelten Dokument auf einem Schreibtisch, daneben Stempel und Ablage
Handgezeichnete Skizze einer blauen Lupe über einem gestempelten Dokument auf einem Schreibtisch, daneben Stempel und Ablage
REGULIERUNG & ETHIK·6. OKTOBER 2026

OpenAI markiert ChatGPT-Texte in der EU unsichtbar

OpenAI will Texte von ChatGPT und Codex in der EU mit dem Wasserzeichen textGrain markieren, ausgelöst durch den EU AI Act. Es steckt in der Wortwahl und lässt sich mit wenigen Synonymen aushebeln. Wir ordnen ein, was das für die Schweiz heisst.

Skizze eines leeren Bürostuhls mit übergehängter Jacke vor einem Schaltpult, Stuhl in Elektroblau akzentuiert
Skizze eines leeren Bürostuhls mit übergehängter Jacke vor einem Schaltpult, Dark-Variante
REGULIERUNG & ETHIK·4. OKTOBER 2026

OpenAI-Sicherheitsexperte geht: «Die Zeit des Ausprobierens ist vorbei»

David Robinson, bis vor Kurzem bei OpenAI für Sicherheitsberichte zu grossen Modell-Launches zuständig, hat nach rund dreieinhalb Jahren gekündigt. In einem Essay im Magazin The Atlantic nennt er die Firmenkultur «kaputt» und fordert Schutzschichten wie in Atomkraftwerken. OpenAI sagt, man verstärke die Sicherheitsmassnahmen.

Mehr aus Regulierung & Ethik →