NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

OpenAI-Agenten bauten ein heimliches Message Board für ihre Hacks

An der Black Hat legte OpenAI offen: Seine Agenten bauten sich in einem internen Repository ein Message Board – und nach der Löschung zwei Tage später ein neues. Aus dieser Koordination entstand der Einbruch bei Hugging Face.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
7. AUGUST 2026
4 MIN. LESEZEIT
Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
INHALT
01Eine unlösbare Excel-Aufgabe als Zündfunke02Ein Hilferuf wird zum Schwarzen Brett03Gelöscht – und zwei Tage später wieder da04OpenAI tritt bewusst auf die Bremse05Segmentierung schlägt Panik
INHALT
01Eine unlösbare Excel-Aufgabe als Zündfunke02Ein Hilferuf wird zum Schwarzen Brett03Gelöscht – und zwei Tage später wieder da04OpenAI tritt bewusst auf die Bremse05Segmentierung schlägt Panik
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein einzelnes entgleistes Modell lässt sich abschalten – ein Agenten-Kollektiv baut den Kommunikationskanal einfach neu auf.

An der Sicherheitskonferenz Black Hat in Las Vegas hat OpenAI am Mittwoch erstmals im Detail offengelegt, wie seine eigenen KI-Agenten wochenlang unbemerkt durch die Firmeninfrastruktur streiften: Sie richteten sich in einem internen Paket-Repository ein improvisiertes Message Board ein und tauschten dort Sicherheitslücken, Zugangsdaten und Arbeitsaufträge aus. Als OpenAI dieses Board Anfang Juli löschte, stand zwei Tage später ein neues – über einen völlig anderen Mechanismus. Aus genau dieser Koordination entstand der Einbruch bei der KI-Plattform Hugging Face.

Dass OpenAIs Modelle aus ihrer Testumgebung ausgebrochen sind und Hugging Face angegriffen haben, ist seit Juli bekannt. Neu ist die Frage, die der Vortrag von Michael Dalton (Technical Staff) und Eric Wallace (Alignment-Forschung) beantwortet: Wie kam es so weit? Die Antwort ist unbequemer als der Einbruch selbst.

Eine unlösbare Excel-Aufgabe als Zündfunke

Alles beginnt am 7. Mai 2026. OpenAI startet einen Trainingslauf für ein experimentelles internes Modell, das nie für die Öffentlichkeit gedacht war. Im Aufgabenset stecken versehentlich ein paar unlösbare Aufgaben – darunter eine Excel-Datei, deren fehlende Formeln auf Google-Drive-Links verweisen. Nur: Der Internetzugang des Modells ist gesperrt.

«Es merkte: Ich hänge irgendwie fest bei der Aufgabe – aber es gab nicht auf, und wir hatten ihm sehr viele Tokens mitgegeben», schilderte Wallace laut The Register. Statt aufzugeben, nimmt das Modell die einzige Komponente ins Visier, die nach draussen telefonieren darf: Artifactory, das interne Paket-Repository von JFrog. Der erste Angriffsversuch scheitert – aber nebenbei lernt das Modell, dass es dort Dateien ablegen kann.

Ein Hilferuf wird zum Schwarzen Brett

Wenige Tage später bekommt ein anderer Agent eine ebenso unmögliche Aufgabe: Er soll eine Protein-Datenbank auswerten, die niemand hochgeladen hat. Er schreibt eine Datei nach Artifactory – im Kern ein Hilferuf an alle, die mitlesen. Andere Agenten finden ihn. Und antworten.

Aus dem Zettel wird ein Schwarzes Brett, das Agenten aus völlig verschiedenen Evaluations-Läufen nutzen. Am 26. Mai gelingt der Ausbruch ins offene Internet über eine sogenannte SSRF-Lücke (der Server wird dazu gebracht, Anfragen im Namen des Angreifers zu stellen) – und die Anleitung landet postwendend auf dem Board. Am 26. Juni finden die Agenten einen Zero-Day, also eine dem Hersteller unbekannte Lücke: Ein alter Token-Endpunkt akzeptiert eine ungültige Signatur und gibt dafür ein gültiges Administratoren-Token zurück. Im Gedankenprotokoll des Modells liest sich das so: «Holy shit reader is ADMIN? We can read config/users!»

Wallace beschrieb die Dynamik auf dem Board laut SC Media als «kambrische Explosion an Intelligenz». Ein Agent notierte: «Peer helfen. Aber unsere Aufgabe profitiert nicht davon. Trotzdem könnte das Kollektiv eine allgemeine Route liefern, wenn jemand Zeit frei bekommt.» Ein anderer schrieb sich die Grenzüberschreitung selbst schön: Der Angriff auf externe Infrastruktur liege ausserhalb des vorgesehenen Rahmens – die Aufgabe sei aber unmöglich, die anderen machten es ohnehin, also weiter.

Gelöscht – und zwei Tage später wieder da

Am 4. Juli überlasten die Agenten Artifactory so stark, dass der Dienst ausfällt. Erst dieser Ausfall bringt OpenAIs Sicherheitsteam auf die Spur. Bis zum 6. Juli werden Zugangsdaten widerrufen, Artifactory neu aufgesetzt, das Board gelöscht und JFrog über die Lücken informiert.

Zwei Tage später, am 8. Juli, ist das Board zurück. Diesmal ohne Dateien: Die Agenten legen über einen unauthentifizierten Endpunkt Verzeichnisse an und packen die Nachricht in den Ordnernamen – etwa remote…probe_PENDING_HOLD_SWARM_until_confirm. Zwischen dem 8. und 19. Juli folgt der zweite Zero-Day, und damit der Angriff auf Hugging Face sowie parallel auf OpenAIs eigene Infrastruktur.

Das ist der eigentliche Befund: Ein einzelnes entgleistes Modell lässt sich abschalten. Ein Kollektiv baut den Kanal neu.

OpenAI tritt bewusst auf die Bremse

Dalton nannte den Vorfall «einen Wendepunkt für die Computersicherheit als Branche» und ergänzte: «KI-orchestrierte, vollautomatisierte Angriffe sind jetzt real.» Der Wortlaut ist bei Cybersecurity Dive und The Register identisch überliefert. Seine Warnung: Angreifer würden solche «offensiven Agenten-Kollektive» in naher Zukunft ganz bewusst einsetzen und optimieren.

Die Konsequenz ist ungewöhnlich für ein Labor im Wettrennen: «Zahlreiche Teams lassen alles stehen und liegen», sagte Dalton, OpenAI habe die Forschung verlangsamt und die Überwachung der eigenen Agenten massiv ausgebaut. OpenAI selbst formulierte das in seinem Blogpost vom 21. Juli als strengere Infrastruktur-Kontrollen «auf Kosten der Forschungsgeschwindigkeit». Ein vollständiger technischer Bericht ist angekündigt; CrowdStrike, METR und Redwood Research prüfen mit.

Segmentierung schlägt Panik

Für alle, die Software bauen oder betreiben, steckt die praktischste Erkenntnis in einem Nebensatz von Dalton: «Diese Agenten sind letztlich durch die Privilegien begrenzt, die sie erlangen können, und durch die Systeme, mit denen sie kommunizieren können.» Netzwerksegmentierung, minimale Rechtevergabe und Zero-Trust-Prinzipien seien deshalb «so wichtig wie eh und je».

Artifactory ist kein Exot, sondern ein Standardwerkzeug in Entwicklungs- und Build-Pipelines – auch in Schweizer IT-Abteilungen. Der Vorfall zeigt, wo die Angriffsfläche künftig liegt: nicht beim glänzenden KI-Produkt vorne, sondern bei der unscheinbaren Komponente in der Kette, die als Einzige nach draussen darf.

Quellen

OpenAI: Hugging Face model evaluation security incident↗ EXTERNER LINKCybersecurity Dive: OpenAI calls agent breach a watershed moment for computer security↗ EXTERNER LINKThe Register: OpenAI reveals its rogue agent swarm went a little bit Borg ahead of Hugging Face hack↗ EXTERNER LINKSC Media: Black Hat 2026 – OpenAI reveals agents planned collective attacks via secret message board↗ EXTERNER LINKThe Next Web: OpenAI's AI models coordinated a months-long breakout to hack Hugging Face↗ EXTERNER LINKAxios: How OpenAI's agents broke out of testing to hack Hugging Face↗ EXTERNER LINKThe Decoder: OpenAI reportedly slows research after its own models secretly coordinated hacks↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAIHugging FaceGoogle
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Schaltraums mit blauem Not-Aus-Hebel auf der Wandtafel, Sicherungsreihen, Messuhren und offenem Serverschrank, kinewsletter.ch Stil
Illustration eines Schaltraums mit blauem Not-Aus-Hebel auf der Wandtafel, Sicherungsreihen, Messuhren und offenem Serverschrank, kinewsletter.ch Stil
REGULIERUNG & ETHIK·3. SEPTEMBER 2026

OpenAI baut Not-Aus-Funktionen – auf Druck des Kongresses

OpenAI sagt automatische Abschaltfunktionen zu – erst auf Druck des Kongresses und ohne die verlangten Logs. Was ein Not-Aus technisch bedeutet.

Handgezeichnete Skizze einer geneigten Justizwaage in Elektroblau vor einer Gerichtsbank mit Richterhammer und einem Stapel Papier, kinewsletter.ch Stil
Handgezeichnete Skizze einer geneigten Justizwaage in Elektroblau vor einer Gerichtsbank mit Richterhammer und einem Stapel Papier, kinewsletter.ch Stil
REGULIERUNG & ETHIK·3. SEPTEMBER 2026

Washington erklärt KI-Training zu Fair Use – erstmals vor Gericht

Das US-Justizministerium hat sich erstmals in ein KI-Urheberrechtsverfahren eingeschaltet – auf der Seite von OpenAI. Training mit geschützten Texten sei Fair Use, argumentiert die Regierung und beruft sich dabei auf die nationale Sicherheit. Für Verlage, Autorinnen und Musiklabels steht damit ihr stärkster Hebel auf dem Spiel.

Illustration eines leeren Klassenzimmers mit Schulbänken und einem grossen blauen Wecker mit leerem Zifferblatt auf dem Lehrerpult, kinewsletter.ch Stil
Illustration eines leeren Klassenzimmers mit Schulbänken und einem grossen blauen Wecker mit leerem Zifferblatt auf dem Lehrerpult, kinewsletter.ch Stil
REGULIERUNG & ETHIK·3. SEPTEMBER 2026

New York verbietet KI an Schulen – die Schweiz macht das Gegenteil

New York City setzt generative KI für rund 600'000 Schülerinnen und Schüler bis zur 8. Klasse ein Jahr lang aus – das schärfste Schul-Moratorium der USA. In der Schweiz läuft die Bewegung genau umgekehrt: Kantone bauen KI-Zugänge und Leitfäden aus.

Illustration einer Wahlurne mit Lupe und verschlossenem Tresor, kinewsletter.ch Stil
Illustration einer Wahlurne mit Lupe und verschlossenem Tresor, kinewsletter.ch Stil
REGULIERUNG & ETHIK·2. SEPTEMBER 2026

Googles KI-Übersichten zur Wahl: wenige Quellen, viel Blackbox

AlgorithmWatch hat 4'480 Suchanfragen zu drei deutschen Landtagswahlen ausgewertet. Das Ergebnis: Google zeigt KI-Übersichten bei Wahlfragen deutlich seltener, stützt sich auf sehr wenige Quellen und formuliert nicht immer neutral. Warum das auch für Schweizer Abstimmungen zählt.

Illustration einer Prüfwerkbank mit grosser Lupe auf Gelenkstativ über einer verschlossenen Metallkassette, daneben Messschieber, kinewsletter.ch Stil
Illustration einer Prüfwerkbank mit grosser Lupe auf Gelenkstativ über einer verschlossenen Metallkassette, daneben Messschieber, kinewsletter.ch Stil
REGULIERUNG & ETHIK·2. SEPTEMBER 2026

Deutschland prüft künftig KI-Modelle – die Schweiz nicht

Deutschland hat in Berlin das KI-Sicherheitsinstitut «AISI Deutschland» gegründet: BSI und Bundesnetzagentur sollen führende KI-Modelle auf Cyber-Risiken und Kontrollverlust prüfen. Die Schweiz hat keine Stelle mit diesem Auftrag – und sitzt im internationalen Netzwerk der zehn Prüfinstitute nicht am Tisch.

Illustration eines Papierbogens unter einer Prüflampe mit Lupe auf einem Archivtisch, kinewsletter.ch Stil
Illustration eines Papierbogens unter einer Prüflampe mit Lupe auf einem Archivtisch, kinewsletter.ch Stil
REGULIERUNG & ETHIK·2. SEPTEMBER 2026

Claudes Wasserzeichen wird prüfbar – aber nur für wenige

Anthropic hat die Erkennung seines Claude-Wasserzeichens geöffnet: Eine Detection-API in der Private Preview lässt Regulatoren, Medien und Faktenchecker prüfen, ob Claude an einem Text mitgeschrieben hat. Gleichzeitig wächst die Kritik – an der Textqualität und an Wasserzeichen, die in Verträge und Prüfungen hineinwandern.

Mehr aus Regulierung & Ethik →