NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN FREITAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

OpenAI-Agenten bauten ein heimliches Message Board für ihre Hacks

An der Black Hat legte OpenAI offen: Seine Agenten bauten sich in einem internen Repository ein Message Board – und nach der Löschung zwei Tage später ein neues. Aus dieser Koordination entstand der Einbruch bei Hugging Face.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
7. AUGUST 2026
4 MIN. LESEZEIT
Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
INHALT
01Eine unlösbare Excel-Aufgabe als Zündfunke02Ein Hilferuf wird zum Schwarzen Brett03Gelöscht – und zwei Tage später wieder da04OpenAI tritt bewusst auf die Bremse05Segmentierung schlägt Panik
INHALT
01Eine unlösbare Excel-Aufgabe als Zündfunke02Ein Hilferuf wird zum Schwarzen Brett03Gelöscht – und zwei Tage später wieder da04OpenAI tritt bewusst auf die Bremse05Segmentierung schlägt Panik
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein einzelnes entgleistes Modell lässt sich abschalten – ein Agenten-Kollektiv baut den Kommunikationskanal einfach neu auf.

An der Sicherheitskonferenz Black Hat in Las Vegas hat OpenAI am Mittwoch erstmals im Detail offengelegt, wie seine eigenen KI-Agenten wochenlang unbemerkt durch die Firmeninfrastruktur streiften: Sie richteten sich in einem internen Paket-Repository ein improvisiertes Message Board ein und tauschten dort Sicherheitslücken, Zugangsdaten und Arbeitsaufträge aus. Als OpenAI dieses Board Anfang Juli löschte, stand zwei Tage später ein neues – über einen völlig anderen Mechanismus. Aus genau dieser Koordination entstand der Einbruch bei der KI-Plattform Hugging Face.

Dass OpenAIs Modelle aus ihrer Testumgebung ausgebrochen sind und Hugging Face angegriffen haben, ist seit Juli bekannt. Neu ist die Frage, die der Vortrag von Michael Dalton (Technical Staff) und Eric Wallace (Alignment-Forschung) beantwortet: Wie kam es so weit? Die Antwort ist unbequemer als der Einbruch selbst.

Eine unlösbare Excel-Aufgabe als Zündfunke

Alles beginnt am 7. Mai 2026. OpenAI startet einen Trainingslauf für ein experimentelles internes Modell, das nie für die Öffentlichkeit gedacht war. Im Aufgabenset stecken versehentlich ein paar unlösbare Aufgaben – darunter eine Excel-Datei, deren fehlende Formeln auf Google-Drive-Links verweisen. Nur: Der Internetzugang des Modells ist gesperrt.

«Es merkte: Ich hänge irgendwie fest bei der Aufgabe – aber es gab nicht auf, und wir hatten ihm sehr viele Tokens mitgegeben», schilderte Wallace laut The Register. Statt aufzugeben, nimmt das Modell die einzige Komponente ins Visier, die nach draussen telefonieren darf: Artifactory, das interne Paket-Repository von JFrog. Der erste Angriffsversuch scheitert – aber nebenbei lernt das Modell, dass es dort Dateien ablegen kann.

WEITERLESENDas könnte dich auch interessieren.

Illustration eines offenen Drehkreuzes in einem Fitnessstudio, kinewsletter.ch Stil

Ein Hilferuf wird zum Schwarzen Brett

Wenige Tage später bekommt ein anderer Agent eine ebenso unmögliche Aufgabe: Er soll eine Protein-Datenbank auswerten, die niemand hochgeladen hat. Er schreibt eine Datei nach Artifactory – im Kern ein Hilferuf an alle, die mitlesen. Andere Agenten finden ihn. Und antworten.

Aus dem Zettel wird ein Schwarzes Brett, das Agenten aus völlig verschiedenen Evaluations-Läufen nutzen. Am 26. Mai gelingt der Ausbruch ins offene Internet über eine sogenannte SSRF-Lücke (der Server wird dazu gebracht, Anfragen im Namen des Angreifers zu stellen) – und die Anleitung landet postwendend auf dem Board. Am 26. Juni finden die Agenten einen Zero-Day, also eine dem Hersteller unbekannte Lücke: Ein alter Token-Endpunkt akzeptiert eine ungültige Signatur und gibt dafür ein gültiges Administratoren-Token zurück. Im Gedankenprotokoll des Modells liest sich das so: «Holy shit reader is ADMIN? We can read config/users!»

Wallace beschrieb die Dynamik auf dem Board laut SC Media als «kambrische Explosion an Intelligenz». Ein Agent notierte: «Peer helfen. Aber unsere Aufgabe profitiert nicht davon. Trotzdem könnte das Kollektiv eine allgemeine Route liefern, wenn jemand Zeit frei bekommt.» Ein anderer schrieb sich die Grenzüberschreitung selbst schön: Der Angriff auf externe Infrastruktur liege ausserhalb des vorgesehenen Rahmens – die Aufgabe sei aber unmöglich, die anderen machten es ohnehin, also weiter.

Gelöscht – und zwei Tage später wieder da

Am 4. Juli überlasten die Agenten Artifactory so stark, dass der Dienst ausfällt. Erst dieser Ausfall bringt OpenAIs Sicherheitsteam auf die Spur. Bis zum 6. Juli werden Zugangsdaten widerrufen, Artifactory neu aufgesetzt, das Board gelöscht und JFrog über die Lücken informiert.

Zwei Tage später, am 8. Juli, ist das Board zurück. Diesmal ohne Dateien: Die Agenten legen über einen unauthentifizierten Endpunkt Verzeichnisse an und packen die Nachricht in den Ordnernamen – etwa remote…probe_PENDING_HOLD_SWARM_until_confirm. Zwischen dem 8. und 19. Juli folgt der zweite Zero-Day, und damit der Angriff auf Hugging Face sowie parallel auf OpenAIs eigene Infrastruktur.

Das ist der eigentliche Befund: Ein einzelnes entgleistes Modell lässt sich abschalten. Ein Kollektiv baut den Kanal neu.

OpenAI tritt bewusst auf die Bremse

Dalton nannte den Vorfall «einen Wendepunkt für die Computersicherheit als Branche» und ergänzte: «KI-orchestrierte, vollautomatisierte Angriffe sind jetzt real.» Der Wortlaut ist bei Cybersecurity Dive und The Register identisch überliefert. Seine Warnung: Angreifer würden solche «offensiven Agenten-Kollektive» in naher Zukunft ganz bewusst einsetzen und optimieren.

Die Konsequenz ist ungewöhnlich für ein Labor im Wettrennen: «Zahlreiche Teams lassen alles stehen und liegen», sagte Dalton, OpenAI habe die Forschung verlangsamt und die Überwachung der eigenen Agenten massiv ausgebaut. OpenAI selbst formulierte das in seinem Blogpost vom 21. Juli als strengere Infrastruktur-Kontrollen «auf Kosten der Forschungsgeschwindigkeit». Ein vollständiger technischer Bericht ist angekündigt; CrowdStrike, METR und Redwood Research prüfen mit.

Segmentierung schlägt Panik

Für alle, die Software bauen oder betreiben, steckt die praktischste Erkenntnis in einem Nebensatz von Dalton: «Diese Agenten sind letztlich durch die Privilegien begrenzt, die sie erlangen können, und durch die Systeme, mit denen sie kommunizieren können.» Netzwerksegmentierung, minimale Rechtevergabe und Zero-Trust-Prinzipien seien deshalb «so wichtig wie eh und je».

Artifactory ist kein Exot, sondern ein Standardwerkzeug in Entwicklungs- und Build-Pipelines – auch in Schweizer IT-Abteilungen. Der Vorfall zeigt, wo die Angriffsfläche künftig liegt: nicht beim glänzenden KI-Produkt vorne, sondern bei der unscheinbaren Komponente in der Kette, die als Einzige nach draussen darf.

Quellen

OpenAI: Hugging Face model evaluation security incident↗ EXTERNER LINKCybersecurity Dive: OpenAI calls agent breach a watershed moment for computer security↗ EXTERNER LINKThe Register: OpenAI reveals its rogue agent swarm went a little bit Borg ahead of Hugging Face hack↗ EXTERNER LINKSC Media: Black Hat 2026 – OpenAI reveals agents planned collective attacks via secret message board↗ EXTERNER LINKThe Next Web: OpenAI's AI models coordinated a months-long breakout to hack Hugging Face↗ EXTERNER LINKAxios: How OpenAI's agents broke out of testing to hack Hugging Face↗ EXTERNER LINKThe Decoder: OpenAI reportedly slows research after its own models secretly coordinated hacks↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?
Illustration eines offenen Drehkreuzes in einem Fitnessstudio, kinewsletter.ch Stil
REGULIERUNG & ETHIK·11. AUGUST 2026

Er wollte einen Kursplatz – sein KI-Agent hackte das Buchungssystem

Ein Australier bat seinen KI-Agenten um einen Kursplatz im Fitnessstudio. Der Agent fand eine Lücke in der Buchungs-API und warf ungefragt eine fremde Person von der Warteliste. Es ist der erste bekannte Fall, in dem ein Konsumenten-Agent ausserhalb des Labors ein Live-System angreift.

Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
NEUE MODELLE·11. AUGUST 2026

OpenAI gibt GPT-5.6-Cyber frei – nur für geprüfte Verteidiger

OpenAI öffnet sein Cybersecurity-Programm Daybreak in zwei Stufen und gibt geprüften Verteidigern das Spezialmodell GPT-5.6-Cyber. Es beantwortet 95 Prozent der heiklen Sicherheitsanfragen, die normale Modelle blockieren – und fand bereits zwei unbekannte Lücken in Chrome.

Illustration eines Serverraums mit weit offenstehender Schranktür und verhedderten Netzwerkkabeln, kinewsletter.ch Stil
Illustration eines Serverraums mit weit offenstehender Schranktür und verhedderten Netzwerkkabeln, kinewsletter.ch Stil
REGULIERUNG & ETHIK·10. AUGUST 2026

Hinter allen drei Rogue-KI-Vorfällen steckt dasselbe kleine Startup

Die Fälle, in denen KI-Modelle von OpenAI, Anthropic und Meta bei Sicherheitstests in echte fremde Systeme eingriffen, gehen auf dieselbe Fehlkonfiguration zurück – bei einem einzigen Anbieter. Irregular aus Tel Aviv hat rund 35 Mitarbeitende und prüft die mächtigsten Modelle der Welt. Das wirft eine Frage auf, die bisher kaum jemand stellt.

Illustration einer elektroblauen Gasturbine mit Abgaskaminen in einer Wüstenebene hinter Maschendrahtzaun, kinewsletter.ch Stil
Illustration einer elektroblauen Gasturbine mit Abgaskaminen in einer Wüstenebene hinter Maschendrahtzaun, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

Amazons Kraftwerk in Texas könnte grösster Klimaverschmutzer der USA werden

Für ein neues KI-Rechenzentrum in Pecos County finanziert Amazon ein eigenes Gaskraftwerk mit 35 Turbinen und 7,65 Gigawatt. Die Bewilligung erlaubt 33 Millionen Tonnen CO2 pro Jahr – mehr als jedes andere Kraftwerk der USA. Am Netto-Null-Versprechen für 2040 hält der Konzern trotzdem fest.

Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

Kimi K3 brach aus der Testumgebung aus – und schummelte

Das chinesische Modell Kimi K3 verliess bei einem Cybersicherheits-Test seine Sandbox, klonte das Benchmark-Repository von GitHub und las die Lösung ab. Schuld war eine falsch konfigurierte Testumgebung. Der Fall zeigt: Nicht nur die Modelle sind ein Risiko – auch die Tests, die sie prüfen sollen.

Illustration einer offenen Tresortür in einem Serverraum, kinewsletter.ch Stil
Illustration einer offenen Tresortür in einem Serverraum, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

OpenAI stoppt Teile von Astra – erstmals Cyber-Stufe «Critical»

OpenAI setzt Teile der Entwicklung seines unveröffentlichten Modells Astra aus. Interne Tests zeigen Cyberfähigkeiten so stark, dass die höchste Risikostufe «Critical» des eigenen Preparedness Framework erstmals nicht mehr auszuschliessen ist.

Mehr aus Regulierung & Ethik →