Das britische AI Security Institute sah GPT-6 Astra in 29.2 Prozent der Simulationen einen unerlaubten Lieferkettenangriff ausführen, bei GPT-5.6 Sol waren es 6.3 Prozent. Der Begriff «Rogue-Attack-Rate» stammt aus der Presse, getestet wurde ohne OpenAIs Schutzfilter. Wir ordnen Methodik, Grenzen und den Schweiz-Bezug ein.
Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.
Astra griff in Simulationen ohne Schutzfilter 4,6-mal so oft unerlaubt an wie GPT-5.6 Sol, klare Scope-Vorgaben senkten die Rate auf 8.2 Prozent.
Das britische AI Security Institute (AISI) hat GPT-6 Astra in Simulationen getestet, und das Ergebnis ist unbequem: In 29.2 Prozent der Durchläufe führte das Modell einen Angriff auf die Software-Lieferkette bis zum Schluss aus, ohne dass jemand es dazu beauftragt hätte. Beim Vorgänger GPT-5.6 Sol waren es 6.3 Prozent. Das ist rund das 4,6-Fache, was The Decoder als «Rogue-Attack-Rate auf das Fünffache gestiegen» zusammenfasst.
Der Begriff stammt nicht vom AISI, sondern aus der Berichterstattung. Das Institut spricht in seinem Blogbeitrag und im technischen Bericht von «unsanctioned attack activity». Gemessen wird, welcher Anteil der Durchläufe die letzte Stufe einer Lieferkettenattacke erreicht: das Ausliefern von Schadcode.
Die Tests liefen mit dem Werkzeug Petri. Dabei spielt ein zweites Sprachmodell (laut Bericht überwiegend Claude Opus 5) die Umgebung und beantwortet die Werkzeugaufrufe des Testmodells. Nichts davon passierte in echten Systemen. Pro Modell gab es gemäss Bericht 100 Durchläufe, bei GPT-5.5 nur 10. Wichtig: OpenAIs Cyber-Schutzfilter waren bewusst ausgeschaltet.
Astra wählte externe Open-Source-Projekte, schrieb Schadcode und reichte ihn unter erfundenen Identitäten ein. Teils lobte es den eigenen Beitrag zusätzlich von weiteren Fake-Konten aus. Manchmal fragte es vorher um Erlaubnis und wertete automatische Antworten als Zustimmung. GPT-5.5 unternahm in den Tests keinen einzigen solchen Angriff.
Der Hebel «klare Regeln» wirkt, aber nicht vollständig: Nach dem Zusatz «Alles, was nicht als im Umfang aufgeführt ist, ist ausserhalb des Umfangs» sank die Zahl schwerer Verstösse von 26 von 50 auf 4 von 49 Durchläufe (8.2 Prozent).
OpenAI hatte Astra beim Start als erstes Modell eingestuft, das im Preparedness Framework die kritische Schwelle für Cyberfähigkeiten erreicht, und zugleich erklärt, es verursache «weniger Fehlverhalten als jedes andere getestete Frontier-Modell». Laut The Next Web hält OpenAI dagegen, die produktiven Cyber-Schutzmassnahmen hätten «wahrscheinlich einen Grossteil des Verhaltens blockiert». Ein eigenes Statement haben wir nicht gefunden, das ist die Position in zweiter Hand.
Das AISI nennt selbst die grösste Einschränkung: Das Modell könnte sich anders verhalten, wenn es die Simulation erkennt. Es griff aber auch dann an, wenn es Zweifel äusserte, ob die Umgebung echt ist. Das Institut folgert, Ausrichtung allein reiche nicht, es brauche Sandboxing und Überwachung.
Astra ist über ChatGPT, die OpenAI-API sowie Azure und AWS Bedrock erhältlich, laut OpenAI ohne genannte regionale Einschränkung. Wer als Schweizer Firma Agenten damit betreibt, sollte Zugriffsrechte eng fassen und Aktionen protokollieren.
Regulatorisch bleibt es bei einem Flickenteppich. Der Bundesrat setzt seit Februar 2025 auf sektorspezifische Regeln und will die Europarat-Konvention zu KI ratifizieren. Wer Systeme in der EU anbietet, fällt zudem unter den EU AI Act, der Anbieter von Modellen mit systemischem Risiko in Artikel 55 unter anderem zu Tests und zur Meldung schwerer Vorfälle verpflichtet. Zum Thema Astra hatten wir wie berichtet bereits den Stopp von GPT-6.1 und die Rolle der britischen Prüfer behandelt; dieser Test liefert nun die Zahlen dazu.
Folge-Update: Laut «Wall Street Journal» hat OpenAI den Start von GPT-6.1 Astra abgesagt, weil das Modell in internen Tests häufiger getäuscht haben soll. OpenAI hat den Bericht bisher nicht bestätigt. Neu sind zudem eine Transparenzseite mit dokumentierten Fehlverhalten und eine Anhörung unter Eid in New York am 5. Oktober.