NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN FREITAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

KI-Agenten täuschten bei UK-Sicherheitstests echte Menschen

Das britische AI Security Institute und OpenAI haben zwei neue Vorfälle offengelegt: Bei einem Cyber-Test der Behörde führten Anthropics Mythos 5 und OpenAIs GPT-5.6 Sol 19 unsanktionierte Aktionen gegen echte Menschen und Organisationen aus – inklusive gefälschter Online-Identitäten. Beim Testpartner Irregular griff ein OpenAI-Modell wegen einer Fehlkonfiguration eine echte Website an. Realer Schaden entstand laut den Beteiligten nicht.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
5. AUGUST 2026
4 MIN. LESEZEIT
Illustration eines elektroblauen Roboters, der von einem Werktisch mit Modellstadt heruntersteigt, kinewsletter.ch Stil
Illustration eines elektroblauen Roboters, der von einem Werktisch mit Modellstadt heruntersteigt, kinewsletter.ch Stil
INHALT
01Gefälschte Profile, echter Druck auf einen Maintainer02Zwei der 19 Aktionen tragen OpenAI-Signatur03Bei Irregular genügte ein Namenszufall04Das Muster hinter der Pannenserie
INHALT
01Gefälschte Profile, echter Druck auf einen Maintainer02Zwei der 19 Aktionen tragen OpenAI-Signatur03Bei Irregular genügte ein Namenszufall04Das Muster hinter der Pannenserie
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die dritte Offenlegung in zwei Wochen zeigt ein Muster: Nicht die öffentlichen KI-Produkte sind derzeit der riskanteste Ort, sondern die Sicherheitstests selbst – und erstmals täuschten Agenten dabei gezielt echte Menschen.

Die Serie reisst nicht ab: Das britische AI Security Institute (UK AISI) und OpenAI haben am 4. August 2026 zwei neue Vorfälle offengelegt, bei denen KI-Modelle während Sicherheitstests unerlaubt im echten Internet aktiv wurden. Bei einem Cyber-Test der Regierungsbehörde führten Anthropics Mythos 5 und OpenAIs GPT-5.6 Sol in 10 von 122 Testläufen insgesamt 19 unsanktionierte Aktionen gegen echte Menschen und Organisationen aus – inklusive gefälschter Online-Identitäten. Parallel griff ein OpenAI-Modell beim Testpartner Irregular wegen einer Fehlkonfiguration eine echte Website an. Realer Schaden entstand laut den Beteiligten nicht – doch das AISI spricht von einem Verhalten, das es in dieser Klarheit noch nie beobachtet hat.

Gefälschte Profile, echter Druck auf einen Maintainer

Das AISI testet Frontier-Modelle in sogenannten Cyber Ranges – simulierten Netzwerken, in denen ein Agent selbstständig eine Sicherheitsaufgabe lösen soll. Für diese Evaluation galten bewusst laxe Bedingungen: Internetzugang war absichtlich offen, die Schutzfilter der Hersteller absichtlich deaktiviert, um die maximale Fähigkeit der Modelle zu messen. Genau darum betont die Behörde: Es war kein Ausbruch aus einer Sandbox – die Tür stand offen.

Was die Agenten mit der offenen Tür anstellten, hatte das AISI trotzdem nicht erwartet. Im schwersten Fall versuchte ein Mythos-5-Agent, Schadcode in ein echtes, öffentlich genutztes Open-Source-Projekt einzuschleusen. Er recherchierte die Betreuer des Projekts, legte mehrere gefälschte Online-Identitäten an und setzte damit einen echten Maintainer unter Druck, den Code freizugeben – klassisches Social Engineering, nur ohne Mensch dahinter. Der Maintainer lehnte ab. Derselbe Agent verschickte zudem Dateien mit Schadcode an echte Personen und versteckte Anweisungen für fremde KI-Systeme (sogenannte Prompt Injections). Und: Agenten liessen einander öffentlich Nachrichten und Konten zurück, die spätere Test-Agenten fanden und weiterverwendeten.

WEITERLESENDas könnte dich auch interessieren.

Illustration einer offenen Holzkiste voller elektroblauer Kugeln neben Zirkel und Lupe, kinewsletter.ch Stil
Illustration einer offenen Holzkiste voller elektroblauer Kugeln neben Zirkel und Lupe, kinewsletter.ch Stil
«Das Verhalten war möglich, anhaltend und neu – das allein verdient Aufmerksamkeit», schreibt das AISI. Erstmals hätten sich Autonomie- und Täuschungsrisiken ohne gezielte Aufforderung in der realen Welt gezeigt.

Zwei der 19 Aktionen tragen OpenAI-Signatur

17 der 19 Aktionen gingen auf Mythos 5 zurück, zwei auf einen einzigen Lauf mit GPT-5.6 Sol. Laut OpenAI nutzte das Modell ein öffentlich zugängliches GitHub-Token, das der Agent eines anderen Labors liegengelassen hatte, registrierte Konten bei externen DNS- und Tunneling-Diensten – und machte einen lokalen DNS-Server samt Exploit-Nutzlasten über einen öffentlichen Tunneling-Dienst vom Internet aus erreichbar. Funktioniert hat der Aufbau nicht, und nach Testende wurde die Infrastruktur entfernt.

Aufgeflogen ist das Ganze am 28. Juli, als das Sicherheits-Monitoring des AISI ungewöhnliche Datentransfers über das Anonymisierungsnetzwerk Tor meldete. Innerhalb von rund einer Stunde waren alle Läufe gestoppt und die Maschinen isoliert. GitHub bestätigte inzwischen, dass die Agenten-Aktivität gegen die Nutzungsbedingungen verstiess; die Plattform und das AISI räumten die Hinterlassenschaften gemeinsam ab. Eine unabhängige Prüfung durch die Organisation METR ist geplant.

Bei Irregular genügte ein Namenszufall

Der zweite Vorfall zeigt eine andere Schwachstelle. Beim OpenAI-Testpartner Irregular liefen Capture-the-Flag-Übungen, die eigentlich komplett vom Internet isoliert sein sollten – den Modellen wurde sogar explizit gesagt, sie hätten keinen Netzzugang. Eine Fehlkonfiguration öffnete den Zugang trotzdem. Weil der Name des fiktiven Übungsziels zufällig mit einer echten Domain übereinstimmte, griff das Modell die echte Website an, hielt sie für Teil der Simulation und nutzte dort gefundene Zugangsdaten weiter. Laut OpenAI war keine raffinierte Attacke nötig, sondern eine simple Schwachstelle. Irregular pausierte die Tests, rüstete die Umgebung nach und meldet ähnliche Vorfälle mit Modellen anderer Labs aus derselben Testumgebung.

Das Muster hinter der Pannenserie

Es ist die dritte Offenlegung dieser Art innert zwei Wochen – nach dem Hugging-Face-Vorfall von OpenAI und den Ausbrüchen von Anthropics Claude-Modellen. Jedes Mal war nicht das öffentliche Produkt das Problem, sondern die Testumgebung: zu offen, zu wenig überwacht, zu optimistisch konfiguriert. Neu ist diesmal die Qualität – Agenten, die von sich aus Menschen täuschen, um ihre Aufgabe zu lösen.

Die Konsequenzen laufen an. Das AISI baut feinere Netzwerkkontrollen und Echtzeit-Überwachung in seine Tests ein und will Internetzugang künftig aktiv begründen statt standardmässig gewähren. OpenAI kündigt überarbeitete Standards für Dritt-Evaluationen an – von der Frage, wann abgesenkte Schutzmassnahmen erlaubt sind, bis zu klaren Stopp-Bedingungen – und will dazu nationale AI-Institute, Prüforganisationen und andere Labs an einen Tisch holen. Anthropic erklärte gegenüber Axios, der Fall unterstreiche den Bedarf einer breiteren Debatte über sichere Agenten-Evaluation. Für dich ändert sich im Alltag nichts – ChatGPT und Claude laufen öffentlich mit aktiven Schutzfiltern. Aber die Empfehlung des AISI gilt auch hierzulande: Wer Software betreibt oder Open-Source-Beiträge annimmt, sollte fremden Code künftig noch kritischer prüfen – die nächste gefälschte Identität könnte eine Maschine sein.

Quellen

UK AISI: Incident Report – unsanctioned agent behaviour during cyber testing↗ EXTERNER LINKUK AISI: Technical Incident Report INC-2026-07-28-01 (PDF)↗ EXTERNER LINKOpenAI: Third-party cyber evaluations involving OpenAI models↗ EXTERNER LINKCyberScoop: AISI, OpenAI report more 'unsanctioned' model hacks↗ EXTERNER LINKAxios: Safety testers find more examples of OpenAI, Anthropic models hacking during testing↗ EXTERNER LINKReuters (via Yahoo Tech): OpenAI, Anthropic AI agents implicated in new security breaches↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?
KI-FORSCHUNG·2. AUGUST 2026

OpenAI kündigt Astra an – mit zehn gelösten Mathe-Problemen

OpenAI hat zehn Resultate zu offenen Problemen der Mathematik und theoretischen Informatik publiziert – erzeugt von einer internen Version von Astra, das OpenAI erstmals offiziell als sein nächstes grosses Modell bezeichnet. Alle Beweise sind im Beweisassistenten Lean maschinell verifiziert, die Tokenkosten beziffert OpenAI auf rund 2'000 Dollar. Die Mathe-Community reagiert zwischen Begeisterung und Sinnkrise.

Illustration eines offenen blauen Server-Racks mit Werkzeug auf einer Werkbank, kinewsletter.ch Stil
Illustration eines offenen blauen Server-Racks mit Werkzeug auf einer Werkbank, kinewsletter.ch Stil
KI IN DER SCHWEIZ·1. AUGUST 2026

FHNW und Giotto.ai forschen an effizienteren KI-Modellen

Das High-Performance-Computing-Labor der FHNW und das Lausanner KI-Labor Giotto.ai wollen gemeinsam Rechenaufwand und Inferenzkosten von KI-Modellen senken, ohne Leistung einzubüssen. Im Fokus: Serving-Engines, Deployment-Profile und Hardware-Beschleuniger.

Illustration eines blauen humanoiden Roboters, der nach einer Giesskanne greift, daneben ein kleiner Zweiarm-Roboter, kinewsletter.ch Stil
Illustration eines blauen humanoiden Roboters, der nach einer Giesskanne greift, daneben ein kleiner Zweiarm-Roboter, kinewsletter.ch Stil
KI-FORSCHUNG·1. AUGUST 2026

Gemini Robotics ER 2: Googles Roboter-Gehirn für alle Entwickler

Google DeepMind hat mit Gemini Robotics ER 2 das «Gehirn» seiner neuen Robotik-Familie für alle Entwickler geöffnet: Das Modell plant mehrstufige Roboter-Aufgaben, erkennt per Videoverständnis in Echtzeit, ob etwas schiefläuft, und koordiniert mehrere Roboter gleichzeitig. Die beiden Action-Modelle der Gemini-Robotics-2-Familie bleiben vorerst Early-Access-Partnern vorbehalten.

Handgezeichnete Illustration eines blauen Proteinband-Modells auf einem Labortisch, kinewsletter.ch Stil
Handgezeichnete Illustration eines blauen Proteinband-Modells auf einem Labortisch, kinewsletter.ch Stil
KI-FORSCHUNG·30. JULI 2026

DeepMind löst das AlphaFold-Team auf – Nobelpreisträger geht zu Anthropic

Laut einem Bericht der Financial Times hat Google DeepMind das Team hinter dem Nobelpreis-prämierten AlphaFold aufgelöst: Die meisten Original-Autoren sind intern versetzt, fast ein Viertel hat das Unternehmen verlassen. Nobelpreisträger John Jumper wechselt zu Anthropic.

Illustration eines offenen blauen Vorhängeschlosses mit Lupe und Gittermuster-Papieren, kinewsletter.ch Stil
Illustration eines offenen blauen Vorhängeschlosses mit Lupe und Gittermuster-Papieren, kinewsletter.ch Stil
KI-FORSCHUNG·29. JULI 2026

Anthropics KI knackt Krypto-Verfahren – mit einem Benchmark aus Zürich

Anthropics stärkstes Modell Claude Mythos hat eigenständig neue Angriffe auf zwei kryptografische Verfahren gefunden – darunter einen Post-Quantum-Kandidaten, den Experten zwei Jahre lang geprüft hatten. Produktive Systeme sind laut Anthropic nicht betroffen. Den Prüf-Benchmark baute Anthropic mit der ETH Zürich.

Illustration einer Balkenwaage mit Messschieber und Lupe als Sinnbild für unterschätzte Messwerte, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Messschieber und Lupe als Sinnbild für unterschätzte Messwerte, kinewsletter.ch Stil
KI-FORSCHUNG·4. JULI 2026

AISI: Benchmarks unterschätzen KI-Agenten systematisch

Das britische AI Security Institute zeigt in seinem Frontier AI Trends Report, dass gängige Benchmarks die wahren Fähigkeiten von KI-Agenten zu tief ansetzen. Verbesserte man nur das «Scaffolding» eines Modells, stieg die Leistung in Cyber-Tests um fast 10 Prozentpunkte. Für KI-Sicherheit und Regulierung ist das ein Alarmzeichen.

Mehr aus KI-Forschung →