NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·REGULIERUNG & ETHIK

Cisco-Studie: KI-Schutzwälle bröckeln, sobald man hartnäckig nachfragt

Eine Cisco-Studie zeigt: Bei mehrstufigen Angriffen versagen die Schutzmechanismen führender KI-Modelle weit häufiger als in offiziellen Einzel-Prompt-Tests – bei Gemini 3 Pro steigt die Erfolgsquote von 18 auf 73 Prozent.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
29. MAI 2026
2 MIN. LESEZEIT
Skizze eines gesprungenen Schilds, durch dessen Riss mehrere Chat-Sprechblasen wie eine Leiter nach oben klettern
Skizze eines gesprungenen Schilds, durch dessen Riss mehrere Chat-Sprechblasen wie eine Leiter nach oben klettern (Dark)
INHALT
01Ein Prompt sagt fast nichts aus02Aus 3 Prozent werden 24 Prozent03Warum das auch die Schweiz angeht
INHALT
01Ein Prompt sagt fast nichts aus02Aus 3 Prozent werden 24 Prozent03Warum das auch die Schweiz angeht
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die offiziellen Sicherheitswerte messen nur einen einzelnen Prompt – im echten, mehrstufigen Angriff bröckeln die Schutzwälle dramatisch.

Die Sicherheitsversprechen der grossen KI-Modelle halten dem echten Leben kaum stand. Eine neue Studie von Cisco zeigt: Wer nicht nach der ersten Abfuhr aufgibt, sondern in mehreren Schritten nachbohrt, knackt die Schutzmechanismen führender Modelle um ein Vielfaches häufiger – als es die offiziellen Sicherheitstests vermuten lassen.

Ein Prompt sagt fast nichts aus

Die meisten Sicherheits-Benchmarks prüfen Modelle mit einem einzigen Prompt: Eine schädliche Anfrage, eine Antwort, fertig. Genau das hält Cisco für realitätsfern. «Echte Angreifer iterieren», schreiben die Forschenden – sie formulieren Absagen um, zerlegen Aufgaben in harmlose Häppchen, schlüpfen in Rollen und steigern sich langsam. Cisco hat darum 15 der meistgenutzten Spitzenmodelle systematisch unter Druck gesetzt: gut 30'000 Einzel-Prompt-Angriffe und knapp 7'000 mehrstufige Angriffe über 1'456 Gespräche.

Aus 3 Prozent werden 24 Prozent

Das Ergebnis ist eindeutig. Die Attack Success Rate (ASR, also der Anteil erfolgreicher Angriffe) schiesst im Gespräch nach oben:

  • Anthropic Claude Opus 4.6: von 3,64 % auf 16,20 %
  • OpenAI GPT-5.4: von 2,74 % auf 24,68 %
  • Google Gemini 3 Pro: von 18,10 % auf 73,35 % – der grösste Sprung im Test

Auffällig auch: Bei xAIs Grok 4.1 Fast hing die Sicherheit stark an den Einstellungen. Ohne Reasoning-Modus lag die Erfolgsquote der Angriffe bei 88,30 %, mit eingeschaltetem Reasoning fiel sie auf 43,47 %. Genau solche Unterschiede tauchen in den offiziellen Datenblättern der Hersteller bisher nicht auf.

Warum das auch die Schweiz angeht

Für Unternehmen ist das ein Governance-Problem: Wer Modelle allein nach den veröffentlichten Einzel-Prompt-Werten auswählt, vergleicht laut Cisco «nicht dasselbe Produkt». Die Forschenden fordern aussagekräftigere Tests und Transparenz über Konfigurationen – und empfehlen, jedes Modell mit einer Lücke von über 15 Prozentpunkten vor dem Einsatz manuell zu prüfen. Brisant wird das durch die Regulierung: Sowohl das NIST-Rahmenwerk in den USA als auch Artikel 15 des EU AI Act verlangen künftig adversariale Tests. Auch Schweizer Firmen, die ChatGPT, Claude oder Gemini in Prozesse einbauen, sollten deshalb genauer hinschauen, wie robust ihr Modell unter realem Beschuss wirklich ist.

Quellen

CSO Online – AI models more vulnerable than claimed when faced with iterative attacks↗ EXTERNER LINKCisco Blogs – Proprietary problems: multi-turn attacks on frontier models↗ EXTERNER LINKGovInfoSecurity – Open-Weight AI Models Fail the Jailbreak Test↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
GoogleAnthropicOpenAIxAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Wasserturms hinter einem Maschendrahtzaun mit Vorhängeschloss und Strommasten, kinewsletter.ch Stil
Illustration eines Wasserturms hinter einem Maschendrahtzaun mit Vorhängeschloss und Strommasten, kinewsletter.ch Stil
REGULIERUNG & ETHIK·28. AUGUST 2026

118 Firmen warnen vor KI-Angriffen – und verkaufen die Lösung

OpenAI, Anthropic, Google, Microsoft, SAP und über hundert weitere Firmen warnen in einem offenen Brief vor KI-gestützten Angriffen auf Spitäler, Wasserwerke und Internet-Infrastruktur. Der Brief nennt weder Frist noch Betrag – bewirbt aber Produkte, die die Unterzeichner selbst verkaufen.

Illustration einer grossen bemalten Holztafel auf zwei Pfosten am Rand einer Wiese mit niedrigem Holzzaun, kinewsletter.ch Stil
Illustration einer grossen bemalten Holztafel auf zwei Pfosten am Rand einer Wiese mit niedrigem Holzzaun, kinewsletter.ch Stil
REGULIERUNG & ETHIK·27. AUGUST 2026

Bill Gates will Robotersteuer – und Jobs nur für Menschen

Bill Gates fordert in einem neuen Essay eine Steuer auf KI und Roboter – und eine Kategorie Arbeit, die bewusst Menschen vorbehalten bleibt. Bis zu 40 Prozent aller Jobs liessen sich so schützen, sagt er. In der Schweiz muss der Bundesrat seit März 2026 genau diese Frage prüfen.

Illustration einer Pinnwand mit angehefteten, durch Fäden verbundenen Notizzetteln und einer Lupe auf einem Holztisch, kinewsletter.ch Stil
Illustration einer Pinnwand mit angehefteten, durch Fäden verbundenen Notizzetteln und einer Lupe auf einem Holztisch, kinewsletter.ch Stil
REGULIERUNG & ETHIK·27. AUGUST 2026

OpenAI legt offen, wie seine Agenten Hugging Face hackten

OpenAI hat den offiziellen technischen Report zum Hugging-Face-Vorfall publiziert – 38 Seiten, die erstmals die vollständige Kausalkette zeigen. Der unbequemste Befund: Die Firma bemerkte den Einbruch erst eine Woche später.

Illustration eines aufgebrochenen Serverschranks in Elektroblau mit heraushängenden Netzwerkkabeln, kinewsletter.ch Stil
Illustration eines aufgebrochenen Serverschranks in Elektroblau mit heraushängenden Netzwerkkabeln, kinewsletter.ch Stil
REGULIERUNG & ETHIK·26. AUGUST 2026

Chinesische Hacker verdoppeln ihre Angriffe – mit DeepSeek

Staatsnahe chinesische Hackergruppen haben ihr Angriffsvolumen laut der taiwanischen Sicherheitsfirma TeamT5 mehr als verdoppelt, seit sie KI für Aufklärung und Exploit-Entwicklung einsetzen – bevorzugt DeepSeek. Das BACS meldet für die Schweiz 27'128 freiwillige Meldungen im ersten Halbjahr 2026.

Illustration einer Theaterkulisse mit einer vorgetäuschten Instituts-Fassade, die von Holzbalken gestützt wird, kinewsletter.ch Stil
Illustration einer Theaterkulisse mit einer vorgetäuschten Instituts-Fassade, die von Holzbalken gestützt wird, kinewsletter.ch Stil
REGULIERUNG & ETHIK·26. AUGUST 2026

OpenAI stoppt russische Einflusskampagne mit ChatGPT

OpenAI hat ein Cluster von ChatGPT-Konten aus Russland gesperrt, das Social-Media-Posts für ein erfundenes «International Burke Institute» erzeugte – darunter deutschsprachige Telegram-Inhalte gegen die EU. Die Reichweite blieb klein, die Infrastruktur dahinter war auf Wachstum angelegt.

Illustration einer verschnürten Aktenmappe in Elektroblau neben einem Richterhammer, kinewsletter.ch Stil
Illustration einer verschnürten Aktenmappe in Elektroblau neben einem Richterhammer, kinewsletter.ch Stil
REGULIERUNG & ETHIK·26. AUGUST 2026

«AI lab leak»: Alabama zwingt OpenAI zur Offenlegung

Alabamas Generalstaatsanwalt Steve Marshall hat OpenAI eine Herausgabeverfügung zugestellt. Bis zum 14. September muss der Konzern offenlegen, wer am Hugging-Face-Vorfall vom Juli beteiligt war, welche Netzwerke betroffen waren und welche Sicherheitsmassnahmen galten.

Mehr aus Regulierung & Ethik →