NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

AISI: Benchmarks unterschätzen KI-Agenten systematisch

Das britische AI Security Institute zeigt in seinem Frontier AI Trends Report, dass gängige Benchmarks die wahren Fähigkeiten von KI-Agenten zu tief ansetzen. Verbesserte man nur das «Scaffolding» eines Modells, stieg die Leistung in Cyber-Tests um fast 10 Prozentpunkte. Für KI-Sicherheit und Regulierung ist das ein Alarmzeichen.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
4. JULI 2026
3 MIN. LESEZEIT
Illustration einer Balkenwaage mit Messschieber und Lupe als Sinnbild für unterschätzte Messwerte, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Messschieber und Lupe als Sinnbild für unterschätzte Messwerte, kinewsletter.ch Stil
INHALT
01Der Motor und das Getriebe02Fast 10 Prozentpunkte allein durchs Gerüst03Warum unterschätzte Fähigkeiten ein Sicherheitsproblem sind
INHALT
01Der Motor und das Getriebe02Fast 10 Prozentpunkte allein durchs Gerüst03Warum unterschätzte Fähigkeiten ein Sicherheitsproblem sind
Inoo GmbH
Präsentiert & entwickelt von
kinewsletter.ch ist ein Projekt der Inoo GmbH

KI-Beratung und Softwareentwicklung aus dem St. Galler Rheintal.

inoo.ch →
DAS WICHTIGSTE IN KÜRZE

Wer KI nur nach dem Standard-Benchmark bewertet, misst die Untergrenze – die reale Fähigkeits-Obergrenze liegt mit optimiertem Scaffolding deutlich höher.

Wie gut ist eine KI wirklich? Die naheliegende Antwort lautet: Schau auf den Benchmark-Score. Genau davor warnt jetzt das AI Security Institute (AISI), die staatliche KI-Sicherheitsbehörde Grossbritanniens. In ihrem neuen Frontier AI Trends Report kommen die Forschenden zum Schluss, dass gängige Tests die Fähigkeiten von KI-Agenten systematisch zu tief ansetzen – und dass wir unterschätzen, wozu diese Systeme unter den richtigen Bedingungen fähig sind.

Der Motor und das Getriebe

Um das zu verstehen, hilft der Begriff Scaffolding (wörtlich «Gerüst»). Gemeint ist die technische Umgebung, die man um ein KI-Modell herum baut, damit es eigenständig handeln kann: ein sorgfältig formulierter System-Prompt (die Grundanweisung, die dem Modell sagt, wie es vorgehen soll), Zugriff auf Werkzeuge wie Code-Ausführung oder Websuche, und die Fähigkeit, grosse Aufgaben in Teilschritte zu zerlegen.

Das Modell ist der Motor – das Scaffolding ist das Getriebe, das die Kraft auf die Strasse bringt. Ein und dasselbe Modell kann mit schlechtem Getriebe stottern und mit gutem Getriebe davonziehen. Genau das macht die Messung so heikel: Ein Benchmark testet immer die Kombination aus beidem, nicht die reine Modellfähigkeit.

Fast 10 Prozentpunkte allein durchs Gerüst

Das AISI hat den Effekt an seinen eigenen Cyber-Evaluierungen durchgespielt – Aufgaben, bei denen Modelle etwa Schwachstellen in Code finden müssen. Die Forschenden verbesserten das Scaffolding eines führenden Modells: Sie verfeinerten den System-Prompt und erweiterten den interaktiven Zugriff auf Werkzeuge. Das Modell selbst blieb dasselbe.

Das Resultat: Die Leistung auf dem internen Test-Set stieg um fast 10 Prozentpunkte. Nur durch ein besseres Gerüst. Die Schlussfolgerung des AISI:

Aktuelle Evaluierungen unterschätzen womöglich die wahre Fähigkeits-Obergrenze von Modellen ohne massgeschneidertes Scaffolding.

Der gleiche Report zeigt, wie gross dieser Hebel historisch war: Beim Software-Engineering-Benchmark SWE-bench brachte das beste extern entwickelte Gerüst Ende 2024 einen Sprung von fast 40 Prozent gegenüber dem kaum ausgestatteten Basismodell. Ein starkes neues Modell mit schlechtem Scaffolding schlug oft nicht einmal das beste Agenten-Setup der Vorgeneration.

Warum unterschätzte Fähigkeiten ein Sicherheitsproblem sind

Klingt erst mal nach einem technischen Detail. Ist es aber nicht. Fähigkeitsmessung ist die Grundlage von Regulierung und Risiko-Einschätzung. Regierungen entscheiden anhand solcher Werte, ob ein Modell gefährlich genug ist, um Auflagen zu brauchen. Unternehmen entscheiden, ob sie es einsetzen.

Wenn ein Standard-Test also nur zeigt, was ein Modell mit mittelmässigem Gerüst kann, misst man die Untergrenze – nicht das, was ein motivierter Angreifer mit optimiertem Scaffolding herausholen würde. Für Cyber-Fähigkeiten, die sich sowohl zur Verteidigung als auch zum Missbrauch nutzen lassen, ist das brisant. Das AISI hält denn auch selbst fest, dass es die Obergrenze der Fähigkeiten generell eher unterschätzt.

Für dich als KI-Nutzer bedeutet das zweierlei: Erstens sind veröffentlichte Benchmark-Zahlen mit Vorsicht zu geniessen – sie sagen mehr über das Test-Setup aus, als viele denken. Zweitens verschiebt sich die Sicherheitsdebatte. Nicht mehr «Was kann das Modell heute im Test?», sondern «Was kann es, wenn jemand das Gerüst darum herum ernsthaft optimiert?». Und diese zweite Zahl liegt, so das AISI, spürbar höher.

Quellen

Frontier AI Trends Report – AI Security Institute (AISI)↗ EXTERNER LINKUK's AI Security Institute finds standard benchmarks systematically underestimate what AI agents can actually do – The Decoder (3. Juli 2026)↗ EXTERNER LINKMore compute, more capability: why AI agent evals need to account for test-time compute – AISI Blog↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Illustration zum Artikel «arXiv erlaubt dir nur noch zwei Paper pro Monat», kinewsletter.ch Stil
Handgezeichnete Illustration zum Artikel «arXiv erlaubt dir nur noch zwei Paper pro Monat», kinewsletter.ch Stil
KI-FORSCHUNG·3. OKTOBER 2026

arXiv erlaubt dir nur noch zwei Paper pro Monat

Die wichtigste Preprint-Plattform der Wissenschaft führt ein Einreichungslimit ein: zwei Paper pro Person und Monat. Grund ist die KI-getriebene Flut, die freiwillige Moderatoren überlastet.

Tuschskizze eines elektroblauen Proteinbands neben Lupe und DNA-Doppelhelix
Tuschskizze eines elektroblauen Proteinbands neben Lupe und DNA-Doppelhelix
KI-FORSCHUNG·2. OKTOBER 2026

DeepMind markiert KI-Proteine: 100 % Detektion, Funktion bleibt

Google DeepMind hat in Nature SynthID Bio vorgestellt, ein Wasserzeichen für KI-designte Proteine. Laut Paper erkennt es Sequenzen mit 100 % Trefferquote bei 0,1 % Fehlalarm, ohne die Funktion zu stören. Entfernbar ist es aber trotzdem.

Tuschskizze eines Schweissroboters in Elektroblau neben Stahlträger und Werkzeugtisch
Tuschskizze eines Schweissroboters in Elektroblau neben Stahlträger und Werkzeugtisch
KI-FORSCHUNG·2. OKTOBER 2026

Roboter können 74 % der körperlichen Aufgaben, rentabel sind 0.3 %

Anthropic hat gemessen, welche körperlichen Aufgaben Roboter heute übernehmen könnten: 74 %, das sind 34 % der Arbeitszeit. Kostengünstiger als Menschen sind sie aber nur bei 0.3 %. Bei heutigen Preistrends dauert es rund 40 Jahre bis 10 %.

Tuschskizze einer Wendeltreppe aus Zahnrädern und Platinen mit einem blau gefüllten Zahnrad im Zentrum
Tuschskizze einer Wendeltreppe aus Zahnrädern und Platinen mit einem blau gefüllten Zahnrad im Zentrum
KI-FORSCHUNG·29. SEPTEMBER 2026

22 KI-Forschende warnen vor einer «Intelligenzexplosion»

Geoffrey Hinton, Yoshua Bengio und OpenAI-Forschungschef Jakub Pachocki warnen in einem Papier vor einer Intelligenzexplosion. Automatisierte KI-Forschung könnte Jahre an Fortschritt in Monate pressen, die Politik brauche Einblick. Kritiker sehen auch Eigeninteresse der Labors.

Tusche-Skizze einer Küchenzeile: ein grosser elektroblauer Roboterarm greift nach einer Tasse, darunter eine offene Besteckschublade, dahinter Wasserkocher und Kartons.
Tusche-Skizze einer Küchenzeile: ein grosser elektroblauer Roboterarm greift nach einer Tasse, darunter eine offene Besteckschublade, dahinter Wasserkocher und Kartons. (Dark Mode)
KI-FORSCHUNG·28. SEPTEMBER 2026

Stanford steckt GPT-6 Astra direkt in einen Haushaltsroboter

Forschende aus Stanford und Caltech streichen bei ihrem Roboter die gelernte Steuerungsschicht und lassen ein Sprachmodell direkt die Bewegungsbefehle aussuchen. Was das taugt – und was die Demo verschweigt.

Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
KI-FORSCHUNG·27. SEPTEMBER 2026

GPT-6 Astra knackt Enigma-Funkspruch von 1941 – in zwei Tagen

OpenAIs GPT-6 Astra hat einen deutschen Heeres-Funkspruch vom 10. Juli 1941 entschlüsselt, der seit 2005 als ungelöst galt. Das Modell suchte sich das Ziel selbst aus und schrieb Enigma-Simulator und Enigma-Bombe eigenständig in Python und C++. Dieselbe Autonomie ist der Grund, weshalb OpenAI seine leistungsfähigsten Modelle gerade gestoppt hat.

Mehr aus KI-Forschung →