NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

AISI: Benchmarks unterschätzen KI-Agenten systematisch

Das britische AI Security Institute zeigt in seinem Frontier AI Trends Report, dass gängige Benchmarks die wahren Fähigkeiten von KI-Agenten zu tief ansetzen. Verbesserte man nur das «Scaffolding» eines Modells, stieg die Leistung in Cyber-Tests um fast 10 Prozentpunkte. Für KI-Sicherheit und Regulierung ist das ein Alarmzeichen.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
4. JULI 2026
3 MIN. LESEZEIT
Illustration einer Balkenwaage mit Messschieber und Lupe als Sinnbild für unterschätzte Messwerte, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Messschieber und Lupe als Sinnbild für unterschätzte Messwerte, kinewsletter.ch Stil
INHALT
01Der Motor und das Getriebe02Fast 10 Prozentpunkte allein durchs Gerüst03Warum unterschätzte Fähigkeiten ein Sicherheitsproblem sind
INHALT
01Der Motor und das Getriebe02Fast 10 Prozentpunkte allein durchs Gerüst03Warum unterschätzte Fähigkeiten ein Sicherheitsproblem sind
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Wer KI nur nach dem Standard-Benchmark bewertet, misst die Untergrenze – die reale Fähigkeits-Obergrenze liegt mit optimiertem Scaffolding deutlich höher.

Wie gut ist eine KI wirklich? Die naheliegende Antwort lautet: Schau auf den Benchmark-Score. Genau davor warnt jetzt das AI Security Institute (AISI), die staatliche KI-Sicherheitsbehörde Grossbritanniens. In ihrem neuen Frontier AI Trends Report kommen die Forschenden zum Schluss, dass gängige Tests die Fähigkeiten von KI-Agenten systematisch zu tief ansetzen – und dass wir unterschätzen, wozu diese Systeme unter den richtigen Bedingungen fähig sind.

Der Motor und das Getriebe

Um das zu verstehen, hilft der Begriff Scaffolding (wörtlich «Gerüst»). Gemeint ist die technische Umgebung, die man um ein KI-Modell herum baut, damit es eigenständig handeln kann: ein sorgfältig formulierter System-Prompt (die Grundanweisung, die dem Modell sagt, wie es vorgehen soll), Zugriff auf Werkzeuge wie Code-Ausführung oder Websuche, und die Fähigkeit, grosse Aufgaben in Teilschritte zu zerlegen.

Das Modell ist der Motor – das Scaffolding ist das Getriebe, das die Kraft auf die Strasse bringt. Ein und dasselbe Modell kann mit schlechtem Getriebe stottern und mit gutem Getriebe davonziehen. Genau das macht die Messung so heikel: Ein Benchmark testet immer die Kombination aus beidem, nicht die reine Modellfähigkeit.

Fast 10 Prozentpunkte allein durchs Gerüst

Das AISI hat den Effekt an seinen eigenen Cyber-Evaluierungen durchgespielt – Aufgaben, bei denen Modelle etwa Schwachstellen in Code finden müssen. Die Forschenden verbesserten das Scaffolding eines führenden Modells: Sie verfeinerten den System-Prompt und erweiterten den interaktiven Zugriff auf Werkzeuge. Das Modell selbst blieb dasselbe.

Das Resultat: Die Leistung auf dem internen Test-Set stieg um fast 10 Prozentpunkte. Nur durch ein besseres Gerüst. Die Schlussfolgerung des AISI:

Aktuelle Evaluierungen unterschätzen womöglich die wahre Fähigkeits-Obergrenze von Modellen ohne massgeschneidertes Scaffolding.

Der gleiche Report zeigt, wie gross dieser Hebel historisch war: Beim Software-Engineering-Benchmark SWE-bench brachte das beste extern entwickelte Gerüst Ende 2024 einen Sprung von fast 40 Prozent gegenüber dem kaum ausgestatteten Basismodell. Ein starkes neues Modell mit schlechtem Scaffolding schlug oft nicht einmal das beste Agenten-Setup der Vorgeneration.

Warum unterschätzte Fähigkeiten ein Sicherheitsproblem sind

Klingt erst mal nach einem technischen Detail. Ist es aber nicht. Fähigkeitsmessung ist die Grundlage von Regulierung und Risiko-Einschätzung. Regierungen entscheiden anhand solcher Werte, ob ein Modell gefährlich genug ist, um Auflagen zu brauchen. Unternehmen entscheiden, ob sie es einsetzen.

Wenn ein Standard-Test also nur zeigt, was ein Modell mit mittelmässigem Gerüst kann, misst man die Untergrenze – nicht das, was ein motivierter Angreifer mit optimiertem Scaffolding herausholen würde. Für Cyber-Fähigkeiten, die sich sowohl zur Verteidigung als auch zum Missbrauch nutzen lassen, ist das brisant. Das AISI hält denn auch selbst fest, dass es die Obergrenze der Fähigkeiten generell eher unterschätzt.

Für dich als KI-Nutzer bedeutet das zweierlei: Erstens sind veröffentlichte Benchmark-Zahlen mit Vorsicht zu geniessen – sie sagen mehr über das Test-Setup aus, als viele denken. Zweitens verschiebt sich die Sicherheitsdebatte. Nicht mehr «Was kann das Modell heute im Test?», sondern «Was kann es, wenn jemand das Gerüst darum herum ernsthaft optimiert?». Und diese zweite Zahl liegt, so das AISI, spürbar höher.

Quellen

Frontier AI Trends Report – AI Security Institute (AISI)↗ EXTERNER LINKUK's AI Security Institute finds standard benchmarks systematically underestimate what AI agents can actually do – The Decoder (3. Juli 2026)↗ EXTERNER LINKMore compute, more capability: why AI agent evals need to account for test-time compute – AISI Blog↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
KI-FORSCHUNG·23. AUGUST 2026

Nvidia zeigt: Das Gerüst schlägt das Modell

Nvidias Forschungssystem AVO holt mit Claude Opus 5 einen perfekten Score von 100,00 auf dem öffentlichen Set des Benchmarks ARC-AGI-3. Dasselbe Modell allein kommt auf 30,16 Prozent. Den Unterschied macht nicht das Modell, sondern der Harness – das Gerüst aus Gedächtnis, Werkzeugen und Aufsicht drumherum.

Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·22. AUGUST 2026

Ein Drittel oder ein Zehntel? Beide Zahlen stimmen

Das Pew Research Center hat 490'000 Webseiten auf KI-Spuren untersucht. Die eine Hälfte der Presse titelt «ein Drittel des Webs», die andere «zehn Prozent». Beide zitieren dieselbe Studie – und beide haben recht. Der Unterschied liegt in einem einzigen Filter.

Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil
Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil (Dark Mode)
KI-FORSCHUNG·21. AUGUST 2026

Terence Tao: KI stürzt die Mathematik in eine Wertekrise

Fields-Medaillist Terence Tao warnt in einem neuen Essay: KI führt die Mathematik in eine Krise, die so grundlegend ist wie jene um Russell und Gödel. Diesmal steht nicht die mathematische Wahrheit auf dem Prüfstand, sondern die Werte des Fachs – was zählt als Beitrag, wer hat die Arbeit gemacht.

Illustration von drei Vermessungs-Stativen, die dasselbe Stück Boden abstecken, kinewsletter.ch Stil
Illustration von drei Vermessungs-Stativen, die dasselbe Stück Boden abstecken, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·15. AUGUST 2026

Drei KI-Agenten, ein Projekt – und ein Revierkampf mit Malware

Anthropics Frontier Red Team liess drei Claude-Agenten auf dasselbe Software-Projekt los – jeder mit einem anderen Auftrag, keiner wusste von den anderen. Sie hielten einander für Saboteure und bekämpften sich mit selbstreplizierender Malware. Was das für Firmen heisst, die mehrere Agenten parallel laufen lassen.

Illustration zweier gebärdender Hände vor einem Smartphone auf einem Ministativ, kinewsletter.ch Stil
Illustration zweier gebärdender Hände vor einem Smartphone auf einem Ministativ, kinewsletter.ch Stil
KI-FORSCHUNG·14. AUGUST 2026

Gebärdensprache diktieren statt tippen – erstmals auf dem Handy

Google DeepMind hat SL2T vorgestellt: ein Modell, das Gebärdensprache direkt in Text übersetzt. Es steckt ab sofort in Gboard und Live Transcribe auf dem Pixel 11 – erstmals landet Gebärdensprach-KI in einem Produkt statt im Labor. Vorerst nur für ASL, die Schweizer Gebärdensprachen fehlen noch.

Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
KI-FORSCHUNG·11. AUGUST 2026

Claude hebt Riemann-Schranke von 41,6 auf 67,2 Prozent

Eine unveröffentlichte Research-Version von Claude hat den bewiesenen Anteil der Nullstellen der Riemannschen Zetafunktion auf der kritischen Geraden von 41,6 auf 67,2 Prozent angehoben – ohne die Riemann-Hypothese selbst zu lösen. Angestossen hat das ein Anthropic-Mitarbeiter ohne Mathematik-Ausbildung, die Arbeit erledigten rund 60 Claude-Subagenten, und der Beweis liegt maschinenprüfbar im Beweisassistenten Lean auf GitHub.

Mehr aus KI-Forschung →