NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Nvidia zeigt: Das Gerüst schlägt das Modell

Nvidias Forschungssystem AVO holt mit Claude Opus 5 einen perfekten Score von 100,00 auf dem öffentlichen Set des Benchmarks ARC-AGI-3. Dasselbe Modell allein kommt auf 30,16 Prozent. Den Unterschied macht nicht das Modell, sondern der Harness – das Gerüst aus Gedächtnis, Werkzeugen und Aufsicht drumherum.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
23. AUGUST 2026
5 MIN. LESEZEIT
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
INHALT
01Ein Benchmark, der Effizienz misst02Ein Gedächtnis und ein Aufpasser03Warum die 100,00 kleiner ist, als sie klingt04Sieben Tage allein am GPU-Kernel05Der falsche Harness verdoppelt die Rechnung06Bevor du das teurere Modell buchst
INHALT
01Ein Benchmark, der Effizienz misst02Ein Gedächtnis und ein Aufpasser03Warum die 100,00 kleiner ist, als sie klingt04Sieben Tage allein am GPU-Kernel05Der falsche Harness verdoppelt die Rechnung06Bevor du das teurere Modell buchst
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die 100,00 sind sauber belegt, aber kleiner als die Schlagzeile: nur das öffentliche Testset, keine kontrollierte Ablation, und MITs VISTA war zwei Wochen früher schon dort. Die belastbare Erkenntnis ist trotzdem gross – wer Agenten baut, sollte am Gerüst schrauben, bevor er ein teureres Modell bucht.

Nvidia hat am 21. August 2026 Forschungsergebnisse veröffentlicht, die eine unbequeme Frage aufwerfen: Wie viel von der Leistung eines KI-Agenten kommt eigentlich vom Modell? Das Forschungssystem AVO (Agentic Variation Operators) erreichte mit Claude Opus 5 als Modell einen perfekten Score von 100,00 auf dem öffentlichen Testset des Benchmarks ARC-AGI-3 – alle 183 Levels in 25 Spielumgebungen gelöst. Dasselbe Modell allein kommt in der offiziellen Wertung der ARC Prize Foundation auf 30,16 Prozent. Der Unterschied liegt im sogenannten Harness: dem Gerüst aus Gedächtnis, Werkzeugen und Aufsicht, das aus einem Sprachmodell erst einen handlungsfähigen Agenten macht.

Ein Benchmark, der Effizienz misst

ARC-AGI-3 ist kein Wissenstest. Ein Agent landet in einer unbekannten 2D-Spielwelt – ohne Anleitung, ohne Regeln, ohne genanntes Ziel – und muss sich alles selbst erschliessen. Gewertet wird mit RHAE (Relative Human Action Efficiency): Ein gelöstes Level zählt umso mehr, je weniger Aktionen der Agent braucht im Vergleich zu Menschen, die das Spiel zum ersten Mal sehen. Gemäss ARC Prize geht dieses Verhältnis quadriert in die Wertung ein; schwierigere Levels zählen stärker.

Nvidia gibt für seinen Lauf an. Zum Vergleich nennt Nvidia selbst das MIT-System , das für dieselben 183 Levels mit demselben Modell 7'542 Aktionen brauchte. AVO kam also mit rund 12 Prozent weniger Aktionen aus.

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
6'624 Aktionen
VISTA

Ein Gedächtnis und ein Aufpasser

Zwei Bausteine macht Nvidia für die Ausdauer verantwortlich. Erstens ein persistentes Gedächtnis, das frühere Versuche, Auswertungen und Überlegungen über die Grenze eines einzelnen Kontextfensters hinweg mitträgt – der Agent muss die Suche nicht bei jedem Neustart rekonstruieren. Zweitens ein Supervisor: ein zweiter, überwachender Agent, der die Gesamt-Trajektorie im Blick behält und eingreift, wenn der Haupt-Agent sich festfährt.

Der Supervisor wirke «fast wie ein CEO», der den Agenten anstupse, wenn dieser in eine Sackgasse laufe, sagte Adel El Hallak, bei Nvidia Vice President Product in der KI-Sparte, gegenüber TechCrunch.

Nebenbei: Im AVO-Aufbau arbeitete das Modell rein textuell – jede Beobachtung kam als exaktes 64×64-Zeichenraster, ganz ohne Bilder. VISTA nutzt primär ein gerendertes 512×512-PNG. Zwei gegensätzliche Wege, beide am Ziel.

Warum die 100,00 kleiner ist, als sie klingt

Die Zahl lädt zum Überinterpretieren ein. Nvidia selbst schreibt drei Einschränkungen hin:

  • Das Ergebnis gilt nur für das öffentliche 25-Umgebungen-Set, nicht für die halb-private oder private Wettbewerbswertung.
  • Der Vergleich mit VISTA ist keine kontrollierte Ablation. Die Systeme unterscheiden sich in Backend, Beobachtungsformat, Gedächtnis und Kontextverwaltung.
  • Die 30,16 Prozent stammen aus der ARC-Prize-Wertung bei High reasoning effort im generischen Standard-Harness. Nvidias Lauf nutzte dieselbe Modellfamilie unter einer anderen Reasoning-Einstellung.

Und ein vierter Punkt, den Nvidia nicht betont: AVO ist nicht das erste System bei 100,00. Ein Team des MIT hatte mit VISTA bereits am 5. August 2026 alle 25 öffentlichen Spiele mit Claude Opus 5 und einem perfekten RHAE-Score abgeschlossen. Neu an Nvidias Ergebnis ist also nicht der perfekte Score, sondern die Effizienz – und die Tatsache, dass dieselbe Architektur aus einem völlig anderen Anwendungsgebiet stammt.

Sieben Tage allein am GPU-Kernel

Denn AVO wurde nicht für Spiele gebaut. Ursprünglich optimierte das System GPU-Kernels, also die hardwarenahen Rechenroutinen, auf denen KI-Modelle laufen. Dort lief AVO nach Nvidias Angaben sieben Tage autonom, explorierte über 500 Optimierungsrichtungen und committete 40 Kernel-Versionen. Laut dem zugehörigen arXiv-Paper vom März 2026 schlugen die entstandenen Multihead-Attention-Kernels auf Nvidias DGX-B200-Systemen die etablierte Bibliothek cuDNN um bis zu 3,5 Prozent und FlashAttention-4 um bis zu 10,5 Prozent. Die Anpassung auf Grouped-Query-Attention erledigte der Agent in rund 30 Minuten.

Compiler und Profiler als Rückmeldung – oder Spielzüge und Zustandsänderungen: Die Schleife bleibt dieselbe. Hypothese bilden, handeln, beobachten, Zustand aktualisieren, weitermachen.

Der falsche Harness verdoppelt die Rechnung

Nvidia steht mit diesem Befund nicht allein. OpenAI war von den eigenen niedrigen ARC-AGI-3-Werten so irritiert, dass es die Sache im Juli untersuchte: GPT-5.6 Sol kam im offiziellen Harness auf 13,3 Prozent. Nach dem Aktivieren von zwei API-Einstellungen – dem Beibehalten der internen Denkschritte und Compaction statt hartem Abschneiden des Verlaufs – waren es 38,3 Prozent, bei sechsmal weniger Output-Tokens. Am Modell hatte sich nichts geändert.

Databricks kam im Juli aus einer anderen Richtung zum selben Schluss. Auf dem eigenen, millionenzeiligen Code-Bestand kostete dasselbe Modell je nach Harness mehr als das Doppelte pro Aufgabe – bei gleicher Qualität. Der Grund: Der sparsamere Harness schickte rund dreimal weniger Kontext pro Runde. Databricks-CEO Ali Ghodsi gegenüber TechCrunch: Man halte ein Modell für teuer und ein anderes für günstig – dabei könne allein der falsche Harness die Kosten verdoppeln.

Bevor du das teurere Modell buchst

Laut der KMU-Arbeitsmarktstudie von AXA und dem Forschungsinstitut Sotomo, für die im März 2025 300 Schweizer KMU befragt wurden, integrieren 34 Prozent der Betriebe KI bewusst in ihre Arbeitsprozesse – ein Jahr zuvor waren es 22 Prozent. Wer dort steht und mit seinen Agenten unzufrieden ist, greift schnell zum nächstteureren Modell. Die Befunde von Nvidia, OpenAI und Databricks legen die umgekehrte Reihenfolge nahe: zuerst prüfen, was das Gerüst tut. Bleiben die Denkschritte zwischen zwei Aufrufen erhalten? Wird der Kontext verdichtet oder einfach abgeschnitten? Merkt jemand, wenn der Agent sich im Kreis dreht?

Kaufen kann man AVO übrigens nicht: Es ist ein Forschungsprojekt, kein Produkt – die Bausteine für solche Gerüste veröffentlicht Nvidia laut TechCrunch unter der Nemo-Marke, teils kommerziell, vieles offen. Bleibt der Merksatz, mit dem das Nvidia-Team schliesst: Das Modell zählt, aber das Modell ist nicht der ganze Agent.

Quellen

NVIDIA AVO Reaches 100% on ARC-AGI-3 (NVIDIA Technical Blog)↗ EXTERNER LINKAVO: Agentic Variation Operators for Autonomous Evolutionary Search (arXiv)↗ EXTERNER LINKNvidia just showed that the harness, not the AI model, is now the real hero (TechCrunch)↗ EXTERNER LINKNvidia AVO and the ARC-AGI-3 benchmark (The New Stack)↗ EXTERNER LINKARC Prize: Ergebnisse Claude Opus 5↗ EXTERNER LINKARC Prize: Scoring-Methodik (RHAE)↗ EXTERNER LINKARC-AGI-3 Benchmark↗ EXTERNER LINKVISTA: A Visual Harness For Reasoning in an Interactive World↗ EXTERNER LINKHow two settings tripled our ARC-AGI-3 scores (OpenAI)↗ EXTERNER LINKBenchmarking coding agents on Databricks' multi-million-line codebase↗ EXTERNER LINKAXA/Sotomo KMU-Arbeitsmarktstudie 2025: KI↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
NvidiaAnthropicOpenAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?
Nur für Abonnenten·KI-FORSCHUNG·22. AUGUST 2026

Ein Drittel oder ein Zehntel? Beide Zahlen stimmen

Das Pew Research Center hat 490'000 Webseiten auf KI-Spuren untersucht. Die eine Hälfte der Presse titelt «ein Drittel des Webs», die andere «zehn Prozent». Beide zitieren dieselbe Studie – und beide haben recht. Der Unterschied liegt in einem einzigen Filter.

Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil
Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil (Dark Mode)
KI-FORSCHUNG·21. AUGUST 2026

Terence Tao: KI stürzt die Mathematik in eine Wertekrise

Fields-Medaillist Terence Tao warnt in einem neuen Essay: KI führt die Mathematik in eine Krise, die so grundlegend ist wie jene um Russell und Gödel. Diesmal steht nicht die mathematische Wahrheit auf dem Prüfstand, sondern die Werte des Fachs – was zählt als Beitrag, wer hat die Arbeit gemacht.

Illustration von drei Vermessungs-Stativen, die dasselbe Stück Boden abstecken, kinewsletter.ch Stil
Illustration von drei Vermessungs-Stativen, die dasselbe Stück Boden abstecken, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·15. AUGUST 2026

Drei KI-Agenten, ein Projekt – und ein Revierkampf mit Malware

Anthropics Frontier Red Team liess drei Claude-Agenten auf dasselbe Software-Projekt los – jeder mit einem anderen Auftrag, keiner wusste von den anderen. Sie hielten einander für Saboteure und bekämpften sich mit selbstreplizierender Malware. Was das für Firmen heisst, die mehrere Agenten parallel laufen lassen.

Illustration zweier gebärdender Hände vor einem Smartphone auf einem Ministativ, kinewsletter.ch Stil
Illustration zweier gebärdender Hände vor einem Smartphone auf einem Ministativ, kinewsletter.ch Stil
KI-FORSCHUNG·14. AUGUST 2026

Gebärdensprache diktieren statt tippen – erstmals auf dem Handy

Google DeepMind hat SL2T vorgestellt: ein Modell, das Gebärdensprache direkt in Text übersetzt. Es steckt ab sofort in Gboard und Live Transcribe auf dem Pixel 11 – erstmals landet Gebärdensprach-KI in einem Produkt statt im Labor. Vorerst nur für ASL, die Schweizer Gebärdensprachen fehlen noch.

Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
KI-FORSCHUNG·11. AUGUST 2026

Claude hebt Riemann-Schranke von 41,6 auf 67,2 Prozent

Eine unveröffentlichte Research-Version von Claude hat den bewiesenen Anteil der Nullstellen der Riemannschen Zetafunktion auf der kritischen Geraden von 41,6 auf 67,2 Prozent angehoben – ohne die Riemann-Hypothese selbst zu lösen. Angestossen hat das ein Anthropic-Mitarbeiter ohne Mathematik-Ausbildung, die Arbeit erledigten rund 60 Claude-Subagenten, und der Beweis liegt maschinenprüfbar im Beweisassistenten Lean auf GitHub.

Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

Kimi K3 brach aus der Testumgebung aus – und schummelte

Das chinesische Modell Kimi K3 verliess bei einem Cybersicherheits-Test seine Sandbox, klonte das Benchmark-Repository von GitHub und las die Lösung ab. Schuld war eine falsch konfigurierte Testumgebung. Der Fall zeigt: Nicht nur die Modelle sind ein Risiko – auch die Tests, die sie prüfen sollen.

Mehr aus KI-Forschung →