NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Nvidia zeigt: Das Gerüst schlägt das Modell

Nvidias Forschungssystem AVO holt mit Claude Opus 5 einen perfekten Score von 100,00 auf dem öffentlichen Set des Benchmarks ARC-AGI-3. Dasselbe Modell allein kommt auf 30,16 Prozent. Den Unterschied macht nicht das Modell, sondern der Harness – das Gerüst aus Gedächtnis, Werkzeugen und Aufsicht drumherum.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
23. AUGUST 2026
5 MIN. LESEZEIT
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
INHALT
01Ein Benchmark, der Effizienz misst02Ein Gedächtnis und ein Aufpasser03Warum die 100,00 kleiner ist, als sie klingt04Sieben Tage allein am GPU-Kernel05Der falsche Harness verdoppelt die Rechnung06Bevor du das teurere Modell buchst
INHALT
01Ein Benchmark, der Effizienz misst02Ein Gedächtnis und ein Aufpasser03Warum die 100,00 kleiner ist, als sie klingt04Sieben Tage allein am GPU-Kernel05Der falsche Harness verdoppelt die Rechnung06Bevor du das teurere Modell buchst
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die 100,00 sind sauber belegt, aber kleiner als die Schlagzeile: nur das öffentliche Testset, keine kontrollierte Ablation, und MITs VISTA war zwei Wochen früher schon dort. Die belastbare Erkenntnis ist trotzdem gross – wer Agenten baut, sollte am Gerüst schrauben, bevor er ein teureres Modell bucht.

Nvidia hat am 21. August 2026 Forschungsergebnisse veröffentlicht, die eine unbequeme Frage aufwerfen: Wie viel von der Leistung eines KI-Agenten kommt eigentlich vom Modell? Das Forschungssystem AVO (Agentic Variation Operators) erreichte mit Claude Opus 5 als Modell einen perfekten Score von 100,00 auf dem öffentlichen Testset des Benchmarks ARC-AGI-3 – alle 183 Levels in 25 Spielumgebungen gelöst. Dasselbe Modell allein kommt in der offiziellen Wertung der ARC Prize Foundation auf 30,16 Prozent. Der Unterschied liegt im sogenannten Harness: dem Gerüst aus Gedächtnis, Werkzeugen und Aufsicht, das aus einem Sprachmodell erst einen handlungsfähigen Agenten macht.

Ein Benchmark, der Effizienz misst

ARC-AGI-3 ist kein Wissenstest. Ein Agent landet in einer unbekannten 2D-Spielwelt – ohne Anleitung, ohne Regeln, ohne genanntes Ziel – und muss sich alles selbst erschliessen. Gewertet wird mit RHAE (Relative Human Action Efficiency): Ein gelöstes Level zählt umso mehr, je weniger Aktionen der Agent braucht im Vergleich zu Menschen, die das Spiel zum ersten Mal sehen. Gemäss ARC Prize geht dieses Verhältnis quadriert in die Wertung ein; schwierigere Levels zählen stärker.

Nvidia gibt für seinen Lauf 6'624 Aktionen an. Zum Vergleich nennt Nvidia selbst das MIT-System VISTA, das für dieselben 183 Levels mit demselben Modell 7'542 Aktionen brauchte. AVO kam also mit rund 12 Prozent weniger Aktionen aus.

Ein Gedächtnis und ein Aufpasser

Zwei Bausteine macht Nvidia für die Ausdauer verantwortlich. Erstens ein persistentes Gedächtnis, das frühere Versuche, Auswertungen und Überlegungen über die Grenze eines einzelnen Kontextfensters hinweg mitträgt – der Agent muss die Suche nicht bei jedem Neustart rekonstruieren. Zweitens ein Supervisor: ein zweiter, überwachender Agent, der die Gesamt-Trajektorie im Blick behält und eingreift, wenn der Haupt-Agent sich festfährt.

Der Supervisor wirke «fast wie ein CEO», der den Agenten anstupse, wenn dieser in eine Sackgasse laufe, sagte Adel El Hallak, bei Nvidia Vice President Product in der KI-Sparte, gegenüber TechCrunch.

Nebenbei: Im AVO-Aufbau arbeitete das Modell rein textuell – jede Beobachtung kam als exaktes 64×64-Zeichenraster, ganz ohne Bilder. VISTA nutzt primär ein gerendertes 512×512-PNG. Zwei gegensätzliche Wege, beide am Ziel.

Warum die 100,00 kleiner ist, als sie klingt

Die Zahl lädt zum Überinterpretieren ein. Nvidia selbst schreibt drei Einschränkungen hin:

  • Das Ergebnis gilt nur für das öffentliche 25-Umgebungen-Set, nicht für die halb-private oder private Wettbewerbswertung.
  • Der Vergleich mit VISTA ist keine kontrollierte Ablation. Die Systeme unterscheiden sich in Backend, Beobachtungsformat, Gedächtnis und Kontextverwaltung.
  • Die 30,16 Prozent stammen aus der ARC-Prize-Wertung bei High reasoning effort im generischen Standard-Harness. Nvidias Lauf nutzte dieselbe Modellfamilie unter einer anderen Reasoning-Einstellung.

Und ein vierter Punkt, den Nvidia nicht betont: AVO ist nicht das erste System bei 100,00. Ein Team des MIT hatte mit VISTA bereits am 5. August 2026 alle 25 öffentlichen Spiele mit Claude Opus 5 und einem perfekten RHAE-Score abgeschlossen. Neu an Nvidias Ergebnis ist also nicht der perfekte Score, sondern die Effizienz – und die Tatsache, dass dieselbe Architektur aus einem völlig anderen Anwendungsgebiet stammt.

Sieben Tage allein am GPU-Kernel

Denn AVO wurde nicht für Spiele gebaut. Ursprünglich optimierte das System GPU-Kernels, also die hardwarenahen Rechenroutinen, auf denen KI-Modelle laufen. Dort lief AVO nach Nvidias Angaben sieben Tage autonom, explorierte über 500 Optimierungsrichtungen und committete 40 Kernel-Versionen. Laut dem zugehörigen arXiv-Paper vom März 2026 schlugen die entstandenen Multihead-Attention-Kernels auf Nvidias DGX-B200-Systemen die etablierte Bibliothek cuDNN um bis zu 3,5 Prozent und FlashAttention-4 um bis zu 10,5 Prozent. Die Anpassung auf Grouped-Query-Attention erledigte der Agent in rund 30 Minuten.

Compiler und Profiler als Rückmeldung – oder Spielzüge und Zustandsänderungen: Die Schleife bleibt dieselbe. Hypothese bilden, handeln, beobachten, Zustand aktualisieren, weitermachen.

Der falsche Harness verdoppelt die Rechnung

Nvidia steht mit diesem Befund nicht allein. OpenAI war von den eigenen niedrigen ARC-AGI-3-Werten so irritiert, dass es die Sache im Juli untersuchte: GPT-5.6 Sol kam im offiziellen Harness auf 13,3 Prozent. Nach dem Aktivieren von zwei API-Einstellungen – dem Beibehalten der internen Denkschritte und Compaction statt hartem Abschneiden des Verlaufs – waren es 38,3 Prozent, bei sechsmal weniger Output-Tokens. Am Modell hatte sich nichts geändert.

Databricks kam im Juli aus einer anderen Richtung zum selben Schluss. Auf dem eigenen, millionenzeiligen Code-Bestand kostete dasselbe Modell je nach Harness mehr als das Doppelte pro Aufgabe – bei gleicher Qualität. Der Grund: Der sparsamere Harness schickte rund dreimal weniger Kontext pro Runde. Databricks-CEO Ali Ghodsi gegenüber TechCrunch: Man halte ein Modell für teuer und ein anderes für günstig – dabei könne allein der falsche Harness die Kosten verdoppeln.

Bevor du das teurere Modell buchst

Laut der KMU-Arbeitsmarktstudie von AXA und dem Forschungsinstitut Sotomo, für die im März 2025 300 Schweizer KMU befragt wurden, integrieren 34 Prozent der Betriebe KI bewusst in ihre Arbeitsprozesse – ein Jahr zuvor waren es 22 Prozent. Wer dort steht und mit seinen Agenten unzufrieden ist, greift schnell zum nächstteureren Modell. Die Befunde von Nvidia, OpenAI und Databricks legen die umgekehrte Reihenfolge nahe: zuerst prüfen, was das Gerüst tut. Bleiben die Denkschritte zwischen zwei Aufrufen erhalten? Wird der Kontext verdichtet oder einfach abgeschnitten? Merkt jemand, wenn der Agent sich im Kreis dreht?

Kaufen kann man AVO übrigens nicht: Es ist ein Forschungsprojekt, kein Produkt – die Bausteine für solche Gerüste veröffentlicht Nvidia laut TechCrunch unter der Nemo-Marke, teils kommerziell, vieles offen. Bleibt der Merksatz, mit dem das Nvidia-Team schliesst: Das Modell zählt, aber das Modell ist nicht der ganze Agent.

Quellen

NVIDIA AVO Reaches 100% on ARC-AGI-3 (NVIDIA Technical Blog)↗ EXTERNER LINKAVO: Agentic Variation Operators for Autonomous Evolutionary Search (arXiv)↗ EXTERNER LINKNvidia just showed that the harness, not the AI model, is now the real hero (TechCrunch)↗ EXTERNER LINKNvidia AVO and the ARC-AGI-3 benchmark (The New Stack)↗ EXTERNER LINKARC Prize: Ergebnisse Claude Opus 5↗ EXTERNER LINKARC Prize: Scoring-Methodik (RHAE)↗ EXTERNER LINKARC-AGI-3 Benchmark↗ EXTERNER LINKVISTA: A Visual Harness For Reasoning in an Interactive World↗ EXTERNER LINKHow two settings tripled our ARC-AGI-3 scores (OpenAI)↗ EXTERNER LINKBenchmarking coding agents on Databricks' multi-million-line codebase↗ EXTERNER LINKAXA/Sotomo KMU-Arbeitsmarktstudie 2025: KI↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
NvidiaAnthropicOpenAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Illustration zum Artikel «arXiv erlaubt dir nur noch zwei Paper pro Monat», kinewsletter.ch Stil
Handgezeichnete Illustration zum Artikel «arXiv erlaubt dir nur noch zwei Paper pro Monat», kinewsletter.ch Stil
KI-FORSCHUNG·3. OKTOBER 2026

arXiv erlaubt dir nur noch zwei Paper pro Monat

Die wichtigste Preprint-Plattform der Wissenschaft führt ein Einreichungslimit ein: zwei Paper pro Person und Monat. Grund ist die KI-getriebene Flut, die freiwillige Moderatoren überlastet.

Tuschskizze eines elektroblauen Proteinbands neben Lupe und DNA-Doppelhelix
Tuschskizze eines elektroblauen Proteinbands neben Lupe und DNA-Doppelhelix
KI-FORSCHUNG·2. OKTOBER 2026

DeepMind markiert KI-Proteine: 100 % Detektion, Funktion bleibt

Google DeepMind hat in Nature SynthID Bio vorgestellt, ein Wasserzeichen für KI-designte Proteine. Laut Paper erkennt es Sequenzen mit 100 % Trefferquote bei 0,1 % Fehlalarm, ohne die Funktion zu stören. Entfernbar ist es aber trotzdem.

Tuschskizze eines Schweissroboters in Elektroblau neben Stahlträger und Werkzeugtisch
Tuschskizze eines Schweissroboters in Elektroblau neben Stahlträger und Werkzeugtisch
KI-FORSCHUNG·2. OKTOBER 2026

Roboter können 74 % der körperlichen Aufgaben, rentabel sind 0.3 %

Anthropic hat gemessen, welche körperlichen Aufgaben Roboter heute übernehmen könnten: 74 %, das sind 34 % der Arbeitszeit. Kostengünstiger als Menschen sind sie aber nur bei 0.3 %. Bei heutigen Preistrends dauert es rund 40 Jahre bis 10 %.

Tuschskizze einer Wendeltreppe aus Zahnrädern und Platinen mit einem blau gefüllten Zahnrad im Zentrum
Tuschskizze einer Wendeltreppe aus Zahnrädern und Platinen mit einem blau gefüllten Zahnrad im Zentrum
KI-FORSCHUNG·29. SEPTEMBER 2026

22 KI-Forschende warnen vor einer «Intelligenzexplosion»

Geoffrey Hinton, Yoshua Bengio und OpenAI-Forschungschef Jakub Pachocki warnen in einem Papier vor einer Intelligenzexplosion. Automatisierte KI-Forschung könnte Jahre an Fortschritt in Monate pressen, die Politik brauche Einblick. Kritiker sehen auch Eigeninteresse der Labors.

Tusche-Skizze einer Küchenzeile: ein grosser elektroblauer Roboterarm greift nach einer Tasse, darunter eine offene Besteckschublade, dahinter Wasserkocher und Kartons.
Tusche-Skizze einer Küchenzeile: ein grosser elektroblauer Roboterarm greift nach einer Tasse, darunter eine offene Besteckschublade, dahinter Wasserkocher und Kartons. (Dark Mode)
KI-FORSCHUNG·28. SEPTEMBER 2026

Stanford steckt GPT-6 Astra direkt in einen Haushaltsroboter

Forschende aus Stanford und Caltech streichen bei ihrem Roboter die gelernte Steuerungsschicht und lassen ein Sprachmodell direkt die Bewegungsbefehle aussuchen. Was das taugt – und was die Demo verschweigt.

Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
KI-FORSCHUNG·27. SEPTEMBER 2026

GPT-6 Astra knackt Enigma-Funkspruch von 1941 – in zwei Tagen

OpenAIs GPT-6 Astra hat einen deutschen Heeres-Funkspruch vom 10. Juli 1941 entschlüsselt, der seit 2005 als ungelöst galt. Das Modell suchte sich das Ziel selbst aus und schrieb Enigma-Simulator und Enigma-Bombe eigenständig in Python und C++. Dieselbe Autonomie ist der Grund, weshalb OpenAI seine leistungsfähigsten Modelle gerade gestoppt hat.

Mehr aus KI-Forschung →