Forschende von Nvidia, NTU und MIT senken den Token-Verbrauch von Coding-Agenten um 44,7 bis 49 Prozent – ohne ein besseres Modell. Optimiert wird der Harness, die Steuerungsschicht zwischen KI und Arbeitsumgebung. Auf Terminal-Bench 4 löst das System dafür weniger Aufgaben als zuvor.
Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.
Die billigste Effizienzsteigerung bei KI-Agenten steckt womöglich nicht im Modell, sondern in der Software drumherum.
Forschende von Nvidia, der NTU und dem MIT haben ein System vorgestellt, das den Token-Verbrauch von Coding-Agenten um 44,7 bis 49 Prozent senkt – ohne ein besseres Modell. Optimiert wird nicht die KI, sondern der Harness: die Steuerungsschicht zwischen Modell und Arbeitsumgebung. Das Paper zu SoL-Pi liegt seit dem 17. September 2026 als Preprint auf arXiv, der Code steht unter MIT-Lizenz auf GitHub.
Ein Harness ist der Klebstoff, der aus einem Sprachmodell einen Agenten macht. Er entscheidet, welche Werkzeuge aufgerufen werden, wie Ergebnisse zurück ins Modell fliessen, wann der Kontext zusammengefasst wird und wann eine Aufgabe als erledigt gilt. Claude Code und OpenAIs Codex sind genau das: ein Harness um ein Modell herum.
Bisher drehte die Effizienzforschung vor allem am Preis pro Token – schnellere Kernels, Quantisierung, günstigere Modelle. Die Nvidia-Gruppe nennt ihren Weg ausdrücklich «orthogonal» dazu: Sie fragt, wie viele Tokens überhaupt anfallen.
Das Verfahren ist rekursiv. Ein Forschungs-Agent liest die Ausführungs-Traces eines zweiten Agenten, schlägt Änderungen am Harness-Code vor und testet sie in vorbereiteten Umgebungen; nur was zwei Gates für Fähigkeit und Effizienz übersteht, bleibt. Laut Paper liefen so rund 150 Ideen durch die Schleife, über 535 ausführbare Umgebungen und mehr als 3'000 Läufe. Vier Mechanismen überlebten – etwa «Action Fusion», die eine Datei-Änderung und den anschliessenden Testbefehl in einem einzigen Aufruf bündelt und damit eine Modell-Runde spart.
Auf EdgeBench (51 öffentliche Aufgaben) braucht die Effizienz-Variante 49 Prozent weniger Tokens und hält dabei 93,7 Prozent der Punktzahl des Basis-Harness (42,0 statt 44,8). Eine zweite Variante dreht die Priorität: plus 5,3 Prozent Leistung bei gleichzeitig geringerem Verbrauch. Auf Opus 5 – ohne jede Anpassung übertragen – bleiben 94,3 Prozent der Leistung bei 44,7 Prozent weniger Tokens.
Der Haken steht im Paper selbst. Auf Terminal-Bench 4 löst SoL-Pi nur 15 von 63 Aufgaben – Codex und das Basis-System Pi je 18. Die Rechnung sinkt (211 statt 286 US-Dollar), die Trefferquote auch. Wer Effizienz kauft, zahlt hier mit Fähigkeit.
Die Autoren nennen weitere Grenzen offen: Entwickelt wurde der Harness nur an Traces eines einzigen Modells, auf dem zweiten greifen die Mechanismen seltener. Die Idee, dass ein effizienterer Harness den nächsten finanziert, bezeichnen sie selbst als Forschungsvision, nicht als Ergebnis.
Kurzfristig wenig – und das ist wichtig. SoL-Pi ist eine Erweiterung für den Open-Source-Harness Pi, nicht für Claude Code oder Codex; einschalten kannst du es dort heute nicht. Nvidia rechnet auf der Projektseite Ersparnisse von 8.75 bis 13.50 US-Dollar pro Stunde gegenüber den Standard-Harnesses von Codex und Claude Code vor – bezogen auf API-Preise und auf «einen Profi, der an einem einzigen Problem arbeitet».
Wer über ein Abo arbeitet, spart mit weniger Tokens ohnehin kein Geld, sondern Reichweite: Du rennst später ins Nutzungslimit. Wer sich über knappe Claude-Code-Limits geärgert hat, sieht hier die Gegenbewegung.
Ein Preprint ist aber noch kein Produkt – nicht peer-reviewed, ein Benchmark klar schlechter. Interessant ist weniger die Zahl als das Prinzip: Die günstigste Verbesserung eines KI-Agenten ist manchmal die, die am Modell gar nichts ändert.
OpenAIs GPT-6 Astra hat einen deutschen Heeres-Funkspruch vom 10. Juli 1941 entschlüsselt, der seit 2005 als ungelöst galt. Das Modell suchte sich das Ziel selbst aus und schrieb Enigma-Simulator und Enigma-Bombe eigenständig in Python und C++. Dieselbe Autonomie ist der Grund, weshalb OpenAI seine leistungsfähigsten Modelle gerade gestoppt hat.