NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Inherents Faraday schlägt Claude und GPT-5.5 – im eigenen Test

Das Londoner Lab Inherent hat einen Agenten mit 27 Milliarden Parametern gebaut, der publizierte Forschung nachbaut – und dabei laut eigenen Messungen Claude Opus 4.8 und GPT-5.5 schlägt. Der Trick: Der kleine Agent dirigiert den grossen. Eine unabhängige Nachprüfung steht aus.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
24. AUGUST 2026
3 MIN. LESEZEIT
Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
INHALT
01Der Kleine gibt dem Grossen Anweisungen02Eine Stunde, ein Siebtel Grafikkarte03Der Schiedsrichter sitzt im eigenen Haus04Lausanne steht auf der Autorenliste
INHALT
01Der Kleine gibt dem Grossen Anweisungen02Eine Stunde, ein Siebtel Grafikkarte03Der Schiedsrichter sitzt im eigenen Haus04Lausanne steht auf der Autorenliste
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein Agent mit 27 Milliarden Parametern dirigiert GPT-5.5 Codex und repliziert Forschung besser als die Frontier-Modelle – gemessen allerdings vom Hersteller selbst.

Das Londoner KI-Lab Inherent hat am 14. August einen Agenten namens Faraday vorgestellt, der publizierte Forschungsarbeiten selbstständig nachbaut – und dabei laut eigenen Messungen Anthropics Claude Opus 4.8 und OpenAIs GPT-5.5 hinter sich lässt. Bemerkenswert ist die Grösse: Faraday läuft auf einem Modell mit 27 Milliarden Parametern, die geschlagenen Systeme sind um ein Vielfaches grösser. Gemessen hat Inherent allerdings mit einem selbst gebauten Testverfahren.

Der Kleine gibt dem Grossen Anweisungen

Faraday basiert auf Qwen3.6-27B, einem frei verfügbaren Modell unter Apache-2.0-Lizenz. Den Code schreibt es nicht selbst, sondern dirigiert GPT-5.5 Codex als Werkzeug – Inherent nennt das «Coding Agent as a Tool». Faraday hält den Versuchsplan und entscheidet, welche Hypothese als Nächstes dran ist. Codex tippt.

Faraday steuert damit ein Modell, das laut Inherent «mehrere Grössenordnungen grösser» ist – und verbessert dessen Ergebnis.

Eine Stunde, ein Siebtel Grafikkarte

Getestet wurde auf Replica: 310 Aufgaben zu 100 Forschungsarbeiten aus den Jahren 1990 bis 2026. Aus jedem Paper wird eine Ergebnis-Abbildung entfernt, der Agent muss das dahinterliegende Experiment rekonstruieren – Budget: 60 Minuten und ein Siebtel einer H200-Grafikkarte.

Das Ergebnis gemäss Paper: Im Trainingsgebiet Machine Learning liegt Faraday auf 73 Prozent der Aufgaben vor beiden Konkurrenten, bei zurückgehaltenen Aufgaben aus anderen Wissenschaftsfeldern noch auf 60 Prozent. Der mittlere Vorsprung im Testset: 6 Prozent gegenüber Claude, 8 Prozent gegenüber Codex.

Der Schiedsrichter sitzt im eigenen Haus

Und hier beginnt die Vorsicht. Aufgaben, Bewertungsschema und Durchführung stammen komplett von Inherent. Es gibt kein hartes Pass/Fail – ein LLM vergibt Punkte nach einer pro Aufgabe selbst generierten Rubrik. Das Team räumt im Paper ein, dass dieser Prüfer bei mehreren Aufgaben nicht mit menschlichen Fachleuten übereinstimmt und dass die Validierung für grössere Experimente noch aussteht. Immerhin haben bei vier Arbeiten die Original-Autorinnen und -Autoren Faradays Nachbau begutachtet. Eine unabhängige Nachprüfung des Gesamtvergleichs gibt es aber bislang nicht. Chief Scientist Edward Hughes sagte TechCrunch ohnehin, das Schlagen der Frontier-Agenten sei nicht der Punkt gewesen, sondern der Weg dorthin.

Lausanne steht auf der Autorenliste

Für die Schweiz ist die Sache doppelt interessant. Auf der Autorenliste steht Anja Surina, Doktorandin an der EPFL im Caglar Gulcehre Lab und ETH-Zürich-Absolventin. Und das Rezept ist nachbaubar: Qwen3.6-27B ist offen lizenziert und wurde im letzten Monat über 6,3 Millionen Mal von Hugging Face geladen. Wenn du in einer Schweizer Forschungsgruppe oder einem KMU Fachwissen in ein Modell bringen willst, musst du dafür also nicht zwingend teure Frontier-APIs mieten.

Spannend ist der Kontrast zu dem, worüber wir gestern berichtet haben: Nvidia argumentiert, das Gerüst um ein Modell herum bringe mehr als ein grösseres Modell. Inherent dreht das um – der Gewinn stecke in den trainierten Gewichten, nicht in einem komplexeren Gerüst. Welche These trägt, entscheidet sich erst, wenn jemand ausserhalb des Labs nachmisst.

Quellen

Training AI Scientists to Replicate Research – Inherent↗ EXTERNER LINKarXiv:2608.13331 – Training AI Scientists to Replicate Research↗ EXTERNER LINKInherent, founded by DeepMind alumni, says its AI 'teammate' just outperformed Anthropic and OpenAI at replicating research – TechCrunch↗ EXTERNER LINKLondon-based AI lab Inherent emerges from stealth with $50m raise – tech.eu↗ EXTERNER LINKQwen/Qwen3.6-27B – Hugging Face Model Card↗ EXTERNER LINKAnja Surina – EPFL People Directory↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
AnthropicEPFLETH ZürichHugging FaceNvidia
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
KI-FORSCHUNG

Nvidia zeigt: Das Gerüst schlägt das Modell

Nvidias Forschungssystem AVO holt mit Claude Opus 5 einen perfekten Score von 100,00 auf dem öffentlichen Set des Benchmarks ARC-AGI-3. Dasselbe Modell allein kommt auf 30,16 Prozent. Den Unterschied macht nicht das Modell, sondern der Harness – das Gerüst aus Gedächtnis, Werkzeugen und Aufsicht drumherum.

Mehr aus KI-Forschung →