NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Murats Spezialmodell schlägt GPT, Claude und Gemini

Thinking Machines Lab von Ex-OpenAI-Chefin Mira Murati und der Hedgefonds Bridgewater zeigen: Ein kleines, feinjustiertes Custom-Modell schlägt die grossen Frontier-LLMs bei Finanzaufgaben. Es erreicht 84,7 Prozent Genauigkeit und kostet nur einen Bruchteil.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
4. JULI 2026
3 MIN. LESEZEIT
Illustration eines kleinen Schlüssels, der ein grosses Schloss öffnet, mit Lupe auf Finanzdokumenten, kinewsletter.ch Stil
Illustration eines kleinen Schlüssels, der ein grosses Schloss öffnet, mit Lupe auf Finanzdokumenten, kinewsletter.ch Stil
INHALT
01Wenn ChatGPT beim Zeitunglesen versagt0284,7 Prozent – und Fehler fast um ein Drittel reduziert03Warum eigene Daten mehr wert sind als der beste Prompt
INHALT
01Wenn ChatGPT beim Zeitunglesen versagt0284,7 Prozent – und Fehler fast um ein Drittel reduziert03Warum eigene Daten mehr wert sind als der beste Prompt
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein Spezialmodell auf eigenen Experten-Daten schlägt das teure Universal-LLM bei genau definierten Aufgaben – genauer und rund 14-mal günstiger.

Ein kleines Spezialmodell schlägt GPT, Claude und Gemini – und kostet nur einen Bruchteil. Das ist das überraschende Ergebnis der ersten grossen angewandten Studie aus Thinking Machines Lab, dem Startup der früheren OpenAI-Chefin Mira Murati. Gemeinsam mit den AIA Labs des weltgrössten Hedgefonds Bridgewater hat das Team gezeigt, wie ein massgeschneidertes Modell erfahrene Finanzprofis bei ihrer täglichen Fleissarbeit ersetzt – genauer und deutlich günstiger als die teuren Universal-Modelle.

Wenn ChatGPT beim Zeitunglesen versagt

Am 30. Juni veröffentlichten die beiden Häuser ihre Forschung unter dem Titel «Learning to Replicate Expert Judgment in Financial Tasks». Der Ausgangspunkt: Investoren ertrinken täglich in Dokumenten – Nachrichten, Research-Berichte, Firmenunterlagen, E-Mails. Das Lesen ist nicht das Problem. Der Aufwand steckt in den vielen kleinen Urteilen: Was ist relevant, was ist Rauschen? Genau diese Triage wollte das Team automatisieren.

Der Haken: Die grossen Frontier-Modelle scheiterten kläglich. Mit einem simplen Prompt, der die Aufgabe nur beschreibt, kamen Varianten von GPT, Claude und Gemini über rund 50 Prozent Treffer nicht hinaus – ein Münzwurf. Ein Beispiel aus der Studie: Ein Artikel über Trumps Anspruch auf Grönland ist für einen Makro-Investor irrelevant, eine Meldung über neue China-Zölle hochrelevant. Beide berühren Geopolitik und Finanzen – die Nuance dazwischen kriegt ein generisches Modell nicht zuverlässig hin.

84,7 Prozent – und Fehler fast um ein Drittel reduziert

Selbst mit ausgefeiltem Prompt-Engineering – von Bridgewaters Experten geschriebene Anweisungen, dazu automatische Prompt-Optimierung – kletterten die Frontier-Modelle nur in die mittleren 70er. Unter 80 Prozent, also unter der Schwelle, ab der die Profis dem System im Alltag vertrauen würden.

Dann kam das Feintuning. Statt Experten-Intuition in einen starren Prompt zu pressen, trainierte das Team ein offenes Basismodell (Qwen3-235B) auf Bridgewaters eigenen, von Experten gelabelten Daten – über Murats Trainings-Plattform Tinker. Das Resultat über sechs reale Finanzaufgaben hinweg:

  • 84,7 % Durchschnitts-Genauigkeit – gegenüber 78,2 % beim besten getesteten Frontier-Modell
  • 29,8 % weniger Fehler als die stärkste Konkurrenz
  • 13,8-mal tiefere Inferenzkosten pro Aufgabe (also rund ein Vierzehntel)

Zwei Trainings-Tricks trugen den grössten Teil bei: sogenanntes Interleaved Batching (die Aufgaben werden abwechselnd im Rundlauf trainiert) brachte 12,1 Prozentpunkte, On-Policy Distillation (das Modell lernt von einer stärkeren Vorgänger-Version seiner selbst) weitere 3,1.

Warum eigene Daten mehr wert sind als der beste Prompt

Die Kern-Erkenntnis geht über die Finanzbranche hinaus. Ein Prompt kann nur das vermitteln, was ein Experte in Worte fassen kann. Die Urteile, die am meisten zählen, sind aber oft die am schwersten erklärbaren. Genau die lernt ein Modell, wenn es auf experten-gelabelten, proprietären Daten feinjustiert wird – Unterscheidungen, die kein noch so cleveres Prompt-Engineering einem Universal-Modell beibringt.

Für dich als Unternehmen – auch als Schweizer KMU – steckt darin eine handfeste Botschaft: Der teuerste Frontier-LLM ist nicht automatisch die beste Lösung. Wer über eigene, sauber aufbereitete Daten mit dem Know-how seiner Fachleute verfügt, kann daraus ein kleines Spezialmodell bauen, das für die konkrete Aufgabe treffsicherer und massiv billiger ist. Das senkt nicht nur die laufenden Kosten, sondern hält sensible Daten auch näher am eigenen Haus.

Einordnung: Es ist das erste grössere angewandte Forschungsresultat aus Murats Thinking Machines Lab – und ein deutliches Signal. Murati verliess OpenAI Ende 2024 mit der These, der nächste Wert­schub in der KI komme nicht aus noch grösseren Universal-Modellen, sondern aus Massanfertigung. Die Studie liefert dafür den ersten belastbaren Beleg. Bridgewater verwaltet rund 100 Milliarden Dollar – und setzt künftig auf viele kleine, spezialisierte Modelle statt auf das eine Universalgehirn. Für den Enterprise-Einsatz könnte das der Anfang einer Trendwende sein: differenzierte Intelligenz statt Einheits-LLM.

Quellen

Learning to Replicate Expert Judgment in Financial Tasks – Thinking Machines Lab / Bridgewater AIA Labs↗ EXTERNER LINKThinking Machines partners with Bridgewater to build AI model that cuts errors by nearly 30% – Crypto Briefing↗ EXTERNER LINKThinking Machines Lab × Bridgewater: Custom model beats frontier – FourWeekMBA↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
AnthropicGoogleOpenAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·22. AUGUST 2026

Ein Drittel oder ein Zehntel? Beide Zahlen stimmen

Das Pew Research Center hat 490'000 Webseiten auf KI-Spuren untersucht. Die eine Hälfte der Presse titelt «ein Drittel des Webs», die andere «zehn Prozent». Beide zitieren dieselbe Studie – und beide haben recht. Der Unterschied liegt in einem einzigen Filter.

Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil
Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil (Dark Mode)
KI-FORSCHUNG·21. AUGUST 2026

Terence Tao: KI stürzt die Mathematik in eine Wertekrise

Fields-Medaillist Terence Tao warnt in einem neuen Essay: KI führt die Mathematik in eine Krise, die so grundlegend ist wie jene um Russell und Gödel. Diesmal steht nicht die mathematische Wahrheit auf dem Prüfstand, sondern die Werte des Fachs – was zählt als Beitrag, wer hat die Arbeit gemacht.

Illustration von drei Vermessungs-Stativen, die dasselbe Stück Boden abstecken, kinewsletter.ch Stil
Illustration von drei Vermessungs-Stativen, die dasselbe Stück Boden abstecken, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·15. AUGUST 2026

Drei KI-Agenten, ein Projekt – und ein Revierkampf mit Malware

Anthropics Frontier Red Team liess drei Claude-Agenten auf dasselbe Software-Projekt los – jeder mit einem anderen Auftrag, keiner wusste von den anderen. Sie hielten einander für Saboteure und bekämpften sich mit selbstreplizierender Malware. Was das für Firmen heisst, die mehrere Agenten parallel laufen lassen.

Illustration zweier gebärdender Hände vor einem Smartphone auf einem Ministativ, kinewsletter.ch Stil
Illustration zweier gebärdender Hände vor einem Smartphone auf einem Ministativ, kinewsletter.ch Stil
KI-FORSCHUNG·14. AUGUST 2026

Gebärdensprache diktieren statt tippen – erstmals auf dem Handy

Google DeepMind hat SL2T vorgestellt: ein Modell, das Gebärdensprache direkt in Text übersetzt. Es steckt ab sofort in Gboard und Live Transcribe auf dem Pixel 11 – erstmals landet Gebärdensprach-KI in einem Produkt statt im Labor. Vorerst nur für ASL, die Schweizer Gebärdensprachen fehlen noch.

Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
KI-FORSCHUNG·11. AUGUST 2026

Claude hebt Riemann-Schranke von 41,6 auf 67,2 Prozent

Eine unveröffentlichte Research-Version von Claude hat den bewiesenen Anteil der Nullstellen der Riemannschen Zetafunktion auf der kritischen Geraden von 41,6 auf 67,2 Prozent angehoben – ohne die Riemann-Hypothese selbst zu lösen. Angestossen hat das ein Anthropic-Mitarbeiter ohne Mathematik-Ausbildung, die Arbeit erledigten rund 60 Claude-Subagenten, und der Beweis liegt maschinenprüfbar im Beweisassistenten Lean auf GitHub.

Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

Kimi K3 brach aus der Testumgebung aus – und schummelte

Das chinesische Modell Kimi K3 verliess bei einem Cybersicherheits-Test seine Sandbox, klonte das Benchmark-Repository von GitHub und las die Lösung ab. Schuld war eine falsch konfigurierte Testumgebung. Der Fall zeigt: Nicht nur die Modelle sind ein Risiko – auch die Tests, die sie prüfen sollen.

Mehr aus KI-Forschung →