NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Murats Spezialmodell schlägt GPT, Claude und Gemini

Thinking Machines Lab von Ex-OpenAI-Chefin Mira Murati und der Hedgefonds Bridgewater zeigen: Ein kleines, feinjustiertes Custom-Modell schlägt die grossen Frontier-LLMs bei Finanzaufgaben. Es erreicht 84,7 Prozent Genauigkeit und kostet nur einen Bruchteil.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
4. JULI 2026
3 MIN. LESEZEIT
Illustration eines kleinen Schlüssels, der ein grosses Schloss öffnet, mit Lupe auf Finanzdokumenten, kinewsletter.ch Stil
Illustration eines kleinen Schlüssels, der ein grosses Schloss öffnet, mit Lupe auf Finanzdokumenten, kinewsletter.ch Stil
INHALT
01Wenn ChatGPT beim Zeitunglesen versagt0284,7 Prozent – und Fehler fast um ein Drittel reduziert03Warum eigene Daten mehr wert sind als der beste Prompt
INHALT
01Wenn ChatGPT beim Zeitunglesen versagt0284,7 Prozent – und Fehler fast um ein Drittel reduziert03Warum eigene Daten mehr wert sind als der beste Prompt
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein Spezialmodell auf eigenen Experten-Daten schlägt das teure Universal-LLM bei genau definierten Aufgaben – genauer und rund 14-mal günstiger.

Ein kleines Spezialmodell schlägt GPT, Claude und Gemini – und kostet nur einen Bruchteil. Das ist das überraschende Ergebnis der ersten grossen angewandten Studie aus Thinking Machines Lab, dem Startup der früheren OpenAI-Chefin Mira Murati. Gemeinsam mit den AIA Labs des weltgrössten Hedgefonds Bridgewater hat das Team gezeigt, wie ein massgeschneidertes Modell erfahrene Finanzprofis bei ihrer täglichen Fleissarbeit ersetzt – genauer und deutlich günstiger als die teuren Universal-Modelle.

Wenn ChatGPT beim Zeitunglesen versagt

Am 30. Juni veröffentlichten die beiden Häuser ihre Forschung unter dem Titel «Learning to Replicate Expert Judgment in Financial Tasks». Der Ausgangspunkt: Investoren ertrinken täglich in Dokumenten – Nachrichten, Research-Berichte, Firmenunterlagen, E-Mails. Das Lesen ist nicht das Problem. Der Aufwand steckt in den vielen kleinen Urteilen: Was ist relevant, was ist Rauschen? Genau diese Triage wollte das Team automatisieren.

Der Haken: Die grossen Frontier-Modelle scheiterten kläglich. Mit einem simplen Prompt, der die Aufgabe nur beschreibt, kamen Varianten von GPT, Claude und Gemini über rund 50 Prozent Treffer nicht hinaus – ein Münzwurf. Ein Beispiel aus der Studie: Ein Artikel über Trumps Anspruch auf Grönland ist für einen Makro-Investor irrelevant, eine Meldung über neue China-Zölle hochrelevant. Beide berühren Geopolitik und Finanzen – die Nuance dazwischen kriegt ein generisches Modell nicht zuverlässig hin.

84,7 Prozent – und Fehler fast um ein Drittel reduziert

Selbst mit ausgefeiltem Prompt-Engineering – von Bridgewaters Experten geschriebene Anweisungen, dazu automatische Prompt-Optimierung – kletterten die Frontier-Modelle nur in die mittleren 70er. Unter 80 Prozent, also unter der Schwelle, ab der die Profis dem System im Alltag vertrauen würden.

Dann kam das Feintuning. Statt Experten-Intuition in einen starren Prompt zu pressen, trainierte das Team ein offenes Basismodell (Qwen3-235B) auf Bridgewaters eigenen, von Experten gelabelten Daten – über Murats Trainings-Plattform Tinker. Das Resultat über sechs reale Finanzaufgaben hinweg:

  • 84,7 % Durchschnitts-Genauigkeit – gegenüber 78,2 % beim besten getesteten Frontier-Modell
  • 29,8 % weniger Fehler als die stärkste Konkurrenz
  • 13,8-mal tiefere Inferenzkosten pro Aufgabe (also rund ein Vierzehntel)

Zwei Trainings-Tricks trugen den grössten Teil bei: sogenanntes Interleaved Batching (die Aufgaben werden abwechselnd im Rundlauf trainiert) brachte 12,1 Prozentpunkte, On-Policy Distillation (das Modell lernt von einer stärkeren Vorgänger-Version seiner selbst) weitere 3,1.

Warum eigene Daten mehr wert sind als der beste Prompt

Die Kern-Erkenntnis geht über die Finanzbranche hinaus. Ein Prompt kann nur das vermitteln, was ein Experte in Worte fassen kann. Die Urteile, die am meisten zählen, sind aber oft die am schwersten erklärbaren. Genau die lernt ein Modell, wenn es auf experten-gelabelten, proprietären Daten feinjustiert wird – Unterscheidungen, die kein noch so cleveres Prompt-Engineering einem Universal-Modell beibringt.

Für dich als Unternehmen – auch als Schweizer KMU – steckt darin eine handfeste Botschaft: Der teuerste Frontier-LLM ist nicht automatisch die beste Lösung. Wer über eigene, sauber aufbereitete Daten mit dem Know-how seiner Fachleute verfügt, kann daraus ein kleines Spezialmodell bauen, das für die konkrete Aufgabe treffsicherer und massiv billiger ist. Das senkt nicht nur die laufenden Kosten, sondern hält sensible Daten auch näher am eigenen Haus.

Einordnung: Es ist das erste grössere angewandte Forschungsresultat aus Murats Thinking Machines Lab – und ein deutliches Signal. Murati verliess OpenAI Ende 2024 mit der These, der nächste Wert­schub in der KI komme nicht aus noch grösseren Universal-Modellen, sondern aus Massanfertigung. Die Studie liefert dafür den ersten belastbaren Beleg. Bridgewater verwaltet rund 100 Milliarden Dollar – und setzt künftig auf viele kleine, spezialisierte Modelle statt auf das eine Universalgehirn. Für den Enterprise-Einsatz könnte das der Anfang einer Trendwende sein: differenzierte Intelligenz statt Einheits-LLM.

Quellen

Learning to Replicate Expert Judgment in Financial Tasks – Thinking Machines Lab / Bridgewater AIA Labs↗ EXTERNER LINKThinking Machines partners with Bridgewater to build AI model that cuts errors by nearly 30% – Crypto Briefing↗ EXTERNER LINKThinking Machines Lab × Bridgewater: Custom model beats frontier – FourWeekMBA↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
AnthropicGoogleOpenAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Illustration zum Artikel «arXiv erlaubt dir nur noch zwei Paper pro Monat», kinewsletter.ch Stil
Handgezeichnete Illustration zum Artikel «arXiv erlaubt dir nur noch zwei Paper pro Monat», kinewsletter.ch Stil
KI-FORSCHUNG·3. OKTOBER 2026

arXiv erlaubt dir nur noch zwei Paper pro Monat

Die wichtigste Preprint-Plattform der Wissenschaft führt ein Einreichungslimit ein: zwei Paper pro Person und Monat. Grund ist die KI-getriebene Flut, die freiwillige Moderatoren überlastet.

Tuschskizze eines elektroblauen Proteinbands neben Lupe und DNA-Doppelhelix
Tuschskizze eines elektroblauen Proteinbands neben Lupe und DNA-Doppelhelix
KI-FORSCHUNG·2. OKTOBER 2026

DeepMind markiert KI-Proteine: 100 % Detektion, Funktion bleibt

Google DeepMind hat in Nature SynthID Bio vorgestellt, ein Wasserzeichen für KI-designte Proteine. Laut Paper erkennt es Sequenzen mit 100 % Trefferquote bei 0,1 % Fehlalarm, ohne die Funktion zu stören. Entfernbar ist es aber trotzdem.

Tuschskizze eines Schweissroboters in Elektroblau neben Stahlträger und Werkzeugtisch
Tuschskizze eines Schweissroboters in Elektroblau neben Stahlträger und Werkzeugtisch
KI-FORSCHUNG·2. OKTOBER 2026

Roboter können 74 % der körperlichen Aufgaben, rentabel sind 0.3 %

Anthropic hat gemessen, welche körperlichen Aufgaben Roboter heute übernehmen könnten: 74 %, das sind 34 % der Arbeitszeit. Kostengünstiger als Menschen sind sie aber nur bei 0.3 %. Bei heutigen Preistrends dauert es rund 40 Jahre bis 10 %.

Tuschskizze einer Wendeltreppe aus Zahnrädern und Platinen mit einem blau gefüllten Zahnrad im Zentrum
Tuschskizze einer Wendeltreppe aus Zahnrädern und Platinen mit einem blau gefüllten Zahnrad im Zentrum
KI-FORSCHUNG·29. SEPTEMBER 2026

22 KI-Forschende warnen vor einer «Intelligenzexplosion»

Geoffrey Hinton, Yoshua Bengio und OpenAI-Forschungschef Jakub Pachocki warnen in einem Papier vor einer Intelligenzexplosion. Automatisierte KI-Forschung könnte Jahre an Fortschritt in Monate pressen, die Politik brauche Einblick. Kritiker sehen auch Eigeninteresse der Labors.

Tusche-Skizze einer Küchenzeile: ein grosser elektroblauer Roboterarm greift nach einer Tasse, darunter eine offene Besteckschublade, dahinter Wasserkocher und Kartons.
Tusche-Skizze einer Küchenzeile: ein grosser elektroblauer Roboterarm greift nach einer Tasse, darunter eine offene Besteckschublade, dahinter Wasserkocher und Kartons. (Dark Mode)
KI-FORSCHUNG·28. SEPTEMBER 2026

Stanford steckt GPT-6 Astra direkt in einen Haushaltsroboter

Forschende aus Stanford und Caltech streichen bei ihrem Roboter die gelernte Steuerungsschicht und lassen ein Sprachmodell direkt die Bewegungsbefehle aussuchen. Was das taugt – und was die Demo verschweigt.

Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
KI-FORSCHUNG·27. SEPTEMBER 2026

GPT-6 Astra knackt Enigma-Funkspruch von 1941 – in zwei Tagen

OpenAIs GPT-6 Astra hat einen deutschen Heeres-Funkspruch vom 10. Juli 1941 entschlüsselt, der seit 2005 als ungelöst galt. Das Modell suchte sich das Ziel selbst aus und schrieb Enigma-Simulator und Enigma-Bombe eigenständig in Python und C++. Dieselbe Autonomie ist der Grund, weshalb OpenAI seine leistungsfähigsten Modelle gerade gestoppt hat.

Mehr aus KI-Forschung →