NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

EPFL gibt der KI Zweifel – und spart 40 Prozent Experimente

Forschende der EPFL koppeln ein Sprachmodell mit einem Gauss-Prozess, der zu jeder Vorhersage eine Unsicherheit mitliefert. Die Methode GOLLuM findet in 23 Benchmark-Aufgaben gute Versuchsbedingungen mit über 40 Prozent weniger Experimenten als klassische Verfahren – publiziert in Nature Machine Intelligence.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
3. SEPTEMBER 2026
4 MIN. LESEZEIT
Illustration einer Chemielabor-Werkbank mit blau gefülltem Rundkolben am Stativ, Becherglas, Ständer mit leeren Reagenzgläsern, Pipette und Lupe, kinewsletter.ch Stil
Illustration einer Chemielabor-Werkbank mit blau gefülltem Rundkolben am Stativ, Becherglas, Ständer mit leeren Reagenzgläsern, Pipette und Lupe, kinewsletter.ch Stil
INHALT
01Ein Labor kann nicht 10'000 Reaktionen durchprobieren02Selbstsicher ist nicht dasselbe wie richtig0336,3 statt 29,7 Prozent Treffer04Vom Deskriptor-Workshop zum ersten Versuchstag
INHALT
01Ein Labor kann nicht 10'000 Reaktionen durchprobieren02Selbstsicher ist nicht dasselbe wie richtig0336,3 statt 29,7 Prozent Treffer04Vom Deskriptor-Workshop zum ersten Versuchstag
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein LLM antwortet immer gleich selbstsicher. Erst wenn ein zweites Modell die Unsicherheit misst, wird aus Selbstüberschätzung ein brauchbares Signal dafür, welches Experiment als nächstes wirklich lohnt.

Ein Team der EPFL hat einem Sprachmodell beigebracht, an sich selbst zu zweifeln – und damit die Suche nach guten Laborexperimenten beschleunigt. Die Methode heisst GOLLuM und stammt von Bojana Ranković und Philippe Schwaller vom Laboratory of Artificial Chemical Intelligence der EPFL, gemeinsam mit Ryan-Rhys Griffiths von der US-Firma QuantumGreen. Publiziert wurde sie am 28. August 2026 in Nature Machine Intelligence. Über 23 Benchmark-Aufgaben aus Chemie, Materialforschung und Molekül-Design erreicht GOLLuM laut der Studie das Ergebnis klassischer Verfahren mit über 40 Prozent weniger Experimenten.

Ein Labor kann nicht 10'000 Reaktionen durchprobieren

Am Computer lassen sich Millionen möglicher Moleküle und Reaktionsbedingungen durchspielen. Im Labor nachkochen kann man davon einen winzigen Bruchteil. Die Frage lautet deshalb nicht «was ist alles denkbar?», sondern «welches Experiment lohnt sich als nächstes?».

Genau dafür gibt es die Bayes'sche Optimierung: Ein Modell lernt aus den bisherigen Versuchen, sagt für jede noch nicht getestete Option ein Ergebnis voraus – und gibt an, wie sicher es sich dabei ist. Getestet wird dort, wo ein gutes Ergebnis winkt oder die Unsicherheit besonders gross ist.

Der Haken: Fachleute müssen jede Versuchsbedingung dafür erst in Zahlen übersetzen, sogenannte Deskriptoren. Diese Arbeit ist fachspezifisch – ein Modell, das für chemische Reaktionen taugt, funktioniert nicht automatisch für Materialdesign. Jedes neue Problem startet praktisch bei null.

WEITERLESENDas könnte dich auch interessieren.

Illustration einer Uhrmacher-Werkbank mit Lupe am Schwenkarm, verstreuten Zahnrädern, Pinzette und einem Schubladenschrank mit blau markierten Fächern, kinewsletter.ch Stil

Selbstsicher ist nicht dasselbe wie richtig

Sprachmodelle könnten diese Übersetzungsarbeit überflüssig machen: Sie haben breites wissenschaftliches Wissen intus und verstehen ein Experiment in normalem Englisch. Ihr Problem ist ein anderes – ein LLM formuliert jede Antwort mit demselben Brustton der Überzeugung, ob es die Sache weiss oder halluziniert.

Die EPFL-Lösung koppelt das Sprachmodell deshalb mit einem Gauss-Prozess, von der Hochschule salopp «Zweifel-Detektor» genannt. Das ist ein statistisches Modell, das zu jeder Vorhersage eine Fehlerbandbreite mitliefert – nicht nur «Ausbeute rund 70 Prozent», sondern «70 Prozent, plus/minus 15». Genau diese Bandbreite fehlt dem Sprachmodell.

«Sprachmodelle sind notorisch schlecht darin, zu wissen, wann sie falschliegen. In GOLLuM wird genau diese Unsicherheit zum Signal, das sie trainiert», sagt Bojana Ranković, die die Methode während ihrer Doktorarbeit an der EPFL entwickelt hat.

Der Clou: Das Sprachmodell wählt die Experimente nicht selbst aus, sondern wird mit den Bewertungen des Gauss-Prozesses trainiert. Dadurch ordnet es seine interne Landkarte des Suchraums neu – Bedingungen mit ähnlichem Ausgang rücken zusammen, unterschiedliche driften auseinander.

36,3 statt 29,7 Prozent Treffer

Getestet wurde auf 23 Aufgaben aus organischer Synthese, Prozesschemie, Materialien und Molekül-Design – jeder Lauf startend mit zehn absichtlich schlechten Ergebnissen und überall mit derselben Konfiguration, ohne Nachjustieren pro Problem.

Bei einem Budget von 50 Experimenten landeten laut EPFL 36,3 Prozent der getesteten Bedingungen in den besten fünf Prozent aller möglichen Ergebnisse. Die klassische Bayes'sche Optimierung mit expertengebauten Deskriptoren kam auf 29,7 Prozent. Auf der Buchwald–Hartwig-Kupplung, einer Standardreaktion der Pharmasynthese, verdoppelte GOLLuM die Trefferquote laut Paper nahezu: 43 Prozent gegenüber 24 bis 25 Prozent.

Wie wichtig der Zweifel-Detektor ist, zeigt der Gegentest. Liess man das Sprachmodell die Experimente direkt vorschlagen, schwankten die Fehlerraten zwischen 10 und rund 80 Prozent – mit erfundenen chemischen Strukturen, doppelt vorgeschlagenen Bedingungen und Vorschlägen ausserhalb des erlaubten Suchraums.

Vom Deskriptor-Workshop zum ersten Versuchstag

Für Forschungsgruppen ist der praktische Gewinn weniger die Prozentzahl als der Start. «Wir können Optimierungskampagnen ab dem ersten Tag starten, statt sechs Monate lang zu diskutieren, wie man Experimente am besten beschreibt und Deskriptoren berechnet», sagt Philippe Schwaller in der EPFL-Mitteilung.

Wichtig für die Einordnung: Alle Zahlen stammen aus Benchmarks auf bestehenden Datensätzen, nicht aus neuen Laborkampagnen. Und GOLLuM macht Sprachmodelle nicht ehrlicher – es umgeht ihre Selbstüberschätzung, indem ein zweites Modell die Unsicherheit übernimmt. Dasselbe Muster – KI als Werkzeug statt als Orakel – zeigte sich zuletzt bei einem Modell zum Replizieren von Studien und bei effizienteren Modellen aus der FHNW-Forschung.

Finanziert wurde die Arbeit vom Schweizerischen Nationalfonds über den Forschungsschwerpunkt NCCR Catalysis. Paper und Code sind frei zugänglich.

Quellen

An AI capable of doubt can optimize scientific discovery (EPFL, 02.09.2026)↗ EXTERNER LINKRanković, Griffiths, Schwaller: Large language models as uncertainty-calibrated optimizers for experimental discovery (Nature Machine Intelligence, 28.08.2026, DOI 10.1038/s42256-026-01283-z)↗ EXTERNER LINKPreprint zum Paper auf arXiv (arXiv:2504.06265, v3 vom 07.11.2025)↗ EXTERNER LINKGOLLuM – Code-Repository der Schwaller-Gruppe auf GitHub↗ EXTERNER LINKAdding a 'doubt detector' helps AI optimize experiments with 40% fewer tests (TechXplore, 02.09.2026)↗ EXTERNER LINKLaboratory of Artificial Chemical Intelligence (LIAC), EPFL↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
EPFL
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?
Illustration einer Uhrmacher-Werkbank mit Lupe am Schwenkarm, verstreuten Zahnrädern, Pinzette und einem Schubladenschrank mit blau markierten Fächern, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·3. SEPTEMBER 2026

KI findet sechs curl-Lücken – der 6:0-Vergleich hinkt

Im neuen curl-Release stecken neun Sicherheitslücken, sechs davon meldete das KI-System der Firma AISLE – kurz nachdem die Systeme von OpenAI und Anthropic nichts mehr gefunden hatten. Die Funde sind echt und amtlich belegt. Der daraus gebastelte Wettkampf ist es nicht.

Illustration eines Tresorraums mit halb geöffneter Stahltür und Schlüsselbund, kinewsletter.ch Stil
Illustration eines Tresorraums mit halb geöffneter Stahltür und Schlüsselbund, kinewsletter.ch Stil
KI-FORSCHUNG·2. SEPTEMBER 2026

OpenAI bremst Astra – erstmals «kritische» Cyber-Stufe erreicht

OpenAI stuft sein Modell Astra als erstes in die höchste Cyber-Risikoklasse ein und drosselt den Zugang.

Illustration einer Schleusentür in einem Laborgang mit Warnleuchte, kinewsletter.ch Stil
Illustration einer Schleusentür in einem Laborgang mit Warnleuchte, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·1. SEPTEMBER 2026

Anthropic stoppte seine Cyber-Tests – und trainierte einen Betrüger

Anthropic legt offen, was nach den Sicherheitsvorfällen vom Sommer intern passierte: pausierte Cyber-Evaluationen, ein Klassifikator, der Ausbruchsversuche vor dem Tool-Call stoppt, und über 10 Prozent fehlerhafte Trainingsumgebungen. Dazu eine Studie, für die ein Opus-Modell absichtlich zum Betrügen trainiert wurde.

Illustration einer Sanduhr mit elektroblauem Sand neben einer stehengebliebenen Werkstattuhr, kinewsletter.ch Stil
Illustration einer Sanduhr mit elektroblauem Sand neben einer stehengebliebenen Werkstattuhr, kinewsletter.ch Stil
KI-FORSCHUNG·31. AUGUST 2026

Dein Coding-Agent hat kein Zeitgefühl – und merkt es nicht

Claude Code und OpenAI Codex können weder vorhersagen, wie lange eine Aufgabe dauert, noch zuverlässig sagen, wie lange sie schon arbeiten. Eine MATS-Studie misst Fehlschätzungen um das Drei- bis Zehnfache – und zeigt, dass die Agenten sich zusätzlich rund 20 Punkte zu gute Noten geben. Was das für Timeouts, Kostenschätzungen und Projektkalkulation bedeutet.

Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
KI-FORSCHUNG·30. AUGUST 2026

Google gibt KI-Agenten ein Wiki – damit sie aus Fehlern lernen

Ein Preprint von Google Research zeigt, wie KI-Agenten ihre Erfahrung in einem wachsenden Wiki festhalten und daraus bessere Anleitungen für sich selbst schreiben. In Tests stieg die Durchschnittsgenauigkeit von Gemini 3.5 Flash von 49,5 auf 68,1 Prozent.

Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
KI-FORSCHUNG·30. AUGUST 2026

Claude repariert seine eigenen Alignment-Fehler – für 4 Dollar pro Stunde

Anthropic liess Claude als Sicherheitsforscher arbeiten: Das Modell entwarf selbstständig Trainingsmethoden gegen zehn Arten von Fehlverhalten – von Täuschung bis Jailbreaks – und schlug dabei die Vorschläge von 28 erfahrenen menschlichen Forschenden. Der Report nennt auch den Preis: 4 Dollar pro Stunde statt 150.

Mehr aus KI-Forschung →