NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

KI scheitert an echter Biologie – in 7 von 10 Fällen

OpenAIs neuer Benchmark GeneBench-Pro prüft echtes Forschungsurteil statt Faktenwissen. Das beste Modell besteht nur knapp jede dritte der 129 Biologie-Aufgaben – eine nüchterne Messlatte für den Hype um KI in der Wissenschaft.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
1. JULI 2026
2 MIN. LESEZEIT
Handgezeichnete Skizze einer Laborbank mit Mikroskop, Reagenzglasstaender und Whiteboard mit DNA-Doppelhelix, elektroblauer Akzent
Handgezeichnete Skizze einer Laborbank mit Mikroskop, Reagenzglasstaender und Whiteboard mit DNA-Doppelhelix, elektroblauer Akzent (Dark Mode)
INHALT
01Worum es geht02Die ernüchternden Zahlen03Warum das wichtig ist04Was du im Kopf behalten solltest
INHALT
01Worum es geht02Die ernüchternden Zahlen03Warum das wichtig ist04Was du im Kopf behalten solltest
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

GeneBench-Pro zeigt: Selbst Spitzenmodelle scheitern an echter Biologie-Forschung in rund sieben von zehn Fällen.

OpenAI hat einen neuen Prüfstein für künstliche Intelligenz vorgestellt – und das Ergebnis ist eine Lektion in Bescheidenheit: Selbst die besten Modelle scheitern an echter biologischer Forschung in rund sieben von zehn Fällen.

Worum es geht

GeneBench-Pro heisst der neue Benchmark, mit dem OpenAI testet, ob KI-Modelle die Art von urteilsbasierter Analyse hinbekommen, die reale computergestützte Biologie verlangt. Es geht nicht um das Abrufen von Fakten, sondern um echte Forschungsarbeit: Ein Modell erhält einen Datensatz, den experimentellen Kontext und eine Forschungsfrage – und muss die Daten analysieren, die passende Methode wählen und zu einer belastbaren Schlussfolgerung kommen.

Der Test umfasst 129 Aufgaben aus Genomik, quantitativer Biologie und translationaler Medizin. Jede Aufgabe ist synthetisch aus einem bekannten Datenerzeugungsprozess gebaut, sodass OpenAI gegen eine gesicherte Wahrheit bewerten und den Schwierigkeitsgrad justieren kann. Zur Absicherung legte das Unternehmen 82 der 129 Probleme externen Fachleuten vor – Doktorierenden, Postdocs, Industrieforschenden und Professorinnen.

Die ernüchternden Zahlen

Das beste Modell im Test, OpenAIs eigenes GPT-5.6 Sol, kam bei höchster Denkstufe auf eine Erfolgsquote von 28,7 Prozent – mit aktiviertem Pro-Modus stieg der Wert auf 31,5 Prozent. Das stärkste Nicht-OpenAI-Modell war Anthropics Claude Opus 4.8 mit 16,0 Prozent.

Anders gesagt: Selbst das führende Modell liegt bei anspruchsvollen Biologie-Aufgaben noch immer in rund 70 Prozent der Fälle daneben.

Warum das wichtig ist

Rund um KI in der Wissenschaft kursieren derzeit grosse Versprechen – von der Abkürzung ganzer Forschungsprogramme bis zum «KI-Wissenschaftler». GeneBench-Pro setzt dem eine nüchterne Messlatte entgegen. Der Benchmark trennt sauber zwischen dem, was Modelle auswendig wiedergeben, und dem, was sie tatsächlich durchdenken können. Und genau beim Durchdenken – Methode wählen, Fallstricke erkennen, aus unsauberen Daten eine Antwort destillieren – ist die Lücke noch gross.

Für einen Forschungs- und Pharmastandort wie die Schweiz ist das eine doppelt nützliche Nachricht. Sie dämpft überzogene Erwartungen an KI als Ersatz für erfahrene Forschende – und liefert zugleich ein sauberes Werkzeug, um den echten Fortschritt der Modelle über die Zeit zu messen, statt sich von Marketing-Zahlen blenden zu lassen.

Was du im Kopf behalten solltest

Ein Benchmark ist immer nur ein Ausschnitt: GeneBench-Pro misst eine bestimmte, besonders harte Klasse von Aufgaben und nicht die gesamte Nützlichkeit eines Modells im Laboralltag. Dass die Werte tief sind, heisst nicht, dass KI in der Biologie nutzlos wäre – sondern dass die schwierigsten Urteilsfragen weiterhin beim Menschen liegen. Für die kommenden Modellgenerationen ist GeneBench-Pro damit vor allem eines: ein ehrlicher Gradmesser.

Quellen

OpenAI – Introducing GeneBench-Pro↗ EXTERNER LINKInvesting.com – OpenAI introduces GeneBench-Pro to test AI research judgment↗ EXTERNER LINKCrypto Briefing – OpenAI introduces GeneBench to evaluate AI on computational biology↗ EXTERNER LINKAlphaSignal – GeneBench-Pro exposes that top AI fails real biology 70% of the time↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAIAnthropic
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Illustration zum Artikel «arXiv erlaubt dir nur noch zwei Paper pro Monat», kinewsletter.ch Stil
Handgezeichnete Illustration zum Artikel «arXiv erlaubt dir nur noch zwei Paper pro Monat», kinewsletter.ch Stil
KI-FORSCHUNG·3. OKTOBER 2026

arXiv erlaubt dir nur noch zwei Paper pro Monat

Die wichtigste Preprint-Plattform der Wissenschaft führt ein Einreichungslimit ein: zwei Paper pro Person und Monat. Grund ist die KI-getriebene Flut, die freiwillige Moderatoren überlastet.

Tuschskizze eines elektroblauen Proteinbands neben Lupe und DNA-Doppelhelix
Tuschskizze eines elektroblauen Proteinbands neben Lupe und DNA-Doppelhelix
KI-FORSCHUNG·2. OKTOBER 2026

DeepMind markiert KI-Proteine: 100 % Detektion, Funktion bleibt

Google DeepMind hat in Nature SynthID Bio vorgestellt, ein Wasserzeichen für KI-designte Proteine. Laut Paper erkennt es Sequenzen mit 100 % Trefferquote bei 0,1 % Fehlalarm, ohne die Funktion zu stören. Entfernbar ist es aber trotzdem.

Tuschskizze eines Schweissroboters in Elektroblau neben Stahlträger und Werkzeugtisch
Tuschskizze eines Schweissroboters in Elektroblau neben Stahlträger und Werkzeugtisch
KI-FORSCHUNG·2. OKTOBER 2026

Roboter können 74 % der körperlichen Aufgaben, rentabel sind 0.3 %

Anthropic hat gemessen, welche körperlichen Aufgaben Roboter heute übernehmen könnten: 74 %, das sind 34 % der Arbeitszeit. Kostengünstiger als Menschen sind sie aber nur bei 0.3 %. Bei heutigen Preistrends dauert es rund 40 Jahre bis 10 %.

Tuschskizze einer Wendeltreppe aus Zahnrädern und Platinen mit einem blau gefüllten Zahnrad im Zentrum
Tuschskizze einer Wendeltreppe aus Zahnrädern und Platinen mit einem blau gefüllten Zahnrad im Zentrum
KI-FORSCHUNG·29. SEPTEMBER 2026

22 KI-Forschende warnen vor einer «Intelligenzexplosion»

Geoffrey Hinton, Yoshua Bengio und OpenAI-Forschungschef Jakub Pachocki warnen in einem Papier vor einer Intelligenzexplosion. Automatisierte KI-Forschung könnte Jahre an Fortschritt in Monate pressen, die Politik brauche Einblick. Kritiker sehen auch Eigeninteresse der Labors.

Tusche-Skizze einer Küchenzeile: ein grosser elektroblauer Roboterarm greift nach einer Tasse, darunter eine offene Besteckschublade, dahinter Wasserkocher und Kartons.
Tusche-Skizze einer Küchenzeile: ein grosser elektroblauer Roboterarm greift nach einer Tasse, darunter eine offene Besteckschublade, dahinter Wasserkocher und Kartons. (Dark Mode)
KI-FORSCHUNG·28. SEPTEMBER 2026

Stanford steckt GPT-6 Astra direkt in einen Haushaltsroboter

Forschende aus Stanford und Caltech streichen bei ihrem Roboter die gelernte Steuerungsschicht und lassen ein Sprachmodell direkt die Bewegungsbefehle aussuchen. Was das taugt – und was die Demo verschweigt.

Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
KI-FORSCHUNG·27. SEPTEMBER 2026

GPT-6 Astra knackt Enigma-Funkspruch von 1941 – in zwei Tagen

OpenAIs GPT-6 Astra hat einen deutschen Heeres-Funkspruch vom 10. Juli 1941 entschlüsselt, der seit 2005 als ungelöst galt. Das Modell suchte sich das Ziel selbst aus und schrieb Enigma-Simulator und Enigma-Bombe eigenständig in Python und C++. Dieselbe Autonomie ist der Grund, weshalb OpenAI seine leistungsfähigsten Modelle gerade gestoppt hat.

Mehr aus KI-Forschung →