NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

KI besteht nur jede dritte Forschungsaufgabe

OpenAIs neuer Test LifeSciBench prüft KI an 750 echten Aufgaben aus der Life-Science-Forschung. Das beste Modell löst nur 36 Prozent – ein nützlicher Dämpfer für überzogene Erwartungen an KI im Labor.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
19. JUNI 2026
2 MIN. LESEZEIT
Illustration eines Mikroskops im Labor, kinewsletter.ch Stil
Dark Illustration, kinewsletter.ch Stil
INHALT
01Ein Test, den Wissenschaftler selbst geschrieben haben0236 Prozent – und das ist schon der Spitzenwert03Warum das ein gesunder Dämpfer ist
INHALT
01Ein Test, den Wissenschaftler selbst geschrieben haben0236 Prozent – und das ist schon der Spitzenwert03Warum das ein gesunder Dämpfer ist
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Selbst Spitzenmodelle scheitern an zwei von drei echten Forschungsaufgaben – KI bleibt vorerst Assistent, nicht Wissenschaftler.

KI-Modelle lösen Mathe-Olympiaden und programmieren ganze Apps – aber taugen sie auch für echte Laborarbeit? OpenAI hat dazu einen neuen Test gebaut und am 17. Juni veröffentlicht. Das ernüchternde Ergebnis: Selbst das beste Modell scheitert an zwei von drei Aufgaben.

Ein Test, den Wissenschaftler selbst geschrieben haben

LifeSciBench heisst der neue Massstab, und er ist anders aufgebaut als die üblichen KI-Tests. Statt Multiple-Choice-Fragen mit einer sauberen Musterlösung stellt er 750 Aufgaben, die echten Forschungsalltag nachbilden: Belege widersprüchlicher Studien abwägen, Experimente planen, Risiken einschätzen, Ergebnisse verständlich aufbereiten. Geschrieben wurden sie von 173 Wissenschaftlerinnen und Wissenschaftlern mit Doktortitel und Industrieerfahrung aus Biotech und Pharma.

Bewertet wird jede Antwort nicht mit einem simplen Richtig/Falsch, sondern anhand von insgesamt 19'020 Einzelkriterien – im Schnitt 25 pro Aufgabe. Nochmals 453 unabhängige Fachleute prüften, ob der Test wirklich misst, was im Labor zählt.

36 Prozent – und das ist schon der Spitzenwert

Das stärkste getestete Modell, intern GPT-Rosalind genannt, löste 36,1 Prozent der Aufgaben vollständig. Der Vorgänger GPT-5.5 kam auf 25,7 Prozent. Ein klarer Fortschritt – aber eben auch: Rund zwei Drittel der Forschungsaufgaben überfordern selbst das beste verfügbare System.

Wo die Modelle glänzen und wo sie einbrechen, lässt sich klar trennen:

  • Stark beim Aufbereiten und Kommunizieren von Ergebnissen sowie beim Übersetzen von Laborbefunden in klinische Schlüsse
  • Schwach beim Planen und Optimieren von Experimenten (30,7 %) und beim Auswerten von Daten (30,3 %)
  • Besonders schwach, sobald echte Dokumente, Tabellen oder Sequenzdateien im Spiel sind: Hier fällt die Trefferquote von 45 auf 28 Prozent
Strenge Erkenntnis: Eine KI kann eine Studie überzeugend zusammenfassen – und trotzdem an der eigentlichen wissenschaftlichen Detailarbeit scheitern.

Warum das ein gesunder Dämpfer ist

Gerade für Branchen, die grosse Hoffnungen in KI-gestützte Wirkstoffforschung setzen – von Roche bis Novartis –, ist das ein nützlicher Realitätscheck. LifeSciBench trennt die beeindruckende Demo von der mühsamen Laborrealität. OpenAI selbst betont, dass ein guter Testwert kein Beweis für echten Forschungsnutzen sei: Das zeige sich erst im laufenden Einsatz über Monate.

Konkret heisst das: KI wird in der Forschung zum starken Assistenten, aber noch lange nicht zum eigenständigen Wissenschaftler. Und genau diese Erwartung sauber zu justieren, ist mehr wert als die nächste Rekordmeldung.

Quellen

Introducing LifeSciBench (OpenAI)↗ EXTERNER LINKOpenAI Releases LifeSciBench (MarkTechPost)↗ EXTERNER LINKAI passes only 1 in 3 scientific research tasks (Tech Times)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Google schickt vier KI-Chips ins All
Google schickt vier KI-Chips ins All
KI-FORSCHUNG·25. SEPTEMBER 2026

Google schickt vier KI-Chips ins All

Am 1. Oktober startet Google mit dem Testsatelliten MVP den ersten realen Hardwaretest für Project Suncatcher: vier TPUs im All statt nur eine Vision auf Papier. Kritiker wie Gartner-Analyst Bill Ray und Jeff Bezos bleiben skeptisch.

Illustration einer Laborwerkbank mit Reagenzglasgestell, Mikroskop und Petrischalen, kinewsletter.ch Stil
Illustration einer Laborwerkbank mit Reagenzglasgestell, Mikroskop und Petrischalen, kinewsletter.ch Stil
KI-FORSCHUNG·24. SEPTEMBER 2026

Claude findet ein neues Enzymsystem – in 21 Stunden

Anthropic hat ein eigenes Biologie-Labor in der Bay Area – und Claude-Agenten fanden darin ein unbeschriebenes Enzymsystem, das an CRISPR erinnert. Laut Anthropic in 21 Stunden, mit rund 950 Agenten.

Illustration eines langen Sitzungstisches in einem alten Seminarraum mit einer Reihe leerer Stühle und einer Wasserkaraffe, kinewsletter.ch Stil
Illustration eines langen Sitzungstisches in einem alten Seminarraum mit einer Reihe leerer Stühle und einer Wasserkaraffe, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·22. SEPTEMBER 2026

OpenAIs Mathe-Beirat darf alles – nur nicht bremsen

OpenAI setzt ein unabhängiges Mathematik-Gremium am Institute for Advanced Study ein – ausgelöst vom eigenen Modell, das neben Navier–Stokes über 100 weitere offene Probleme gelöst haben will. Der Beirat darf ungefragt beraten und öffentlich widersprechen, nur das Tempo nicht bremsen. Mit Martin Hairer sitzt ein EPFL-Professor darin, der die kritische Fields-Medaillen-Erklärung mitunterzeichnet hat.

Skizze eines humanoiden Roboters neben einer offenen Schutzabsperrung in Elektroblau, kinewsletter.ch Stil
Skizze eines humanoiden Roboters neben einer offenen Schutzabsperrung in Elektroblau, kinewsletter.ch Stil
KI-FORSCHUNG·16. SEPTEMBER 2026

Humanoider Roboter Digit 5 soll ohne Schutzzaun arbeiten

Agility Robotics hat am 15. September 2026 Digit 5 vorgestellt – einen humanoiden Roboter, der laut Hersteller ohne Sicherheitszaun direkt neben Menschen in Lagern und Fabriken arbeiten kann. Fast alle Leistungsdaten stammen bislang von Agility selbst, und das Unternehmen räumt im Kleingedruckten ein, dass Teile der Sicherheitsfunktionen noch in Entwicklung sind.

Illustration eines Studiertisches mit blauer Kugel, gepackten Kugeln, Zirkel und Lineal, kinewsletter.ch Stil
Illustration eines Studiertisches mit blauer Kugel, gepackten Kugeln, Zirkel und Lineal, kinewsletter.ch Stil
KI-FORSCHUNG·13. SEPTEMBER 2026

25 Fields-Medaillen-Träger: KI-Labore beschädigen die Mathematik

25 Träger der Fields-Medaille werfen den KI-Firmen in einer gemeinsamen Deklaration vor, mathematische Probleme als Benchmark zu missbrauchen und dabei die Wissenschaft selbst zu beschädigen. Vier der 25 lehren an Schweizer Hochschulen – darunter Alessio Figalli an der ETH Zürich und Maryna Viazovska an der EPFL. Und die Warnung endet nicht bei der Mathematik.

Illustration eines DNA-Doppelhelix-Modells auf einer Laborbank neben Mikroskop und Glasröhrchen, kinewsletter.ch Stil
Illustration eines DNA-Doppelhelix-Modells auf einer Laborbank neben Mikroskop und Glasröhrchen, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·10. SEPTEMBER 2026

DeepMind kartiert alle 9 Milliarden DNA-Mutationen

Rund 1 Petabyte vorberechnete Wirkungs-Vorhersagen für jede mögliche Punktmutation im menschlichen Genom — 30-mal grösser als die AlphaFold-Datenbank und gratis für die Forschung.

Mehr aus KI-Forschung →