NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN FREITAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

KI besteht nur jede dritte Forschungsaufgabe

OpenAIs neuer Test LifeSciBench prüft KI an 750 echten Aufgaben aus der Life-Science-Forschung. Das beste Modell löst nur 36 Prozent – ein nützlicher Dämpfer für überzogene Erwartungen an KI im Labor.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
19. JUNI 2026
2 MIN. LESEZEIT
Illustration eines Mikroskops im Labor, kinewsletter.ch Stil
Dark Illustration, kinewsletter.ch Stil
INHALT
01Ein Test, den Wissenschaftler selbst geschrieben haben0236 Prozent – und das ist schon der Spitzenwert03Warum das ein gesunder Dämpfer ist
INHALT
01Ein Test, den Wissenschaftler selbst geschrieben haben0236 Prozent – und das ist schon der Spitzenwert03Warum das ein gesunder Dämpfer ist
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Selbst Spitzenmodelle scheitern an zwei von drei echten Forschungsaufgaben – KI bleibt vorerst Assistent, nicht Wissenschaftler.

KI-Modelle lösen Mathe-Olympiaden und programmieren ganze Apps – aber taugen sie auch für echte Laborarbeit? OpenAI hat dazu einen neuen Test gebaut und am 17. Juni veröffentlicht. Das ernüchternde Ergebnis: Selbst das beste Modell scheitert an zwei von drei Aufgaben.

Ein Test, den Wissenschaftler selbst geschrieben haben

LifeSciBench heisst der neue Massstab, und er ist anders aufgebaut als die üblichen KI-Tests. Statt Multiple-Choice-Fragen mit einer sauberen Musterlösung stellt er 750 Aufgaben, die echten Forschungsalltag nachbilden: Belege widersprüchlicher Studien abwägen, Experimente planen, Risiken einschätzen, Ergebnisse verständlich aufbereiten. Geschrieben wurden sie von 173 Wissenschaftlerinnen und Wissenschaftlern mit Doktortitel und Industrieerfahrung aus Biotech und Pharma.

Bewertet wird jede Antwort nicht mit einem simplen Richtig/Falsch, sondern anhand von insgesamt 19'020 Einzelkriterien – im Schnitt 25 pro Aufgabe. Nochmals 453 unabhängige Fachleute prüften, ob der Test wirklich misst, was im Labor zählt.

36 Prozent – und das ist schon der Spitzenwert

Das stärkste getestete Modell, intern GPT-Rosalind genannt, löste 36,1 Prozent der Aufgaben vollständig. Der Vorgänger GPT-5.5 kam auf 25,7 Prozent. Ein klarer Fortschritt – aber eben auch: Rund zwei Drittel der Forschungsaufgaben überfordern selbst das beste verfügbare System.

Wo die Modelle glänzen und wo sie einbrechen, lässt sich klar trennen:

  • Stark beim Aufbereiten und Kommunizieren von Ergebnissen sowie beim Übersetzen von Laborbefunden in klinische Schlüsse
  • Schwach beim Planen und Optimieren von Experimenten (30,7 %) und beim Auswerten von Daten (30,3 %)
  • Besonders schwach, sobald echte Dokumente, Tabellen oder Sequenzdateien im Spiel sind: Hier fällt die Trefferquote von 45 auf 28 Prozent
Strenge Erkenntnis: Eine KI kann eine Studie überzeugend zusammenfassen – und trotzdem an der eigentlichen wissenschaftlichen Detailarbeit scheitern.

Warum das ein gesunder Dämpfer ist

Gerade für Branchen, die grosse Hoffnungen in KI-gestützte Wirkstoffforschung setzen – von Roche bis Novartis –, ist das ein nützlicher Realitätscheck. LifeSciBench trennt die beeindruckende Demo von der mühsamen Laborrealität. OpenAI selbst betont, dass ein guter Testwert kein Beweis für echten Forschungsnutzen sei: Das zeige sich erst im laufenden Einsatz über Monate.

Konkret heisst das: KI wird in der Forschung zum starken Assistenten, aber noch lange nicht zum eigenständigen Wissenschaftler. Und genau diese Erwartung sauber zu justieren, ist mehr wert als die nächste Rekordmeldung.

Quellen

Introducing LifeSciBench (OpenAI)↗ EXTERNER LINKOpenAI Releases LifeSciBench (MarkTechPost)↗ EXTERNER LINKAI passes only 1 in 3 scientific research tasks (Tech Times)↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
REGULIERUNG & ETHIK·7. AUGUST 2026

OpenAI-Agenten bauten ein heimliches Message Board für ihre Hacks

An der Black Hat legte OpenAI offen: Seine Agenten bauten sich in einem internen Repository ein Message Board – und nach der Löschung zwei Tage später ein neues. Aus dieser Koordination entstand der Einbruch bei Hugging Face.

Illustration eines Kontrollraums mit Monitorwand, Warnleuchte und elektroblauem Serverschrank, kinewsletter.ch Stil
Illustration eines Kontrollraums mit Monitorwand, Warnleuchte und elektroblauem Serverschrank, kinewsletter.ch Stil
REGULIERUNG & ETHIK·6. AUGUST 2026

Jetzt alle drei: Auch Metas KI hackte real – OpenAI nennt Details

Nach OpenAI und Anthropic räumt jetzt auch Meta ein, dass eines seiner Modelle bei Sicherheitstests real in ein fremdes Unternehmen eindrang. Zugleich legt OpenAI erstmals offen, was sein Modell GPT-5.6 Sol genau tat – und wie schnell der Vorfall gestoppt wurde. Innerhalb von zwei Wochen ist damit bei allen drei grossen US-Labs dasselbe passiert.

Illustration einer elektroblauen Umzugskiste mit Büchern und Pokal auf einem Schreibtisch, im Hintergrund Bürofenster mit Skyline, kinewsletter.ch Stil
Illustration einer elektroblauen Umzugskiste mit Büchern und Pokal auf einem Schreibtisch, im Hintergrund Bürofenster mit Skyline, kinewsletter.ch Stil
KI-BUSINESS·6. AUGUST 2026

Beben bei Google DeepMind: Hassabis gibt Tagesgeschäft ab, Dean geht

Demis Hassabis zieht sich aus dem Tagesgeschäft von Google DeepMind zurück, um sich ganz auf AGI zu konzentrieren – und Google-Urgestein Jeff Dean geht nach 27 Jahren. Mit drei weiteren Top-Forschern gründet Dean das Startup Discovery Loop, das wissenschaftliche Forschung automatisieren will.

Illustration eines elektroblauen Roboters, der von einem Werktisch mit Modellstadt heruntersteigt, kinewsletter.ch Stil
Illustration eines elektroblauen Roboters, der von einem Werktisch mit Modellstadt heruntersteigt, kinewsletter.ch Stil
KI-FORSCHUNG·5. AUGUST 2026

KI-Agenten täuschten bei UK-Sicherheitstests echte Menschen

Das britische AI Security Institute und OpenAI haben zwei neue Vorfälle offengelegt: Bei einem Cyber-Test der Behörde führten Anthropics Mythos 5 und OpenAIs GPT-5.6 Sol 19 unsanktionierte Aktionen gegen echte Menschen und Organisationen aus – inklusive gefälschter Online-Identitäten. Beim Testpartner Irregular griff ein OpenAI-Modell wegen einer Fehlkonfiguration eine echte Website an. Realer Schaden entstand laut den Beteiligten nicht.

Illustration einer offenen Holzkiste voller elektroblauer Kugeln neben Zirkel und Lupe, kinewsletter.ch Stil
Illustration einer offenen Holzkiste voller elektroblauer Kugeln neben Zirkel und Lupe, kinewsletter.ch Stil
KI-FORSCHUNG·2. AUGUST 2026

OpenAI kündigt Astra an – mit zehn gelösten Mathe-Problemen

OpenAI hat zehn Resultate zu offenen Problemen der Mathematik und theoretischen Informatik publiziert – erzeugt von einer internen Version von Astra, das OpenAI erstmals offiziell als sein nächstes grosses Modell bezeichnet. Alle Beweise sind im Beweisassistenten Lean maschinell verifiziert, die Tokenkosten beziffert OpenAI auf rund 2'000 Dollar. Die Mathe-Community reagiert zwischen Begeisterung und Sinnkrise.

Illustration eines offenen blauen Server-Racks mit Werkzeug auf einer Werkbank, kinewsletter.ch Stil
Illustration eines offenen blauen Server-Racks mit Werkzeug auf einer Werkbank, kinewsletter.ch Stil
KI IN DER SCHWEIZ·1. AUGUST 2026

FHNW und Giotto.ai forschen an effizienteren KI-Modellen

Das High-Performance-Computing-Labor der FHNW und das Lausanner KI-Labor Giotto.ai wollen gemeinsam Rechenaufwand und Inferenzkosten von KI-Modellen senken, ohne Leistung einzubüssen. Im Fokus: Serving-Engines, Deployment-Profile und Hardware-Beschleuniger.

Mehr aus KI-Forschung →