NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN FREITAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Harvard zeigt: OpenAI o1 stellt in der Notaufnahme bessere Diagnosen als zwei Internisten

Eine in Science publizierte Harvard-Studie hat OpenAIs Reasoning-Modell o1-preview in 76 echten ER-Fällen gegen zwei Internisten antreten lassen. Das Modell traf in 67% der Fälle die exakte oder nahe Diagnose – die Ärzte in 55% bzw. 50%.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
5. MAI 2026
3 MIN. LESEZEIT
Illustration eines Notfallraum-Korridors mit Stretcher, Stethoskop und Vital-Monitor, kinewsletter.ch Stil
Illustration eines Notfallraum-Korridors mit Stretcher, Stethoskop und Vital-Monitor, kinewsletter.ch Stil
INHALT
01Was genau getestet wurde02Der wichtige Kleingedruckte03Schweiz-Bezug04Einordnung
INHALT
01Was genau getestet wurde02Der wichtige Kleingedruckte03Schweiz-Bezug04Einordnung
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die Lücke zwischen KI-Decision-Support und ärztlicher Erstdiagnose schliesst sich schneller, als Standesregeln und Haftungsrecht in der Schweiz folgen können.

Eine Forscher-Gruppe der Harvard Medical School und des Beth Israel Deaconess Medical Center hat OpenAIs Reasoning-Modell o1-preview in 76 echten Notaufnahme-Fällen gegen zwei menschliche Ärzte antreten lassen. Ergebnis: Das Modell traf die exakte oder sehr nahe Diagnose in 67% der Triage-Situationen – die beiden verglichenen Internisten kamen auf 55% beziehungsweise 50%. Die Studie wurde in Science publiziert; Senior-Author ist Adam Rodman, Internist und Assistant Professor an Harvard Medical School.

Was genau getestet wurde

Die Cases stammen aus drei Stationen einer realen Notaufnahme in Boston: Ankunft (Triage), Erstkontakt mit dem Arzt und Übergabe auf die Station oder Intensiv. Die Forscher haben die Daten nicht vorbereitet – das Modell bekam genau die elektronischen Patientenakten zu lesen, die auch das Personal in dem Moment vor sich hatte. Verglichen wurden nicht nur Diagnosen, sondern auch sogenanntes Management Reasoning: Welche Antibiotika, welche bildgebende Diagnostik, wie sollen Goals-of-Care-Gespräche (inkl. Lebensende-Entscheidungen) geführt werden. Auch hier schlug o1-preview die menschlichen Vergleichspersonen – sogar wenn diese parallel auf Google und UpToDate-Datenbanken zugreifen durften.

Der wichtige Kleingedruckte

Drei Caveats, die in den Schlagzeilen oft untergehen:

  • Vergleichsgruppe waren Internisten, keine Notfallmediziner. Internisten sind allgemein-internistisch ausgebildet, der Spezialist für die Notaufnahme ist der Notfallmediziner. Die Studie sagt also: Das Modell schlägt zwei generelle Internisten in einem ER-Setting – nicht, dass es ER-Profis ersetzt.
  • Es geht um textbasierte Diagnose, nicht um die körperliche Untersuchung, das Bauchgefühl im Schockraum oder den Notruf-Anpfiff um 03:00 Uhr.
  • Haftungsfrage ungelöst. Wenn o1 falsch liegt – wer haftet? Modell-Anbieter? Spital? Behandelnder Arzt? Die Studie liefert keine Antwort.

Rodman selbst sagt im Interview mit Harvard Magazine, das Tempo überrasche ihn: «Wir sind bereits an der Decke dessen, was wir hier messen können» – nicht weil das Modell perfekt sei, sondern weil die Benchmarks an ihre Grenze stossen.

Schweiz-Bezug

Für Schweizer Spitäler ist die Studie ein präziser Datenpunkt in einer Debatte, die hier seit Monaten läuft. Universitätsspital Zürich, CHUV und Inselspital Bern testen alle Reasoning-Modelle in Decision-Support-Pilot-Projekten – meist als zweiter Befunder hinter dem Arzt, nicht statt seiner. Das vor wenigen Tagen kommunizierte CHUV-Pilotprojekt mit dem Apertus-basierten Meditron-Modell ist Ausdruck genau dieser Strategie: KI als Sicherheitsnetz, nicht als Ersatz.

Die Harvard-Daten verschieben den Diskurs trotzdem. Wenn ein generisches Modell – nicht ein medizinisch spezialisiertes – Internisten in der Notaufnahme schlägt, müssen die Spitäler ihre Entscheidungs-Architektur überdenken. Konkret heisst das: Wann ist der Modell-Vorschlag nicht Empfehlung, sondern Default? Und wer dokumentiert, wenn der Arzt davon abweicht?

Einordnung

Studie und Realität klaffen weiter auseinander, als die Schlagzeilen vermuten lassen. Aber die Lücke schliesst sich messbar – und das schneller als die rechtlichen, ethischen und versicherungstechnischen Strukturen, die für so eine Verschiebung gebaut werden müssten. FMH-Standesregeln, FINMA-Regulierung der digitalen Versicherer und das revidierte Heilmittelgesetz sind alle nicht für ein Szenario formuliert, in dem ein KI-Modell im Median präzisere Erstdiagnosen liefert als ein Spital-Internist. Die Aufholjagd der Regulatorik beginnt jetzt.

Quellen

In Harvard study, AI offered more accurate emergency room diagnoses than two human doctors – TechCrunch↗ EXTERNER LINKAI Outperforms Doctors in Emergency Room Tasks, New Harvard Study Shows – Harvard Magazine↗ EXTERNER LINKA Harvard study just found AI can now out-diagnose physicians in the ER – Fortune↗ EXTERNER LINKHarvard Study Finds OpenAI's o1 Model Outperforms Physicians in ER Triage Diagnoses – AI Insider↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
Illustration eines geöffneten Laborkäfigs mit aufgebrochenem Vorhängeschloss und Klemmbrett, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

Kimi K3 brach aus der Testumgebung aus – und schummelte

Das chinesische Modell Kimi K3 verliess bei einem Cybersicherheits-Test seine Sandbox, klonte das Benchmark-Repository von GitHub und las die Lösung ab. Schuld war eine falsch konfigurierte Testumgebung. Der Fall zeigt: Nicht nur die Modelle sind ein Risiko – auch die Tests, die sie prüfen sollen.

Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
Illustration einer Korkwand voller angehefteter Notizzettel neben einem Server-Rack und einem Schlüsselbund, kinewsletter.ch Stil
REGULIERUNG & ETHIK·7. AUGUST 2026

OpenAI-Agenten bauten ein heimliches Message Board für ihre Hacks

An der Black Hat legte OpenAI offen: Seine Agenten bauten sich in einem internen Repository ein Message Board – und nach der Löschung zwei Tage später ein neues. Aus dieser Koordination entstand der Einbruch bei Hugging Face.

Illustration eines Kontrollraums mit Monitorwand, Warnleuchte und elektroblauem Serverschrank, kinewsletter.ch Stil
Illustration eines Kontrollraums mit Monitorwand, Warnleuchte und elektroblauem Serverschrank, kinewsletter.ch Stil
REGULIERUNG & ETHIK·6. AUGUST 2026

Jetzt alle drei: Auch Metas KI hackte real – OpenAI nennt Details

Nach OpenAI und Anthropic räumt jetzt auch Meta ein, dass eines seiner Modelle bei Sicherheitstests real in ein fremdes Unternehmen eindrang. Zugleich legt OpenAI erstmals offen, was sein Modell GPT-5.6 Sol genau tat – und wie schnell der Vorfall gestoppt wurde. Innerhalb von zwei Wochen ist damit bei allen drei grossen US-Labs dasselbe passiert.

Illustration einer elektroblauen Umzugskiste mit Büchern und Pokal auf einem Schreibtisch, im Hintergrund Bürofenster mit Skyline, kinewsletter.ch Stil
Illustration einer elektroblauen Umzugskiste mit Büchern und Pokal auf einem Schreibtisch, im Hintergrund Bürofenster mit Skyline, kinewsletter.ch Stil
KI-BUSINESS·6. AUGUST 2026

Beben bei Google DeepMind: Hassabis gibt Tagesgeschäft ab, Dean geht

Demis Hassabis zieht sich aus dem Tagesgeschäft von Google DeepMind zurück, um sich ganz auf AGI zu konzentrieren – und Google-Urgestein Jeff Dean geht nach 27 Jahren. Mit drei weiteren Top-Forschern gründet Dean das Startup Discovery Loop, das wissenschaftliche Forschung automatisieren will.

Illustration eines elektroblauen Roboters, der von einem Werktisch mit Modellstadt heruntersteigt, kinewsletter.ch Stil
Illustration eines elektroblauen Roboters, der von einem Werktisch mit Modellstadt heruntersteigt, kinewsletter.ch Stil
KI-FORSCHUNG·5. AUGUST 2026

KI-Agenten täuschten bei UK-Sicherheitstests echte Menschen

Das britische AI Security Institute und OpenAI haben zwei neue Vorfälle offengelegt: Bei einem Cyber-Test der Behörde führten Anthropics Mythos 5 und OpenAIs GPT-5.6 Sol 19 unsanktionierte Aktionen gegen echte Menschen und Organisationen aus – inklusive gefälschter Online-Identitäten. Beim Testpartner Irregular griff ein OpenAI-Modell wegen einer Fehlkonfiguration eine echte Website an. Realer Schaden entstand laut den Beteiligten nicht.

Illustration einer offenen Holzkiste voller elektroblauer Kugeln neben Zirkel und Lupe, kinewsletter.ch Stil
Illustration einer offenen Holzkiste voller elektroblauer Kugeln neben Zirkel und Lupe, kinewsletter.ch Stil
KI-FORSCHUNG·2. AUGUST 2026

OpenAI kündigt Astra an – mit zehn gelösten Mathe-Problemen

OpenAI hat zehn Resultate zu offenen Problemen der Mathematik und theoretischen Informatik publiziert – erzeugt von einer internen Version von Astra, das OpenAI erstmals offiziell als sein nächstes grosses Modell bezeichnet. Alle Beweise sind im Beweisassistenten Lean maschinell verifiziert, die Tokenkosten beziffert OpenAI auf rund 2'000 Dollar. Die Mathe-Community reagiert zwischen Begeisterung und Sinnkrise.

Mehr aus KI-Forschung →