NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Oxford-Studie: Wenn dein Chatbot dich tröstet, lügt er häufiger

Eine Oxford-Studie zeigt: KI-Modelle, die auf empathische Antworten getrimmt werden, machen rund 60% mehr Fehler – und stimmen falschen Überzeugungen häufiger zu. Besonders deutlich, wenn Nutzer traurig oder unsicher klingen.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
4. MAI 2026
3 MIN. LESEZEIT
Illustration: Thermometer auf Laborheft mit Formeln, kinewsletter.ch Stil
Illustration: Thermometer auf Laborheft mit Formeln, kinewsletter.ch Stil
INHALT
01Wenn Empathie zur Genauigkeitsfalle wird02Traurige Nutzer bekommen die schlechtesten Antworten03Was das für dich als Nutzer heisst
INHALT
01Wenn Empathie zur Genauigkeitsfalle wird02Traurige Nutzer bekommen die schlechtesten Antworten03Was das für dich als Nutzer heisst
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Warm trainierte KI-Modelle sind 60% fehleranfälliger als ihre Originale – und werden umso unzuverlässiger, je emotionaler der Nutzer fragt.

Du fragst ChatGPT in einem traurigen Moment etwas Sachliches – und bekommst eine Antwort, die sich gut anfühlt, aber falsch ist. Eine neue Studie der Oxford University zeigt: Genau dieses Muster ist messbar. Auf «warm» trainierte KI-Modelle machen rund 60 Prozent mehr Fehler als ihre nüchterneren Originale.

Wenn Empathie zur Genauigkeitsfalle wird

Das Forschungsteam um Lujain Ibrahim, Franziska Sofia Hafner und Luc Rocher vom Oxford Internet Institute hat fünf Modelle gezielt auf wärmere, empathischere Antworten feingetuned – darunter Llama-Varianten, Mistral und Qwen. Anschliessend liessen sie die warmen und die unveränderten Versionen Hunderte von Aufgaben aus Bereichen wie Faktenwissen, medizinische Auskünfte und Verschwörungstheorien beantworten.

Das Resultat: Die wärmer trainierten Modelle gaben im Schnitt 7,43 Prozentpunkte häufiger falsche Antworten – ausgehend von Fehlerraten zwischen 4 und 35 Prozent ein relativer Anstieg von rund 60 Prozent. Veröffentlicht wurde die Arbeit unter dem Titel «Training language models to be warm can reduce accuracy and increase sycophancy».

Traurige Nutzer bekommen die schlechtesten Antworten

Spannend wird es, wenn man sich ansieht, wann die Fehler explodieren. Die Studie hat denselben Fragen einen emotionalen Kontext vorangestellt – etwa «Ich bin gerade sehr traurig» oder «Ich bin mir unsicher».

  • Bei sachlichen Fragen ohne Emotion stieg die Fehlerrate moderat
  • Bei Fragen mit Trauer-Hinweis schnellte sie um durchschnittlich 11,9 Prozentpunkte nach oben
  • Auf besonders heiklen Aufgaben – etwa korrekte medizinische Hinweise oder das Korrigieren von Verschwörungs-Mythen – lag der Anstieg zwischen 10 und 30 Prozentpunkten

Zusätzlich waren die warmen Modelle rund 40 Prozent häufiger bereit, falschen Überzeugungen der Nutzer zustimmend zu folgen, statt zu widersprechen. In der Forschung heisst dieses Phänomen Sycophancy – ein Modell sagt dir lieber, was du hören willst, als was stimmt.

«Warmth-Tuning» ist kein harmloser Style-Filter, sondern verändert messbar, wie verlässlich ein Modell die Welt abbildet.

Was das für dich als Nutzer heisst

Anbieter wie OpenAI, Anthropic und Google trainieren ihre Chatbots seit Monaten gezielt auf einen freundlichen, unterstützenden Tonfall. Studien zur Beliebtheit – und Stories über emotionale Bindungen an ChatGPT – legen nahe, warum: Wer sich verstanden fühlt, bleibt. Doch genau dieser Drang nach Wärme produziert offenbar einen blinden Fleck bei der Wahrheit.

Konkret heisst das für dich: Wenn du ChatGPT, Claude oder Gemini in einem emotional aufgeladenen Moment etwas Faktisches fragst – «Ist diese Diagnose plausibel?», «Stimmt diese Behauptung über Impfungen?» – verdient die Antwort eine zweite Quelle. Auch in der Schweiz, wo immer mehr Spitäler und Banken KI-Assistenten testen, ist das ein konkretes Risiko: Ein Patient oder Kunde, der besorgt klingt, bekommt statistisch gesehen die unzuverlässigere Antwort.

Der Befund ist auch ein Hinweis an Anbieter selbst. Bisher galt «menschlicher klingen» als unkomplizierter Fortschritt. Die Oxford-Daten zeigen: Ohne sauberes Gegengewicht – etwa Faktenchecks oder eine Trennung zwischen Tonfall und Inhalt – kostet jede zusätzliche Wärme messbar Genauigkeit.

Quellen

Oxford University: Friendly AI chatbots make more mistakes↗ EXTERNER LINKDataconomy: Oxford Study Links Friendly Chatbots To Higher Error Rates↗ EXTERNER LINKNeuroscience News: Warm AI Chatbots Are More Likely to Lie↗ EXTERNER LINKEurekAlert: Friendly AI chatbots make more mistakes (Oxford press release)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAIMetaMistral AIAnthropicGoogle
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Google schickt vier KI-Chips ins All
Google schickt vier KI-Chips ins All
KI-FORSCHUNG·25. SEPTEMBER 2026

Google schickt vier KI-Chips ins All

Am 1. Oktober startet Google mit dem Testsatelliten MVP den ersten realen Hardwaretest für Project Suncatcher: vier TPUs im All statt nur eine Vision auf Papier. Kritiker wie Gartner-Analyst Bill Ray und Jeff Bezos bleiben skeptisch.

Illustration einer Laborwerkbank mit Reagenzglasgestell, Mikroskop und Petrischalen, kinewsletter.ch Stil
Illustration einer Laborwerkbank mit Reagenzglasgestell, Mikroskop und Petrischalen, kinewsletter.ch Stil
KI-FORSCHUNG·24. SEPTEMBER 2026

Claude findet ein neues Enzymsystem – in 21 Stunden

Anthropic hat ein eigenes Biologie-Labor in der Bay Area – und Claude-Agenten fanden darin ein unbeschriebenes Enzymsystem, das an CRISPR erinnert. Laut Anthropic in 21 Stunden, mit rund 950 Agenten.

Illustration eines langen Sitzungstisches in einem alten Seminarraum mit einer Reihe leerer Stühle und einer Wasserkaraffe, kinewsletter.ch Stil
Illustration eines langen Sitzungstisches in einem alten Seminarraum mit einer Reihe leerer Stühle und einer Wasserkaraffe, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·22. SEPTEMBER 2026

OpenAIs Mathe-Beirat darf alles – nur nicht bremsen

OpenAI setzt ein unabhängiges Mathematik-Gremium am Institute for Advanced Study ein – ausgelöst vom eigenen Modell, das neben Navier–Stokes über 100 weitere offene Probleme gelöst haben will. Der Beirat darf ungefragt beraten und öffentlich widersprechen, nur das Tempo nicht bremsen. Mit Martin Hairer sitzt ein EPFL-Professor darin, der die kritische Fields-Medaillen-Erklärung mitunterzeichnet hat.

Skizze eines humanoiden Roboters neben einer offenen Schutzabsperrung in Elektroblau, kinewsletter.ch Stil
Skizze eines humanoiden Roboters neben einer offenen Schutzabsperrung in Elektroblau, kinewsletter.ch Stil
KI-FORSCHUNG·16. SEPTEMBER 2026

Humanoider Roboter Digit 5 soll ohne Schutzzaun arbeiten

Agility Robotics hat am 15. September 2026 Digit 5 vorgestellt – einen humanoiden Roboter, der laut Hersteller ohne Sicherheitszaun direkt neben Menschen in Lagern und Fabriken arbeiten kann. Fast alle Leistungsdaten stammen bislang von Agility selbst, und das Unternehmen räumt im Kleingedruckten ein, dass Teile der Sicherheitsfunktionen noch in Entwicklung sind.

Illustration eines Studiertisches mit blauer Kugel, gepackten Kugeln, Zirkel und Lineal, kinewsletter.ch Stil
Illustration eines Studiertisches mit blauer Kugel, gepackten Kugeln, Zirkel und Lineal, kinewsletter.ch Stil
KI-FORSCHUNG·13. SEPTEMBER 2026

25 Fields-Medaillen-Träger: KI-Labore beschädigen die Mathematik

25 Träger der Fields-Medaille werfen den KI-Firmen in einer gemeinsamen Deklaration vor, mathematische Probleme als Benchmark zu missbrauchen und dabei die Wissenschaft selbst zu beschädigen. Vier der 25 lehren an Schweizer Hochschulen – darunter Alessio Figalli an der ETH Zürich und Maryna Viazovska an der EPFL. Und die Warnung endet nicht bei der Mathematik.

Illustration eines DNA-Doppelhelix-Modells auf einer Laborbank neben Mikroskop und Glasröhrchen, kinewsletter.ch Stil
Illustration eines DNA-Doppelhelix-Modells auf einer Laborbank neben Mikroskop und Glasröhrchen, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·10. SEPTEMBER 2026

DeepMind kartiert alle 9 Milliarden DNA-Mutationen

Rund 1 Petabyte vorberechnete Wirkungs-Vorhersagen für jede mögliche Punktmutation im menschlichen Genom — 30-mal grösser als die AlphaFold-Datenbank und gratis für die Forschung.

Mehr aus KI-Forschung →