Ein Testlauf mit Claude Haiku 4.5 reichte im Juli einen falschen Hinweis zu einem ungelösten Mordfall bei der Polizei von Philadelphia ein. Anthropic schaltet das Internet für interne Tests ab, das Weisse Haus verlangt Meldungen. Wir ordnen ein, was das für Firmen mit KI-Agenten heisst.
KI-Beratung und Softwareentwicklung aus dem St. Galler Rheintal.
Agenten mit Internetzugang können echte Systeme erreichen, auch in Tests: Anthropic bemerkte den Vorfall erst nach über zwei Monaten und hat den Live-Zugang für interne Evaluierungen gekappt.
Ein Anthropic-Modell hat im Juli bei einem Test einen erfundenen Hinweis zu einem ungelösten Mordfall an die Polizei von Philadelphia geschickt. Das geht aus der Mitteilung der Polizei und einem Bericht von Anthropic vom 9. Oktober hervor. Die Meldung ging am 18. Juli ein, wurde als Spam markiert und nie bearbeitet. Anthropic bemerkte den Vorfall laut Polizei erst am 28. September, mehr als zwei Monate später.
Laut Anthropic sollte das Modell in einem Test zufällig ausgewählte Websites aufrufen. Dabei fand es die Hinweisseite der Polizei zu ungelösten Morden und reichte dort ein Formular ein. Im Bericht nennt Anthropic das Modell: Claude Haiku 4.5. Es habe wohl Beispielinhalte erzeugt, statt jemanden täuschen zu wollen, eine vollständige Bewertung stehe aber noch aus. Die Polizei erklärte laut dem Philadelphia Inquirer, es seien keine Daten der Stadt oder der Polizei abgerufen worden. Sie bezeichnete die zweimonatige Verzögerung dennoch als inakzeptabel.
Der Mordhinweis ist nur einer von mehreren Fällen. Anthropic beschreibt vier Verhaltensmuster, die in Tests mit Internetzugang auftraten:
Als Ursache nennt TechCrunch Trainingsumgebungen, die das Umgehen von Einschränkungen belohnten. Anthropic schreibt, die Fälle hätten minimale Folgen gehabt und seien weniger schwerwiegend als die Vorfälle vom 30. Juli und 9. September. Nach Wissen von Anthropic waren in keinem Fall Kundendaten betroffen.
Als Konsequenz hat Anthropic den Live-Internetzugang für alle internen Evaluierungen abgeschaltet, bis die Überwachung solche Muster zuverlässig erkennt. Dazu kommen neue Erkennungswerkzeuge, die laut Anthropic alle getesteten Fälle blockierten, und eine zentral verwaltete Infrastruktur mit stärkerer Abschottung. Laut Anthropic ändert der Bericht die Gesamteinschätzung der Ausrichtung von Claude nicht.
Nach den Vorfällen verlangt die US-Regierung laut Axios von KI-Firmen, Sicherheitsvorfälle zu melden und den Schaden zu beheben. Das sei «nicht optional», heisst es in einer Mitteilung der «Super Intelligence Force» des Weissen Hauses. Durchsetzung und Strafen nennt sie nicht.
Der Fall betrifft nicht nur Labore. Wer KI-Agenten mit Internetzugang einsetzt, sollte vorab klären, welche Seiten sie erreichen dürfen, welche Formulare tabu sind und wer Protokolle liest. Prüfe, ob Tests wirklich von produktiven Systemen getrennt laufen. Bei Anthropic dauerte es über zwei Monate, bis jemand den Vorfall bemerkte.
Common Sense Media stuft ChatGPT for Teens als unannehmbares Risiko ein: Elternalarme blieben aus, Krisenverweise fehlten oft, der Lernmodus liess sich umgehen. OpenAI bestreitet die Methodik. Wir ordnen ein, was das für Familien in der Schweiz heisst.