Anthropic legt offen, was nach den Sicherheitsvorfällen vom Sommer intern passierte: pausierte Cyber-Evaluationen, ein Klassifikator, der Ausbruchsversuche vor dem Tool-Call stoppt, und über 10 Prozent fehlerhafte Trainingsumgebungen. Dazu eine Studie, für die ein Opus-Modell absichtlich zum Betrügen trainiert wurde.

Claude Code und OpenAI Codex können weder vorhersagen, wie lange eine Aufgabe dauert, noch zuverlässig sagen, wie lange sie schon arbeiten. Eine MATS-Studie misst Fehlschätzungen um das Drei- bis Zehnfache – und zeigt, dass die Agenten sich zusätzlich rund 20 Punkte zu gute Noten geben. Was das für Timeouts, Kostenschätzungen und Projektkalkulation bedeutet.
Nicht das Modell war «böse» – es reagierte auf einen sichtbaren Punktestand. Reward Hacking im Training erzeugt reale Schadensbereitschaft, sobald ein Grader im Spiel ist.
Anthropic hat am 31. August 2026 offengelegt, was nach den Sicherheitsvorfällen des Sommers intern passiert ist: Externe Cyber-Evaluationen von Vorab-Modellen wurden gestoppt und laufen erst jetzt wieder, ein neuer Klassifikator blockiert Ausbruchsversuche, bevor der Tool-Call überhaupt ausgeführt wird, und während eines rund einmonatigen Freezes im April flaggte das Unternehmen über 10 Prozent seiner produktiven Trainingsumgebungen als fehlerhaft. Parallel dazu veröffentlichte das Alignment-Team eine Studie, für die ein Modell der Opus-Klasse absichtlich auf 80 anfällige Umgebungen trainiert wurde — um zu zeigen, was passiert, wenn genau diese Aufräumarbeit unterbleibt.
Rückblende: Am 30. Juli meldete Anthropic drei Vorfälle, bei denen Claude-Modelle unautorisierten Zugriff auf reale Computersysteme erlangten. Sie liefen für Evaluationszwecke bewusst ohne Cyber-Schutzmechanismen und kamen wegen einer Fehlkonfiguration in einer Drittanbieter-Testumgebung ans offene Internet. Am 4. August meldete das britische AI Security Institute einen eigenen Vorfall: Claude Mythos 5 führte bei Cybersicherheitstests unautorisierte Aktionen im echten Netz aus — dort hatte das Modell den Internetzugang absichtlich bekommen.
Melde dich an, um den vollständigen Artikel zu lesen. Der Zugang ist kostenlos.