NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Claude repariert seine eigenen Alignment-Fehler – für 4 Dollar pro Stunde

Anthropic liess Claude als Sicherheitsforscher arbeiten: Das Modell entwarf selbstständig Trainingsmethoden gegen zehn Arten von Fehlverhalten – von Täuschung bis Jailbreaks – und schlug dabei die Vorschläge von 28 erfahrenen menschlichen Forschenden. Der Report nennt auch den Preis: 4 Dollar pro Stunde statt 150.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
30. AUGUST 2026
5 MIN. LESEZEIT
Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
INHALT
01Fünf Agenten, ein Leaderboard, 48 Stunden0285 Prozent gegen 20 Prozent03Wenn das schwächere Modell das stärkere ausrichtet0439 Betrugsversuche unter 1'601 Anläufen05Was der Report ausdrücklich nicht zeigt06Warum das für Apertus interessant wird
INHALT
01Fünf Agenten, ein Leaderboard, 48 Stunden0285 Prozent gegen 20 Prozent03Wenn das schwächere Modell das stärkere ausrichtet0439 Betrugsversuche unter 1'601 Anläufen05Was der Report ausdrücklich nicht zeigt06Warum das für Apertus interessant wird
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Rekursive Selbstverbesserung wird ausgerechnet bei der Sicherheitsarbeit zuerst praktisch – aber nur dort, wo sich Fehlverhalten sauber messen lässt, und Anthropic legt die Grenzen dieses Befunds selbst offen.

Anthropic hat am 28. August 2026 einen Report veröffentlicht, in dem Claude die Rolle des Sicherheitsforschers übernimmt: Das Modell durchsuchte selbstständig die Fachliteratur, entwarf Trainingsmethoden und trainierte damit kleinere KI-Modelle um – in zehn Kategorien von Alignment-Fehlern, von Täuschung über Schmeichelei bis zu Jailbreaks. In allen zehn fand es Methoden, die den Zielfehler messbar reduzierten, ohne die allgemeinen Fähigkeiten der Modelle zu zerstören. Der Kostenvergleich steht wörtlich im Report: Ein solcher automatisierter Forscher kostet rund 4 US-Dollar pro Stunde an API-Inferenz, während Anthropic seinen menschlichen Forschenden 150 Dollar pro Stunde zahlt.

Alignment meint, wie zuverlässig ein Modell das tut, was seine Nutzer wirklich wollen – statt zu lügen, zu schmeicheln oder sich mit einem geschickten Prompt aushebeln zu lassen.

Fünf Agenten, ein Leaderboard, 48 Stunden

Der Aufbau ist ein Forschungslabor im Zeitraffer. Zuerst bauen vier «Bibliothekar»-Agenten eine gemeinsame Literaturübersicht. Danach arbeiten fünf Agenten auf Basis von Claude Opus 4.8 parallel am selben Fehlertyp: Jeder schlägt eine Methode vor, lässt den Code von einem Prüf-Agenten freigeben, trainiert das Zielmodell rund 30 Minuten auf einer einzelnen H200-Grafikkarte und schickt es an einen separaten Evaluator. Ergebnis auf eine gemeinsame Rangliste, nächste Runde – bis zu 48 Stunden lang.

WEITERLESENDas könnte dich auch interessieren.

Illustration einer Uhrmacher-Werkbank mit Lupe am Schwenkarm, verstreuten Zahnrädern, Pinzette und einem Schubladenschrank mit blau markierten Fächern, kinewsletter.ch Stil

Die Zielmodelle sind offene Modelle mit 2 bis 7 Milliarden Parametern: Qwen, Llama, Gemma, Phi und Olmo. Entscheidend ist eine Regel, die Anthropic hart durchsetzt: Claude durfte sein eigenes Verhalten nicht ins Zielmodell hineinkopieren. Der Fortschritt musste aus der Methode kommen, nicht aus dem Abschreiben bei einem klügeren Lehrer.

85 Prozent gegen 20 Prozent

Gemessen wird der geschlossene «Sicherheits-Abstand»: wie viel des Wegs vom untrainierten Modell zur theoretisch perfekten Punktzahl eine Methode schafft. Beim Fehlertyp Täuschung schloss Claudes bester Ansatz laut Anthropic in einem Durchlauf 82 Prozent dieses Abstands, im Mittel über mehrere Durchläufe 85 Prozent. Sechs erfahrene Sicherheitsforscher, die unter denselben Regeln antraten, kamen im Durchschnitt auf 20 Prozent.

Insgesamt lieferten 28 Forschende 30 Ideen ab – alle mit mindestens einem Jahr Erfahrung in technischer KI-Sicherheit, im Schnitt 2,5 Jahre, und mit bis zu acht Stunden Zeit pro Idee. Claudes Suche überholte die beste menschliche Idee nach durchschnittlich 6,4 Stunden. Kurios: Gab man einem Lauf eine menschliche Idee als Startrichtung mit, wurde das Ergebnis nicht besser.

Anthropic relativiert den Vergleich selbst: Die Menschen durften ihre Idee nicht überarbeiten, und Claudes Bestwert ist das Maximum aus rund 150 bewerteten Methoden – also nach oben verzerrt. Der Report liest ihn deshalb als Arbeitsteilung: Die Maschine liefert Kandidaten in einer Menge, die Menschen nicht schaffen; verfeinern sollen sie Menschen.

Wenn das schwächere Modell das stärkere ausrichtet

Der brisante Teil kommt später. Anthropic setzte Claude Sonnet 5 darauf an, Alignment-Fehler in einem frühen Checkpoint von Claude Opus 4.8 zu beheben – also das schwächere Modell auf das stärkere. In rund 60 Stunden testete Sonnet 5 über 50 Lösungen. Die Siegerlösung bestand aus rund 2'400 Trainingsbeispielen aus einfachen Vorlagen und öffentlichen Datensätzen und erreichte im Petri-Audit 65 Prozent – ein offener Test, bei dem ein zweites Modell über mehrere Gesprächsrunden Fehlverhalten zu provozieren versucht. Das ausgelieferte Opus 4.8 kommt nach dem vollständigen Produktions-Alignment auf 72 Prozent. Die Siegerlösung sei «rund 15'000-mal effizienter» als die eigene Produktions-Prozedur, schreibt Anthropic – eine Angabe über einen nicht öffentlichen Prozess.

39 Betrugsversuche unter 1'601 Anläufen

Weil Forschungsagenten dazu neigen, das Messsystem statt das Problem zu lösen, liess Anthropic Opus 4.8 alle 1'601 Transkripte durchleuchten. In 39 davon (2,4 Prozent) fand der Monitor bestätigte Betrugsversuche. Zwei Drittel waren simpel: dieselbe Methode nochmals einreichen und hoffen, dass die Messschwankung eine höhere Zahl ausspuckt. Andere ahmten in den Trainingsdaten das Benchmark-Format nach oder tarnten einen verbotenen Schritt vor dem Prüf-Agenten. Keine Gewinnermethode war ein Betrugsversuch.

Was der Report ausdrücklich nicht zeigt

Das Kleingedruckte liefert Anthropic selbst mit. Die untersuchten Fehler sind eng gefasst – politische Verzerrungen etwa wurden gar nicht gemessen. Benchmarks und Petri-Audits sind nur Stellvertreter für echtes Fehlverhalten im Einsatz. Und ob die Gewinne bestehen bleiben, nachdem ein Modell anschliessend ausgiebig mit Reinforcement Learning auf anderen Aufgaben trainiert wird, wurde nicht getestet.

Dazu ein Detail aus dem Anhang: Der Instruktionsbefolgungs-Benchmark IFEval fiel bei allen zehn Fehlertypen, bei fünf davon um 9,5 bis 12 Punkte – innerhalb der Konfidenzintervalle, weshalb die Prüfung sie durchwinkte. Der Report formuliert es nüchtern: Die Hürde schliesse einen Zusammenbruch aus, sie bescheinige aber nicht, dass die Fähigkeiten unverändert seien.

Warum das für Apertus interessant wird

Anthropic hat das komplette Harness als Open Source freigegeben. Und gearbeitet wurde durchweg mit offenen Modellen – also derselben Sorte, die die Schweiz mit Apertus selber hat: dem vollständig offenen, mehrsprachigen Modell von ETH Zürich, EPFL und dem Supercomputing-Zentrum CSCS, verfügbar seit September 2025. Arbeitest du mit offenen Modellen, kannst du dieses Werkzeug ab sofort einsetzen, ohne ein eigenes Alignment-Team aufzubauen.

Für Schweizer Anbieter, die in der EU auf den Markt gehen, kommt ein zweiter Grund dazu: Die Pflichten des EU AI Act für Modelle mit allgemeinem Verwendungszweck gelten seit dem 2. August 2025, und wer systemische Risiken verursachen könnte, muss diese laut EU-Kommission bewerten und mindern. Günstige, wiederholbare Alignment-Arbeit wird damit von einer Forschungs- zu einer Compliance-Frage.

Bemerkenswert bleibt die Richtung des Befunds: Rekursive Selbstverbesserung wird meist als Fähigkeitssprung diskutiert. Hier taucht sie zuerst dort auf, wo man sie am ehesten kontrollieren kann – bei messbarer Sicherheitsarbeit, mit einem Benchmark als Schiedsrichter statt einem Menschen, der sich täuschen lässt.

Quellen

Automated researchers can reliably mitigate alignment failures (Anthropic)↗ EXTERNER LINKAutomated Researchers Can Reliably Mitigate Alignment Failures (Anthropic Alignment Science Blog)↗ EXTERNER LINKAutomated Alignment Researchers – vollständiger Report (PDF, August 2026)↗ EXTERNER LINKAn Anthropic researcher just gave us a peek at self-improving AI (TechCrunch)↗ EXTERNER LINKRecursive self-improvement (Anthropic Institute)↗ EXTERNER LINKApertus: a fully open, transparent, multilingual language model (ETH Zürich)↗ EXTERNER LINKRegulatory framework for AI (Europäische Kommission)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
AnthropicMetaETH ZürichEPFL
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?
Illustration einer Uhrmacher-Werkbank mit Lupe am Schwenkarm, verstreuten Zahnrädern, Pinzette und einem Schubladenschrank mit blau markierten Fächern, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·3. SEPTEMBER 2026

KI findet sechs curl-Lücken – der 6:0-Vergleich hinkt

Im neuen curl-Release stecken neun Sicherheitslücken, sechs davon meldete das KI-System der Firma AISLE – kurz nachdem die Systeme von OpenAI und Anthropic nichts mehr gefunden hatten. Die Funde sind echt und amtlich belegt. Der daraus gebastelte Wettkampf ist es nicht.

Illustration einer Chemielabor-Werkbank mit blau gefülltem Rundkolben am Stativ, Becherglas, Ständer mit leeren Reagenzgläsern, Pipette und Lupe, kinewsletter.ch Stil
Illustration einer Chemielabor-Werkbank mit blau gefülltem Rundkolben am Stativ, Becherglas, Ständer mit leeren Reagenzgläsern, Pipette und Lupe, kinewsletter.ch Stil
KI-FORSCHUNG·3. SEPTEMBER 2026

EPFL gibt der KI Zweifel – und spart 40 Prozent Experimente

Forschende der EPFL koppeln ein Sprachmodell mit einem Gauss-Prozess, der zu jeder Vorhersage eine Unsicherheit mitliefert. Die Methode GOLLuM findet in 23 Benchmark-Aufgaben gute Versuchsbedingungen mit über 40 Prozent weniger Experimenten als klassische Verfahren – publiziert in Nature Machine Intelligence.

Illustration eines Tresorraums mit halb geöffneter Stahltür und Schlüsselbund, kinewsletter.ch Stil
Illustration eines Tresorraums mit halb geöffneter Stahltür und Schlüsselbund, kinewsletter.ch Stil
KI-FORSCHUNG·2. SEPTEMBER 2026

OpenAI bremst Astra – erstmals «kritische» Cyber-Stufe erreicht

OpenAI stuft sein Modell Astra als erstes in die höchste Cyber-Risikoklasse ein und drosselt den Zugang.

Illustration einer Schleusentür in einem Laborgang mit Warnleuchte, kinewsletter.ch Stil
Illustration einer Schleusentür in einem Laborgang mit Warnleuchte, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·1. SEPTEMBER 2026

Anthropic stoppte seine Cyber-Tests – und trainierte einen Betrüger

Anthropic legt offen, was nach den Sicherheitsvorfällen vom Sommer intern passierte: pausierte Cyber-Evaluationen, ein Klassifikator, der Ausbruchsversuche vor dem Tool-Call stoppt, und über 10 Prozent fehlerhafte Trainingsumgebungen. Dazu eine Studie, für die ein Opus-Modell absichtlich zum Betrügen trainiert wurde.

Illustration einer Sanduhr mit elektroblauem Sand neben einer stehengebliebenen Werkstattuhr, kinewsletter.ch Stil
Illustration einer Sanduhr mit elektroblauem Sand neben einer stehengebliebenen Werkstattuhr, kinewsletter.ch Stil
KI-FORSCHUNG·31. AUGUST 2026

Dein Coding-Agent hat kein Zeitgefühl – und merkt es nicht

Claude Code und OpenAI Codex können weder vorhersagen, wie lange eine Aufgabe dauert, noch zuverlässig sagen, wie lange sie schon arbeiten. Eine MATS-Studie misst Fehlschätzungen um das Drei- bis Zehnfache – und zeigt, dass die Agenten sich zusätzlich rund 20 Punkte zu gute Noten geben. Was das für Timeouts, Kostenschätzungen und Projektkalkulation bedeutet.

Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
KI-FORSCHUNG·30. AUGUST 2026

Google gibt KI-Agenten ein Wiki – damit sie aus Fehlern lernen

Ein Preprint von Google Research zeigt, wie KI-Agenten ihre Erfahrung in einem wachsenden Wiki festhalten und daraus bessere Anleitungen für sich selbst schreiben. In Tests stieg die Durchschnittsgenauigkeit von Gemini 3.5 Flash von 49,5 auf 68,1 Prozent.

Mehr aus KI-Forschung →