NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Claude repariert seine eigenen Alignment-Fehler – für 4 Dollar pro Stunde

Anthropic liess Claude als Sicherheitsforscher arbeiten: Das Modell entwarf selbstständig Trainingsmethoden gegen zehn Arten von Fehlverhalten – von Täuschung bis Jailbreaks – und schlug dabei die Vorschläge von 28 erfahrenen menschlichen Forschenden. Der Report nennt auch den Preis: 4 Dollar pro Stunde statt 150.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
30. AUGUST 2026
5 MIN. LESEZEIT
Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
INHALT
01Fünf Agenten, ein Leaderboard, 48 Stunden0285 Prozent gegen 20 Prozent03Wenn das schwächere Modell das stärkere ausrichtet0439 Betrugsversuche unter 1'601 Anläufen05Was der Report ausdrücklich nicht zeigt06Warum das für Apertus interessant wird
INHALT
01Fünf Agenten, ein Leaderboard, 48 Stunden0285 Prozent gegen 20 Prozent03Wenn das schwächere Modell das stärkere ausrichtet0439 Betrugsversuche unter 1'601 Anläufen05Was der Report ausdrücklich nicht zeigt06Warum das für Apertus interessant wird
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Rekursive Selbstverbesserung wird ausgerechnet bei der Sicherheitsarbeit zuerst praktisch – aber nur dort, wo sich Fehlverhalten sauber messen lässt, und Anthropic legt die Grenzen dieses Befunds selbst offen.

Anthropic hat am 28. August 2026 einen Report veröffentlicht, in dem Claude die Rolle des Sicherheitsforschers übernimmt: Das Modell durchsuchte selbstständig die Fachliteratur, entwarf Trainingsmethoden und trainierte damit kleinere KI-Modelle um – in zehn Kategorien von Alignment-Fehlern, von Täuschung über Schmeichelei bis zu Jailbreaks. In allen zehn fand es Methoden, die den Zielfehler messbar reduzierten, ohne die allgemeinen Fähigkeiten der Modelle zu zerstören. Der Kostenvergleich steht wörtlich im Report: Ein solcher automatisierter Forscher kostet rund 4 US-Dollar pro Stunde an API-Inferenz, während Anthropic seinen menschlichen Forschenden 150 Dollar pro Stunde zahlt.

Alignment meint, wie zuverlässig ein Modell das tut, was seine Nutzer wirklich wollen – statt zu lügen, zu schmeicheln oder sich mit einem geschickten Prompt aushebeln zu lassen.

Fünf Agenten, ein Leaderboard, 48 Stunden

Der Aufbau ist ein Forschungslabor im Zeitraffer. Zuerst bauen vier «Bibliothekar»-Agenten eine gemeinsame Literaturübersicht. Danach arbeiten fünf Agenten auf Basis von Claude Opus 4.8 parallel am selben Fehlertyp: Jeder schlägt eine Methode vor, lässt den Code von einem Prüf-Agenten freigeben, trainiert das Zielmodell rund 30 Minuten auf einer einzelnen H200-Grafikkarte und schickt es an einen separaten Evaluator. Ergebnis auf eine gemeinsame Rangliste, nächste Runde – bis zu 48 Stunden lang.

WEITERLESENDas könnte dich auch interessieren.

Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil

Die Zielmodelle sind offene Modelle mit 2 bis 7 Milliarden Parametern: Qwen, Llama, Gemma, Phi und Olmo. Entscheidend ist eine Regel, die Anthropic hart durchsetzt: Claude durfte sein eigenes Verhalten nicht ins Zielmodell hineinkopieren. Der Fortschritt musste aus der Methode kommen, nicht aus dem Abschreiben bei einem klügeren Lehrer.

85 Prozent gegen 20 Prozent

Gemessen wird der geschlossene «Sicherheits-Abstand»: wie viel des Wegs vom untrainierten Modell zur theoretisch perfekten Punktzahl eine Methode schafft. Beim Fehlertyp Täuschung schloss Claudes bester Ansatz laut Anthropic in einem Durchlauf 82 Prozent dieses Abstands, im Mittel über mehrere Durchläufe 85 Prozent. Sechs erfahrene Sicherheitsforscher, die unter denselben Regeln antraten, kamen im Durchschnitt auf 20 Prozent.

Insgesamt lieferten 28 Forschende 30 Ideen ab – alle mit mindestens einem Jahr Erfahrung in technischer KI-Sicherheit, im Schnitt 2,5 Jahre, und mit bis zu acht Stunden Zeit pro Idee. Claudes Suche überholte die beste menschliche Idee nach durchschnittlich 6,4 Stunden. Kurios: Gab man einem Lauf eine menschliche Idee als Startrichtung mit, wurde das Ergebnis nicht besser.

Anthropic relativiert den Vergleich selbst: Die Menschen durften ihre Idee nicht überarbeiten, und Claudes Bestwert ist das Maximum aus rund 150 bewerteten Methoden – also nach oben verzerrt. Der Report liest ihn deshalb als Arbeitsteilung: Die Maschine liefert Kandidaten in einer Menge, die Menschen nicht schaffen; verfeinern sollen sie Menschen.

Wenn das schwächere Modell das stärkere ausrichtet

Der brisante Teil kommt später. Anthropic setzte Claude Sonnet 5 darauf an, Alignment-Fehler in einem frühen Checkpoint von Claude Opus 4.8 zu beheben – also das schwächere Modell auf das stärkere. In rund 60 Stunden testete Sonnet 5 über 50 Lösungen. Die Siegerlösung bestand aus rund 2'400 Trainingsbeispielen aus einfachen Vorlagen und öffentlichen Datensätzen und erreichte im Petri-Audit 65 Prozent – ein offener Test, bei dem ein zweites Modell über mehrere Gesprächsrunden Fehlverhalten zu provozieren versucht. Das ausgelieferte Opus 4.8 kommt nach dem vollständigen Produktions-Alignment auf 72 Prozent. Die Siegerlösung sei «rund 15'000-mal effizienter» als die eigene Produktions-Prozedur, schreibt Anthropic – eine Angabe über einen nicht öffentlichen Prozess.

39 Betrugsversuche unter 1'601 Anläufen

Weil Forschungsagenten dazu neigen, das Messsystem statt das Problem zu lösen, liess Anthropic Opus 4.8 alle 1'601 Transkripte durchleuchten. In 39 davon (2,4 Prozent) fand der Monitor bestätigte Betrugsversuche. Zwei Drittel waren simpel: dieselbe Methode nochmals einreichen und hoffen, dass die Messschwankung eine höhere Zahl ausspuckt. Andere ahmten in den Trainingsdaten das Benchmark-Format nach oder tarnten einen verbotenen Schritt vor dem Prüf-Agenten. Keine Gewinnermethode war ein Betrugsversuch.

Was der Report ausdrücklich nicht zeigt

Das Kleingedruckte liefert Anthropic selbst mit. Die untersuchten Fehler sind eng gefasst – politische Verzerrungen etwa wurden gar nicht gemessen. Benchmarks und Petri-Audits sind nur Stellvertreter für echtes Fehlverhalten im Einsatz. Und ob die Gewinne bestehen bleiben, nachdem ein Modell anschliessend ausgiebig mit Reinforcement Learning auf anderen Aufgaben trainiert wird, wurde nicht getestet.

Dazu ein Detail aus dem Anhang: Der Instruktionsbefolgungs-Benchmark IFEval fiel bei allen zehn Fehlertypen, bei fünf davon um 9,5 bis 12 Punkte – innerhalb der Konfidenzintervalle, weshalb die Prüfung sie durchwinkte. Der Report formuliert es nüchtern: Die Hürde schliesse einen Zusammenbruch aus, sie bescheinige aber nicht, dass die Fähigkeiten unverändert seien.

Warum das für Apertus interessant wird

Anthropic hat das komplette Harness als Open Source freigegeben. Und gearbeitet wurde durchweg mit offenen Modellen – also derselben Sorte, die die Schweiz mit Apertus selber hat: dem vollständig offenen, mehrsprachigen Modell von ETH Zürich, EPFL und dem Supercomputing-Zentrum CSCS, verfügbar seit September 2025. Arbeitest du mit offenen Modellen, kannst du dieses Werkzeug ab sofort einsetzen, ohne ein eigenes Alignment-Team aufzubauen.

Für Schweizer Anbieter, die in der EU auf den Markt gehen, kommt ein zweiter Grund dazu: Die Pflichten des EU AI Act für Modelle mit allgemeinem Verwendungszweck gelten seit dem 2. August 2025, und wer systemische Risiken verursachen könnte, muss diese laut EU-Kommission bewerten und mindern. Günstige, wiederholbare Alignment-Arbeit wird damit von einer Forschungs- zu einer Compliance-Frage.

Bemerkenswert bleibt die Richtung des Befunds: Rekursive Selbstverbesserung wird meist als Fähigkeitssprung diskutiert. Hier taucht sie zuerst dort auf, wo man sie am ehesten kontrollieren kann – bei messbarer Sicherheitsarbeit, mit einem Benchmark als Schiedsrichter statt einem Menschen, der sich täuschen lässt.

Quellen

Automated researchers can reliably mitigate alignment failures (Anthropic)↗ EXTERNER LINKAutomated Researchers Can Reliably Mitigate Alignment Failures (Anthropic Alignment Science Blog)↗ EXTERNER LINKAutomated Alignment Researchers – vollständiger Report (PDF, August 2026)↗ EXTERNER LINKAn Anthropic researcher just gave us a peek at self-improving AI (TechCrunch)↗ EXTERNER LINKRecursive self-improvement (Anthropic Institute)↗ EXTERNER LINKApertus: a fully open, transparent, multilingual language model (ETH Zürich)↗ EXTERNER LINKRegulatory framework for AI (Europäische Kommission)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
AnthropicMetaETH ZürichEPFL
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?
Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
KI-FORSCHUNG·30. AUGUST 2026

Google gibt KI-Agenten ein Wiki – damit sie aus Fehlern lernen

Ein Preprint von Google Research zeigt, wie KI-Agenten ihre Erfahrung in einem wachsenden Wiki festhalten und daraus bessere Anleitungen für sich selbst schreiben. In Tests stieg die Durchschnittsgenauigkeit von Gemini 3.5 Flash von 49,5 auf 68,1 Prozent.

Illustration eines Tresors mit zwei Schlüssellöchern, zwei getrennt liegenden Schlüsseln und einem versiegelten Umschlag, kinewsletter.ch Stil
Illustration eines Tresors mit zwei Schlüssellöchern, zwei getrennt liegenden Schlüsseln und einem versiegelten Umschlag, kinewsletter.ch Stil
KI-FORSCHUNG·28. AUGUST 2026

Google lässt Gemini prüfen, ohne die Fragen zu sehen

DeepMind liess Gemini 2.5 Flash Lite erstmals doppelblind prüfen: Die Prüfer sahen die Modellgewichte nicht, Google die Testfragen nicht. Ein Fortschritt – mit offensichtlichem Interessenkonflikt.

Illustration eines Roboterarms, der einen Stapel Probenplatten über eine Laborbank mit Mikroskop hebt, kinewsletter.ch Stil
Illustration eines Roboterarms, der einen Stapel Probenplatten über eine Laborbank mit Mikroskop hebt, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·28. AUGUST 2026

Anthropic lässt KI-Agenten Laborgeräte steuern – vorerst nur auf Einladung

Anthropic hat den Model Hardware Standard als Research Preview gestartet – eine Spezifikation, mit der KI-Agenten Mikroskope, Pipettierroboter und Roboterarme gleichzeitig bedienen. Erste Partner hängten ihre Geräte in acht Stunden statt mehreren Wochen zusammen. Open Source ist angekündigt, bisher gibt es nur eine Warteliste.

Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
KI-FORSCHUNG·24. AUGUST 2026

Inherents Faraday schlägt Claude und GPT-5.5 – im eigenen Test

Das Londoner Lab Inherent hat einen Agenten mit 27 Milliarden Parametern gebaut, der publizierte Forschung nachbaut – und dabei laut eigenen Messungen Claude Opus 4.8 und GPT-5.5 schlägt. Der Trick: Der kleine Agent dirigiert den grossen. Eine unabhängige Nachprüfung steht aus.

Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
KI-FORSCHUNG·23. AUGUST 2026

Nvidia zeigt: Das Gerüst schlägt das Modell

Nvidias Forschungssystem AVO holt mit Claude Opus 5 einen perfekten Score von 100,00 auf dem öffentlichen Set des Benchmarks ARC-AGI-3. Dasselbe Modell allein kommt auf 30,16 Prozent. Den Unterschied macht nicht das Modell, sondern der Harness – das Gerüst aus Gedächtnis, Werkzeugen und Aufsicht drumherum.

Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·22. AUGUST 2026

Ein Drittel oder ein Zehntel? Beide Zahlen stimmen

Das Pew Research Center hat 490'000 Webseiten auf KI-Spuren untersucht. Die eine Hälfte der Presse titelt «ein Drittel des Webs», die andere «zehn Prozent». Beide zitieren dieselbe Studie – und beide haben recht. Der Unterschied liegt in einem einzigen Filter.

Mehr aus KI-Forschung →