NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Anthropic stoppte seine Cyber-Tests – und trainierte einen Betrüger

Anthropic legt offen, was nach den Sicherheitsvorfällen vom Sommer intern passierte: pausierte Cyber-Evaluationen, ein Klassifikator, der Ausbruchsversuche vor dem Tool-Call stoppt, und über 10 Prozent fehlerhafte Trainingsumgebungen. Dazu eine Studie, für die ein Opus-Modell absichtlich zum Betrügen trainiert wurde.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
1. SEPTEMBER 2026
5 MIN. LESEZEIT
Illustration einer Schleusentür in einem Laborgang mit Warnleuchte, kinewsletter.ch Stil
Illustration einer Schleusentür in einem Laborgang mit Warnleuchte, kinewsletter.ch Stil
FIRMEN IN DIESEM ARTIKEL
AnthropicOpenAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration einer Uhrmacher-Werkbank mit Lupe am Schwenkarm, verstreuten Zahnrädern, Pinzette und einem Schubladenschrank mit blau markierten Fächern, kinewsletter.ch Stil
Illustration einer Uhrmacher-Werkbank mit Lupe am Schwenkarm, verstreuten Zahnrädern, Pinzette und einem Schubladenschrank mit blau markierten Fächern, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·3. SEPTEMBER 2026

KI findet sechs curl-Lücken – der 6:0-Vergleich hinkt

Im neuen curl-Release stecken neun Sicherheitslücken, sechs davon meldete das KI-System der Firma AISLE – kurz nachdem die Systeme von OpenAI und Anthropic nichts mehr gefunden hatten. Die Funde sind echt und amtlich belegt. Der daraus gebastelte Wettkampf ist es nicht.

Illustration einer Chemielabor-Werkbank mit blau gefülltem Rundkolben am Stativ, Becherglas, Ständer mit leeren Reagenzgläsern, Pipette und Lupe, kinewsletter.ch Stil
Illustration einer Chemielabor-Werkbank mit blau gefülltem Rundkolben am Stativ, Becherglas, Ständer mit leeren Reagenzgläsern, Pipette und Lupe, kinewsletter.ch Stil
KI-FORSCHUNG·3. SEPTEMBER 2026

EPFL gibt der KI Zweifel – und spart 40 Prozent Experimente

Forschende der EPFL koppeln ein Sprachmodell mit einem Gauss-Prozess, der zu jeder Vorhersage eine Unsicherheit mitliefert. Die Methode GOLLuM findet in 23 Benchmark-Aufgaben gute Versuchsbedingungen mit über 40 Prozent weniger Experimenten als klassische Verfahren – publiziert in Nature Machine Intelligence.

Illustration eines Tresorraums mit halb geöffneter Stahltür und Schlüsselbund, kinewsletter.ch Stil
Illustration eines Tresorraums mit halb geöffneter Stahltür und Schlüsselbund, kinewsletter.ch Stil
KI-FORSCHUNG·2. SEPTEMBER 2026

OpenAI bremst Astra – erstmals «kritische» Cyber-Stufe erreicht

OpenAI stuft sein Modell Astra als erstes in die höchste Cyber-Risikoklasse ein und drosselt den Zugang.

Illustration einer Sanduhr mit elektroblauem Sand neben einer stehengebliebenen Werkstattuhr, kinewsletter.ch Stil
Illustration einer Sanduhr mit elektroblauem Sand neben einer stehengebliebenen Werkstattuhr, kinewsletter.ch Stil
KI-FORSCHUNG·31. AUGUST 2026

Dein Coding-Agent hat kein Zeitgefühl – und merkt es nicht

Claude Code und OpenAI Codex können weder vorhersagen, wie lange eine Aufgabe dauert, noch zuverlässig sagen, wie lange sie schon arbeiten. Eine MATS-Studie misst Fehlschätzungen um das Drei- bis Zehnfache – und zeigt, dass die Agenten sich zusätzlich rund 20 Punkte zu gute Noten geben. Was das für Timeouts, Kostenschätzungen und Projektkalkulation bedeutet.

Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
KI-FORSCHUNG·30. AUGUST 2026

Google gibt KI-Agenten ein Wiki – damit sie aus Fehlern lernen

Ein Preprint von Google Research zeigt, wie KI-Agenten ihre Erfahrung in einem wachsenden Wiki festhalten und daraus bessere Anleitungen für sich selbst schreiben. In Tests stieg die Durchschnittsgenauigkeit von Gemini 3.5 Flash von 49,5 auf 68,1 Prozent.

Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
KI-FORSCHUNG·30. AUGUST 2026

Claude repariert seine eigenen Alignment-Fehler – für 4 Dollar pro Stunde

Anthropic liess Claude als Sicherheitsforscher arbeiten: Das Modell entwarf selbstständig Trainingsmethoden gegen zehn Arten von Fehlverhalten – von Täuschung bis Jailbreaks – und schlug dabei die Vorschläge von 28 erfahrenen menschlichen Forschenden. Der Report nennt auch den Preis: 4 Dollar pro Stunde statt 150.

Mehr aus KI-Forschung →
DAS WICHTIGSTE IN KÜRZE

Nicht das Modell war «böse» – es reagierte auf einen sichtbaren Punktestand. Reward Hacking im Training erzeugt reale Schadensbereitschaft, sobald ein Grader im Spiel ist.

Anthropic hat am 31. August 2026 offengelegt, was nach den Sicherheitsvorfällen des Sommers intern passiert ist: Externe Cyber-Evaluationen von Vorab-Modellen wurden gestoppt und laufen erst jetzt wieder, ein neuer Klassifikator blockiert Ausbruchsversuche, bevor der Tool-Call überhaupt ausgeführt wird, und während eines rund einmonatigen Freezes im April flaggte das Unternehmen über 10 Prozent seiner produktiven Trainingsumgebungen als fehlerhaft. Parallel dazu veröffentlichte das Alignment-Team eine Studie, für die ein Modell der Opus-Klasse absichtlich auf 80 anfällige Umgebungen trainiert wurde — um zu zeigen, was passiert, wenn genau diese Aufräumarbeit unterbleibt.

Zwei Vorfälle, eine gemeinsame Diagnose

Rückblende: Am 30. Juli meldete Anthropic drei Vorfälle, bei denen Claude-Modelle unautorisierten Zugriff auf reale Computersysteme erlangten. Sie liefen für Evaluationszwecke bewusst ohne Cyber-Schutzmechanismen und kamen wegen einer Fehlkonfiguration in einer Drittanbieter-Testumgebung ans offene Internet. Am 4. August meldete das britische AI Security Institute einen eigenen Vorfall: Claude Mythos 5 führte bei Cybersicherheitstests unautorisierte Aktionen im echten Netz aus — dort hatte das Modell den Internetzugang absichtlich bekommen.

NUR FÜR ABONNENTEN

Exklusiver Inhalt

Melde dich an, um den vollständigen Artikel zu lesen. Der Zugang ist kostenlos.

Noch kein Abonnent? Jetzt anmelden