NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Google gibt KI-Agenten ein Wiki – damit sie aus Fehlern lernen

Ein Preprint von Google Research zeigt, wie KI-Agenten ihre Erfahrung in einem wachsenden Wiki festhalten und daraus bessere Anleitungen für sich selbst schreiben. In Tests stieg die Durchschnittsgenauigkeit von Gemini 3.5 Flash von 49,5 auf 68,1 Prozent.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
30. AUGUST 2026
4 MIN. LESEZEIT
Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
INHALT
01Jeden Morgen ein neuer Praktikant02Drei Schichten statt einem Notizzettel039 Milliarden schlagen 27 Milliarden04Skills, die den Besitzer wechseln05Vielversprechend, aber noch nicht abgeholt
INHALT
01Jeden Morgen ein neuer Praktikant02Drei Schichten statt einem Notizzettel039 Milliarden schlagen 27 Milliarden04Skills, die den Besitzer wechseln05Vielversprechend, aber noch nicht abgeholt
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Nicht das grössere Modell bringt den Sprung, sondern besser gepflegte Anleitungen: Ein 9B-Modell mit WikiSkill-Skills schlägt ein 27B-Modell ohne.

Forschende von Google Research haben am 27. August 2026 einen Preprint veröffentlicht, der KI-Agenten das Vergessen abgewöhnen soll. Das Verfahren heisst WikiSkill und sammelt die Erfahrung eines Agenten nach jedem Durchlauf in einer wachsenden Wissenssammlung – einem Wiki –, aus der der Agent laufend bessere Arbeitsanleitungen für sich selbst schreibt. In Tests über fünf Benchmarks und fünf Modelle hob das Verfahren die Durchschnittsgenauigkeit von Gemini 3.5 Flash von 49,5 auf 68,1 Prozent. Begutachtet wurde die Arbeit noch nicht.

Jeden Morgen ein neuer Praktikant

Ein KI-Agent ist ein Programm, das eine Aufgabe in mehreren Schritten abarbeitet und dabei Werkzeuge benutzt: suchen, rechnen, eine Datei öffnen, ein Ergebnis prüfen. Dabei lernt er eine Menge – welcher Weg funktioniert und welcher in die Sackgasse führt. Nur: Am Ende des Laufs ist das alles weg. Beim dritten Mal erklärst du wieder, dass die Preise in der zweiten Tabellenspalte stehen.

Wichtig ist dabei die Unterscheidung: Es geht nicht um klassisches Memory, also einen Gesprächsspeicher, der dem Modell Kontext nachschiebt. Es geht um Skills – nachlesbare Anleitungen im Markdown-Format, die zwischen Läufen bestehen bleiben und die du als Mensch öffnen, prüfen und korrigieren kannst.

Drei Schichten statt einem Notizzettel

Laut dem Paper trennt WikiSkill den Arbeitsplatz des Agenten in drei Ebenen: unveränderliche Protokolle jedes Laufs, ein daraus destilliertes Wiki mit dokumentierten Fehlermustern und erfolgreichen Strategien, und zuoberst die aktiven Anleitungen. Die mittlere Ebene wird nie zurückgesetzt, sie wächst nur.

WEITERLESENDas könnte dich auch interessieren.

Illustration einer Uhrmacher-Werkbank mit Lupe am Schwenkarm, verstreuten Zahnrädern, Pinzette und einem Schubladenschrank mit blau markierten Fächern, kinewsletter.ch Stil

Dazwischen laufen drei Rollen im Kreis: Ein Agent erledigt die Aufgaben, ein «Wiki Maintainer» wertet die Protokolle aus, ein «Skill Proposer» leitet daraus eine konkrete Änderung an einer Anleitung ab. Ein Gate prüft an einem separaten Testset, ob die Änderung wirklich hilft – wenn nicht, wird der Skill zurückgerollt. Das Wiki bleibt trotzdem stehen, auch gescheiterte Versuche sind dokumentiert und werden nicht zweimal probiert.

Das Format ist dabei kein Google-Sonderweg: Es sind Ordner mit einer SKILL.md-Datei – genau der offene Standard, den Anthropic für Agent Skills publiziert hat. Die Wiki-Idee stammt laut The Decoder aus einem Gedankenexperiment von Andrej Karpathy zum «LLM Wiki», das der Preprint auch selbst zitiert.

9 Milliarden schlagen 27 Milliarden

Die interessanteste Zahl steckt im Vergleich der Modellgrössen. Qwen-3.5-9B mit WikiSkill-Skills kommt im Schnitt auf 47,4 Prozent – und liegt damit vor Qwen-3.6-27B ohne Skills mit 39,4 Prozent. Ein Modell mit rund einem Drittel der Parameter schlägt das grössere, nur weil es bessere Anleitungen mitbekommt.

Dass wirklich das dauerhafte Wiki den Unterschied macht und nicht bloss die Schleife an sich, zeigt der Ablationstest: Ohne Zugriff auf das persistente Wiki sinkt der Schnitt über vier Benchmarks von 63,7 auf 48,7 Prozent.

Der Haken: Die Gewinne sind ungleich verteilt. Bei Tabellenkalkulation legte Qwen-3.6-27B um 40,9 Punkte zu, bei Fragen an lange Dokumente sind die Zuwächse klein – und das kleinste getestete Modell wurde dort sogar leicht schlechter (30,2 auf 28,5 Prozent).

Skills, die den Besitzer wechseln

Die zweite Überraschung: Die entwickelten Anleitungen sind übertragbar, auch über Modellfamilien hinweg. Gemma-4-31B erreicht bei den Matheaufgaben mit selbst entwickelten Skills 56,7 Prozent, mit Skills von Qwen-3.6-27B dagegen 73,7 Prozent. Fremdes Wissen schlägt hier das eigene.

Verlassen kann man sich darauf nicht. In der Gegenrichtung geht es auch schief: Gemini 3.5 Flash fällt bei Tabellenkalkulation mit Skills des kleinen Qwen-3.5-4B von 50,5 auf 18,1 Prozent ab. Anleitungen, die Schwächen eines bestimmten Modells umgehen, können bei einem anderen aktiv schaden.

Vielversprechend, aber noch nicht abgeholt

Bleib nüchtern beim Einordnen. Das ist ein Preprint ohne Peer Review, ein öffentliches Code-Repository ist im Papier nicht verlinkt, und die Autoren nennen ihre Grenzen selbst: Die Skills wurden vollständig in den Prompt geschrieben – ob ein Agent unter vielen Skills den richtigen findet, wurde gar nicht getestet. Das Wiki wächst zudem unbegrenzt, ein Aufräum-Mechanismus fehlt.

Trotzdem ist die Richtung praktisch relevant. Wer in der Schweiz aus Datenschutzgründen lieber ein kleineres Open-Weight-Modell im eigenen oder einem hiesigen Rechenzentrum betreibt statt ein Frontier-Modell aus der Cloud, findet hier den interessanteren Hebel: nicht das nächstgrössere Modell kaufen, sondern die Arbeitsanleitungen systematisch pflegen. Und weil das simple Markdown-Dateien sind, kannst du sie lesen, versionieren und im Zweifel selbst korrigieren – ein Vorteil, den ein undurchsichtiger Gedächtnisspeicher nicht bietet.

Für dich heisst das konkret: Wenn dein Agent denselben Fehler zum dritten Mal macht, ist das kein Modellproblem, sondern ein Dokumentationsproblem.

Quellen

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution (arXiv)↗ EXTERNER LINKWikiSkill – Volltext (arXiv HTML)↗ EXTERNER LINKWikiSkill – Paper page (Hugging Face)↗ EXTERNER LINKGoogle's WikiSkill gives AI agents a persistent memory of past mistakes (The Decoder)↗ EXTERNER LINKAndrej Karpathy: LLM Wiki (GitHub Gist)↗ EXTERNER LINKEquipping agents for the real world with Agent Skills (Anthropic Engineering)↗ EXTERNER LINKAgent Skills – offener Standard↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
GoogleAnthropic
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?
Illustration einer Uhrmacher-Werkbank mit Lupe am Schwenkarm, verstreuten Zahnrädern, Pinzette und einem Schubladenschrank mit blau markierten Fächern, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·3. SEPTEMBER 2026

KI findet sechs curl-Lücken – der 6:0-Vergleich hinkt

Im neuen curl-Release stecken neun Sicherheitslücken, sechs davon meldete das KI-System der Firma AISLE – kurz nachdem die Systeme von OpenAI und Anthropic nichts mehr gefunden hatten. Die Funde sind echt und amtlich belegt. Der daraus gebastelte Wettkampf ist es nicht.

Illustration einer Chemielabor-Werkbank mit blau gefülltem Rundkolben am Stativ, Becherglas, Ständer mit leeren Reagenzgläsern, Pipette und Lupe, kinewsletter.ch Stil
Illustration einer Chemielabor-Werkbank mit blau gefülltem Rundkolben am Stativ, Becherglas, Ständer mit leeren Reagenzgläsern, Pipette und Lupe, kinewsletter.ch Stil
KI-FORSCHUNG·3. SEPTEMBER 2026

EPFL gibt der KI Zweifel – und spart 40 Prozent Experimente

Forschende der EPFL koppeln ein Sprachmodell mit einem Gauss-Prozess, der zu jeder Vorhersage eine Unsicherheit mitliefert. Die Methode GOLLuM findet in 23 Benchmark-Aufgaben gute Versuchsbedingungen mit über 40 Prozent weniger Experimenten als klassische Verfahren – publiziert in Nature Machine Intelligence.

Illustration eines Tresorraums mit halb geöffneter Stahltür und Schlüsselbund, kinewsletter.ch Stil
Illustration eines Tresorraums mit halb geöffneter Stahltür und Schlüsselbund, kinewsletter.ch Stil
KI-FORSCHUNG·2. SEPTEMBER 2026

OpenAI bremst Astra – erstmals «kritische» Cyber-Stufe erreicht

OpenAI stuft sein Modell Astra als erstes in die höchste Cyber-Risikoklasse ein und drosselt den Zugang.

Illustration einer Schleusentür in einem Laborgang mit Warnleuchte, kinewsletter.ch Stil
Illustration einer Schleusentür in einem Laborgang mit Warnleuchte, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·1. SEPTEMBER 2026

Anthropic stoppte seine Cyber-Tests – und trainierte einen Betrüger

Anthropic legt offen, was nach den Sicherheitsvorfällen vom Sommer intern passierte: pausierte Cyber-Evaluationen, ein Klassifikator, der Ausbruchsversuche vor dem Tool-Call stoppt, und über 10 Prozent fehlerhafte Trainingsumgebungen. Dazu eine Studie, für die ein Opus-Modell absichtlich zum Betrügen trainiert wurde.

Illustration einer Sanduhr mit elektroblauem Sand neben einer stehengebliebenen Werkstattuhr, kinewsletter.ch Stil
Illustration einer Sanduhr mit elektroblauem Sand neben einer stehengebliebenen Werkstattuhr, kinewsletter.ch Stil
KI-FORSCHUNG·31. AUGUST 2026

Dein Coding-Agent hat kein Zeitgefühl – und merkt es nicht

Claude Code und OpenAI Codex können weder vorhersagen, wie lange eine Aufgabe dauert, noch zuverlässig sagen, wie lange sie schon arbeiten. Eine MATS-Studie misst Fehlschätzungen um das Drei- bis Zehnfache – und zeigt, dass die Agenten sich zusätzlich rund 20 Punkte zu gute Noten geben. Was das für Timeouts, Kostenschätzungen und Projektkalkulation bedeutet.

Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
KI-FORSCHUNG·30. AUGUST 2026

Claude repariert seine eigenen Alignment-Fehler – für 4 Dollar pro Stunde

Anthropic liess Claude als Sicherheitsforscher arbeiten: Das Modell entwarf selbstständig Trainingsmethoden gegen zehn Arten von Fehlverhalten – von Täuschung bis Jailbreaks – und schlug dabei die Vorschläge von 28 erfahrenen menschlichen Forschenden. Der Report nennt auch den Preis: 4 Dollar pro Stunde statt 150.

Mehr aus KI-Forschung →