NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Google gibt KI-Agenten ein Wiki – damit sie aus Fehlern lernen

Ein Preprint von Google Research zeigt, wie KI-Agenten ihre Erfahrung in einem wachsenden Wiki festhalten und daraus bessere Anleitungen für sich selbst schreiben. In Tests stieg die Durchschnittsgenauigkeit von Gemini 3.5 Flash von 49,5 auf 68,1 Prozent.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
30. AUGUST 2026
4 MIN. LESEZEIT
Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
Skizze eines Bibliotheks-Zettelkastens mit drei offenen Schubladen, Schreibtischlampe und Kartenstapel, kinewsletter.ch Stil
INHALT
01Jeden Morgen ein neuer Praktikant02Drei Schichten statt einem Notizzettel039 Milliarden schlagen 27 Milliarden04Skills, die den Besitzer wechseln05Vielversprechend, aber noch nicht abgeholt
INHALT
01Jeden Morgen ein neuer Praktikant02Drei Schichten statt einem Notizzettel039 Milliarden schlagen 27 Milliarden04Skills, die den Besitzer wechseln05Vielversprechend, aber noch nicht abgeholt
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Nicht das grössere Modell bringt den Sprung, sondern besser gepflegte Anleitungen: Ein 9B-Modell mit WikiSkill-Skills schlägt ein 27B-Modell ohne.

Forschende von Google Research haben am 27. August 2026 einen Preprint veröffentlicht, der KI-Agenten das Vergessen abgewöhnen soll. Das Verfahren heisst WikiSkill und sammelt die Erfahrung eines Agenten nach jedem Durchlauf in einer wachsenden Wissenssammlung – einem Wiki –, aus der der Agent laufend bessere Arbeitsanleitungen für sich selbst schreibt. In Tests über fünf Benchmarks und fünf Modelle hob das Verfahren die Durchschnittsgenauigkeit von Gemini 3.5 Flash von 49,5 auf 68,1 Prozent. Begutachtet wurde die Arbeit noch nicht.

Jeden Morgen ein neuer Praktikant

Ein KI-Agent ist ein Programm, das eine Aufgabe in mehreren Schritten abarbeitet und dabei Werkzeuge benutzt: suchen, rechnen, eine Datei öffnen, ein Ergebnis prüfen. Dabei lernt er eine Menge – welcher Weg funktioniert und welcher in die Sackgasse führt. Nur: Am Ende des Laufs ist das alles weg. Beim dritten Mal erklärst du wieder, dass die Preise in der zweiten Tabellenspalte stehen.

Wichtig ist dabei die Unterscheidung: Es geht nicht um klassisches Memory, also einen Gesprächsspeicher, der dem Modell Kontext nachschiebt. Es geht um Skills – nachlesbare Anleitungen im Markdown-Format, die zwischen Läufen bestehen bleiben und die du als Mensch öffnen, prüfen und korrigieren kannst.

Drei Schichten statt einem Notizzettel

Laut dem Paper trennt WikiSkill den Arbeitsplatz des Agenten in drei Ebenen: unveränderliche Protokolle jedes Laufs, ein daraus destilliertes Wiki mit dokumentierten Fehlermustern und erfolgreichen Strategien, und zuoberst die aktiven Anleitungen. Die mittlere Ebene wird nie zurückgesetzt, sie wächst nur.

WEITERLESENDas könnte dich auch interessieren.

Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil

Dazwischen laufen drei Rollen im Kreis: Ein Agent erledigt die Aufgaben, ein «Wiki Maintainer» wertet die Protokolle aus, ein «Skill Proposer» leitet daraus eine konkrete Änderung an einer Anleitung ab. Ein Gate prüft an einem separaten Testset, ob die Änderung wirklich hilft – wenn nicht, wird der Skill zurückgerollt. Das Wiki bleibt trotzdem stehen, auch gescheiterte Versuche sind dokumentiert und werden nicht zweimal probiert.

Das Format ist dabei kein Google-Sonderweg: Es sind Ordner mit einer SKILL.md-Datei – genau der offene Standard, den Anthropic für Agent Skills publiziert hat. Die Wiki-Idee stammt laut The Decoder aus einem Gedankenexperiment von Andrej Karpathy zum «LLM Wiki», das der Preprint auch selbst zitiert.

9 Milliarden schlagen 27 Milliarden

Die interessanteste Zahl steckt im Vergleich der Modellgrössen. Qwen-3.5-9B mit WikiSkill-Skills kommt im Schnitt auf 47,4 Prozent – und liegt damit vor Qwen-3.6-27B ohne Skills mit 39,4 Prozent. Ein Modell mit rund einem Drittel der Parameter schlägt das grössere, nur weil es bessere Anleitungen mitbekommt.

Dass wirklich das dauerhafte Wiki den Unterschied macht und nicht bloss die Schleife an sich, zeigt der Ablationstest: Ohne Zugriff auf das persistente Wiki sinkt der Schnitt über vier Benchmarks von 63,7 auf 48,7 Prozent.

Der Haken: Die Gewinne sind ungleich verteilt. Bei Tabellenkalkulation legte Qwen-3.6-27B um 40,9 Punkte zu, bei Fragen an lange Dokumente sind die Zuwächse klein – und das kleinste getestete Modell wurde dort sogar leicht schlechter (30,2 auf 28,5 Prozent).

Skills, die den Besitzer wechseln

Die zweite Überraschung: Die entwickelten Anleitungen sind übertragbar, auch über Modellfamilien hinweg. Gemma-4-31B erreicht bei den Matheaufgaben mit selbst entwickelten Skills 56,7 Prozent, mit Skills von Qwen-3.6-27B dagegen 73,7 Prozent. Fremdes Wissen schlägt hier das eigene.

Verlassen kann man sich darauf nicht. In der Gegenrichtung geht es auch schief: Gemini 3.5 Flash fällt bei Tabellenkalkulation mit Skills des kleinen Qwen-3.5-4B von 50,5 auf 18,1 Prozent ab. Anleitungen, die Schwächen eines bestimmten Modells umgehen, können bei einem anderen aktiv schaden.

Vielversprechend, aber noch nicht abgeholt

Bleib nüchtern beim Einordnen. Das ist ein Preprint ohne Peer Review, ein öffentliches Code-Repository ist im Papier nicht verlinkt, und die Autoren nennen ihre Grenzen selbst: Die Skills wurden vollständig in den Prompt geschrieben – ob ein Agent unter vielen Skills den richtigen findet, wurde gar nicht getestet. Das Wiki wächst zudem unbegrenzt, ein Aufräum-Mechanismus fehlt.

Trotzdem ist die Richtung praktisch relevant. Wer in der Schweiz aus Datenschutzgründen lieber ein kleineres Open-Weight-Modell im eigenen oder einem hiesigen Rechenzentrum betreibt statt ein Frontier-Modell aus der Cloud, findet hier den interessanteren Hebel: nicht das nächstgrössere Modell kaufen, sondern die Arbeitsanleitungen systematisch pflegen. Und weil das simple Markdown-Dateien sind, kannst du sie lesen, versionieren und im Zweifel selbst korrigieren – ein Vorteil, den ein undurchsichtiger Gedächtnisspeicher nicht bietet.

Für dich heisst das konkret: Wenn dein Agent denselben Fehler zum dritten Mal macht, ist das kein Modellproblem, sondern ein Dokumentationsproblem.

Quellen

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution (arXiv)↗ EXTERNER LINKWikiSkill – Volltext (arXiv HTML)↗ EXTERNER LINKWikiSkill – Paper page (Hugging Face)↗ EXTERNER LINKGoogle's WikiSkill gives AI agents a persistent memory of past mistakes (The Decoder)↗ EXTERNER LINKAndrej Karpathy: LLM Wiki (GitHub Gist)↗ EXTERNER LINKEquipping agents for the real world with Agent Skills (Anthropic Engineering)↗ EXTERNER LINKAgent Skills – offener Standard↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
GoogleAnthropic
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?
Skizze eines kalibrierten Gyroskops auf einer Laborwerkbank mit Messschieber und Messuhr, kinewsletter.ch Stil
KI-FORSCHUNG·30. AUGUST 2026

Claude repariert seine eigenen Alignment-Fehler – für 4 Dollar pro Stunde

Anthropic liess Claude als Sicherheitsforscher arbeiten: Das Modell entwarf selbstständig Trainingsmethoden gegen zehn Arten von Fehlverhalten – von Täuschung bis Jailbreaks – und schlug dabei die Vorschläge von 28 erfahrenen menschlichen Forschenden. Der Report nennt auch den Preis: 4 Dollar pro Stunde statt 150.

Illustration eines Tresors mit zwei Schlüssellöchern, zwei getrennt liegenden Schlüsseln und einem versiegelten Umschlag, kinewsletter.ch Stil
Illustration eines Tresors mit zwei Schlüssellöchern, zwei getrennt liegenden Schlüsseln und einem versiegelten Umschlag, kinewsletter.ch Stil
KI-FORSCHUNG·28. AUGUST 2026

Google lässt Gemini prüfen, ohne die Fragen zu sehen

DeepMind liess Gemini 2.5 Flash Lite erstmals doppelblind prüfen: Die Prüfer sahen die Modellgewichte nicht, Google die Testfragen nicht. Ein Fortschritt – mit offensichtlichem Interessenkonflikt.

Illustration eines Roboterarms, der einen Stapel Probenplatten über eine Laborbank mit Mikroskop hebt, kinewsletter.ch Stil
Illustration eines Roboterarms, der einen Stapel Probenplatten über eine Laborbank mit Mikroskop hebt, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·28. AUGUST 2026

Anthropic lässt KI-Agenten Laborgeräte steuern – vorerst nur auf Einladung

Anthropic hat den Model Hardware Standard als Research Preview gestartet – eine Spezifikation, mit der KI-Agenten Mikroskope, Pipettierroboter und Roboterarme gleichzeitig bedienen. Erste Partner hängten ihre Geräte in acht Stunden statt mehreren Wochen zusammen. Open Source ist angekündigt, bisher gibt es nur eine Warteliste.

Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
KI-FORSCHUNG·24. AUGUST 2026

Inherents Faraday schlägt Claude und GPT-5.5 – im eigenen Test

Das Londoner Lab Inherent hat einen Agenten mit 27 Milliarden Parametern gebaut, der publizierte Forschung nachbaut – und dabei laut eigenen Messungen Claude Opus 4.8 und GPT-5.5 schlägt. Der Trick: Der kleine Agent dirigiert den grossen. Eine unabhängige Nachprüfung steht aus.

Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
KI-FORSCHUNG·23. AUGUST 2026

Nvidia zeigt: Das Gerüst schlägt das Modell

Nvidias Forschungssystem AVO holt mit Claude Opus 5 einen perfekten Score von 100,00 auf dem öffentlichen Set des Benchmarks ARC-AGI-3. Dasselbe Modell allein kommt auf 30,16 Prozent. Den Unterschied macht nicht das Modell, sondern der Harness – das Gerüst aus Gedächtnis, Werkzeugen und Aufsicht drumherum.

Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·22. AUGUST 2026

Ein Drittel oder ein Zehntel? Beide Zahlen stimmen

Das Pew Research Center hat 490'000 Webseiten auf KI-Spuren untersucht. Die eine Hälfte der Presse titelt «ein Drittel des Webs», die andere «zehn Prozent». Beide zitieren dieselbe Studie – und beide haben recht. Der Unterschied liegt in einem einzigen Filter.

Mehr aus KI-Forschung →