NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

Google lässt Gemini prüfen, ohne die Fragen zu sehen

DeepMind liess Gemini 2.5 Flash Lite erstmals doppelblind prüfen: Die Prüfer sahen die Modellgewichte nicht, Google die Testfragen nicht. Ein Fortschritt – mit offensichtlichem Interessenkonflikt.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
28. AUGUST 2026
4 MIN. LESEZEIT
Illustration eines Tresors mit zwei Schlüssellöchern, zwei getrennt liegenden Schlüsseln und einem versiegelten Umschlag, kinewsletter.ch Stil
Illustration eines Tresors mit zwei Schlüssellöchern, zwei getrennt liegenden Schlüsseln und einem versiegelten Umschlag, kinewsletter.ch Stil
INHALT
01Wenn der Prüfling die Prüfung schon kennt02Zwei Tresore in einer Kiste03Ein kleines Modell, keine einzige Zahl04Google prüft, hostet und signiert05Warum offene Modelle das Problem gar nicht haben
INHALT
01Wenn der Prüfling die Prüfung schon kennt02Zwei Tresore in einer Kiste03Ein kleines Modell, keine einzige Zahl04Google prüft, hostet und signiert05Warum offene Modelle das Problem gar nicht haben
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Das Verfahren löst ein reales Problem, wird aber von der Partei ausgerichtet, die davon profitiert. Für Schweizer Firmen zählt die praktische Lehre: eigenes, geheimes Testset statt Leaderboard.

Google DeepMind hat am 27. August einen Pilotversuch vorgestellt, den das Unternehmen als weltweit erste doppelblinde Evaluation eines kommerziellen KI-Modells bezeichnet: Externe Prüfer testeten Gemini 2.5 Flash Lite in einer hardware-verschlüsselten Rechenkammer – sie bekamen die Modellgewichte nie zu sehen, und Google bekam die geheimen Testfragen nie zu sehen. Beteiligt waren das Singapore AI Safety Institute, die Organisationen OpenMined und AVERI sowie das Benchmark-Konsortium MLCommons. Es geht um ein Problem, das jede Modell-Rangliste betrifft, die du liest.

Wenn der Prüfling die Prüfung schon kennt

Benchmarks sind Prüfungen für KI-Modelle. Und wie bei jeder Prüfung ist die Note wertlos, wenn der Kandidat die Fragen vorher gesehen hat. Fachleute nennen das Benchmark-Contamination: Testfragen landen – absichtlich oder versehentlich – in den Trainingsdaten.

Das ist keine Theorie. Eine von Google selbst zitierte Untersuchung fand bei rund der Hälfte von 31 geprüften Modellen Hinweise auf durchgesickerte Benchmark-Daten; eine Nachfolgestudie von 2026 zeigt, dass die Verzerrung mit der Modellgrösse wächst. Und das Paper «The Leaderboard Illusion» dokumentierte, wie ein Frontier-Labor 27 private Modellvarianten auf der Vergleichsplattform Chatbot Arena testete – und danach nur die beste veröffentlichte.

Der Haken bei geschlossenen Modellen: Wer sie prüfen will, muss seine Fragen durch die API des Anbieters schicken. Damit sieht der Anbieter sie im Klartext. Die Alternative wäre, dass er seine Gewichte herausgibt – was laut dem technischen Bericht zu diesem Zweck noch nie ein externer Prüfer im Klartext erhalten hat.

Zwei Tresore in einer Kiste

Das neue Verfahren löst den Konflikt mit Hardware statt mit Verträgen. Die Modellgewichte fliessen verschlüsselt in den Speicher einer NVIDIA-H100-Grafikkarte, die Testfragen in den per Intel-Technik verschlüsselten Arbeitsspeicher desselben Rechners. Beide Seiten prüfen vorher kryptografisch nach, welche Software dort läuft, und müssen den Code der jeweils anderen freigeben. Nach dem Lauf gehen nur zusammengefasste Ergebnisse hinaus, die Kammer wird gelöscht.

Der Rechenaufwand dafür liegt laut Bericht bei unter 5 Prozent. Der eigentliche Engpass sei ein anderer, schreiben die Autoren: Juristische Vereinbarungen und gegenseitige Code-Reviews zwischen den Organisationen.

Ein kleines Modell, keine einzige Zahl

Hier lohnt der genaue Blick. Geprüft wurde Gemini 2.5 Flash Lite – ein kleines, günstiges Modell einer älteren Generation, nicht Googles aktuelles Spitzenprodukt. Und veröffentlicht wurde kein einziger Punktwert. Der Pilot zeigt, wie getestet wurde, nicht wie gut Gemini abschnitt.

Auch der Superlativ verdient eine Fussnote. Im Blogpost heisst es «weltweit erste», im technischen Bericht deutlich vorsichtiger «nach unserem besten Wissen». Denn 2024 hatte OpenMined dieselbe Technik bereits mit dem britischen AI Safety Institute und Anthropic erprobt – damals nur mit GPT-2 und einer Fünf-Zeilen-Stichprobe. Neu ist der Umfang und die gegenseitige Geheimhaltung, nicht die Idee.

Google prüft, hostet und signiert

Der Interessenkonflikt liegt offen: Google stellt das Modell, die Cloud und den Blogpost. Bemerkenswert ist, dass der technische Bericht ihn selbst einräumt. Nicht der gesamte Gemini-Code liess sich offenlegen – AVERI wurde informiert und akzeptierte den Aufbau trotzdem. Die einzelnen Software-Builds sind nicht unabhängig nachbaubar. Und wörtlich, hier übersetzt:

Wir verlassen uns auf Googles Dienste, um den Attestierungsbericht zu signieren und zu verifizieren, was Google in den Verifikationspfad stellt und damit das nötige Vertrauen in Google erhöht.

Das Verfahren reduziert also, wie viel man Google glauben muss. Es schafft das Vertrauen nicht ab, sondern verschiebt es auf Hardware-Hersteller und Cloud-Betreiber.

Warum offene Modelle das Problem gar nicht haben

Für dich ist die praktische Lehre wichtiger als die Kryptografie. Der Bericht hält selbst fest, dass die ganze Übung bei Modellen mit offenen Gewichten entfällt: herunterladen, auf eigener Infrastruktur testen, fertig. Genau so funktioniert Apertus, das Modell von ETH Zürich, EPFL und dem CSCS – Gewichte, Trainingsdaten und Code sind öffentlich.

Wählst du in einem Schweizer Unternehmen ein Modell aus, gilt dieselbe Konsequenz wie bei Optima vor elf Tagen und bei Inherents Faraday vor vier: Bau dir ein eigenes Testset aus echten Aufgaben deines Betriebs, halte es unter Verschluss und veröffentliche es nie. Eine öffentliche Rangliste sagt dir, wer gut Prüfungen schreibt. Deine eigenen Fälle sagen dir, wer deine Arbeit erledigt.

Quellen

Piloting the world's first double-blind AI evaluations (Google DeepMind)↗ EXTERNER LINKDouble-blind evaluations – Technical Report (Google DeepMind)↗ EXTERNER LINKDouble-blind reliability evaluation (MLCommons)↗ EXTERNER LINKGoogle's double-blind evaluation (The New Stack)↗ EXTERNER LINKSecure enclaves for AI evaluation (OpenMined)↗ EXTERNER LINKThe Leaderboard Illusion (arXiv)↗ EXTERNER LINKBenchmarking Benchmark Leakage (arXiv)↗ EXTERNER LINKConfidential Computing (Google Cloud)↗ EXTERNER LINKSwiss AI Initiative↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
GoogleAnthropicETH ZürichEPFL
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Roboterarms, der einen Stapel Probenplatten über eine Laborbank mit Mikroskop hebt, kinewsletter.ch Stil
Illustration eines Roboterarms, der einen Stapel Probenplatten über eine Laborbank mit Mikroskop hebt, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·28. AUGUST 2026

Anthropic lässt KI-Agenten Laborgeräte steuern – vorerst nur auf Einladung

Anthropic hat den Model Hardware Standard als Research Preview gestartet – eine Spezifikation, mit der KI-Agenten Mikroskope, Pipettierroboter und Roboterarme gleichzeitig bedienen. Erste Partner hängten ihre Geräte in acht Stunden statt mehreren Wochen zusammen. Open Source ist angekündigt, bisher gibt es nur eine Warteliste.

Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
KI-FORSCHUNG·24. AUGUST 2026

Inherents Faraday schlägt Claude und GPT-5.5 – im eigenen Test

Das Londoner Lab Inherent hat einen Agenten mit 27 Milliarden Parametern gebaut, der publizierte Forschung nachbaut – und dabei laut eigenen Messungen Claude Opus 4.8 und GPT-5.5 schlägt. Der Trick: Der kleine Agent dirigiert den grossen. Eine unabhängige Nachprüfung steht aus.

Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
KI-FORSCHUNG·23. AUGUST 2026

Nvidia zeigt: Das Gerüst schlägt das Modell

Nvidias Forschungssystem AVO holt mit Claude Opus 5 einen perfekten Score von 100,00 auf dem öffentlichen Set des Benchmarks ARC-AGI-3. Dasselbe Modell allein kommt auf 30,16 Prozent. Den Unterschied macht nicht das Modell, sondern der Harness – das Gerüst aus Gedächtnis, Werkzeugen und Aufsicht drumherum.

Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·22. AUGUST 2026

Ein Drittel oder ein Zehntel? Beide Zahlen stimmen

Das Pew Research Center hat 490'000 Webseiten auf KI-Spuren untersucht. Die eine Hälfte der Presse titelt «ein Drittel des Webs», die andere «zehn Prozent». Beide zitieren dieselbe Studie – und beide haben recht. Der Unterschied liegt in einem einzigen Filter.

Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil
Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil (Dark Mode)
KI-FORSCHUNG·21. AUGUST 2026

Terence Tao: KI stürzt die Mathematik in eine Wertekrise

Fields-Medaillist Terence Tao warnt in einem neuen Essay: KI führt die Mathematik in eine Krise, die so grundlegend ist wie jene um Russell und Gödel. Diesmal steht nicht die mathematische Wahrheit auf dem Prüfstand, sondern die Werte des Fachs – was zählt als Beitrag, wer hat die Arbeit gemacht.

Illustration von drei Vermessungs-Stativen, die dasselbe Stück Boden abstecken, kinewsletter.ch Stil
Illustration von drei Vermessungs-Stativen, die dasselbe Stück Boden abstecken, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·15. AUGUST 2026

Drei KI-Agenten, ein Projekt – und ein Revierkampf mit Malware

Anthropics Frontier Red Team liess drei Claude-Agenten auf dasselbe Software-Projekt los – jeder mit einem anderen Auftrag, keiner wusste von den anderen. Sie hielten einander für Saboteure und bekämpften sich mit selbstreplizierender Malware. Was das für Firmen heisst, die mehrere Agenten parallel laufen lassen.

Mehr aus KI-Forschung →