NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-FORSCHUNG

TurboQuant: Googles Kompressionsalgorithmus lässt grosse KI-Modelle auf kleinen GPUs laufen

Google Research hat einen Algorithmus vorgestellt, der den Speicherhunger von KI-Modellen um den Faktor 6 senkt – ohne Qualitätsverlust. Die Community dreht durch, Speicherchip-Aktien fallen, und das Internet zieht Vergleiche mit HBOs «Silicon Valley».

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
27. MÄRZ 2026
5 MIN. LESEZEIT
Illustration einer mechanischen Presse die einen Kristall komprimiert, kinewsletter.ch Stil
Illustration einer mechanischen Presse die einen Kristall komprimiert, kinewsletter.ch Stil
INHALT
016× weniger Speicher, kein Training nötig02So funktioniert der Trick – einfach erklärt03160'000 statt 30'000 Tokens auf einer Consumer-GPU04Hacker News zwischen Begeisterung und Zitationsstreit05Noch kein Code, noch kein Produkt – aber die Konkurrenz schläft nicht06Lokale KI auf Schweizer Hardware – ein konkreter Enabler
INHALT
016× weniger Speicher, kein Training nötig02So funktioniert der Trick – einfach erklärt03160'000 statt 30'000 Tokens auf einer Consumer-GPU04Hacker News zwischen Begeisterung und Zitationsstreit05Noch kein Code, noch kein Produkt – aber die Konkurrenz schläft nicht06Lokale KI auf Schweizer Hardware – ein konkreter Enabler
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

TurboQuant komprimiert den KV-Cache von KI-Modellen auf 3 Bit – 6× weniger Speicher, kein Training nötig. Das könnte grosse Modelle auf Consumer-GPUs bringen.

Google Research hat einen Algorithmus vorgestellt, der den Speicherhunger von KI-Modellen um den Faktor 6 senkt – ohne dass die Qualität leidet. Die Community dreht durch, Speicherchip-Aktien fallen, und das Internet zieht Vergleiche mit der fiktiven Kompression aus HBOs «Silicon Valley».

6× weniger Speicher, kein Training nötig

Der am 24. März per Blogpost vorgestellte TurboQuant komprimiert den sogenannten KV-Cache – eine Art Kurzzeitgedächtnis, das KI-Modelle während der Textgenerierung aufbauen – auf 3 Bit pro Kanal. Zum Vergleich: Standard sind 16 Bit. Das Ergebnis ist eine mindestens 6-fache Speicherreduktion und bis zu 8-facher Speedup bei der Attention-Berechnung (dem rechenintensivsten Teil der Textgenerierung).

Das Besondere: TurboQuant ist datenblind. Der Algorithmus braucht kein Training, kein Feintuning und keine Kalibrierungsdaten. Dasselbe Verfahren funktioniert für jedes Modell sofort – ein fundamentaler Vorteil gegenüber Konkurrenten wie KIVI oder KVQuant, die für jedes Modell einzeln angepasst werden müssen.

Cloudflare-CEO Matthew Prince nannte TurboQuant «Google's DeepSeek moment» – und auf Twitter/X erzielte die Ankündigung 11,9 Millionen Views in unter 24 Stunden.

So funktioniert der Trick – einfach erklärt

Stell dir vor, du fotografierst ein Dokument mit dem Handy. Ein normales JPEG komprimiert das Bild, indem es die Farbwerte vereinfacht – aber es muss zuerst das ganze Bild analysieren. TurboQuant macht etwas Clevereres: Es dreht die Daten zuerst in eine mathematisch vorhersagbare Form (per Zufallsrotation), sodass ein universeller Kompressor funktioniert – ohne die Daten überhaupt anzuschauen.

Konkret arbeitet der Algorithmus in zwei Stufen:

  • Stufe 1 (PolarQuant): Die Daten werden rotiert, sodass ihre Verteilung vorhersagbar wird. Dann wird ein vorgefertigter Quantisierer angewandt – kein Overhead für Normalisierung, kein modellspezifisches Codebook.
  • Stufe 2 (QJL-Fehlerkorrektur): Der Restfehler aus Stufe 1 wird mit nur 1 Bit pro Komponente korrigiert – mathematisch beweisbar unverzerrt.

Das Ergebnis liegt innerhalb eines Faktors von 2,7 der theoretisch bestmöglichen Kompression nach Shannon. Bei 1 Bit sogar nur Faktor 1,45. Für Mathematik-Nerds: Das ist bemerkenswert nah am Optimum.

160'000 statt 30'000 Tokens auf einer Consumer-GPU

Die praktischen Auswirkungen sind erheblich. Für ein 7B-Modell auf einer GPU mit 16 GB VRAM bedeutet TurboQuant: Statt ~30'000 Context-Tokens passen plötzlich 160'000+ Tokens in den Speicher. Eine Community-Implementierung auf einer RTX 3060 (12 GB) demonstrierte: 289 MB KV-Cache schrumpften auf 58 MB.

Weitere Community-Erfolge:

  • Gemma 3 4B auf RTX 4090: Zeichenidentische Ausgabe bei 2-Bit-Präzision
  • 35B-Modell auf Apple M5 Max: Via llama.cpp mit 3-Bit TurboQuant KV-Cache lauffähig
  • Needle-in-a-Haystack-Test: 100% perfekte Recall-Rate bis 104'000 Tokens

Wichtiger Caveat: Der «8× Speedup» bezieht sich nur auf die Attention-Berechnung, nicht auf die gesamte Inferenz. Und «kein Genauigkeitsverlust» bedeutet: auf Benchmark-Ebene nicht messbar – nicht mathematisch verlustfrei. Getestet wurde zudem nur auf Modellen bis 8 Milliarden Parameter. Das Verhalten bei 70B+ Modellen – wo der KV-Cache am relevantesten ist – ist noch nicht verifiziert.

Hacker News zwischen Begeisterung und Zitationsstreit

Die Community-Reaktion war explosiv: 516 Upvotes und 144 Kommentare auf Hacker News innerhalb eines Tages, 11,9 Millionen Views auf X in unter 24 Stunden. Der «Pied Piper»-Vergleich mit HBOs Silicon Valley ging viral – TechCrunch widmete dem Phänomen einen eigenen Artikel.

Aber es gab auch substanzielle Kritik: Der Erstautor des NeurIPS-2021-Papers «DRIVE» warf Google vor, die grundlegende Technik – geometrische Rotation vor extremer Quantisierung mit Bias-Korrektur – nicht zitiert zu haben. Die Community bezeichnete das als «Schmidhuber'd» – eine Anspielung auf den KI-Forscher Jürgen Schmidhuber, der regelmässig fehlende Zitationen anprangert.

An den Finanzmärkten fielen Speicherchip-Aktien: Micron −3%, Western Digital −4,7%, SanDisk −5,7%. Analysten von Morgan Stanley und Wells Fargo bewerteten den Ausverkauf als übertrieben und verwiesen auf das Jevons-Paradoxon: Effizienzgewinne steigern typischerweise die Nachfrage, statt Ausgaben zu senken.

Noch kein Code, noch kein Produkt – aber die Konkurrenz schläft nicht

Stand heute hat Google weder offiziellen Code veröffentlicht noch TurboQuant in einem Produkt bestätigt. Der Blogpost erwähnt Gemini als Anwendungsfall, die Community vermutet eine interne Nutzung. Die ICLR-Präsentation ist für Ende April geplant, Google I/O gilt als wahrscheinlichster Zeitpunkt für Produktankündigungen.

Die Konkurrenz ist ernst zu nehmen: Nvidias KVTC (ebenfalls ICLR 2026) erreicht sogar 20× Kompression – braucht aber eine einmalige Kalibrierung pro Modell. KIVI von der Rice University ist bereits in HuggingFace Transformers integriert. TurboQuants Trumpf bleibt die Universalität: Kein Modell muss angepasst werden, keine Daten müssen analysiert werden.

Lokale KI auf Schweizer Hardware – ein konkreter Enabler

Für die Schweiz ist TurboQuant aus drei Gründen relevant. Erstens: Apertus, der erste offene Schweizer LLM von ETH und EPFL, ist für lokale, auditierbare Nutzung konzipiert. KV-Cache-Kompression ermöglicht es, Apertus-8B auf Consumer-GPUs mit deutlich längerem Kontext zu betreiben – ein direkter Enabler für datensouveräne Inferenz.

Zweitens: Meditron, der Schweizer medizinische LLM, wird ab Mai 2026 am CHUV in Lausanne getestet. Lokale Bereitstellung ohne Datenübertragung an externe Server profitiert direkt – längere Patientenakten-Kontexte auf limitierter Spitalhardware werden möglich.

Drittens treibt der EU AI Act Edge-Deployment voran. Obwohl die Schweiz kein EU-Mitglied ist, orientieren sich Schweizer KI-Projekte an der Regulierung. Meta hat fortgeschrittene Modelle für den EU-Markt zurückgehalten und setzt auf On-Device-KI. Kompression wie TurboQuant senkt die technische Hürde für genau solche lokalen Deployments.

Quellen

Google Research Blog↗ EXTERNER LINKarXiv: TurboQuant Paper↗ EXTERNER LINKTechCrunch↗ EXTERNER LINKWinBuzzer↗ EXTERNER LINKThe Next Web↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
GoogleDeepSeekAppleETH ZürichEPFL
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Tresors mit zwei Schlüssellöchern, zwei getrennt liegenden Schlüsseln und einem versiegelten Umschlag, kinewsletter.ch Stil
Illustration eines Tresors mit zwei Schlüssellöchern, zwei getrennt liegenden Schlüsseln und einem versiegelten Umschlag, kinewsletter.ch Stil
KI-FORSCHUNG·28. AUGUST 2026

Google lässt Gemini prüfen, ohne die Fragen zu sehen

DeepMind liess Gemini 2.5 Flash Lite erstmals doppelblind prüfen: Die Prüfer sahen die Modellgewichte nicht, Google die Testfragen nicht. Ein Fortschritt – mit offensichtlichem Interessenkonflikt.

Illustration eines Roboterarms, der einen Stapel Probenplatten über eine Laborbank mit Mikroskop hebt, kinewsletter.ch Stil
Illustration eines Roboterarms, der einen Stapel Probenplatten über eine Laborbank mit Mikroskop hebt, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·28. AUGUST 2026

Anthropic lässt KI-Agenten Laborgeräte steuern – vorerst nur auf Einladung

Anthropic hat den Model Hardware Standard als Research Preview gestartet – eine Spezifikation, mit der KI-Agenten Mikroskope, Pipettierroboter und Roboterarme gleichzeitig bedienen. Erste Partner hängten ihre Geräte in acht Stunden statt mehreren Wochen zusammen. Open Source ist angekündigt, bisher gibt es nur eine Warteliste.

Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
Illustration einer Laborwerkbank mit geschwärztem Paper und Plotterkurve, kinewsletter.ch Stil
KI-FORSCHUNG·24. AUGUST 2026

Inherents Faraday schlägt Claude und GPT-5.5 – im eigenen Test

Das Londoner Lab Inherent hat einen Agenten mit 27 Milliarden Parametern gebaut, der publizierte Forschung nachbaut – und dabei laut eigenen Messungen Claude Opus 4.8 und GPT-5.5 schlägt. Der Trick: Der kleine Agent dirigiert den grossen. Eine unabhängige Nachprüfung steht aus.

Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
Illustration eines Baugerüsts, das eine kleine Maschine umschliesst, kinewsletter.ch Stil
KI-FORSCHUNG·23. AUGUST 2026

Nvidia zeigt: Das Gerüst schlägt das Modell

Nvidias Forschungssystem AVO holt mit Claude Opus 5 einen perfekten Score von 100,00 auf dem öffentlichen Set des Benchmarks ARC-AGI-3. Dasselbe Modell allein kommt auf 30,16 Prozent. Den Unterschied macht nicht das Modell, sondern der Harness – das Gerüst aus Gedächtnis, Werkzeugen und Aufsicht drumherum.

Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Handgezeichnete Skizze einer Druckerei mit Stapeln identischer Bogen, einer davon blau hervorgehoben, kinewsletter.ch Stil
Nur für Abonnenten·KI-FORSCHUNG·22. AUGUST 2026

Ein Drittel oder ein Zehntel? Beide Zahlen stimmen

Das Pew Research Center hat 490'000 Webseiten auf KI-Spuren untersucht. Die eine Hälfte der Presse titelt «ein Drittel des Webs», die andere «zehn Prozent». Beide zitieren dieselbe Studie – und beide haben recht. Der Unterschied liegt in einem einzigen Filter.

Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil
Illustration einer Waage mit Papierstapeln auf beiden Schalen vor einem Rundbogenfenster, kinewsletter.ch Stil (Dark Mode)
KI-FORSCHUNG·21. AUGUST 2026

Terence Tao: KI stürzt die Mathematik in eine Wertekrise

Fields-Medaillist Terence Tao warnt in einem neuen Essay: KI führt die Mathematik in eine Krise, die so grundlegend ist wie jene um Russell und Gödel. Diesmal steht nicht die mathematische Wahrheit auf dem Prüfstand, sondern die Werte des Fachs – was zählt als Beitrag, wer hat die Arbeit gemacht.

Mehr aus KI-Forschung →