NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN FREITAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Gemini 3.1 Flash-Lite ist GA – Google macht Billig-KI für Agenten salonfähig

Google hat am 8. Mai Gemini 3.1 Flash-Lite auf der Gemini Enterprise Agent Platform GA gemacht. Mit 0,25 Dollar pro Million Input-Tokens und 2,5-mal schnellerer Time-to-First-Token zielt das Modell auf Hochvolumen-Workflows – und unterbietet OpenAI sowie Anthropic im Preis.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
11. MAI 2026
2 MIN. LESEZEIT
Skizze einer Stoppuhr auf Werkbank mit Zahnrädern und Glühbirne – steht für Geschwindigkeit und Effizienz
Skizze einer Stoppuhr auf Werkbank mit Zahnraedern und Gluehbirne, dark mode, kinewsletter.ch Stil
INHALT
0125 Cent pro Million Tokens – und 2,5x schneller02Erste Kunden, harte Zahlen03Was das im Wettbewerb verschiebt
INHALT
0125 Cent pro Million Tokens – und 2,5x schneller02Erste Kunden, harte Zahlen03Was das im Wettbewerb verschiebt
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Google kontert OpenAIs GPT-5 mini und Anthropics Claude Haiku mit dem günstigsten Modell der Gemini-3-Reihe – und macht im Volumen-Segment den Preis.

Google hat am 8. Mai bekannt gegeben, dass Gemini 3.1 Flash-Lite auf der Gemini Enterprise Agent Platform allgemein verfügbar ist. Das Modell zielt klar auf eine Lücke, die OpenAIs GPT‑5.5 und Anthropics Claude im Frontier-Segment offenlassen: Workloads, bei denen Latenz und Preis die wichtigsten Kennzahlen sind.

25 Cent pro Million Tokens – und 2,5x schneller

Mit 0,25 Dollar pro Million Input-Tokens und 1,50 Dollar pro Million Output-Tokens ist Flash-Lite das günstigste Modell der Gemini-3-Reihe. Laut Google-Benchmarks liefert es im Vergleich zum Vorgänger Gemini 2.5 Flash eine 2,5-mal schnellere Time to First Token und 45 Prozent mehr Output-Geschwindigkeit – bei vergleichbarer oder besserer Qualität.

Auf dem Arena.ai-Leaderboard erreicht Flash-Lite einen Elo-Score von 1432. In den akademischen Benchmarks GPQA Diamond (86,9 Prozent) und MMMU Pro (76,8 Prozent) schlägt das Modell sogar grössere Gemini-Generationen wie 2.5 Flash. Wichtig für Agenten-Workflows: Die «Thinking Levels» lassen sich pro Anfrage steuern – kurze Replies kosten wenig Compute, komplexe Reasoning-Aufgaben dürfen länger denken.

Erste Kunden, harte Zahlen

Google nennt eine Reihe Kunden, die Flash-Lite bereits produktiv einsetzen:

  • JetBrains integriert das Modell in seinen Junie-Agenten und in den IDE-Assistenten – laut AI-Director Vladislav Tankov der «perfekte Mix aus Intelligenz und minimaler Latenz»
  • Gladly wickelt mit Flash-Lite Millionen Kundendialoge pro Woche über SMS, WhatsApp und Instagram ab – ungefähr 60 Prozent günstiger als bei vergleichbaren Reasoning-Modellen, mit p95-Latenz um 1,8 Sekunden und 99,6 Prozent Erfolgsrate
  • Ramp nutzt Flash-Lite für latenzkritische Funktionen in seiner Finanz-Plattform
  • AlphaSense, OffDeal, krea.ai und das Gaming-Startup Astrocade stehen ebenfalls auf der Referenzliste

Was das im Wettbewerb verschiebt

Flash-Lite zielt auf den Sweet Spot zwischen Smart und Schnell: Tool-Calling, Klassifizierung, Übersetzung, Content-Moderation, agentische Pipelines mit hoher Frequenz. Google positioniert das Modell explizit gegen GPT‑5 mini, Claude 4.5 Haiku und Grok 4.1 Fast – und unterbietet sie laut eigener Tabelle bei Output-Speed wie Preis.

Für dich als Entwickler oder Team-Lead heisst das: Wer bislang Reasoning-Modelle in High-Volume-Pipelines verbrannt hat, kann ab sofort deutlich günstiger auf Flash-Lite umsteigen, ohne Qualität in den meisten Standardfällen zu verlieren. Die Botschaft an OpenAI und Anthropic ist eindeutig: Im Volumen-Segment macht Google jetzt den Preis.

Verfügbar ist das Modell über die Gemini API in Google AI Studio sowie für Enterprise-Kunden über Vertex AI und die neue Gemini Enterprise Agent Platform.

Quellen

Gemini 3.1 Flash-Lite is now generally available – Google Cloud Blog↗ EXTERNER LINKGemini 3.1 Flash-Lite: Built for intelligence at scale – The Keyword↗ EXTERNER LINKGoogle launches Gemini 3.1 Flash-Lite in General Availability – TestingCatalog↗ EXTERNER LINKGemini 3.1 Flash-Lite – Google DeepMind↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
NEUE MODELLE·11. AUGUST 2026

OpenAI gibt GPT-5.6-Cyber frei – nur für geprüfte Verteidiger

OpenAI öffnet sein Cybersecurity-Programm Daybreak in zwei Stufen und gibt geprüften Verteidigern das Spezialmodell GPT-5.6-Cyber. Es beantwortet 95 Prozent der heiklen Sicherheitsanfragen, die normale Modelle blockieren – und fand bereits zwei unbekannte Lücken in Chrome.

Illustration eines offenen Vorhängeschlosses vor einem offenen PC-Gehäuse mit Grafikkarte, kinewsletter.ch Stil
Illustration eines offenen Vorhängeschlosses vor einem offenen PC-Gehäuse mit Grafikkarte, kinewsletter.ch Stil
NEUE MODELLE·11. AUGUST 2026

Muse Glimmer: Meta öffnet 30-Milliarden-Modell unter Apache 2.0

Meta Superintelligence Labs hat am 10. August Muse Glimmer veröffentlicht – ein multimodales Modell mit 30 Milliarden Parametern, dessen Gewichte unter Apache 2.0 frei verfügbar sind. Quantisiert läuft es auf einer einzelnen Consumer-Grafikkarte. Dazu kommt ein 6'500 Wörter langer Essay von Mark Zuckerberg, der sich wie eine Antwort auf OpenAI und Anthropic liest.

Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
KI-FORSCHUNG·11. AUGUST 2026

Claude hebt Riemann-Schranke von 41,6 auf 67,2 Prozent

Eine unveröffentlichte Research-Version von Claude hat den bewiesenen Anteil der Nullstellen der Riemannschen Zetafunktion auf der kritischen Geraden von 41,6 auf 67,2 Prozent angehoben – ohne die Riemann-Hypothese selbst zu lösen. Angestossen hat das ein Anthropic-Mitarbeiter ohne Mathematik-Ausbildung, die Arbeit erledigten rund 60 Claude-Subagenten, und der Beweis liegt maschinenprüfbar im Beweisassistenten Lean auf GitHub.

Illustration einer offenen Tresortür in einem Serverraum, kinewsletter.ch Stil
Illustration einer offenen Tresortür in einem Serverraum, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

OpenAI stoppt Teile von Astra – erstmals Cyber-Stufe «Critical»

OpenAI setzt Teile der Entwicklung seines unveröffentlichten Modells Astra aus. Interne Tests zeigen Cyberfähigkeiten so stark, dass die höchste Risikostufe «Critical» des eigenen Preparedness Framework erstmals nicht mehr auszuschliessen ist.

Illustration einer Filmklappe mit elektroblauen Balken neben Tonangel-Mikrofon und Scheinwerfer, im Hintergrund ein Fenster mit Schwarzwald-Tannen, kinewsletter.ch Stil
Illustration einer Filmklappe mit elektroblauen Balken neben Tonangel-Mikrofon und Scheinwerfer, im Hintergrund ein Fenster mit Schwarzwald-Tannen, kinewsletter.ch Stil
NEUE MODELLE·6. AUGUST 2026

FLUX 3 Video: KI-Clips mit Ton – jetzt für alle verfügbar

Black Forest Labs macht sein Videomodell FLUX 3 Video über die API allgemein verfügbar: bis zu 20 Sekunden Video mit nativ mitgeneriertem Ton, Lippensynchronisation auf Deutsch und einem günstigen Draft-Modus. In internen Tests sieht sich das Freiburger KI-Studio an der Spitze.

Illustration einer Balkenwaage mit elektroblauem Ständer, auf der einen Schale Münzen, auf der anderen gerollte Dokumente, kinewsletter.ch Stil
Illustration einer Balkenwaage mit elektroblauem Ständer, auf der einen Schale Münzen, auf der anderen gerollte Dokumente, kinewsletter.ch Stil
KI-TOOLS & APPS·6. AUGUST 2026

Meta greift Claude Code an: 92 Prozent Rabatt fürs Datenteilen

Meta Superintelligence Labs lanciert mit Muse Code einen Terminal-Coding-Agenten als direkte Konkurrenz zu Claude Code und Codex – angetrieben vom neuen Modell Muse Spark 1.2. Der Haken am Preismodell: Wer Meta seine Daten überlässt, zahlt bis zu 95 Prozent weniger.

Mehr aus Neue Modelle →