NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Gemini 3.1 Flash-Lite ist GA – Google macht Billig-KI für Agenten salonfähig

Google hat am 8. Mai Gemini 3.1 Flash-Lite auf der Gemini Enterprise Agent Platform GA gemacht. Mit 0,25 Dollar pro Million Input-Tokens und 2,5-mal schnellerer Time-to-First-Token zielt das Modell auf Hochvolumen-Workflows – und unterbietet OpenAI sowie Anthropic im Preis.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
11. MAI 2026
2 MIN. LESEZEIT
Skizze einer Stoppuhr auf Werkbank mit Zahnrädern und Glühbirne – steht für Geschwindigkeit und Effizienz
Skizze einer Stoppuhr auf Werkbank mit Zahnraedern und Gluehbirne, dark mode, kinewsletter.ch Stil
INHALT
0125 Cent pro Million Tokens – und 2,5x schneller02Erste Kunden, harte Zahlen03Was das im Wettbewerb verschiebt
INHALT
0125 Cent pro Million Tokens – und 2,5x schneller02Erste Kunden, harte Zahlen03Was das im Wettbewerb verschiebt
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Google kontert OpenAIs GPT-5 mini und Anthropics Claude Haiku mit dem günstigsten Modell der Gemini-3-Reihe – und macht im Volumen-Segment den Preis.

Google hat am 8. Mai bekannt gegeben, dass Gemini 3.1 Flash-Lite auf der Gemini Enterprise Agent Platform allgemein verfügbar ist. Das Modell zielt klar auf eine Lücke, die OpenAIs GPT‑5.5 und Anthropics Claude im Frontier-Segment offenlassen: Workloads, bei denen Latenz und Preis die wichtigsten Kennzahlen sind.

25 Cent pro Million Tokens – und 2,5x schneller

Mit 0,25 Dollar pro Million Input-Tokens und 1,50 Dollar pro Million Output-Tokens ist Flash-Lite das günstigste Modell der Gemini-3-Reihe. Laut Google-Benchmarks liefert es im Vergleich zum Vorgänger Gemini 2.5 Flash eine 2,5-mal schnellere Time to First Token und 45 Prozent mehr Output-Geschwindigkeit – bei vergleichbarer oder besserer Qualität.

Auf dem Arena.ai-Leaderboard erreicht Flash-Lite einen Elo-Score von 1432. In den akademischen Benchmarks GPQA Diamond (86,9 Prozent) und MMMU Pro (76,8 Prozent) schlägt das Modell sogar grössere Gemini-Generationen wie 2.5 Flash. Wichtig für Agenten-Workflows: Die «Thinking Levels» lassen sich pro Anfrage steuern – kurze Replies kosten wenig Compute, komplexe Reasoning-Aufgaben dürfen länger denken.

Erste Kunden, harte Zahlen

Google nennt eine Reihe Kunden, die Flash-Lite bereits produktiv einsetzen:

  • JetBrains integriert das Modell in seinen Junie-Agenten und in den IDE-Assistenten – laut AI-Director Vladislav Tankov der «perfekte Mix aus Intelligenz und minimaler Latenz»
  • Gladly wickelt mit Flash-Lite Millionen Kundendialoge pro Woche über SMS, WhatsApp und Instagram ab – ungefähr 60 Prozent günstiger als bei vergleichbaren Reasoning-Modellen, mit p95-Latenz um 1,8 Sekunden und 99,6 Prozent Erfolgsrate
  • Ramp nutzt Flash-Lite für latenzkritische Funktionen in seiner Finanz-Plattform
  • AlphaSense, OffDeal, krea.ai und das Gaming-Startup Astrocade stehen ebenfalls auf der Referenzliste

Was das im Wettbewerb verschiebt

Flash-Lite zielt auf den Sweet Spot zwischen Smart und Schnell: Tool-Calling, Klassifizierung, Übersetzung, Content-Moderation, agentische Pipelines mit hoher Frequenz. Google positioniert das Modell explizit gegen GPT‑5 mini, Claude 4.5 Haiku und Grok 4.1 Fast – und unterbietet sie laut eigener Tabelle bei Output-Speed wie Preis.

Für dich als Entwickler oder Team-Lead heisst das: Wer bislang Reasoning-Modelle in High-Volume-Pipelines verbrannt hat, kann ab sofort deutlich günstiger auf Flash-Lite umsteigen, ohne Qualität in den meisten Standardfällen zu verlieren. Die Botschaft an OpenAI und Anthropic ist eindeutig: Im Volumen-Segment macht Google jetzt den Preis.

Verfügbar ist das Modell über die Gemini API in Google AI Studio sowie für Enterprise-Kunden über Vertex AI und die neue Gemini Enterprise Agent Platform.

Quellen

Gemini 3.1 Flash-Lite is now generally available – Google Cloud Blog↗ EXTERNER LINKGemini 3.1 Flash-Lite: Built for intelligence at scale – The Keyword↗ EXTERNER LINKGoogle launches Gemini 3.1 Flash-Lite in General Availability – TestingCatalog↗ EXTERNER LINKGemini 3.1 Flash-Lite – Google DeepMind↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
GoogleOpenAIAnthropicxAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Tonstudios mit Mischpult, Kondensatormikrofon am Galgen und Kopfhörern, kinewsletter.ch Stil
Illustration eines Tonstudios mit Mischpult, Kondensatormikrofon am Galgen und Kopfhörern, kinewsletter.ch Stil
NEUE MODELLE·24. SEPTEMBER 2026

Alibaba macht KI-Sprache um bis zu 95 Prozent billiger

Alibabas Qwen-Team hat Qwen-Audio-3.1 veröffentlicht: fünf Modelle für Spracherkennung, Sprachsynthese und Echtzeit-Dialog, dazu Preissenkungen von bis zu 95 Prozent. Die Modelle laufen ausschliesslich als Cloud-API – offene Gewichte gibt es nur für die ältere Qwen3-ASR-Reihe.

Illustration einer Balkenwaage mit Münzen gegen ein Zahnrad in einer Werkstatt, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Münzen gegen ein Zahnrad in einer Werkstatt, kinewsletter.ch Stil
NEUE MODELLE·23. SEPTEMBER 2026

Claude Opus 5.5: Fable-Niveau zum tieferen Preis

Anthropic hat Claude Opus 5.5 veröffentlicht. Das Modell arbeitet laut Anthropic auf Fable-5.1-Niveau, kostet im Betrieb aber 40 Prozent weniger als Opus 5.

Illustration einer Balkenwaage mit Münzstapel in Elektroblau, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Münzstapel in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·23. SEPTEMBER 2026

OpenAI halbiert die API-Preise für GPT-6 Sol und Luna

OpenAI hat GPT-6 Sol und Luna veröffentlicht und die API-Preise halbiert. Für Schweizer Teams mit Agenten-Workloads schrumpft die Token-Rechnung auf die Hälfte.

Illustration einer Waage mit Preisschild und Stoppuhren auf einer Werkbank am Fenster, kinewsletter.ch Stil
Illustration einer Waage mit Preisschild und Stoppuhren auf einer Werkbank am Fenster, kinewsletter.ch Stil
NEUE MODELLE·22. SEPTEMBER 2026

xAI bringt Grok 4.7 – günstig, aber kein Spitzenreiter

xAI hat Grok 4.7 veröffentlicht: 2 US-Dollar pro Million Input-Token, 6 Dollar für Output – ein Bruchteil dessen, was Claude Fable 5.1 kostet. Im unabhängigen Artificial Analysis Intelligence Index landet das Modell mit 46 Punkten aber nur im Mittelfeld. Für Schweizer Teams heisst das: günstig rechnen, aber nicht blind auf lange Agenten-Läufe setzen.

Skizze einer Waage mit Münzen und Dokumentenstapel in Elektroblau, kinewsletter.ch Stil
Skizze einer Waage mit Münzen und Dokumentenstapel in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·21. SEPTEMBER 2026

600-Milliarden-Modell für einen Dollar pro Million Token

StepFun hat am 20. September 2026 Step 5 Preview gestartet: ein Sparse-MoE-Modell mit rund 600 Milliarden Parametern, 1 Million Token Kontext und einem Listenpreis von 1 US-Dollar pro Million Input-Token. Die Gewichte sollen am 15. Oktober offengelegt werden.

Skizze eines Mikrofons mit Sprachwellen in Elektroblau, kinewsletter.ch Stil
Skizze eines Mikrofons mit Sprachwellen in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·16. SEPTEMBER 2026

Gemini 3.8 Live: Google unterbietet OpenAI beim Sprechen

Googles neue Sprachmodelle wechseln mitten im Gespräch zwischen 97 Sprachen und erledigen Tool-Calls im Hintergrund – zu einem Bruchteil der Kosten der Konkurrenz.

Mehr aus Neue Modelle →