NewsKategorienNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Gemini 3.1 Flash-Lite ist GA – Google macht Billig-KI für Agenten salonfähig

Google hat am 8. Mai Gemini 3.1 Flash-Lite auf der Gemini Enterprise Agent Platform GA gemacht. Mit 0,25 Dollar pro Million Input-Tokens und 2,5-mal schnellerer Time-to-First-Token zielt das Modell auf Hochvolumen-Workflows – und unterbietet OpenAI sowie Anthropic im Preis.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
11. MAI 2026
2 MIN. LESEZEIT
Skizze einer Stoppuhr auf Werkbank mit Zahnrädern und Glühbirne – steht für Geschwindigkeit und Effizienz
Skizze einer Stoppuhr auf Werkbank mit Zahnraedern und Gluehbirne, dark mode, kinewsletter.ch Stil
INHALT
0125 Cent pro Million Tokens – und 2,5x schneller02Erste Kunden, harte Zahlen03Was das im Wettbewerb verschiebt
INHALT
0125 Cent pro Million Tokens – und 2,5x schneller02Erste Kunden, harte Zahlen03Was das im Wettbewerb verschiebt
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Google kontert OpenAIs GPT-5 mini und Anthropics Claude Haiku mit dem günstigsten Modell der Gemini-3-Reihe – und macht im Volumen-Segment den Preis.

Google hat am 8. Mai bekannt gegeben, dass Gemini 3.1 Flash-Lite auf der Gemini Enterprise Agent Platform allgemein verfügbar ist. Das Modell zielt klar auf eine Lücke, die OpenAIs GPT‑5.5 und Anthropics Claude im Frontier-Segment offenlassen: Workloads, bei denen Latenz und Preis die wichtigsten Kennzahlen sind.

25 Cent pro Million Tokens – und 2,5x schneller

Mit 0,25 Dollar pro Million Input-Tokens und 1,50 Dollar pro Million Output-Tokens ist Flash-Lite das günstigste Modell der Gemini-3-Reihe. Laut Google-Benchmarks liefert es im Vergleich zum Vorgänger Gemini 2.5 Flash eine 2,5-mal schnellere Time to First Token und 45 Prozent mehr Output-Geschwindigkeit – bei vergleichbarer oder besserer Qualität.

Auf dem Arena.ai-Leaderboard erreicht Flash-Lite einen Elo-Score von 1432. In den akademischen Benchmarks GPQA Diamond (86,9 Prozent) und MMMU Pro (76,8 Prozent) schlägt das Modell sogar grössere Gemini-Generationen wie 2.5 Flash. Wichtig für Agenten-Workflows: Die «Thinking Levels» lassen sich pro Anfrage steuern – kurze Replies kosten wenig Compute, komplexe Reasoning-Aufgaben dürfen länger denken.

Erste Kunden, harte Zahlen

Google nennt eine Reihe Kunden, die Flash-Lite bereits produktiv einsetzen:

  • JetBrains integriert das Modell in seinen Junie-Agenten und in den IDE-Assistenten – laut AI-Director Vladislav Tankov der «perfekte Mix aus Intelligenz und minimaler Latenz»
  • Gladly wickelt mit Flash-Lite Millionen Kundendialoge pro Woche über SMS, WhatsApp und Instagram ab – ungefähr 60 Prozent günstiger als bei vergleichbaren Reasoning-Modellen, mit p95-Latenz um 1,8 Sekunden und 99,6 Prozent Erfolgsrate
  • Ramp nutzt Flash-Lite für latenzkritische Funktionen in seiner Finanz-Plattform
  • AlphaSense, OffDeal, krea.ai und das Gaming-Startup Astrocade stehen ebenfalls auf der Referenzliste

Was das im Wettbewerb verschiebt

Flash-Lite zielt auf den Sweet Spot zwischen Smart und Schnell: Tool-Calling, Klassifizierung, Übersetzung, Content-Moderation, agentische Pipelines mit hoher Frequenz. Google positioniert das Modell explizit gegen GPT‑5 mini, Claude 4.5 Haiku und Grok 4.1 Fast – und unterbietet sie laut eigener Tabelle bei Output-Speed wie Preis.

Für dich als Entwickler oder Team-Lead heisst das: Wer bislang Reasoning-Modelle in High-Volume-Pipelines verbrannt hat, kann ab sofort deutlich günstiger auf Flash-Lite umsteigen, ohne Qualität in den meisten Standardfällen zu verlieren. Die Botschaft an OpenAI und Anthropic ist eindeutig: Im Volumen-Segment macht Google jetzt den Preis.

Verfügbar ist das Modell über die Gemini API in Google AI Studio sowie für Enterprise-Kunden über Vertex AI und die neue Gemini Enterprise Agent Platform.

Quellen

Gemini 3.1 Flash-Lite is now generally available – Google Cloud Blog↗ EXTERNER LINKGemini 3.1 Flash-Lite: Built for intelligence at scale – The Keyword↗ EXTERNER LINKGoogle launches Gemini 3.1 Flash-Lite in General Availability – TestingCatalog↗ EXTERNER LINKGemini 3.1 Flash-Lite – Google DeepMind↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Skizze: drei Tueren zunehmender Groesse in einem Werkstattflur, jede mit einem leeren Preisschild am Griff, mit elektroblauem Akzent
Handgezeichnete Skizze: drei Tueren zunehmender Groesse in einem Werkstattflur, jede mit einem leeren Preisschild am Griff, mit elektroblauem Akzent (Dark Mode)
NEUE MODELLE·10. JULI 2026

GPT-5.6 für alle: OpenAI bringt drei Modelle zu drei Preisen

Seit dem 9. Juli ist OpenAIs neue Generation GPT-5.6 öffentlich verfügbar – in drei Stufen namens Sol, Terra und Luna, deren Preise von 1 bis 30 Dollar pro Million Token reichen. Zuvor hatte eine staatliche Sicherheitsprüfung die Freigabe wochenlang verzögert.

Skizze zu Grok 4.5 von SpaceXAI, kinewsletter.ch Stil
Skizze zu Grok 4.5 von SpaceXAI, kinewsletter.ch Stil (dark)
NEUE MODELLE·9. JULI 2026

Grok 4.5: SpaceXAIs günstiger Angriff auf Claude Opus

SpaceXAI hat Grok 4.5 veröffentlicht – ein «Opus-class model» für Coding und agentische Aufgaben, das beim Output rund viermal günstiger ist als Claude Opus 4.8. Die Leistungsvergleiche stammen allerdings aus xAI-eigenen Benchmarks, und selbst dort liegt Grok nicht an der Spitze.

Handgezeichnete Skizze eines Studiomikrofons mit Lautsprecher, Schallwellen und einer Stoppuhr, mit elektroblauem Akzent
Handgezeichnete Skizze eines Studiomikrofons mit Lautsprecher, Schallwellen und einer Stoppuhr, mit elektroblauem Akzent (Dark Mode)
NEUE MODELLE·7. JULI 2026

OpenAIs neue Sprachmodelle antworten schneller – und eines wird günstiger

OpenAI hat zwei neue Realtime-Sprachmodelle veröffentlicht: gpt-realtime-2.1 und die günstigere Mini-Variante. Beide reagieren dank besserem Caching mindestens 25 Prozent schneller – die Technik hinter Sprachassistenten und Telefon-Bots wird flüssiger und billiger.

Illustration eines offenen Serverschranks an einer Werkbank, kinewsletter.ch Stil
Illustration offener Serverschrank, kinewsletter.ch Stil Dark
NEUE MODELLE·7. JULI 2026

Tencent bringt Hy3: offenes 295-Milliarden-Modell, das über seiner Klasse boxt

Nur 21 Mrd. aktive Parameter, Apache-2.0-Lizenz und Self-Hosting: Tencents neues MoE-Modell zielt auf Effizienz statt Grösse.

Illustration: Person am Schreibtisch, der Monitor schaltet sich wieder ein und ein Papierflieger kehrt durchs Fenster zurück – kinewsletter.ch Stil
Illustration Dark Mode: Person am Schreibtisch, Monitor schaltet sich wieder ein – kinewsletter.ch Stil
KI-TOOLS & APPS·2. JULI 2026

Claude Fable 5 ist zurück – mit Gratis-Woche und Benchmark-Sieg

Nach drei Wochen Zwangspause ist Anthropics stärkstes Modell wieder online – bis zum 7. Juli sogar gratis. Und ein neuer Benchmark zeigt, warum das mehr ist als ein Software-Update.

Handgezeichnete Skizze eines Kontrollraums mit Schaltpult und einem heruntergezogenen blauen Hebel, elektroblauer Akzent
Handgezeichnete Skizze eines Kontrollraums mit Schaltpult und einem heruntergezogenen blauen Hebel, elektroblauer Akzent (Dark Mode)
NEUE MODELLE·1. JULI 2026

Claude Sonnet 5: fast Opus-Niveau zum Sonnet-Preis

Anthropics neues Modell Claude Sonnet 5 reicht nahe an das Spitzenmodell Opus 4.8 heran – zum Einführungspreis von 2 statt 5 Dollar pro Million Token. Agentische KI, die eben noch ein Premium-Budget verlangte, wird damit alltagstauglich.

Mehr aus Neue Modelle →