NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

OpenAIs neue Sprachmodelle antworten schneller – und eines wird günstiger

OpenAI hat zwei neue Realtime-Sprachmodelle veröffentlicht: gpt-realtime-2.1 und die günstigere Mini-Variante. Beide reagieren dank besserem Caching mindestens 25 Prozent schneller – die Technik hinter Sprachassistenten und Telefon-Bots wird flüssiger und billiger.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
7. JULI 2026
2 MIN. LESEZEIT
Handgezeichnete Skizze eines Studiomikrofons mit Lautsprecher, Schallwellen und einer Stoppuhr, mit elektroblauem Akzent
Handgezeichnete Skizze eines Studiomikrofons mit Lautsprecher, Schallwellen und einer Stoppuhr, mit elektroblauem Akzent (Dark Mode)
INHALT
01Ein Viertel weniger Wartezeit02Das grosse Modell hört genauer zu03Die Sparvariante für den Massenbetrieb04So kommst du dran
INHALT
01Ein Viertel weniger Wartezeit02Das grosse Modell hört genauer zu03Die Sparvariante für den Massenbetrieb04So kommst du dran
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

OpenAIs neue Realtime-Modelle senken die Antwortzeit von Sprach-KI um mindestens ein Viertel – und die Mini-Variante kostet nur rund ein Drittel des grossen Modells.

OpenAI hat zwei neue Sprachmodelle für seine Realtime-API veröffentlicht: gpt-realtime-2.1 und gpt-realtime-2.1-mini. Beide sind dafür gemacht, dass Anwendungen in Echtzeit zuhören und antworten – also die Technik hinter Sprachassistenten, Telefon-Bots und Voice-Agenten.

Ein Viertel weniger Wartezeit

Der wichtigste Fortschritt ist Tempo. Laut OpenAI sinkt die sogenannte p95-Latenz – die Wartezeit, die 95 Prozent der Anfragen nicht überschreiten – über alle Realtime-Sprachmodelle hinweg um mindestens 25 Prozent. Möglich macht das ein verbessertes Caching, bei dem wiederkehrende Teile einer Anfrage zwischengespeichert statt jedes Mal neu berechnet werden. Für dich als Nutzer heisst das: Ein Sprach-Bot, der auf dieser Technik läuft, reagiert flüssiger und stockt seltener.

Das grosse Modell hört genauer zu

gpt-realtime-2.1 baut auf dem Vorgänger GPT-Realtime-2 auf und verbessert vor allem drei Dinge: Es erkennt Buchstaben- und Zahlenfolgen zuverlässiger – etwa wenn du eine Kundennummer oder ein Autokennzeichen diktierst –, geht besser mit Sprechpausen und Hintergrundgeräuschen um und lässt sich sauberer unterbrechen. Dazu kommt ein einstellbarer «Reasoning-Aufwand», also wie viel das Modell nachdenkt, bevor es antwortet, plus die Fähigkeit, externe Werkzeuge für komplexere Abläufe zu nutzen.

Die Sparvariante für den Massenbetrieb

Daneben steht gpt-realtime-2.1-mini: ein kleineres, schnelleres Modell für alle, die vor allem auf die Kosten achten. Der Preisunterschied ist deutlich. Während die grosse Version pro einer Million Audio-Token 32 Dollar für Eingaben und 64 Dollar für Ausgaben kostet, sind es bei der Mini-Variante nur 10 respektive 20 Dollar – also rund ein Drittel. Wer einen Voice-Agenten für viele gleichzeitige Gespräche baut, kann mit dem Mini-Modell kräftig sparen und die grosse Version für die kniffligen Fälle reservieren.

So kommst du dran

Beide Modelle sind ab sofort über die Realtime-API und den Playground von OpenAI verfügbar. Wer bereits eine Sprachanwendung auf GPT-Realtime-2 betreibt, kann in vielen Fällen einfach den Modellnamen austauschen – und profitiert sofort von der kürzeren Wartezeit.

Quellen

OpenAI Developer Community – New Realtime models: gpt-realtime-2.1 and gpt-realtime-2.1-mini↗ EXTERNER LINKMarkTechPost – OpenAI Releases GPT-Realtime-2.1 and GPT-Realtime-2.1-mini for Low-Latency Voice Agents↗ EXTERNER LINKOpenAI Developers – gpt-realtime-2.1 model documentation↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Skizze einer grossen runden Glaslinse in Elektroblau auf einem Messingstativ auf einer Holzwerkbank, daneben ein kleiner Schrank mit Vorhängeschloss und drei lose Linsen in einer Metallschale, kinewsletter.ch Stil
Handgezeichnete Skizze einer grossen runden Glaslinse in Elektroblau auf einem Messingstativ auf einer Holzwerkbank, daneben ein kleiner Schrank mit Vorhängeschloss und drei lose Linsen in einer Metallschale, kinewsletter.ch Stil
NEUE MODELLE·22. AUGUST 2026

DeepSeek gibt Flash Augen – und behält diesmal die Gewichte

DeepSeek hat sein günstiges V4-Flash um Bildverständnis erweitert – zum identischen Preis, ohne Aufschlag. Laut DeepSeeks eigener Tabelle kommt das experimentelle Modell nahe an Claude Opus 4.8 heran und schlägt es auf drei von elf Benchmarks. Zwei Details fehlen in den Schlagzeilen: Jedes Bild wird auf 0,64 Megapixel eingedampft – und die Gewichte veröffentlicht DeepSeek diesmal nicht.

Illustration einer geöffneten Tresortür mit Serverracks dahinter, kinewsletter.ch Stil
Illustration einer geöffneten Tresortür mit Serverracks dahinter, kinewsletter.ch Stil
NEUE MODELLE·16. AUGUST 2026

Qwen3.8 ist offen – Apache 2.0 aber nur für das kleine Modell

Alibabas Qwen-Team hat die Gewichte von Qwen3.8 freigegeben. Apache 2.0 gilt aber nur fürs 27B-Modell – beim Max steht Kleingedrucktes im Lizenztext.

Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·14. AUGUST 2026

DeepSeek verschenkt seine Agenten-Software – und versechsfacht die Cache-Preise

DeepSeek hat gleich dreifach geliefert: Das Flaggschiff V4-Pro verlässt mit Build 0813 die Testphase, die hauseigene Agenten-Software Harness erscheint unter MIT-Lizenz – und ab Sonntagabend steigen die API-Preise. Am stärksten trifft es ausgerechnet die Cache-Hits, von denen Coding-Agenten leben.

Illustration einer Stoppuhr mit blauem Gehäuse und einem Messschieber auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Stoppuhr mit blauem Gehäuse und einem Messschieber auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·14. AUGUST 2026

Gemini 3.7 Flash: drei Wochen nach 3.6, halber Preis

Google hat Gemini 3.7 Flash veröffentlicht – nur drei Wochen nach dem Vorgänger und zum halben Einführungspreis. Beim Programmieren legt das Modell deutlich zu, bei Agenten-Benchmarks bleibt GPT-5.6 Terra vorn. Und der Consumer-Agent Gemini Spark, der ab sofort auf 3.7 Flash läuft, ist in der Schweiz gar nicht verfügbar.

Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
NEUE MODELLE·12. AUGUST 2026

Nvidias schnellstes offenes Modell läuft auf einer einzigen GPU

Nemotron 3.5 Lightning erreicht bei Artificial Analysis dieselbe Punktzahl wie OpenAIs gpt-oss-120b – mit einem Viertel der Parameter und dem höchsten gemessenen Tempo unter 134 Modellen. Laut Modellsteckbrief genügt eine einzige H100 oder ein DGX Spark. Für Schweizer Firmen, die Daten im Haus behalten müssen, ist genau das die interessante Zahl.

Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
NEUE MODELLE·11. AUGUST 2026

OpenAI gibt GPT-5.6-Cyber frei – nur für geprüfte Verteidiger

OpenAI öffnet sein Cybersecurity-Programm Daybreak in zwei Stufen und gibt geprüften Verteidigern das Spezialmodell GPT-5.6-Cyber. Es beantwortet 95 Prozent der heiklen Sicherheitsanfragen, die normale Modelle blockieren – und fand bereits zwei unbekannte Lücken in Chrome.

Mehr aus Neue Modelle →