NewsKategorienNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

OpenAIs neue Sprachmodelle antworten schneller – und eines wird günstiger

OpenAI hat zwei neue Realtime-Sprachmodelle veröffentlicht: gpt-realtime-2.1 und die günstigere Mini-Variante. Beide reagieren dank besserem Caching mindestens 25 Prozent schneller – die Technik hinter Sprachassistenten und Telefon-Bots wird flüssiger und billiger.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
7. JULI 2026
2 MIN. LESEZEIT
Handgezeichnete Skizze eines Studiomikrofons mit Lautsprecher, Schallwellen und einer Stoppuhr, mit elektroblauem Akzent
Handgezeichnete Skizze eines Studiomikrofons mit Lautsprecher, Schallwellen und einer Stoppuhr, mit elektroblauem Akzent (Dark Mode)
INHALT
01Ein Viertel weniger Wartezeit02Das grosse Modell hört genauer zu03Die Sparvariante für den Massenbetrieb04So kommst du dran
INHALT
01Ein Viertel weniger Wartezeit02Das grosse Modell hört genauer zu03Die Sparvariante für den Massenbetrieb04So kommst du dran
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

OpenAIs neue Realtime-Modelle senken die Antwortzeit von Sprach-KI um mindestens ein Viertel – und die Mini-Variante kostet nur rund ein Drittel des grossen Modells.

OpenAI hat zwei neue Sprachmodelle für seine Realtime-API veröffentlicht: gpt-realtime-2.1 und gpt-realtime-2.1-mini. Beide sind dafür gemacht, dass Anwendungen in Echtzeit zuhören und antworten – also die Technik hinter Sprachassistenten, Telefon-Bots und Voice-Agenten.

Ein Viertel weniger Wartezeit

Der wichtigste Fortschritt ist Tempo. Laut OpenAI sinkt die sogenannte p95-Latenz – die Wartezeit, die 95 Prozent der Anfragen nicht überschreiten – über alle Realtime-Sprachmodelle hinweg um mindestens 25 Prozent. Möglich macht das ein verbessertes Caching, bei dem wiederkehrende Teile einer Anfrage zwischengespeichert statt jedes Mal neu berechnet werden. Für dich als Nutzer heisst das: Ein Sprach-Bot, der auf dieser Technik läuft, reagiert flüssiger und stockt seltener.

Das grosse Modell hört genauer zu

gpt-realtime-2.1 baut auf dem Vorgänger GPT-Realtime-2 auf und verbessert vor allem drei Dinge: Es erkennt Buchstaben- und Zahlenfolgen zuverlässiger – etwa wenn du eine Kundennummer oder ein Autokennzeichen diktierst –, geht besser mit Sprechpausen und Hintergrundgeräuschen um und lässt sich sauberer unterbrechen. Dazu kommt ein einstellbarer «Reasoning-Aufwand», also wie viel das Modell nachdenkt, bevor es antwortet, plus die Fähigkeit, externe Werkzeuge für komplexere Abläufe zu nutzen.

Die Sparvariante für den Massenbetrieb

Daneben steht gpt-realtime-2.1-mini: ein kleineres, schnelleres Modell für alle, die vor allem auf die Kosten achten. Der Preisunterschied ist deutlich. Während die grosse Version pro einer Million Audio-Token 32 Dollar für Eingaben und 64 Dollar für Ausgaben kostet, sind es bei der Mini-Variante nur 10 respektive 20 Dollar – also rund ein Drittel. Wer einen Voice-Agenten für viele gleichzeitige Gespräche baut, kann mit dem Mini-Modell kräftig sparen und die grosse Version für die kniffligen Fälle reservieren.

So kommst du dran

Beide Modelle sind ab sofort über die Realtime-API und den Playground von OpenAI verfügbar. Wer bereits eine Sprachanwendung auf GPT-Realtime-2 betreibt, kann in vielen Fällen einfach den Modellnamen austauschen – und profitiert sofort von der kürzeren Wartezeit.

Quellen

OpenAI Developer Community – New Realtime models: gpt-realtime-2.1 and gpt-realtime-2.1-mini↗ EXTERNER LINKMarkTechPost – OpenAI Releases GPT-Realtime-2.1 and GPT-Realtime-2.1-mini for Low-Latency Voice Agents↗ EXTERNER LINKOpenAI Developers – gpt-realtime-2.1 model documentation↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Tintenfasses mit Füllfederhalter, Bauplänen und Zirkel auf einem Zeichentisch, kinewsletter.ch Stil
Illustration eines Tintenfasses mit Füllfederhalter, Bauplänen und Zirkel auf einem Zeichentisch, kinewsletter.ch Stil
NEUE MODELLE·17. JULI 2026

Muratis erstes Modell ist offen – und bewusst nicht das beste

Thinking Machines Lab veröffentlicht Inkling: 975 Milliarden Parameter, offene Gewichte. Laut der Firma bewusst nicht das stärkste Modell – sondern ein Rohling zum Feintunen.

Illustration einer riesigen kreisförmigen Maschine in einer Werkhalle, mit einer winzigen Person auf dem Laufsteg als Grössenvergleich, kinewsletter.ch Stil
Illustration einer riesigen kreisförmigen Maschine in einer Werkhalle, mit einer winzigen Person auf dem Laufsteg als Grössenvergleich, kinewsletter.ch Stil
NEUE MODELLE·17. JULI 2026

Kimi K3 erreicht Frontier-Niveau – und beendet die Billig-Ära

Moonshot AI hat Kimi K3 vorgestellt: 2,8 Billionen Parameter, eine Million Token Kontext, offene Gewichte ab dem 27. Juli. Das Modell spielt auf Augenhöhe mit den besten US-Systemen – und kostet dreimal so viel wie sein Vorgänger. Die Zeit der chinesischen Kampfpreise ist damit vorbei.

Handgezeichnete Skizze: drei Tueren zunehmender Groesse in einem Werkstattflur, jede mit einem leeren Preisschild am Griff, mit elektroblauem Akzent
Handgezeichnete Skizze: drei Tueren zunehmender Groesse in einem Werkstattflur, jede mit einem leeren Preisschild am Griff, mit elektroblauem Akzent (Dark Mode)
NEUE MODELLE·10. JULI 2026

GPT-5.6 für alle: OpenAI bringt drei Modelle zu drei Preisen

Seit dem 9. Juli ist OpenAIs neue Generation GPT-5.6 öffentlich verfügbar – in drei Stufen namens Sol, Terra und Luna, deren Preise von 1 bis 30 Dollar pro Million Token reichen. Zuvor hatte eine staatliche Sicherheitsprüfung die Freigabe wochenlang verzögert.

Skizze zu Grok 4.5 von SpaceXAI, kinewsletter.ch Stil
Skizze zu Grok 4.5 von SpaceXAI, kinewsletter.ch Stil (dark)
NEUE MODELLE·9. JULI 2026

Grok 4.5: SpaceXAIs günstiger Angriff auf Claude Opus

SpaceXAI hat Grok 4.5 veröffentlicht – ein «Opus-class model» für Coding und agentische Aufgaben, das beim Output rund viermal günstiger ist als Claude Opus 4.8. Die Leistungsvergleiche stammen allerdings aus xAI-eigenen Benchmarks, und selbst dort liegt Grok nicht an der Spitze.

Illustration eines offenen Serverschranks an einer Werkbank, kinewsletter.ch Stil
Illustration offener Serverschrank, kinewsletter.ch Stil Dark
NEUE MODELLE·7. JULI 2026

Tencent bringt Hy3: offenes 295-Milliarden-Modell, das über seiner Klasse boxt

Nur 21 Mrd. aktive Parameter, Apache-2.0-Lizenz und Self-Hosting: Tencents neues MoE-Modell zielt auf Effizienz statt Grösse.

Illustration: Person am Schreibtisch, der Monitor schaltet sich wieder ein und ein Papierflieger kehrt durchs Fenster zurück – kinewsletter.ch Stil
Illustration Dark Mode: Person am Schreibtisch, Monitor schaltet sich wieder ein – kinewsletter.ch Stil
KI-TOOLS & APPS·2. JULI 2026

Claude Fable 5 ist zurück – mit Gratis-Woche und Benchmark-Sieg

Nach drei Wochen Zwangspause ist Anthropics stärkstes Modell wieder online – bis zum 7. Juli sogar gratis. Und ein neuer Benchmark zeigt, warum das mehr ist als ein Software-Update.

Mehr aus Neue Modelle →