NewsKategorienNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

GPT-Realtime-2: OpenAI bringt Voice mit GPT-5-Hirn und Echtzeit-Übersetzung

OpenAI hat drei neue Voice-Modelle veröffentlicht: GPT-Realtime-2 mit GPT-5-Reasoning, GPT-Realtime-Translate für Live-Übersetzung in 70 Sprachen und GPT-Realtime-Whisper für Streaming-Transkription. Voice ist damit nicht mehr Demo-Feature, sondern operativer Bauklotz für Produkte.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
8. MAI 2026
2 MIN. LESEZEIT
Vintage Telefonzentrale mit Sprachenflaggen, kinewsletter.ch Stil
Vintage Telefonzentrale mit Sprachenflaggen (Dark Mode), kinewsletter.ch Stil
INHALT
01GPT-5-Reasoning, jetzt mit Stimme02Übersetzung als eigenes Modell03Was das für deinen Stack bedeutet
INHALT
01GPT-5-Reasoning, jetzt mit Stimme02Übersetzung als eigenes Modell03Was das für deinen Stack bedeutet
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Drei API-Endpunkte – Reasoning-Voice, Live-Translation und Streaming-Transkription – die das Voice-Modell zum echten Produkt-Bauklotz machen.

OpenAI hat seine Voice-API generalüberholt: GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper sind seit Donnerstag, 7. Mai 2026, im Realtime-API verfügbar. Drei Modelle, drei Aufgaben – und der Anspruch, dass Voice-Apps endlich aus dem "kann auch reden"-Kuriositätsmodus kommen.

GPT-5-Reasoning, jetzt mit Stimme

GPT-Realtime-2 ist OpenAIs erstes Voice-Modell mit GPT-5-Klasse-Reasoning. Das heisst: Während du sprichst, kann das Modell mitdenken, Tools aufrufen, Korrekturen verarbeiten und Unterbrechungen handhaben – ohne das Gespräch zu verlieren. Der Kontext ist auf 128'000 Token angewachsen, was für längere Service-Calls oder Tutorings genug Spielraum lässt.

Der Preis ist saftig: 32 Dollar pro Million Audio-Input-Token, 64 Dollar pro Million Output-Token. Cached Input kostet 40 Cent. Wer ernsthaft skaliert, sollte rechnen.

Übersetzung als eigenes Modell

Spannender ist GPT-Realtime-Translate. Das Modell übersetzt gesprochene Sprache aus über 70 Eingabesprachen in 13 Ausgabesprachen – live, Wort für Wort, im Tempo der Sprecherin. Abrechnung: 3,4 Cent pro Minute. Für Customer-Support-Hotlines, internationale Sales-Calls, Konferenz-Streams oder Bildungsplattformen ist das eine Ansage.

GPT-Realtime-Whisper rundet das Paket ab: Streaming-Transkription in Echtzeit für 1,7 Cent pro Minute. Damit kann eine App mitschreiben, während gesprochen wird – ohne auf das Ende des Satzes zu warten.

Was das für deinen Stack bedeutet

Wenn du als Entwicklerin oder Entwickler an Voice-Agenten, Live-Translation-Tools oder Meeting-Bots baust, musste man bisher mehrere Modelle stapeln – Speech-to-Text, dann LLM, dann Text-to-Speech. GPT-Realtime-2 macht das in einem Aufruf. Die Modelle laufen alle im Realtime-API von OpenAI und sind sofort im Playground testbar.

Für Anthropic – aktuell ohne breit verfügbares Voice-Modell – wird es eng. Die Voice-Schiene war einer der wenigen Vorsprünge, den OpenAI im Produktwettbewerb noch klar hielt. Mit Reasoning, Übersetzung und Transkription jeweils als eigene API-Endpunkte wird der Vorsprung jetzt operationalisiert.

Einordnung: Voice ist ab jetzt nicht mehr Demo-Feature, sondern Bauklotz für ernsthafte Produkte. Wer Schweizer Mehrsprachigkeit (de/fr/it/en) automatisch ins Produkt holen will, hat plötzlich einen sauberen API-Pfad.

Quellen

OpenAI: Advancing voice intelligence↗ EXTERNER LINKOpenAI Realtime API Docs↗ EXTERNER LINKTechCrunch↗ EXTERNER LINK9to5Mac↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Skizze: drei Tueren zunehmender Groesse in einem Werkstattflur, jede mit einem leeren Preisschild am Griff, mit elektroblauem Akzent
Handgezeichnete Skizze: drei Tueren zunehmender Groesse in einem Werkstattflur, jede mit einem leeren Preisschild am Griff, mit elektroblauem Akzent (Dark Mode)
NEUE MODELLE·10. JULI 2026

GPT-5.6 für alle: OpenAI bringt drei Modelle zu drei Preisen

Seit dem 9. Juli ist OpenAIs neue Generation GPT-5.6 öffentlich verfügbar – in drei Stufen namens Sol, Terra und Luna, deren Preise von 1 bis 30 Dollar pro Million Token reichen. Zuvor hatte eine staatliche Sicherheitsprüfung die Freigabe wochenlang verzögert.

Skizze zu Grok 4.5 von SpaceXAI, kinewsletter.ch Stil
Skizze zu Grok 4.5 von SpaceXAI, kinewsletter.ch Stil (dark)
NEUE MODELLE·9. JULI 2026

Grok 4.5: SpaceXAIs günstiger Angriff auf Claude Opus

SpaceXAI hat Grok 4.5 veröffentlicht – ein «Opus-class model» für Coding und agentische Aufgaben, das beim Output rund viermal günstiger ist als Claude Opus 4.8. Die Leistungsvergleiche stammen allerdings aus xAI-eigenen Benchmarks, und selbst dort liegt Grok nicht an der Spitze.

Handgezeichnete Skizze eines Studiomikrofons mit Lautsprecher, Schallwellen und einer Stoppuhr, mit elektroblauem Akzent
Handgezeichnete Skizze eines Studiomikrofons mit Lautsprecher, Schallwellen und einer Stoppuhr, mit elektroblauem Akzent (Dark Mode)
NEUE MODELLE·7. JULI 2026

OpenAIs neue Sprachmodelle antworten schneller – und eines wird günstiger

OpenAI hat zwei neue Realtime-Sprachmodelle veröffentlicht: gpt-realtime-2.1 und die günstigere Mini-Variante. Beide reagieren dank besserem Caching mindestens 25 Prozent schneller – die Technik hinter Sprachassistenten und Telefon-Bots wird flüssiger und billiger.

Illustration eines offenen Serverschranks an einer Werkbank, kinewsletter.ch Stil
Illustration offener Serverschrank, kinewsletter.ch Stil Dark
NEUE MODELLE·7. JULI 2026

Tencent bringt Hy3: offenes 295-Milliarden-Modell, das über seiner Klasse boxt

Nur 21 Mrd. aktive Parameter, Apache-2.0-Lizenz und Self-Hosting: Tencents neues MoE-Modell zielt auf Effizienz statt Grösse.

Illustration: Person am Schreibtisch, der Monitor schaltet sich wieder ein und ein Papierflieger kehrt durchs Fenster zurück – kinewsletter.ch Stil
Illustration Dark Mode: Person am Schreibtisch, Monitor schaltet sich wieder ein – kinewsletter.ch Stil
KI-TOOLS & APPS·2. JULI 2026

Claude Fable 5 ist zurück – mit Gratis-Woche und Benchmark-Sieg

Nach drei Wochen Zwangspause ist Anthropics stärkstes Modell wieder online – bis zum 7. Juli sogar gratis. Und ein neuer Benchmark zeigt, warum das mehr ist als ein Software-Update.

Handgezeichnete Skizze eines Kontrollraums mit Schaltpult und einem heruntergezogenen blauen Hebel, elektroblauer Akzent
Handgezeichnete Skizze eines Kontrollraums mit Schaltpult und einem heruntergezogenen blauen Hebel, elektroblauer Akzent (Dark Mode)
NEUE MODELLE·1. JULI 2026

Claude Sonnet 5: fast Opus-Niveau zum Sonnet-Preis

Anthropics neues Modell Claude Sonnet 5 reicht nahe an das Spitzenmodell Opus 4.8 heran – zum Einführungspreis von 2 statt 5 Dollar pro Million Token. Agentische KI, die eben noch ein Premium-Budget verlangte, wird damit alltagstauglich.

Mehr aus Neue Modelle →