NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

GPT-Realtime-2: OpenAI bringt Voice mit GPT-5-Hirn und Echtzeit-Übersetzung

OpenAI hat drei neue Voice-Modelle veröffentlicht: GPT-Realtime-2 mit GPT-5-Reasoning, GPT-Realtime-Translate für Live-Übersetzung in 70 Sprachen und GPT-Realtime-Whisper für Streaming-Transkription. Voice ist damit nicht mehr Demo-Feature, sondern operativer Bauklotz für Produkte.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
8. MAI 2026
2 MIN. LESEZEIT
Vintage Telefonzentrale mit Sprachenflaggen, kinewsletter.ch Stil
Vintage Telefonzentrale mit Sprachenflaggen (Dark Mode), kinewsletter.ch Stil
INHALT
01GPT-5-Reasoning, jetzt mit Stimme02Übersetzung als eigenes Modell03Was das für deinen Stack bedeutet
INHALT
01GPT-5-Reasoning, jetzt mit Stimme02Übersetzung als eigenes Modell03Was das für deinen Stack bedeutet
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Drei API-Endpunkte – Reasoning-Voice, Live-Translation und Streaming-Transkription – die das Voice-Modell zum echten Produkt-Bauklotz machen.

OpenAI hat seine Voice-API generalüberholt: GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper sind seit Donnerstag, 7. Mai 2026, im Realtime-API verfügbar. Drei Modelle, drei Aufgaben – und der Anspruch, dass Voice-Apps endlich aus dem "kann auch reden"-Kuriositätsmodus kommen.

GPT-5-Reasoning, jetzt mit Stimme

GPT-Realtime-2 ist OpenAIs erstes Voice-Modell mit GPT-5-Klasse-Reasoning. Das heisst: Während du sprichst, kann das Modell mitdenken, Tools aufrufen, Korrekturen verarbeiten und Unterbrechungen handhaben – ohne das Gespräch zu verlieren. Der Kontext ist auf 128'000 Token angewachsen, was für längere Service-Calls oder Tutorings genug Spielraum lässt.

Der Preis ist saftig: 32 Dollar pro Million Audio-Input-Token, 64 Dollar pro Million Output-Token. Cached Input kostet 40 Cent. Wer ernsthaft skaliert, sollte rechnen.

Übersetzung als eigenes Modell

Spannender ist GPT-Realtime-Translate. Das Modell übersetzt gesprochene Sprache aus über 70 Eingabesprachen in 13 Ausgabesprachen – live, Wort für Wort, im Tempo der Sprecherin. Abrechnung: 3,4 Cent pro Minute. Für Customer-Support-Hotlines, internationale Sales-Calls, Konferenz-Streams oder Bildungsplattformen ist das eine Ansage.

GPT-Realtime-Whisper rundet das Paket ab: Streaming-Transkription in Echtzeit für 1,7 Cent pro Minute. Damit kann eine App mitschreiben, während gesprochen wird – ohne auf das Ende des Satzes zu warten.

Was das für deinen Stack bedeutet

Wenn du als Entwicklerin oder Entwickler an Voice-Agenten, Live-Translation-Tools oder Meeting-Bots baust, musste man bisher mehrere Modelle stapeln – Speech-to-Text, dann LLM, dann Text-to-Speech. GPT-Realtime-2 macht das in einem Aufruf. Die Modelle laufen alle im Realtime-API von OpenAI und sind sofort im Playground testbar.

Für Anthropic – aktuell ohne breit verfügbares Voice-Modell – wird es eng. Die Voice-Schiene war einer der wenigen Vorsprünge, den OpenAI im Produktwettbewerb noch klar hielt. Mit Reasoning, Übersetzung und Transkription jeweils als eigene API-Endpunkte wird der Vorsprung jetzt operationalisiert.

Einordnung: Voice ist ab jetzt nicht mehr Demo-Feature, sondern Bauklotz für ernsthafte Produkte. Wer Schweizer Mehrsprachigkeit (de/fr/it/en) automatisch ins Produkt holen will, hat plötzlich einen sauberen API-Pfad.

Quellen

OpenAI: Advancing voice intelligence↗ EXTERNER LINKOpenAI Realtime API Docs↗ EXTERNER LINKTechCrunch↗ EXTERNER LINK9to5Mac↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
OpenAIAnthropic
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Tonstudios mit Mischpult, Kondensatormikrofon am Galgen und Kopfhörern, kinewsletter.ch Stil
Illustration eines Tonstudios mit Mischpult, Kondensatormikrofon am Galgen und Kopfhörern, kinewsletter.ch Stil
NEUE MODELLE·24. SEPTEMBER 2026

Alibaba macht KI-Sprache um bis zu 95 Prozent billiger

Alibabas Qwen-Team hat Qwen-Audio-3.1 veröffentlicht: fünf Modelle für Spracherkennung, Sprachsynthese und Echtzeit-Dialog, dazu Preissenkungen von bis zu 95 Prozent. Die Modelle laufen ausschliesslich als Cloud-API – offene Gewichte gibt es nur für die ältere Qwen3-ASR-Reihe.

Illustration einer Balkenwaage mit Münzen gegen ein Zahnrad in einer Werkstatt, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Münzen gegen ein Zahnrad in einer Werkstatt, kinewsletter.ch Stil
NEUE MODELLE·23. SEPTEMBER 2026

Claude Opus 5.5: Fable-Niveau zum tieferen Preis

Anthropic hat Claude Opus 5.5 veröffentlicht. Das Modell arbeitet laut Anthropic auf Fable-5.1-Niveau, kostet im Betrieb aber 40 Prozent weniger als Opus 5.

Illustration einer Balkenwaage mit Münzstapel in Elektroblau, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Münzstapel in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·23. SEPTEMBER 2026

OpenAI halbiert die API-Preise für GPT-6 Sol und Luna

OpenAI hat GPT-6 Sol und Luna veröffentlicht und die API-Preise halbiert. Für Schweizer Teams mit Agenten-Workloads schrumpft die Token-Rechnung auf die Hälfte.

Illustration einer Waage mit Preisschild und Stoppuhren auf einer Werkbank am Fenster, kinewsletter.ch Stil
Illustration einer Waage mit Preisschild und Stoppuhren auf einer Werkbank am Fenster, kinewsletter.ch Stil
NEUE MODELLE·22. SEPTEMBER 2026

xAI bringt Grok 4.7 – günstig, aber kein Spitzenreiter

xAI hat Grok 4.7 veröffentlicht: 2 US-Dollar pro Million Input-Token, 6 Dollar für Output – ein Bruchteil dessen, was Claude Fable 5.1 kostet. Im unabhängigen Artificial Analysis Intelligence Index landet das Modell mit 46 Punkten aber nur im Mittelfeld. Für Schweizer Teams heisst das: günstig rechnen, aber nicht blind auf lange Agenten-Läufe setzen.

Skizze einer Waage mit Münzen und Dokumentenstapel in Elektroblau, kinewsletter.ch Stil
Skizze einer Waage mit Münzen und Dokumentenstapel in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·21. SEPTEMBER 2026

600-Milliarden-Modell für einen Dollar pro Million Token

StepFun hat am 20. September 2026 Step 5 Preview gestartet: ein Sparse-MoE-Modell mit rund 600 Milliarden Parametern, 1 Million Token Kontext und einem Listenpreis von 1 US-Dollar pro Million Input-Token. Die Gewichte sollen am 15. Oktober offengelegt werden.

Skizze eines Mikrofons mit Sprachwellen in Elektroblau, kinewsletter.ch Stil
Skizze eines Mikrofons mit Sprachwellen in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·16. SEPTEMBER 2026

Gemini 3.8 Live: Google unterbietet OpenAI beim Sprechen

Googles neue Sprachmodelle wechseln mitten im Gespräch zwischen 97 Sprachen und erledigen Tool-Calls im Hintergrund – zu einem Bruchteil der Kosten der Konkurrenz.

Mehr aus Neue Modelle →