Alibabas Qwen-Team hat Qwen-Audio-3.1 veröffentlicht: fünf Modelle für Spracherkennung, Sprachsynthese und Echtzeit-Dialog, dazu Preissenkungen von bis zu 95 Prozent. Die Modelle laufen ausschliesslich als Cloud-API – offene Gewichte gibt es nur für die ältere Qwen3-ASR-Reihe.
Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.
Sprach-KI wird zur Massenware. Wer das in der Schweiz einsetzen will, muss aber zuerst die Bekanntgabe ins Ausland nach DSG klären – und Schweizerdeutsch ist nicht dokumentiert.
Alibabas Qwen-Team hat am 23. September 2026 Qwen-Audio-3.1 veröffentlicht: fünf Modelle für Spracherkennung, Sprachsynthese und Echtzeit-Dialog. Gleichzeitig senkt Alibaba die Preise drastisch – Sprachsynthese wird laut der Ankündigung des Qwen-Teams rund 70 Prozent günstiger, Echtzeit-Interaktion rund 85 Prozent, Spracherkennung bis zu 95 Prozent. Neu in der Reihe sind zwei Modelle: ASR-Next fürs Verstehen, TTS-Next fürs Erzeugen von Audio.
ASR-Next trennt mehrere Sprecher mit Zeitstempeln und erkennt zusätzlich Emotionen sowie Umgebungs- und Maschinengeräusche. Das reguläre ASR-Modell entfernt Füllwörter und Wiederholungen bereits beim Transkribieren statt in einem zweiten Durchgang. Die Basis dafür beschreibt Alibaba im technischen Bericht zu Qwen-Audio-3.0-ASR: 30 Sprachen, Deutsch inklusive, plus 16 chinesische Dialekte über eine einzige Modellschnittstelle.
TTS-Next kombiniert ein Sprachmodell mit einem Diffusionsverfahren – derselben Technik, die auch hinter KI-Bildgeneratoren steckt – und erzeugt Stimme, Soundeffekte und Hintergrundaudio in einem einzigen Durchgang. Emotion, Tempo und Stil steuerst du per Textanweisung. Das Echtzeit-Modell kann gleichzeitig sprechen und zuhören und lässt sich mitten im Satz unterbrechen.
Qwen-Audio-3.1 läuft ausschliesslich als Cloud-API über Alibaba Cloud Model Studio beziehungsweise QwenCloud. Auf Hugging Face liegen keine 3.1- – offen verfügbar ist nur die ältere Qwen3-ASR-Reihe unter Apache-2.0-Lizenz. Die Preisliste von Alibaba Cloud zeigt, wie tief das Niveau inzwischen liegt: 0.15 US-Dollar pro Million Eingabe- für , 0.47 Dollar für die Ausgabe.
qwen-audio-3.1-asr-flashFür Schweizer Anbieter von Voice-Produkten heisst das vor allem Preisdruck: Wer Transkription oder Sprachausgabe weiterverkauft, konkurriert jetzt mit Centbeträgen. Zwei Einschränkungen bleiben aber. Erstens der Datenschutz – Sprachaufnahmen sind heikle Personendaten, und Model Studio läuft in Peking, Singapur, Tokio, Hongkong, Virginia und Frankfurt, nicht aber in der Schweiz. Wer solche Daten bearbeitet, braucht einen sauberen Auftragsbearbeitungsvertrag und muss die Bekanntgabe ins Ausland nach DSG prüfen. Zweitens die Sprache: Die 16 Dialekte sind chinesische. Für Schweizerdeutsch gibt es in den Unterlagen keinen Beleg – Hochdeutsch ist abgedeckt, Mundart nicht dokumentiert.
Anthropic hat Claude Opus 5.5 veröffentlicht. Das Modell arbeitet laut Anthropic auf Fable-5.1-Niveau, kostet im Betrieb aber 40 Prozent weniger als Opus 5.