NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Alibaba macht KI-Sprache um bis zu 95 Prozent billiger

Alibabas Qwen-Team hat Qwen-Audio-3.1 veröffentlicht: fünf Modelle für Spracherkennung, Sprachsynthese und Echtzeit-Dialog, dazu Preissenkungen von bis zu 95 Prozent. Die Modelle laufen ausschliesslich als Cloud-API – offene Gewichte gibt es nur für die ältere Qwen3-ASR-Reihe.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
24. SEPTEMBER 2026
2 MIN. LESEZEIT
Illustration eines Tonstudios mit Mischpult, Kondensatormikrofon am Galgen und Kopfhörern, kinewsletter.ch Stil
Illustration eines Tonstudios mit Mischpult, Kondensatormikrofon am Galgen und Kopfhörern, kinewsletter.ch Stil
INHALT
01Wer spricht, wann und in welcher Stimmung02Stimme, Geräusch und Hintergrund in einem Zug03Der Haken: Es gibt nichts zum Herunterladen04Schweizerdeutsch steht nicht auf der Liste
INHALT
01Wer spricht, wann und in welcher Stimmung02Stimme, Geräusch und Hintergrund in einem Zug03Der Haken: Es gibt nichts zum Herunterladen04Schweizerdeutsch steht nicht auf der Liste
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Sprach-KI wird zur Massenware. Wer das in der Schweiz einsetzen will, muss aber zuerst die Bekanntgabe ins Ausland nach DSG klären – und Schweizerdeutsch ist nicht dokumentiert.

Alibabas Qwen-Team hat am 23. September 2026 Qwen-Audio-3.1 veröffentlicht: fünf Modelle für Spracherkennung, Sprachsynthese und Echtzeit-Dialog. Gleichzeitig senkt Alibaba die Preise drastisch – Sprachsynthese wird laut der Ankündigung des Qwen-Teams rund 70 Prozent günstiger, Echtzeit-Interaktion rund 85 Prozent, Spracherkennung bis zu 95 Prozent. Neu in der Reihe sind zwei Modelle: ASR-Next fürs Verstehen, TTS-Next fürs Erzeugen von Audio.

Wer spricht, wann und in welcher Stimmung

ASR-Next trennt mehrere Sprecher mit Zeitstempeln und erkennt zusätzlich Emotionen sowie Umgebungs- und Maschinengeräusche. Das reguläre ASR-Modell entfernt Füllwörter und Wiederholungen bereits beim Transkribieren statt in einem zweiten Durchgang. Die Basis dafür beschreibt Alibaba im technischen Bericht zu Qwen-Audio-3.0-ASR: 30 Sprachen, Deutsch inklusive, plus 16 chinesische Dialekte über eine einzige Modellschnittstelle.

Stimme, Geräusch und Hintergrund in einem Zug

TTS-Next kombiniert ein Sprachmodell mit einem Diffusionsverfahren – derselben Technik, die auch hinter KI-Bildgeneratoren steckt – und erzeugt Stimme, Soundeffekte und Hintergrundaudio in einem einzigen Durchgang. Emotion, Tempo und Stil steuerst du per Textanweisung. Das Echtzeit-Modell kann gleichzeitig sprechen und zuhören und lässt sich mitten im Satz unterbrechen.

Der Haken: Es gibt nichts zum Herunterladen

Qwen-Audio-3.1 läuft ausschliesslich als Cloud-API über Alibaba Cloud Model Studio beziehungsweise QwenCloud. Auf Hugging Face liegen keine 3.1- – offen verfügbar ist nur die ältere Qwen3-ASR-Reihe unter Apache-2.0-Lizenz. Die Preisliste von Alibaba Cloud zeigt, wie tief das Niveau inzwischen liegt: 0.15 US-Dollar pro Million Eingabe- für , 0.47 Dollar für die Ausgabe.

WEITERLESENDas könnte dich auch interessieren.

Illustration einer Balkenwaage mit Münzen gegen ein Zahnrad in einer Werkstatt, kinewsletter.ch Stil
Gewichte
Token
qwen-audio-3.1-asr-flash

Schweizerdeutsch steht nicht auf der Liste

Für Schweizer Anbieter von Voice-Produkten heisst das vor allem Preisdruck: Wer Transkription oder Sprachausgabe weiterverkauft, konkurriert jetzt mit Centbeträgen. Zwei Einschränkungen bleiben aber. Erstens der Datenschutz – Sprachaufnahmen sind heikle Personendaten, und Model Studio läuft in Peking, Singapur, Tokio, Hongkong, Virginia und Frankfurt, nicht aber in der Schweiz. Wer solche Daten bearbeitet, braucht einen sauberen Auftragsbearbeitungsvertrag und muss die Bekanntgabe ins Ausland nach DSG prüfen. Zweitens die Sprache: Die 16 Dialekte sind chinesische. Für Schweizerdeutsch gibt es in den Unterlagen keinen Beleg – Hochdeutsch ist abgedeckt, Mundart nicht dokumentiert.

Quellen

Qwen (@Alibaba_Qwen): Meet Qwen-Audio-3.1 – offizielle Ankündigung↗ EXTERNER LINKAlibaba Cloud Model Studio – Model inference pricing↗ EXTERNER LINKQwenCloud – Qwen-Audio-3.1-ASR-Flash-Filetrans Modellseite↗ EXTERNER LINKQwen-Audio-3.0-ASR Technical Report (arXiv 2609.07549)↗ EXTERNER LINKAlibaba Cloud Model Studio – Übersicht und Regionen↗ EXTERNER LINKHugging Face – Qwen/Qwen3-ASR-1.7B (Apache-2.0, offene Gewichte)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
Hugging Face
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?
Illustration einer Balkenwaage mit Münzen gegen ein Zahnrad in einer Werkstatt, kinewsletter.ch Stil
NEUE MODELLE·23. SEPTEMBER 2026

Claude Opus 5.5: Fable-Niveau zum tieferen Preis

Anthropic hat Claude Opus 5.5 veröffentlicht. Das Modell arbeitet laut Anthropic auf Fable-5.1-Niveau, kostet im Betrieb aber 40 Prozent weniger als Opus 5.

Illustration einer Balkenwaage mit Münzstapel in Elektroblau, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Münzstapel in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·23. SEPTEMBER 2026

OpenAI halbiert die API-Preise für GPT-6 Sol und Luna

OpenAI hat GPT-6 Sol und Luna veröffentlicht und die API-Preise halbiert. Für Schweizer Teams mit Agenten-Workloads schrumpft die Token-Rechnung auf die Hälfte.

Illustration einer Waage mit Preisschild und Stoppuhren auf einer Werkbank am Fenster, kinewsletter.ch Stil
Illustration einer Waage mit Preisschild und Stoppuhren auf einer Werkbank am Fenster, kinewsletter.ch Stil
NEUE MODELLE·22. SEPTEMBER 2026

xAI bringt Grok 4.7 – günstig, aber kein Spitzenreiter

xAI hat Grok 4.7 veröffentlicht: 2 US-Dollar pro Million Input-Token, 6 Dollar für Output – ein Bruchteil dessen, was Claude Fable 5.1 kostet. Im unabhängigen Artificial Analysis Intelligence Index landet das Modell mit 46 Punkten aber nur im Mittelfeld. Für Schweizer Teams heisst das: günstig rechnen, aber nicht blind auf lange Agenten-Läufe setzen.

Skizze einer Waage mit Münzen und Dokumentenstapel in Elektroblau, kinewsletter.ch Stil
Skizze einer Waage mit Münzen und Dokumentenstapel in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·21. SEPTEMBER 2026

600-Milliarden-Modell für einen Dollar pro Million Token

StepFun hat am 20. September 2026 Step 5 Preview gestartet: ein Sparse-MoE-Modell mit rund 600 Milliarden Parametern, 1 Million Token Kontext und einem Listenpreis von 1 US-Dollar pro Million Input-Token. Die Gewichte sollen am 15. Oktober offengelegt werden.

Skizze eines Mikrofons mit Sprachwellen in Elektroblau, kinewsletter.ch Stil
Skizze eines Mikrofons mit Sprachwellen in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·16. SEPTEMBER 2026

Gemini 3.8 Live: Google unterbietet OpenAI beim Sprechen

Googles neue Sprachmodelle wechseln mitten im Gespräch zwischen 97 Sprachen und erledigen Tool-Calls im Hintergrund – zu einem Bruchteil der Kosten der Konkurrenz.

Handgezeichnete Illustration: Dirigentenpodest mit Notenstaender vor leeren Orchesterstuehlen, kinewsletter.ch Stil
Handgezeichnete Illustration: Dirigentenpodest mit Notenstaender vor leeren Orchesterstuehlen, kinewsletter.ch Stil
NEUE MODELLE·12. SEPTEMBER 2026

Sakana teilt Fugu auf: ein Modell, das andere Modelle dirigiert

Sakana AI hat Fugu Max und Fugu Ultra v2 veröffentlicht. Beide sind keine klassischen Sprachmodelle, sondern gelernte Dirigenten, die Aufgaben auf einen Pool anderer Modelle verteilen. Fugu Max kostet 2 US-Dollar pro Million Input-Token – und die Schweiz fällt nicht unter den EU-Ausschluss.

Mehr aus Neue Modelle →