NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Alibaba zeigt die Qwen4-Architektur – zum Zwölftel-Preis

Alibabas Qwen-Team hat Qwen3.8-Flash-Next veröffentlicht – ein Modell mit offenen Gewichten, das die Architektur des kommenden Qwen4 vorwegnimmt. 125 Milliarden Parameter, davon nur 6 Milliarden aktiv pro Token, und ein API-Preis von 0.16 Dollar pro Million Eingabe-Tokens: rund ein Zwölftel dessen, was Alibabas eigenes Flaggschiff kostet.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
27. AUGUST 2026
3 MIN. LESEZEIT
Illustration eines Abakus auf einem Kaufmannstisch mit blauen Kugeln, kinewsletter.ch Stil
Illustration eines Abakus auf einem Kaufmannstisch mit blauen Kugeln, kinewsletter.ch Stil
INHALT
01Sechs Milliarden Parameter, die wirklich rechnen02Der Benchmark-Vorsprung hat ein Sternchen03Offene Gewichte, aber keine Apache-Lizenz
INHALT
01Sechs Milliarden Parameter, die wirklich rechnen02Der Benchmark-Vorsprung hat ein Sternchen03Offene Gewichte, aber keine Apache-Lizenz
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Sparsame Architektur schlägt rohe Grösse: Qwen trainiert für ein Neuntel der Kosten des Vorgängers und unterbietet das eigene Flaggschiff um den Faktor zwölf – der Haken sind Herstellerbenchmarks und eine Lizenz, die keine Apache 2.0 ist.

Alibabas Qwen-Team hat am 26. August Qwen3.8-Flash-Next veröffentlicht – ein Modell mit offenen Gewichten, das die Architektur des kommenden Qwen4 bereits vorwegnimmt. Es trägt 125 Milliarden Parameter, rechnet pro Token aber nur mit 6 Milliarden davon und kostet über die QwenCloud-API 0.16 Dollar pro Million Eingabe- und 0.47 Dollar pro Million Ausgabe-Tokens. Zum Vergleich: Alibabas eigenes Flaggschiff Qwen3.8-Max verlangt 2 beziehungsweise 6 Dollar – rund das Zwölffache.

Sechs Milliarden Parameter, die wirklich rechnen

Möglich macht das eine Mixture-of-Experts-Architektur: Statt das ganze Netzwerk zu aktivieren, schickt das Modell jedes Token nur durch eine kleine Auswahl von Spezialisten – hier 10 von 512, plus einen fest aktiven. Dazu kommt eine neue N-gram-Embedding-Schicht mit 51 Milliarden Parametern: eine Art Nachschlagetabelle für häufige Wortgruppen, die sich in normalen Arbeitsspeicher auslagern lässt, statt teuren GPU-Speicher zu belegen.

Der Effekt aufs Budget ist der eigentliche Punkt: Laut dem Qwen-Team hat das Training nur rund ein Neuntel dessen gekostet wie beim Vorgänger Qwen3.7-Plus – und liefert trotzdem bessere Ergebnisse beim Programmieren und bei Büroaufgaben. Das Kontextfenster liegt nativ bei 262'144 Tokens und lässt sich auf eine Million erweitern.

Der Benchmark-Vorsprung hat ein Sternchen

Qwens veröffentlichte Zahlen sind eindrücklich: 58.7 Punkte auf DeepSWE 1.1, 62.5 auf SWE-bench Pro – Tests, bei denen eine KI eigenständig Fehler in echten Software-Projekten finden und beheben muss. Claude Opus 4.6 kommt dort auf 53.4. Bei Büroaufgaben ist der Abstand noch grösser: 73.9 gegenüber 45.1 für DeepSeek-V4-Flash auf CoWorkBench, 55.7 gegenüber 27.6 für den eigenen Vorgänger auf JobBench.

Der Haken: Das sind durchwegs Herstellerangaben, gemessen auf Qwens eigenen Test-Aufbauten. Unabhängige Nachmessungen fehlen bislang. Und Flash-Next führt nicht überall – auf «Humanity's Last Exam» liegt Claude Opus 4.6 mit 40.0 zu 35.9 vorn, auf NL2Repo-Bench DeepSeek-V4-Flash mit 54.2 zu 48.1.

Offene Gewichte, aber keine Apache-Lizenz

Für Schweizer Firmen steckt der interessanteste Teil im Kleingedruckten. Die Gewichte stehen auf Hugging Face zum Download – aber unter der Qwen Community License 1.0, nicht unter Apache 2.0 wie das kleinere Qwen3.8-27B. Interner Einsatz im eigenen Betrieb ist erlaubt. Wer das Modell dagegen als API weiterverkauft oder daraus ein eigenständiges KI-Produkt für Coding oder Büroarbeit baut, braucht laut Lizenztext eine separate Vereinbarung mit Qwen.

Auch die On-Prem-Rechnung geht nur bedingt auf: Die Gewichte sind selbst in der komprimierten FP8-Variante rund 173 Gigabyte gross, in voller Präzision 335. Das ist ein Server mit mehreren GPUs, keine Workstation im Büroschrank. Für ein KMU, das seine Daten im Haus behalten will, führt der Weg damit über einen Hosting-Partner mit passender Hardware.

Bleibt der Preisdruck. Wenn ein Modell dieser Klasse für 0.16 Dollar pro Million Tokens läuft, wird es für OpenAI und Anthropic schwieriger, Aufpreise für Standardaufgaben zu rechtfertigen. Und Qwen4, das auf genau dieser Architektur aufbauen soll, ist noch gar nicht da.

Quellen

Qwen3.8-Flash-Next – Modelcard (Hugging Face, Primärquelle)↗ EXTERNER LINKQwen Community License 1.0 – Volltext (Hugging Face)↗ EXTERNER LINKQwen3.8-Flash-Next-FP8 – Modelcard (Hugging Face)↗ EXTERNER LINKQwenLM/Qwen3.8-Flash-Next – README und Tech Report (GitHub)↗ EXTERNER LINKQwen3.8-Flash-Next – Ankündigung im Qwen-Blog↗ EXTERNER LINKQwen3.8-Flash – Preise und Limits (QwenCloud)↗ EXTERNER LINKQwen3.8-Max – Vergleichspreise (QwenCloud)↗ EXTERNER LINKQwen3.8-Flash-Next (ModelScope)↗ EXTERNER LINKAlibaba releases Qwen3.8-Flash-Next, targeting 'ultimate cost efficiency' (The Decoder)↗ EXTERNER LINKQwen3.8-Flash-Next Previews Qwen4 Architecture With 6B Active Parameters (Unite.AI)↗ EXTERNER LINKAlibaba's Qwen Team Releases Qwen3.8-Flash-Next (MarkTechPost)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
AnthropicDeepSeekHugging FaceOpenAI
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Granitblocks auf einer Steinmetz-Werkbank mit Meissel und Fäustel, daneben eine offene Holzkiste, kinewsletter.ch Stil
Illustration eines Granitblocks auf einer Steinmetz-Werkbank mit Meissel und Fäustel, daneben eine offene Holzkiste, kinewsletter.ch Stil
NEUE MODELLE·27. AUGUST 2026

IBM gibt Granite 4.2 frei – ohne Lizenzhaken

IBM veröffentlicht Granite 4.2 in den Grössen 3B, 8B und 30B unter Apache 2.0 – frei herunterladbar, feintunebar, produktiv einsetzbar. Klein genug fürs eigene Rechenzentrum.

Handgezeichnete Skizze einer grossen runden Glaslinse in Elektroblau auf einem Messingstativ auf einer Holzwerkbank, daneben ein kleiner Schrank mit Vorhängeschloss und drei lose Linsen in einer Metallschale, kinewsletter.ch Stil
Handgezeichnete Skizze einer grossen runden Glaslinse in Elektroblau auf einem Messingstativ auf einer Holzwerkbank, daneben ein kleiner Schrank mit Vorhängeschloss und drei lose Linsen in einer Metallschale, kinewsletter.ch Stil
NEUE MODELLE·22. AUGUST 2026

DeepSeek gibt Flash Augen – und behält diesmal die Gewichte

DeepSeek hat sein günstiges V4-Flash um Bildverständnis erweitert – zum identischen Preis, ohne Aufschlag. Laut DeepSeeks eigener Tabelle kommt das experimentelle Modell nahe an Claude Opus 4.8 heran und schlägt es auf drei von elf Benchmarks. Zwei Details fehlen in den Schlagzeilen: Jedes Bild wird auf 0,64 Megapixel eingedampft – und die Gewichte veröffentlicht DeepSeek diesmal nicht.

Illustration einer geöffneten Tresortür mit Serverracks dahinter, kinewsletter.ch Stil
Illustration einer geöffneten Tresortür mit Serverracks dahinter, kinewsletter.ch Stil
NEUE MODELLE·16. AUGUST 2026

Qwen3.8 ist offen – Apache 2.0 aber nur für das kleine Modell

Alibabas Qwen-Team hat die Gewichte von Qwen3.8 freigegeben. Apache 2.0 gilt aber nur fürs 27B-Modell – beim Max steht Kleingedrucktes im Lizenztext.

Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·14. AUGUST 2026

DeepSeek verschenkt seine Agenten-Software – und versechsfacht die Cache-Preise

DeepSeek hat gleich dreifach geliefert: Das Flaggschiff V4-Pro verlässt mit Build 0813 die Testphase, die hauseigene Agenten-Software Harness erscheint unter MIT-Lizenz – und ab Sonntagabend steigen die API-Preise. Am stärksten trifft es ausgerechnet die Cache-Hits, von denen Coding-Agenten leben.

Illustration einer Stoppuhr mit blauem Gehäuse und einem Messschieber auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Stoppuhr mit blauem Gehäuse und einem Messschieber auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·14. AUGUST 2026

Gemini 3.7 Flash: drei Wochen nach 3.6, halber Preis

Google hat Gemini 3.7 Flash veröffentlicht – nur drei Wochen nach dem Vorgänger und zum halben Einführungspreis. Beim Programmieren legt das Modell deutlich zu, bei Agenten-Benchmarks bleibt GPT-5.6 Terra vorn. Und der Consumer-Agent Gemini Spark, der ab sofort auf 3.7 Flash läuft, ist in der Schweiz gar nicht verfügbar.

Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
NEUE MODELLE·12. AUGUST 2026

Nvidias schnellstes offenes Modell läuft auf einer einzigen GPU

Nemotron 3.5 Lightning erreicht bei Artificial Analysis dieselbe Punktzahl wie OpenAIs gpt-oss-120b – mit einem Viertel der Parameter und dem höchsten gemessenen Tempo unter 134 Modellen. Laut Modellsteckbrief genügt eine einzige H100 oder ein DGX Spark. Für Schweizer Firmen, die Daten im Haus behalten müssen, ist genau das die interessante Zahl.

Mehr aus Neue Modelle →