NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Chinas GLM-5.3-Flash läuft ohne Nvidia – und trägt MIT-Lizenz

Z.ai hat GLM-5.3-Flash freigegeben: 320 Milliarden Parameter unter MIT-Lizenz, drei Punkte hinter dem grossen Schwestermodell – zum Siebtel des Preises. Die ganze Testphase lief auf chinesischen Chips. Was daran belegt ist und was nicht.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
28. AUGUST 2026
4 MIN. LESEZEIT
Illustration eines offenen Serverschranks mit Kabelbündel und einer Platine auf einem Wartungswagen, kinewsletter.ch Stil
Illustration eines offenen Serverschranks mit Kabelbündel und einer Platine auf einem Wartungswagen, kinewsletter.ch Stil
INHALT
01Drei Punkte Rückstand, ein Siebtel des Preises02Der Nvidia-Haken steckt im Kleingedruckten03MIT statt Kleingedrucktem04320 Milliarden Parameter passen in kein Sitzungszimmer05Apertus spielt ein anderes Spiel06Der CUDA-Graben ist schmaler geworden
INHALT
01Drei Punkte Rückstand, ein Siebtel des Preises02Der Nvidia-Haken steckt im Kleingedruckten03MIT statt Kleingedrucktem04320 Milliarden Parameter passen in kein Sitzungszimmer05Apertus spielt ein anderes Spiel06Der CUDA-Graben ist schmaler geworden
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Nvidia-frei ist bisher nur die Auslieferung, nicht belegbar das Training – aber die MIT-Lizenz macht das Modell für Schweizer Firmen zum ersten ernsthaft frei nutzbaren Spitzenmodell aus China.

Z.ai hat am Mittwoch das Open-Weight-Modell GLM-5.3-Flash freigegeben: 320 Milliarden Parameter, MIT-Lizenz, ein Kontextfenster von einer Million Token. Auf dem Intelligence Index von Artificial Analysis kommt es auf 57 Punkte – nur drei weniger als das grosse GLM-5.3 mit 60, aber zu rund einem Siebtel der Kosten pro Aufgabe. Der eigentliche Aufreger steckt jedoch in der Infrastruktur: Die komplette Vorab-Phase lief laut Z.ai auf chinesischen KI-Chips, ohne eine einzige Nvidia-GPU im Auslieferungspfad.

Drei Punkte Rückstand, ein Siebtel des Preises

Die Zahlen, die für Aufsehen sorgen, kommen vom Analysehaus Artificial Analysis: 0.09 US-Dollar kostet eine Aufgabe auf dem Index – beim grösseren GLM-5.3 sind es 0.68 Dollar. Das ist der Faktor 7,5 bei drei Punkten Leistungsunterschied. Über die Schnittstelle von Z.ai zahlst du 0.15 Dollar pro Million Eingabe-Token und 0.50 Dollar pro Million Ausgabe-Token.

Möglich macht das die Architektur. Von den 320 Milliarden Parametern sind pro Anfrage nur 18 Milliarden aktiv – das Modell aktiviert also je nach Aufgabe einen Bruchteil seines Netzwerks. Dazu kombiniert Z.ai zwei Aufmerksamkeitsverfahren: Linear Attention für lokale Zusammenhänge, Sparse Attention fürs gezielte Nachschlagen im weiten Kontext. Gegenüber GLM-5.3 sinkt der Rechenaufwand für Aufmerksamkeit laut Hersteller um den Faktor 3,0, der Zwischenspeicher um 4,4.

Einen Haken nennt Artificial Analysis selbst: Das Modell ist geschwätzig. Rund 90 Prozent der erzeugten Ausgabe-Token gehen ins interne Nachdenken, nicht in die Antwort. Bei diesen Preisen fällt das kaum ins Gewicht – bei Latenz-kritischen Anwendungen schon.

Der Nvidia-Haken steckt im Kleingedruckten

Vor dem Release testete Z.ai das Modell anonym als «ox-alpha» auf OpenRouter und OpenCode, wo es binnen Tagen zum meistgenutzten Coding-Modell der Woche wurde. Genau dieser Verkehr lief nach Firmenangaben vollständig auf heimischen Beschleunigern. Z.ai baute dafür eine eigene Inferenz-Software auf Basis von SGLang und holte damit gegenüber dem ersten Anlauf auf derselben Hardware die dreifache Leistung heraus – nach eigener Darstellung bei Effizienz und Kosten pro Token «vergleichbar mit gängigen Nvidia-GPUs».

Und hier lohnt sich Genauigkeit, denn zwei Dinge werden gerade munter vermischt:

  • Nvidia-frei ist die Auslieferung, nicht das Training. Z.ai macht keine Angabe dazu, auf welcher Hardware GLM-5.3-Flash trainiert wurde. The New Stack hält das ausdrücklich fest. Wer «ohne Nvidia trainiert» liest, liest etwas, das niemand belegt hat.
  • Welche Chips es sind, sagt Z.ai nicht. Im Blogpost ist von «zehntausenden im Inland entwickelten Beschleunigern» die Rede – kein Hersteller, kein Modellname. Die South China Morning Post berichtet von 100'000 heimischen Chips; das ist eine Angabe des Unternehmens, die CNBC nach eigener Aussage nicht unabhängig verifizieren konnte. Alle kursierenden Namen sind bislang Spekulation.

Was bleibt, ist trotzdem stark genug: Eine Woche lang globaler Produktivbetrieb auf nicht-amerikanischer Hardware. Der Aktienmarkt hat es honoriert – die Zhipu-Aktie schloss am Donnerstag in Hongkong über 12 Prozent höher.

MIT statt Kleingedrucktem

Für Schweizer Unternehmen ist ein anderes Detail wichtiger als jede Benchmark-Zahl: die Lizenz. Auf Hugging Face steht schlicht «mit». Die MIT-Lizenz erlaubt kommerzielle Nutzung, Veränderung und Weitergabe ohne Auflagen zur Firmengrösse, zum Produkttyp oder zur Nutzerzahl. Das ist keine Selbstverständlichkeit – etliche chinesische Open-Weight-Modelle kommen mit eigenen Community-Lizenzen, die genau dort Bedingungen einziehen.

320 Milliarden Parameter passen in kein Sitzungszimmer

Bevor du das als KMU einplanst: Ein Modell dieser Grösse braucht Server mit mehreren Beschleunigern, keinen Bürorechner. Realistisch ist entweder ein Schweizer Hoster oder eine quantisierte, verkleinerte Fassung – davon listet Hugging Face bereits gut zwei Dutzend.

Der Unterschied ist trotzdem handfest. Betreibst du die Gewichte selbst, verlassen deine Daten das Haus nicht. Nutzt du stattdessen die Schnittstelle von Z.ai, fliessen Personendaten nach China – und China steht nicht auf der Staatenliste des Bundesrats mit angemessenem Datenschutzniveau. Ohne diesen Angemessenheitsbeschluss verlangt das revidierte Datenschutzgesetz zusätzliche Garantien, in der Praxis meist Vertragsklauseln nach Vorgabe des EDÖB. Genau dieser Unterschied ist der Grund, warum offene Gewichte für Souveränitätsfragen so viel wertvoller sind als ein günstiger API-Tarif.

Apertus spielt ein anderes Spiel

Der Schweizer Gegenentwurf heisst Apertus. EPFL, ETH Zürich und das Nationale Hochleistungsrechenzentrum CSCS haben Ende Juli die Version 1.5 veröffentlicht, unter Apache 2.0, trainiert auf dem Supercomputer Alps in Lugano und neu ebenfalls multimodal. Der Anspruch ist bewusst ein anderer: «Apertus is not about competing with frontier models», sagt ETH-Forscher Imanol Schlag – es gehe um nachvollziehbare, transparente KI. Offengelegt sind hier auch Trainingsdaten und Verfahren, nicht nur die Gewichte. Der Kanton Tessin übersetzt damit Verwaltungsdokumente im Haus, das Basler Portal Bajour lässt es im Newsroom laufen.

Der CUDA-Graben ist schmaler geworden

Nvidias eigentlicher Schutzwall war nie nur die Hardware, sondern CUDA – die Software-Schicht, auf die praktisch jedes KI-Framework seit fast zwanzig Jahren optimiert ist. Z.ai hat gezeigt, dass sich dieser Vorsprung mit genug Ingenieursarbeit einholen lässt, zumindest für die Inferenz. Ob das auch fürs Training gilt, weiss ausserhalb von Peking niemand. Die Antwort kommt erst, wenn ein Labor sie freiwillig gibt.

Quellen

GLM-5.3-Flash (Z.ai Blog)↗ EXTERNER LINKGLM-5.3-Flash Dokumentation (Z.ai)↗ EXTERNER LINKzai-org/GLM-5.3-Flash Model Card (Hugging Face)↗ EXTERNER LINKGLM-5.3-Flash runs without Nvidia (The Decoder)↗ EXTERNER LINKZ.ai is the AI lab behind the mysterious Ox Alpha model (TechCrunch)↗ EXTERNER LINKGLM-5.3-Flash and Chinese chips (The New Stack)↗ EXTERNER LINKZhipu AI shares jump as Ox Alpha revealed (SCMP)↗ EXTERNER LINKZ.ai shares surge on new AI model using Chinese chips (CNBC)↗ EXTERNER LINKGLM-5 Technical Report (arXiv)↗ EXTERNER LINKApertus 1.5: building the next generation of open models (EPFL)↗ EXTERNER LINKBekanntgabe von Personendaten ins Ausland (EDÖB)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
NvidiaHugging FaceEPFLETH Zürich
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Granitblocks auf einer Steinmetz-Werkbank mit Meissel und Fäustel, daneben eine offene Holzkiste, kinewsletter.ch Stil
Illustration eines Granitblocks auf einer Steinmetz-Werkbank mit Meissel und Fäustel, daneben eine offene Holzkiste, kinewsletter.ch Stil
NEUE MODELLE·27. AUGUST 2026

IBM gibt Granite 4.2 frei – ohne Lizenzhaken

IBM veröffentlicht Granite 4.2 in den Grössen 3B, 8B und 30B unter Apache 2.0 – frei herunterladbar, feintunebar, produktiv einsetzbar. Klein genug fürs eigene Rechenzentrum.

Illustration eines Abakus auf einem Kaufmannstisch mit blauen Kugeln, kinewsletter.ch Stil
Illustration eines Abakus auf einem Kaufmannstisch mit blauen Kugeln, kinewsletter.ch Stil
NEUE MODELLE·27. AUGUST 2026

Alibaba zeigt die Qwen4-Architektur – zum Zwölftel-Preis

Alibabas Qwen-Team hat Qwen3.8-Flash-Next veröffentlicht – ein Modell mit offenen Gewichten, das die Architektur des kommenden Qwen4 vorwegnimmt. 125 Milliarden Parameter, davon nur 6 Milliarden aktiv pro Token, und ein API-Preis von 0.16 Dollar pro Million Eingabe-Tokens: rund ein Zwölftel dessen, was Alibabas eigenes Flaggschiff kostet.

Handgezeichnete Skizze einer grossen runden Glaslinse in Elektroblau auf einem Messingstativ auf einer Holzwerkbank, daneben ein kleiner Schrank mit Vorhängeschloss und drei lose Linsen in einer Metallschale, kinewsletter.ch Stil
Handgezeichnete Skizze einer grossen runden Glaslinse in Elektroblau auf einem Messingstativ auf einer Holzwerkbank, daneben ein kleiner Schrank mit Vorhängeschloss und drei lose Linsen in einer Metallschale, kinewsletter.ch Stil
NEUE MODELLE·22. AUGUST 2026

DeepSeek gibt Flash Augen – und behält diesmal die Gewichte

DeepSeek hat sein günstiges V4-Flash um Bildverständnis erweitert – zum identischen Preis, ohne Aufschlag. Laut DeepSeeks eigener Tabelle kommt das experimentelle Modell nahe an Claude Opus 4.8 heran und schlägt es auf drei von elf Benchmarks. Zwei Details fehlen in den Schlagzeilen: Jedes Bild wird auf 0,64 Megapixel eingedampft – und die Gewichte veröffentlicht DeepSeek diesmal nicht.

Illustration einer geöffneten Tresortür mit Serverracks dahinter, kinewsletter.ch Stil
Illustration einer geöffneten Tresortür mit Serverracks dahinter, kinewsletter.ch Stil
NEUE MODELLE·16. AUGUST 2026

Qwen3.8 ist offen – Apache 2.0 aber nur für das kleine Modell

Alibabas Qwen-Team hat die Gewichte von Qwen3.8 freigegeben. Apache 2.0 gilt aber nur fürs 27B-Modell – beim Max steht Kleingedrucktes im Lizenztext.

Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·14. AUGUST 2026

DeepSeek verschenkt seine Agenten-Software – und versechsfacht die Cache-Preise

DeepSeek hat gleich dreifach geliefert: Das Flaggschiff V4-Pro verlässt mit Build 0813 die Testphase, die hauseigene Agenten-Software Harness erscheint unter MIT-Lizenz – und ab Sonntagabend steigen die API-Preise. Am stärksten trifft es ausgerechnet die Cache-Hits, von denen Coding-Agenten leben.

Illustration einer Stoppuhr mit blauem Gehäuse und einem Messschieber auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Stoppuhr mit blauem Gehäuse und einem Messschieber auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·14. AUGUST 2026

Gemini 3.7 Flash: drei Wochen nach 3.6, halber Preis

Google hat Gemini 3.7 Flash veröffentlicht – nur drei Wochen nach dem Vorgänger und zum halben Einführungspreis. Beim Programmieren legt das Modell deutlich zu, bei Agenten-Benchmarks bleibt GPT-5.6 Terra vorn. Und der Consumer-Agent Gemini Spark, der ab sofort auf 3.7 Flash läuft, ist in der Schweiz gar nicht verfügbar.

Mehr aus Neue Modelle →