NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Chinas GLM-5.3-Flash läuft ohne Nvidia – und trägt MIT-Lizenz

Z.ai hat GLM-5.3-Flash freigegeben: 320 Milliarden Parameter unter MIT-Lizenz, drei Punkte hinter dem grossen Schwestermodell – zum Siebtel des Preises. Die ganze Testphase lief auf chinesischen Chips. Was daran belegt ist und was nicht.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
28. AUGUST 2026
4 MIN. LESEZEIT
Illustration eines offenen Serverschranks mit Kabelbündel und einer Platine auf einem Wartungswagen, kinewsletter.ch Stil
Illustration eines offenen Serverschranks mit Kabelbündel und einer Platine auf einem Wartungswagen, kinewsletter.ch Stil
INHALT
01Drei Punkte Rückstand, ein Siebtel des Preises02Der Nvidia-Haken steckt im Kleingedruckten03MIT statt Kleingedrucktem04320 Milliarden Parameter passen in kein Sitzungszimmer05Apertus spielt ein anderes Spiel06Der CUDA-Graben ist schmaler geworden
INHALT
01Drei Punkte Rückstand, ein Siebtel des Preises02Der Nvidia-Haken steckt im Kleingedruckten03MIT statt Kleingedrucktem04320 Milliarden Parameter passen in kein Sitzungszimmer05Apertus spielt ein anderes Spiel06Der CUDA-Graben ist schmaler geworden
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Nvidia-frei ist bisher nur die Auslieferung, nicht belegbar das Training – aber die MIT-Lizenz macht das Modell für Schweizer Firmen zum ersten ernsthaft frei nutzbaren Spitzenmodell aus China.

Z.ai hat am Mittwoch das Open-Weight-Modell GLM-5.3-Flash freigegeben: 320 Milliarden Parameter, MIT-Lizenz, ein Kontextfenster von einer Million Token. Auf dem Intelligence Index von Artificial Analysis kommt es auf 57 Punkte – nur drei weniger als das grosse GLM-5.3 mit 60, aber zu rund einem Siebtel der Kosten pro Aufgabe. Der eigentliche Aufreger steckt jedoch in der Infrastruktur: Die komplette Vorab-Phase lief laut Z.ai auf chinesischen KI-Chips, ohne eine einzige Nvidia-GPU im Auslieferungspfad.

Drei Punkte Rückstand, ein Siebtel des Preises

Die Zahlen, die für Aufsehen sorgen, kommen vom Analysehaus Artificial Analysis: 0.09 US-Dollar kostet eine Aufgabe auf dem Index – beim grösseren GLM-5.3 sind es 0.68 Dollar. Das ist der Faktor 7,5 bei drei Punkten Leistungsunterschied. Über die Schnittstelle von Z.ai zahlst du 0.15 Dollar pro Million Eingabe-Token und 0.50 Dollar pro Million Ausgabe-Token.

Möglich macht das die Architektur. Von den 320 Milliarden Parametern sind pro Anfrage nur 18 Milliarden aktiv – das Modell aktiviert also je nach Aufgabe einen Bruchteil seines Netzwerks. Dazu kombiniert Z.ai zwei Aufmerksamkeitsverfahren: Linear Attention für lokale Zusammenhänge, Sparse Attention fürs gezielte Nachschlagen im weiten Kontext. Gegenüber GLM-5.3 sinkt der Rechenaufwand für Aufmerksamkeit laut Hersteller um den Faktor 3,0, der Zwischenspeicher um 4,4.

Einen Haken nennt Artificial Analysis selbst: Das Modell ist geschwätzig. Rund 90 Prozent der erzeugten Ausgabe-Token gehen ins interne Nachdenken, nicht in die Antwort. Bei diesen Preisen fällt das kaum ins Gewicht – bei Latenz-kritischen Anwendungen schon.

Der Nvidia-Haken steckt im Kleingedruckten

Vor dem Release testete Z.ai das Modell anonym als «ox-alpha» auf OpenRouter und OpenCode, wo es binnen Tagen zum meistgenutzten Coding-Modell der Woche wurde. Genau dieser Verkehr lief nach Firmenangaben vollständig auf heimischen Beschleunigern. Z.ai baute dafür eine eigene Inferenz-Software auf Basis von SGLang und holte damit gegenüber dem ersten Anlauf auf derselben Hardware die dreifache Leistung heraus – nach eigener Darstellung bei Effizienz und Kosten pro Token «vergleichbar mit gängigen Nvidia-GPUs».

Und hier lohnt sich Genauigkeit, denn zwei Dinge werden gerade munter vermischt:

  • Nvidia-frei ist die Auslieferung, nicht das Training. Z.ai macht keine Angabe dazu, auf welcher Hardware GLM-5.3-Flash trainiert wurde. The New Stack hält das ausdrücklich fest. Wer «ohne Nvidia trainiert» liest, liest etwas, das niemand belegt hat.
  • Welche Chips es sind, sagt Z.ai nicht. Im Blogpost ist von «zehntausenden im Inland entwickelten Beschleunigern» die Rede – kein Hersteller, kein Modellname. Die South China Morning Post berichtet von 100'000 heimischen Chips; das ist eine Angabe des Unternehmens, die CNBC nach eigener Aussage nicht unabhängig verifizieren konnte. Alle kursierenden Namen sind bislang Spekulation.

Was bleibt, ist trotzdem stark genug: Eine Woche lang globaler Produktivbetrieb auf nicht-amerikanischer Hardware. Der Aktienmarkt hat es honoriert – die Zhipu-Aktie schloss am Donnerstag in Hongkong über 12 Prozent höher.

MIT statt Kleingedrucktem

Für Schweizer Unternehmen ist ein anderes Detail wichtiger als jede Benchmark-Zahl: die Lizenz. Auf Hugging Face steht schlicht «mit». Die MIT-Lizenz erlaubt kommerzielle Nutzung, Veränderung und Weitergabe ohne Auflagen zur Firmengrösse, zum Produkttyp oder zur Nutzerzahl. Das ist keine Selbstverständlichkeit – etliche chinesische Open-Weight-Modelle kommen mit eigenen Community-Lizenzen, die genau dort Bedingungen einziehen.

320 Milliarden Parameter passen in kein Sitzungszimmer

Bevor du das als KMU einplanst: Ein Modell dieser Grösse braucht Server mit mehreren Beschleunigern, keinen Bürorechner. Realistisch ist entweder ein Schweizer Hoster oder eine quantisierte, verkleinerte Fassung – davon listet Hugging Face bereits gut zwei Dutzend.

Der Unterschied ist trotzdem handfest. Betreibst du die Gewichte selbst, verlassen deine Daten das Haus nicht. Nutzt du stattdessen die Schnittstelle von Z.ai, fliessen Personendaten nach China – und China steht nicht auf der Staatenliste des Bundesrats mit angemessenem Datenschutzniveau. Ohne diesen Angemessenheitsbeschluss verlangt das revidierte Datenschutzgesetz zusätzliche Garantien, in der Praxis meist Vertragsklauseln nach Vorgabe des EDÖB. Genau dieser Unterschied ist der Grund, warum offene Gewichte für Souveränitätsfragen so viel wertvoller sind als ein günstiger API-Tarif.

Apertus spielt ein anderes Spiel

Der Schweizer Gegenentwurf heisst Apertus. EPFL, ETH Zürich und das Nationale Hochleistungsrechenzentrum CSCS haben Ende Juli die Version 1.5 veröffentlicht, unter Apache 2.0, trainiert auf dem Supercomputer Alps in Lugano und neu ebenfalls multimodal. Der Anspruch ist bewusst ein anderer: «Apertus is not about competing with frontier models», sagt ETH-Forscher Imanol Schlag – es gehe um nachvollziehbare, transparente KI. Offengelegt sind hier auch Trainingsdaten und Verfahren, nicht nur die Gewichte. Der Kanton Tessin übersetzt damit Verwaltungsdokumente im Haus, das Basler Portal Bajour lässt es im Newsroom laufen.

Der CUDA-Graben ist schmaler geworden

Nvidias eigentlicher Schutzwall war nie nur die Hardware, sondern CUDA – die Software-Schicht, auf die praktisch jedes KI-Framework seit fast zwanzig Jahren optimiert ist. Z.ai hat gezeigt, dass sich dieser Vorsprung mit genug Ingenieursarbeit einholen lässt, zumindest für die Inferenz. Ob das auch fürs Training gilt, weiss ausserhalb von Peking niemand. Die Antwort kommt erst, wenn ein Labor sie freiwillig gibt.

Quellen

GLM-5.3-Flash (Z.ai Blog)↗ EXTERNER LINKGLM-5.3-Flash Dokumentation (Z.ai)↗ EXTERNER LINKzai-org/GLM-5.3-Flash Model Card (Hugging Face)↗ EXTERNER LINKGLM-5.3-Flash runs without Nvidia (The Decoder)↗ EXTERNER LINKZ.ai is the AI lab behind the mysterious Ox Alpha model (TechCrunch)↗ EXTERNER LINKGLM-5.3-Flash and Chinese chips (The New Stack)↗ EXTERNER LINKZhipu AI shares jump as Ox Alpha revealed (SCMP)↗ EXTERNER LINKZ.ai shares surge on new AI model using Chinese chips (CNBC)↗ EXTERNER LINKGLM-5 Technical Report (arXiv)↗ EXTERNER LINKApertus 1.5: building the next generation of open models (EPFL)↗ EXTERNER LINKBekanntgabe von Personendaten ins Ausland (EDÖB)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
NvidiaHugging FaceEPFLETH Zürich
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Orrery mit blauer Planetenkugel neben einem offenen Sternatlas mit Zirkel und Lupe, kinewsletter.ch Stil
Illustration eines Orrery mit blauer Planetenkugel neben einem offenen Sternatlas mit Zirkel und Lupe, kinewsletter.ch Stil
NEUE MODELLE·4. SEPTEMBER 2026

OpenAI ruft die AGI-Ära aus – mit GPT-6 Astra

OpenAI hat GPT-6 Astra veröffentlicht. Präsident Greg Brockman spricht vom «generationellen Sprung» und beendet das Briefing mit «Welcome to the AGI era».

Illustration eines Tonmodells eines Hauses auf einem Drehteller, umringt von drei kleinen Stativkameras auf einer Werkbank, kinewsletter.ch Stil
Illustration eines Tonmodells eines Hauses auf einem Drehteller, umringt von drei kleinen Stativkameras auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·3. SEPTEMBER 2026

Fei-Fei Lis Atlas baut 3D-Welten aus wenigen Fotos

World Labs hat Atlas vorgestellt: ein Weltmodell, das aus einer Handvoll Fotos begehbare 3D-Szenen erzeugt, rekonstruiert und simuliert — bis zu eine Minute Video in 1440p mit frei gewählter Kameraführung, wahlweise als echte 3D-Geometrie. Verfügbar ist es bisher nur im Early Access, und alle Vergleichszahlen stammen von World Labs selbst.

Illustration einer Werkstattwaage mit Gewichtsscheiben, Messschieber und Notizzettel auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Werkstattwaage mit Gewichtsscheiben, Messschieber und Notizzettel auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·3. SEPTEMBER 2026

Muse Spark 1.3: Meta setzt auf sparsam statt Spitzenplatz

Meta hat Muse Spark 1.3 veröffentlicht: 62 Punkte im Artificial Analysis Intelligence Index, einen hinter Claude Opus 5 – aber zum Achtel des Preises von Claude Fable 5.1. Die beworbene Sparsamkeit stammt allerdings aus Metas eigener Messung, und die Open-Weights-Frage ist offener denn je.

Illustration einer Schlüsselwerkstatt mit Schlüsselfräse, Rohlingen an der Wand und offenem Vorhängeschloss, kinewsletter.ch Stil
Illustration einer Schlüsselwerkstatt mit Schlüsselfräse, Rohlingen an der Wand und offenem Vorhängeschloss, kinewsletter.ch Stil
NEUE MODELLE·3. SEPTEMBER 2026

Googles dritter Flash in sechs Wochen – plus ein Cyber-Modell

Gemini 3.8 Flash kostet gleich viel wie der Vorgänger – die Cyber-Variante gibt es nur für geprüfte Verteidiger. Das Frontier-Modell fehlt weiter.

Illustration einer mechanischen Rechenmaschine mit Papierstreifen und Lochkartenstapel auf einer Werkbank, kinewsletter.ch Stil
Illustration einer mechanischen Rechenmaschine mit Papierstreifen und Lochkartenstapel auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·2. SEPTEMBER 2026

Claude Fable 5.1: stärker beim Coden, günstiger im Betrieb

Anthropic hat Claude Fable 5.1 und Mythos 5.1 veröffentlicht: deutlich bessere Werte bei agentischem Coding und Recherche, dazu ein um 75 Prozent gesenkter Cache-Preis – doch bei voller Effort-Stufe rechnet Artificial Analysis vor, dass die Rechnung höher ausfällt als bei Opus 5.

Illustration einer offenen Tresortür mit Speichenrad vor hohen Archivregalen, kinewsletter.ch Stil
Illustration einer offenen Tresortür mit Speichenrad vor hohen Archivregalen, kinewsletter.ch Stil
NEUE MODELLE·31. AUGUST 2026

Tencent öffnet 770-Milliarden-Modell – Apache 2.0, 1 Million Token

Tencent hat Hy4 preview veröffentlicht: 770 Milliarden Parameter, 1 Million Token Kontext, Gewichte frei unter Apache 2.0. Das bisher grösste offene Modell des Konzerns – und der Lizenztext hat diesmal wirklich kein Kleingedrucktes.

Mehr aus Neue Modelle →