NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Nvidias schnellstes offenes Modell läuft auf einer einzigen GPU

Nemotron 3.5 Lightning erreicht bei Artificial Analysis dieselbe Punktzahl wie OpenAIs gpt-oss-120b – mit einem Viertel der Parameter und dem höchsten gemessenen Tempo unter 134 Modellen. Laut Modellsteckbrief genügt eine einzige H100 oder ein DGX Spark. Für Schweizer Firmen, die Daten im Haus behalten müssen, ist genau das die interessante Zahl.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
12. AUGUST 2026
3 MIN. LESEZEIT
Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
INHALT
01Ein Viertel der Parameter, dieselbe Punktzahl02Was «eine GPU» für ein Schweizer KMU heisst03Warum Nvidia Modelle verschenkt04Schnell heisst nicht klug
INHALT
01Ein Viertel der Parameter, dieselbe Punktzahl02Was «eine GPU» für ein Schweizer KMU heisst03Warum Nvidia Modelle verschenkt04Schnell heisst nicht klug
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein offenes Modell auf Frontier-nahem Agenten-Niveau, das auf einer einzigen GPU im eigenen Serverraum läuft – Datenhaltung im Haus ist damit keine Frage des Budgets mehr, sondern der Entscheidung.

Nvidia hat am 11. August 2026 Nemotron 3.5 Lightning veröffentlicht, ein offenes Sprachmodell mit rund 30 Milliarden Parametern, von denen pro Anfrage nur etwa 3 Milliarden aktiv sind. Beim unabhängigen Messdienst Artificial Analysis erreicht es 24 Punkte im Intelligence Index – exakt gleich viel wie OpenAIs gpt-oss-120b, das mit 117 Milliarden Parametern fast viermal so gross ist. Und laut dem Modellsteckbrief auf Hugging Face genügt für den Betrieb eine einzige GPU: eine H100 im Rack oder ein DGX Spark auf dem Pult.

Ein Viertel der Parameter, dieselbe Punktzahl

Möglich macht das eine Mixture-of-Experts-Architektur – vereinfacht gesagt schickt ein Router jedes Token nur an wenige Spezialisten im Modell, statt jedes Mal das ganze Netzwerk zu rechnen. Das Ergebnis ist vor allem Tempo: Artificial Analysis misst rund 481 Token pro Sekunde – Platz eins unter 134 verglichenen Modellen. Auch bei Agenten-Aufgaben, also Arbeit über viele selbstständige Schritte hinweg, zieht Lightning an. Auf GDPval-AA v2 erreicht es eine Elo-Wertung von 824 gegenüber 800 bei gpt-oss-120b; bei Terminal-Bench v2.1 liegt es mit 24,3 Prozent knapp dahinter (26,2 Prozent).

Was «eine GPU» für ein Schweizer KMU heisst

Das Modell steht unter der permissiven Lizenz OpenMDW-1.1; Firmen dürfen es laut CNBC herunterladen, anpassen und weiterverteilen, ohne Nvidia zu fragen und ohne zu zahlen. Die Modellkarte hält ausdrücklich fest: bereit für den kommerziellen Einsatz.

Wer heute Kunden-, Personal- oder Mandatsdaten durch eine Cloud-KI schickt, braucht einen Auftragsbearbeitungsvertrag und muss die Bekanntgabe ins Ausland prüfen. Läuft das Modell im eigenen Serverraum, verlassen die Daten das Haus gar nicht erst. Neu ist nicht die Idee, neu ist ihr Preis: Es braucht kein GPU-Cluster mehr, sondern eine Karte – Nvidia nennt neben H100 und DGX Spark auch die GeForce RTX 5090 sowie LM Studio, llama.cpp und Ollama. Das Kontextfenster liegt bei einer Million Token; Deutsch, Französisch und Italienisch sind unterstützt, Bilder und Audio nicht. Wer lieber mietet: Über Serverless-Anbieter kostet die Million Input-Token im Median 5 Cent, die Million Output-Token 20 Cent.

Warum Nvidia Modelle verschenkt

Es ist Nvidias erstes offenes Modell, seit Konzernchef Jensen Huang Ende Juli erstmals auf X für offene Gewichte eintrat – sie stärkten Sicherheit, beschleunigten Innovation und ermöglichten Souveränität, schrieb er laut CNBC in einem offenen Brief. Das Geschäftsinteresse liegt zutage: Auch ein verschenktes Modell braucht Grafikkarten. «Free AI should be great for hardware», sagte Huang im Juli gegenüber Axios. «Free AI should be great for chips.»

Schnell heisst nicht klug

Der Haken: Lightning ist nicht das klügste Modell seiner Klasse. Laut The Decoder liegen Qwen3.6 35B A3B und Metas Muse Glimmer im Intelligence Index klar vorne. Nvidia positioniert Lightning bewusst als Arbeiter, nicht als Denker: Werkzeuge aufrufen, Ergebnisse prüfen, Ausgaben formatieren – während ein grösseres Modell plant. Für die meisten KMU-Anwendungen ist genau das der Teil, der laufend Geld kostet.

Quellen

NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents (NVIDIA Technical Blog, 11.08.2026)↗ EXTERNER LINKNVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 – Model Card (Hugging Face, 11.08.2026)↗ EXTERNER LINKNemotron 3.5 Lightning – Intelligence, Performance & Price Analysis (Artificial Analysis)↗ EXTERNER LINKgpt-oss-120b – Intelligence, Performance & Price Analysis (Artificial Analysis)↗ EXTERNER LINKNvidia unveils first open-source AI model since CEO Jensen Huang entered the chat (CNBC, 11.08.2026)↗ EXTERNER LINKNvidia's open-weight Nemotron 3.5 Lightning prioritizes speed over maximum intelligence (The Decoder, 11.08.2026)↗ EXTERNER LINKOpenMDW License Agreement, Version 1.1↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
NvidiaHugging Face
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Tonstudios mit Mischpult, Kondensatormikrofon am Galgen und Kopfhörern, kinewsletter.ch Stil
Illustration eines Tonstudios mit Mischpult, Kondensatormikrofon am Galgen und Kopfhörern, kinewsletter.ch Stil
NEUE MODELLE·24. SEPTEMBER 2026

Alibaba macht KI-Sprache um bis zu 95 Prozent billiger

Alibabas Qwen-Team hat Qwen-Audio-3.1 veröffentlicht: fünf Modelle für Spracherkennung, Sprachsynthese und Echtzeit-Dialog, dazu Preissenkungen von bis zu 95 Prozent. Die Modelle laufen ausschliesslich als Cloud-API – offene Gewichte gibt es nur für die ältere Qwen3-ASR-Reihe.

Illustration einer Balkenwaage mit Münzen gegen ein Zahnrad in einer Werkstatt, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Münzen gegen ein Zahnrad in einer Werkstatt, kinewsletter.ch Stil
NEUE MODELLE·23. SEPTEMBER 2026

Claude Opus 5.5: Fable-Niveau zum tieferen Preis

Anthropic hat Claude Opus 5.5 veröffentlicht. Das Modell arbeitet laut Anthropic auf Fable-5.1-Niveau, kostet im Betrieb aber 40 Prozent weniger als Opus 5.

Illustration einer Balkenwaage mit Münzstapel in Elektroblau, kinewsletter.ch Stil
Illustration einer Balkenwaage mit Münzstapel in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·23. SEPTEMBER 2026

OpenAI halbiert die API-Preise für GPT-6 Sol und Luna

OpenAI hat GPT-6 Sol und Luna veröffentlicht und die API-Preise halbiert. Für Schweizer Teams mit Agenten-Workloads schrumpft die Token-Rechnung auf die Hälfte.

Illustration einer Waage mit Preisschild und Stoppuhren auf einer Werkbank am Fenster, kinewsletter.ch Stil
Illustration einer Waage mit Preisschild und Stoppuhren auf einer Werkbank am Fenster, kinewsletter.ch Stil
NEUE MODELLE·22. SEPTEMBER 2026

xAI bringt Grok 4.7 – günstig, aber kein Spitzenreiter

xAI hat Grok 4.7 veröffentlicht: 2 US-Dollar pro Million Input-Token, 6 Dollar für Output – ein Bruchteil dessen, was Claude Fable 5.1 kostet. Im unabhängigen Artificial Analysis Intelligence Index landet das Modell mit 46 Punkten aber nur im Mittelfeld. Für Schweizer Teams heisst das: günstig rechnen, aber nicht blind auf lange Agenten-Läufe setzen.

Skizze einer Waage mit Münzen und Dokumentenstapel in Elektroblau, kinewsletter.ch Stil
Skizze einer Waage mit Münzen und Dokumentenstapel in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·21. SEPTEMBER 2026

600-Milliarden-Modell für einen Dollar pro Million Token

StepFun hat am 20. September 2026 Step 5 Preview gestartet: ein Sparse-MoE-Modell mit rund 600 Milliarden Parametern, 1 Million Token Kontext und einem Listenpreis von 1 US-Dollar pro Million Input-Token. Die Gewichte sollen am 15. Oktober offengelegt werden.

Skizze eines Mikrofons mit Sprachwellen in Elektroblau, kinewsletter.ch Stil
Skizze eines Mikrofons mit Sprachwellen in Elektroblau, kinewsletter.ch Stil
NEUE MODELLE·16. SEPTEMBER 2026

Gemini 3.8 Live: Google unterbietet OpenAI beim Sprechen

Googles neue Sprachmodelle wechseln mitten im Gespräch zwischen 97 Sprachen und erledigen Tool-Calls im Hintergrund – zu einem Bruchteil der Kosten der Konkurrenz.

Mehr aus Neue Modelle →