NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Nvidias schnellstes offenes Modell läuft auf einer einzigen GPU

Nemotron 3.5 Lightning erreicht bei Artificial Analysis dieselbe Punktzahl wie OpenAIs gpt-oss-120b – mit einem Viertel der Parameter und dem höchsten gemessenen Tempo unter 134 Modellen. Laut Modellsteckbrief genügt eine einzige H100 oder ein DGX Spark. Für Schweizer Firmen, die Daten im Haus behalten müssen, ist genau das die interessante Zahl.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
12. AUGUST 2026
3 MIN. LESEZEIT
Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
INHALT
01Ein Viertel der Parameter, dieselbe Punktzahl02Was «eine GPU» für ein Schweizer KMU heisst03Warum Nvidia Modelle verschenkt04Schnell heisst nicht klug
INHALT
01Ein Viertel der Parameter, dieselbe Punktzahl02Was «eine GPU» für ein Schweizer KMU heisst03Warum Nvidia Modelle verschenkt04Schnell heisst nicht klug
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein offenes Modell auf Frontier-nahem Agenten-Niveau, das auf einer einzigen GPU im eigenen Serverraum läuft – Datenhaltung im Haus ist damit keine Frage des Budgets mehr, sondern der Entscheidung.

Nvidia hat am 11. August 2026 Nemotron 3.5 Lightning veröffentlicht, ein offenes Sprachmodell mit rund 30 Milliarden Parametern, von denen pro Anfrage nur etwa 3 Milliarden aktiv sind. Beim unabhängigen Messdienst Artificial Analysis erreicht es 24 Punkte im Intelligence Index – exakt gleich viel wie OpenAIs gpt-oss-120b, das mit 117 Milliarden Parametern fast viermal so gross ist. Und laut dem Modellsteckbrief auf Hugging Face genügt für den Betrieb eine einzige GPU: eine H100 im Rack oder ein DGX Spark auf dem Pult.

Ein Viertel der Parameter, dieselbe Punktzahl

Möglich macht das eine Mixture-of-Experts-Architektur – vereinfacht gesagt schickt ein Router jedes Token nur an wenige Spezialisten im Modell, statt jedes Mal das ganze Netzwerk zu rechnen. Das Ergebnis ist vor allem Tempo: Artificial Analysis misst rund 481 Token pro Sekunde – Platz eins unter 134 verglichenen Modellen. Auch bei Agenten-Aufgaben, also Arbeit über viele selbstständige Schritte hinweg, zieht Lightning an. Auf GDPval-AA v2 erreicht es eine Elo-Wertung von 824 gegenüber 800 bei gpt-oss-120b; bei Terminal-Bench v2.1 liegt es mit 24,3 Prozent knapp dahinter (26,2 Prozent).

Was «eine GPU» für ein Schweizer KMU heisst

Das Modell steht unter der permissiven Lizenz OpenMDW-1.1; Firmen dürfen es laut CNBC herunterladen, anpassen und weiterverteilen, ohne Nvidia zu fragen und ohne zu zahlen. Die Modellkarte hält ausdrücklich fest: bereit für den kommerziellen Einsatz.

Wer heute Kunden-, Personal- oder Mandatsdaten durch eine Cloud-KI schickt, braucht einen Auftragsbearbeitungsvertrag und muss die Bekanntgabe ins Ausland prüfen. Läuft das Modell im eigenen Serverraum, verlassen die Daten das Haus gar nicht erst. Neu ist nicht die Idee, neu ist ihr Preis: Es braucht kein GPU-Cluster mehr, sondern eine Karte – Nvidia nennt neben H100 und DGX Spark auch die GeForce RTX 5090 sowie LM Studio, llama.cpp und Ollama. Das Kontextfenster liegt bei einer Million Token; Deutsch, Französisch und Italienisch sind unterstützt, Bilder und Audio nicht. Wer lieber mietet: Über Serverless-Anbieter kostet die Million Input-Token im Median 5 Cent, die Million Output-Token 20 Cent.

Warum Nvidia Modelle verschenkt

Es ist Nvidias erstes offenes Modell, seit Konzernchef Jensen Huang Ende Juli erstmals auf X für offene Gewichte eintrat – sie stärkten Sicherheit, beschleunigten Innovation und ermöglichten Souveränität, schrieb er laut CNBC in einem offenen Brief. Das Geschäftsinteresse liegt zutage: Auch ein verschenktes Modell braucht Grafikkarten. «Free AI should be great for hardware», sagte Huang im Juli gegenüber Axios. «Free AI should be great for chips.»

Schnell heisst nicht klug

Der Haken: Lightning ist nicht das klügste Modell seiner Klasse. Laut The Decoder liegen Qwen3.6 35B A3B und Metas Muse Glimmer im Intelligence Index klar vorne. Nvidia positioniert Lightning bewusst als Arbeiter, nicht als Denker: Werkzeuge aufrufen, Ergebnisse prüfen, Ausgaben formatieren – während ein grösseres Modell plant. Für die meisten KMU-Anwendungen ist genau das der Teil, der laufend Geld kostet.

Quellen

NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents (NVIDIA Technical Blog, 11.08.2026)↗ EXTERNER LINKNVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 – Model Card (Hugging Face, 11.08.2026)↗ EXTERNER LINKNemotron 3.5 Lightning – Intelligence, Performance & Price Analysis (Artificial Analysis)↗ EXTERNER LINKgpt-oss-120b – Intelligence, Performance & Price Analysis (Artificial Analysis)↗ EXTERNER LINKNvidia unveils first open-source AI model since CEO Jensen Huang entered the chat (CNBC, 11.08.2026)↗ EXTERNER LINKNvidia's open-weight Nemotron 3.5 Lightning prioritizes speed over maximum intelligence (The Decoder, 11.08.2026)↗ EXTERNER LINKOpenMDW License Agreement, Version 1.1↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
NvidiaHugging Face
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Orrery mit blauer Planetenkugel neben einem offenen Sternatlas mit Zirkel und Lupe, kinewsletter.ch Stil
Illustration eines Orrery mit blauer Planetenkugel neben einem offenen Sternatlas mit Zirkel und Lupe, kinewsletter.ch Stil
NEUE MODELLE·4. SEPTEMBER 2026

OpenAI ruft die AGI-Ära aus – mit GPT-6 Astra

OpenAI hat GPT-6 Astra veröffentlicht. Präsident Greg Brockman spricht vom «generationellen Sprung» und beendet das Briefing mit «Welcome to the AGI era».

Illustration eines Tonmodells eines Hauses auf einem Drehteller, umringt von drei kleinen Stativkameras auf einer Werkbank, kinewsletter.ch Stil
Illustration eines Tonmodells eines Hauses auf einem Drehteller, umringt von drei kleinen Stativkameras auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·3. SEPTEMBER 2026

Fei-Fei Lis Atlas baut 3D-Welten aus wenigen Fotos

World Labs hat Atlas vorgestellt: ein Weltmodell, das aus einer Handvoll Fotos begehbare 3D-Szenen erzeugt, rekonstruiert und simuliert — bis zu eine Minute Video in 1440p mit frei gewählter Kameraführung, wahlweise als echte 3D-Geometrie. Verfügbar ist es bisher nur im Early Access, und alle Vergleichszahlen stammen von World Labs selbst.

Illustration einer Werkstattwaage mit Gewichtsscheiben, Messschieber und Notizzettel auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Werkstattwaage mit Gewichtsscheiben, Messschieber und Notizzettel auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·3. SEPTEMBER 2026

Muse Spark 1.3: Meta setzt auf sparsam statt Spitzenplatz

Meta hat Muse Spark 1.3 veröffentlicht: 62 Punkte im Artificial Analysis Intelligence Index, einen hinter Claude Opus 5 – aber zum Achtel des Preises von Claude Fable 5.1. Die beworbene Sparsamkeit stammt allerdings aus Metas eigener Messung, und die Open-Weights-Frage ist offener denn je.

Illustration einer Schlüsselwerkstatt mit Schlüsselfräse, Rohlingen an der Wand und offenem Vorhängeschloss, kinewsletter.ch Stil
Illustration einer Schlüsselwerkstatt mit Schlüsselfräse, Rohlingen an der Wand und offenem Vorhängeschloss, kinewsletter.ch Stil
NEUE MODELLE·3. SEPTEMBER 2026

Googles dritter Flash in sechs Wochen – plus ein Cyber-Modell

Gemini 3.8 Flash kostet gleich viel wie der Vorgänger – die Cyber-Variante gibt es nur für geprüfte Verteidiger. Das Frontier-Modell fehlt weiter.

Illustration einer mechanischen Rechenmaschine mit Papierstreifen und Lochkartenstapel auf einer Werkbank, kinewsletter.ch Stil
Illustration einer mechanischen Rechenmaschine mit Papierstreifen und Lochkartenstapel auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·2. SEPTEMBER 2026

Claude Fable 5.1: stärker beim Coden, günstiger im Betrieb

Anthropic hat Claude Fable 5.1 und Mythos 5.1 veröffentlicht: deutlich bessere Werte bei agentischem Coding und Recherche, dazu ein um 75 Prozent gesenkter Cache-Preis – doch bei voller Effort-Stufe rechnet Artificial Analysis vor, dass die Rechnung höher ausfällt als bei Opus 5.

Illustration einer offenen Tresortür mit Speichenrad vor hohen Archivregalen, kinewsletter.ch Stil
Illustration einer offenen Tresortür mit Speichenrad vor hohen Archivregalen, kinewsletter.ch Stil
NEUE MODELLE·31. AUGUST 2026

Tencent öffnet 770-Milliarden-Modell – Apache 2.0, 1 Million Token

Tencent hat Hy4 preview veröffentlicht: 770 Milliarden Parameter, 1 Million Token Kontext, Gewichte frei unter Apache 2.0. Das bisher grösste offene Modell des Konzerns – und der Lizenztext hat diesmal wirklich kein Kleingedrucktes.

Mehr aus Neue Modelle →