NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN FREITAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

Nvidias schnellstes offenes Modell läuft auf einer einzigen GPU

Nemotron 3.5 Lightning erreicht bei Artificial Analysis dieselbe Punktzahl wie OpenAIs gpt-oss-120b – mit einem Viertel der Parameter und dem höchsten gemessenen Tempo unter 134 Modellen. Laut Modellsteckbrief genügt eine einzige H100 oder ein DGX Spark. Für Schweizer Firmen, die Daten im Haus behalten müssen, ist genau das die interessante Zahl.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
12. AUGUST 2026
3 MIN. LESEZEIT
Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
INHALT
01Ein Viertel der Parameter, dieselbe Punktzahl02Was «eine GPU» für ein Schweizer KMU heisst03Warum Nvidia Modelle verschenkt04Schnell heisst nicht klug
INHALT
01Ein Viertel der Parameter, dieselbe Punktzahl02Was «eine GPU» für ein Schweizer KMU heisst03Warum Nvidia Modelle verschenkt04Schnell heisst nicht klug
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein offenes Modell auf Frontier-nahem Agenten-Niveau, das auf einer einzigen GPU im eigenen Serverraum läuft – Datenhaltung im Haus ist damit keine Frage des Budgets mehr, sondern der Entscheidung.

Nvidia hat am 11. August 2026 Nemotron 3.5 Lightning veröffentlicht, ein offenes Sprachmodell mit rund 30 Milliarden Parametern, von denen pro Anfrage nur etwa 3 Milliarden aktiv sind. Beim unabhängigen Messdienst Artificial Analysis erreicht es 24 Punkte im Intelligence Index – exakt gleich viel wie OpenAIs gpt-oss-120b, das mit 117 Milliarden Parametern fast viermal so gross ist. Und laut dem Modellsteckbrief auf Hugging Face genügt für den Betrieb eine einzige GPU: eine H100 im Rack oder ein DGX Spark auf dem Pult.

Ein Viertel der Parameter, dieselbe Punktzahl

Möglich macht das eine Mixture-of-Experts-Architektur – vereinfacht gesagt schickt ein Router jedes Token nur an wenige Spezialisten im Modell, statt jedes Mal das ganze Netzwerk zu rechnen. Das Ergebnis ist vor allem Tempo: Artificial Analysis misst rund 481 Token pro Sekunde – Platz eins unter 134 verglichenen Modellen. Auch bei Agenten-Aufgaben, also Arbeit über viele selbstständige Schritte hinweg, zieht Lightning an. Auf GDPval-AA v2 erreicht es eine Elo-Wertung von 824 gegenüber 800 bei gpt-oss-120b; bei Terminal-Bench v2.1 liegt es mit 24,3 Prozent knapp dahinter (26,2 Prozent).

Was «eine GPU» für ein Schweizer KMU heisst

WEITERLESENDas könnte dich auch interessieren.

Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil

Das Modell steht unter der permissiven Lizenz OpenMDW-1.1; Firmen dürfen es laut CNBC herunterladen, anpassen und weiterverteilen, ohne Nvidia zu fragen und ohne zu zahlen. Die Modellkarte hält ausdrücklich fest: bereit für den kommerziellen Einsatz.

Wer heute Kunden-, Personal- oder Mandatsdaten durch eine Cloud-KI schickt, braucht einen Auftragsbearbeitungsvertrag und muss die Bekanntgabe ins Ausland prüfen. Läuft das Modell im eigenen Serverraum, verlassen die Daten das Haus gar nicht erst. Neu ist nicht die Idee, neu ist ihr Preis: Es braucht kein GPU-Cluster mehr, sondern eine Karte – Nvidia nennt neben H100 und DGX Spark auch die GeForce RTX 5090 sowie LM Studio, llama.cpp und Ollama. Das Kontextfenster liegt bei einer Million Token; Deutsch, Französisch und Italienisch sind unterstützt, Bilder und Audio nicht. Wer lieber mietet: Über Serverless-Anbieter kostet die Million Input-Token im Median 5 Cent, die Million Output-Token 20 Cent.

Warum Nvidia Modelle verschenkt

Es ist Nvidias erstes offenes Modell, seit Konzernchef Jensen Huang Ende Juli erstmals auf X für offene Gewichte eintrat – sie stärkten Sicherheit, beschleunigten Innovation und ermöglichten Souveränität, schrieb er laut CNBC in einem offenen Brief. Das Geschäftsinteresse liegt zutage: Auch ein verschenktes Modell braucht Grafikkarten. «Free AI should be great for hardware», sagte Huang im Juli gegenüber Axios. «Free AI should be great for chips.»

Schnell heisst nicht klug

Der Haken: Lightning ist nicht das klügste Modell seiner Klasse. Laut The Decoder liegen Qwen3.6 35B A3B und Metas Muse Glimmer im Intelligence Index klar vorne. Nvidia positioniert Lightning bewusst als Arbeiter, nicht als Denker: Werkzeuge aufrufen, Ergebnisse prüfen, Ausgaben formatieren – während ein grösseres Modell plant. Für die meisten KMU-Anwendungen ist genau das der Teil, der laufend Geld kostet.

Quellen

NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents (NVIDIA Technical Blog, 11.08.2026)↗ EXTERNER LINKNVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 – Model Card (Hugging Face, 11.08.2026)↗ EXTERNER LINKNemotron 3.5 Lightning – Intelligence, Performance & Price Analysis (Artificial Analysis)↗ EXTERNER LINKgpt-oss-120b – Intelligence, Performance & Price Analysis (Artificial Analysis)↗ EXTERNER LINKNvidia unveils first open-source AI model since CEO Jensen Huang entered the chat (CNBC, 11.08.2026)↗ EXTERNER LINKNvidia's open-weight Nemotron 3.5 Lightning prioritizes speed over maximum intelligence (The Decoder, 11.08.2026)↗ EXTERNER LINKOpenMDW License Agreement, Version 1.1↗ EXTERNER LINK
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Freitag in dein Postfach?
NEUE MODELLE·11. AUGUST 2026

OpenAI gibt GPT-5.6-Cyber frei – nur für geprüfte Verteidiger

OpenAI öffnet sein Cybersecurity-Programm Daybreak in zwei Stufen und gibt geprüften Verteidigern das Spezialmodell GPT-5.6-Cyber. Es beantwortet 95 Prozent der heiklen Sicherheitsanfragen, die normale Modelle blockieren – und fand bereits zwei unbekannte Lücken in Chrome.

Illustration eines offenen Vorhängeschlosses vor einem offenen PC-Gehäuse mit Grafikkarte, kinewsletter.ch Stil
Illustration eines offenen Vorhängeschlosses vor einem offenen PC-Gehäuse mit Grafikkarte, kinewsletter.ch Stil
NEUE MODELLE·11. AUGUST 2026

Muse Glimmer: Meta öffnet 30-Milliarden-Modell unter Apache 2.0

Meta Superintelligence Labs hat am 10. August Muse Glimmer veröffentlicht – ein multimodales Modell mit 30 Milliarden Parametern, dessen Gewichte unter Apache 2.0 frei verfügbar sind. Quantisiert läuft es auf einer einzelnen Consumer-Grafikkarte. Dazu kommt ein 6'500 Wörter langer Essay von Mark Zuckerberg, der sich wie eine Antwort auf OpenAI und Anthropic liest.

Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
Illustration einer Wandtafel auf Staffelei mit blauer senkrechter Linie und Punkten, kinewsletter.ch Stil
KI-FORSCHUNG·11. AUGUST 2026

Claude hebt Riemann-Schranke von 41,6 auf 67,2 Prozent

Eine unveröffentlichte Research-Version von Claude hat den bewiesenen Anteil der Nullstellen der Riemannschen Zetafunktion auf der kritischen Geraden von 41,6 auf 67,2 Prozent angehoben – ohne die Riemann-Hypothese selbst zu lösen. Angestossen hat das ein Anthropic-Mitarbeiter ohne Mathematik-Ausbildung, die Arbeit erledigten rund 60 Claude-Subagenten, und der Beweis liegt maschinenprüfbar im Beweisassistenten Lean auf GitHub.

Illustration einer offenen Tresortür in einem Serverraum, kinewsletter.ch Stil
Illustration einer offenen Tresortür in einem Serverraum, kinewsletter.ch Stil
REGULIERUNG & ETHIK·9. AUGUST 2026

OpenAI stoppt Teile von Astra – erstmals Cyber-Stufe «Critical»

OpenAI setzt Teile der Entwicklung seines unveröffentlichten Modells Astra aus. Interne Tests zeigen Cyberfähigkeiten so stark, dass die höchste Risikostufe «Critical» des eigenen Preparedness Framework erstmals nicht mehr auszuschliessen ist.

Illustration einer Filmklappe mit elektroblauen Balken neben Tonangel-Mikrofon und Scheinwerfer, im Hintergrund ein Fenster mit Schwarzwald-Tannen, kinewsletter.ch Stil
Illustration einer Filmklappe mit elektroblauen Balken neben Tonangel-Mikrofon und Scheinwerfer, im Hintergrund ein Fenster mit Schwarzwald-Tannen, kinewsletter.ch Stil
NEUE MODELLE·6. AUGUST 2026

FLUX 3 Video: KI-Clips mit Ton – jetzt für alle verfügbar

Black Forest Labs macht sein Videomodell FLUX 3 Video über die API allgemein verfügbar: bis zu 20 Sekunden Video mit nativ mitgeneriertem Ton, Lippensynchronisation auf Deutsch und einem günstigen Draft-Modus. In internen Tests sieht sich das Freiburger KI-Studio an der Spitze.

Illustration einer Balkenwaage mit elektroblauem Ständer, auf der einen Schale Münzen, auf der anderen gerollte Dokumente, kinewsletter.ch Stil
Illustration einer Balkenwaage mit elektroblauem Ständer, auf der einen Schale Münzen, auf der anderen gerollte Dokumente, kinewsletter.ch Stil
KI-TOOLS & APPS·6. AUGUST 2026

Meta greift Claude Code an: 92 Prozent Rabatt fürs Datenteilen

Meta Superintelligence Labs lanciert mit Muse Code einen Terminal-Coding-Agenten als direkte Konkurrenz zu Claude Code und Codex – angetrieben vom neuen Modell Muse Spark 1.2. Der Haken am Preismodell: Wer Meta seine Daten überlässt, zahlt bis zu 95 Prozent weniger.

Mehr aus Neue Modelle →