NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

DeepSeek macht KI-Agenten radikal billiger – mit einem Speichertrick

DeepSeeks neues Modell V4.1-Flash braucht nur noch ein Viertel Speicher – und schlägt auf einem Coding-Benchmark knapp Claude Opus 5. Die Gewichte stehen unter MIT-Lizenz.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
11. SEPTEMBER 2026
3 MIN. LESEZEIT
Illustration einer festgezurrten blauen Transportkiste vor einem Stapel leerer Holzkisten, kinewsletter.ch Stil
Illustration einer festgezurrten blauen Transportkiste vor einem Stapel leerer Holzkisten, kinewsletter.ch Stil
INHALT
01890 Byte pro Token statt Speicherfresser02Lesen kostet nur noch halb so viel wie Schreiben0374,2 Prozent – hauchdünn vor Opus 504Offene Gewichte, aber kein Server im Keller
INHALT
01890 Byte pro Token statt Speicherfresser02Lesen kostet nur noch halb so viel wie Schreiben0374,2 Prozent – hauchdünn vor Opus 504Offene Gewichte, aber kein Server im Keller
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Der Durchbruch ist nicht die Intelligenz, sondern der Speicher: Mit einem Viertel KV-Cache und 8 aktiven Milliarden Parametern beim Lesen wird der Dauerbetrieb von KI-Agenten erstmals kalkulierbar – für Schweizer KMU aber nur über gehostete Endpunkte, nicht über einen eigenen Server.

DeepSeek hat am 10. September 2026 das Modell V4.1-Flash veröffentlicht: ein multimodales Mixture-of-Experts-Modell mit 552 Milliarden Parametern, das laut der offiziellen Ankündigung des chinesischen Labors nur noch ein Viertel des schnellen GPU-Speichers seines Vorgängers V4-Flash benötigt. Die Gewichte liegen unter der freizügigen MIT-Lizenz auf Hugging Face, die API-Preise sind gleichzeitig gefallen. Zielgruppe sind KI-Agenten – also Systeme, die viele Schritte hintereinander abarbeiten und heute vor allem am Speicherhunger scheitern.

890 Byte pro Token statt Speicherfresser

Der Engpass heisst KV-Cache: ein Zwischenspeicher, in dem ein Modell alles ablegt, was es im laufenden Gespräch schon verarbeitet hat, damit es nicht bei jedem Schritt neu rechnen muss. Bei einem Agenten, der dutzende Werkzeuge aufruft, wächst dieser Puffer rasant – und er landet im teuersten Speicher, den ein Rechenzentrum hat.

V4.1-Flash drückt ihn laut Modellkarte auf 890 Byte pro Token. Das ist rund ein Viertel des Vorgängers; der dauerhaft auf SSD ausgelagerte Teil schrumpft auf etwa ein Achtel. Gegenüber DeepSeeks erstem Modell V1 ist es der Faktor 437. Das Kontextfenster bleibt bei einer Million Token.

WEITERLESENDas könnte dich auch interessieren.

Illustration eines Orrery mit blauer Planetenkugel neben einem offenen Sternatlas mit Zirkel und Lupe, kinewsletter.ch Stil

Lesen kostet nur noch halb so viel wie Schreiben

Möglich macht das eine ungewöhnliche Architektur, die DeepSeek Causal Encoder-Decoder nennt: Die 40 Schichten des Modells sind in eine lesende und eine schreibende Hälfte geteilt. Beim Einlesen von Text und Bildern sind deshalb nur 8 Milliarden Parameter aktiv, beim Schreiben 16 Milliarden. Für Agenten, die permanent neue Tool-Ergebnisse verdauen, halbiert das den Rechenaufwand auf der Input-Seite fast. Trainiert wurde von Grund auf mit 45 Billionen Token aus Text und Bildern.

74,2 Prozent – hauchdünn vor Opus 5

Auf dem Coding-Benchmark DeepSWE v1.1 löst V4.1-Flash 74,2 Prozent der Aufgaben – knapp vor Anthropics Claude Opus 5 (74,0) und OpenAIs GPT-5.6 Sol (73,0). Ein offenes Modell mit 16 aktiven Milliarden Parametern zieht damit erstmals an den geschlossenen Spitzenmodellen vorbei.

Der Haken: Es ist eine Punktlandung, kein Vorsprung auf ganzer Linie. Auf ProgramBench kommt DeepSeek auf 20,3 Prozent gegenüber 37,0 bei Opus 5, auf Terminal-Bench 4.0 auf 31,2 statt 51,8. Und beim Lesen komplexer Bilder räumt der technische Bericht selbst eine messbare Lücke zu den führenden geschlossenen Systemen ein.

Bezahlbar ist es trotzdem: 0,15 US-Dollar pro Million Input-Token und 0,60 pro Million Output-Token zum Randzeiten-Tarif. DeepSeek zieht daraus die Konsequenz und stellt sein eigenes Flaggschiff V4-Pro ein – ab dem 14. September landen dessen Anfragen auf V4.1-Flash.

Offene Gewichte, aber kein Server im Keller

Für Schweizer KMU ist «MIT-Lizenz» verlockend – der Reflex «dann hosten wir das eben selbst, und die Daten bleiben im Haus» greift hier aber zu kurz. Die Gewichte umfassen 485 Milliarden Parameter; DeepSeek selbst spricht in der Ankündigung von Grosseinsätzen mit 2'000 GPUs plus Storage-Cluster. Das ist kein Serverschrank, das ist ein Rechenzentrum.

Realistisch bleiben zwei Wege. Erstens: gehostete Endpunkte bei Schweizer Anbietern, die offene Modelle in hiesigen Rechenzentren betreiben – so lässt sich der Datenpfad revDSG-konform gestalten, statt Anfragen direkt an den chinesischen Anbieter zu schicken. Swisscom etwa betreibt Apertus bereits auf einer eigenen souveränen Schweizer KI-Plattform für Geschäftskunden. Zweitens: kleinere offene Modelle, die tatsächlich on-prem laufen. Das Schweizer Apertus von EPFL, ETH Zürich und dem Supercomputing-Zentrum CSCS gibt es in Varianten mit 8 und 70 Milliarden Parametern – deutlich schwächer als V4.1-Flash, aber auf Hardware lauffähig, die ein Mittelständler wirklich kaufen kann.

Die eigentliche Nachricht für dich ist deshalb weniger das Modell als der Preis dahinter: Wenn ein Agent nur noch ein Viertel Speicher braucht, wird der Dauerbetrieb von KI-Assistenten im Tagesgeschäft zum ersten Mal eine nüchterne Rechnung statt eines Budgetposten mit Bauchschmerzen.

Quellen

DeepSeek-V4.1-Flash Release (DeepSeek API Docs)↗ EXTERNER LINKDeepSeek-V4.1-Flash Modellkarte (Hugging Face)↗ EXTERNER LINKDeepSeek API Pricing↗ EXTERNER LINKNew Deepseek model V4.1-Flash cuts memory needs for AI agents (The Decoder)↗ EXTERNER LINKApertus – a fully open, transparent, multilingual language model (EPFL)↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
DeepSeekAnthropicHugging FaceSwisscomEPFL
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?
Illustration eines Orrery mit blauer Planetenkugel neben einem offenen Sternatlas mit Zirkel und Lupe, kinewsletter.ch Stil
NEUE MODELLE·4. SEPTEMBER 2026

OpenAI ruft die AGI-Ära aus – mit GPT-6 Astra

OpenAI hat GPT-6 Astra veröffentlicht. Präsident Greg Brockman spricht vom «generationellen Sprung» und beendet das Briefing mit «Welcome to the AGI era».

Illustration eines Tonmodells eines Hauses auf einem Drehteller, umringt von drei kleinen Stativkameras auf einer Werkbank, kinewsletter.ch Stil
Illustration eines Tonmodells eines Hauses auf einem Drehteller, umringt von drei kleinen Stativkameras auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·3. SEPTEMBER 2026

Fei-Fei Lis Atlas baut 3D-Welten aus wenigen Fotos

World Labs hat Atlas vorgestellt: ein Weltmodell, das aus einer Handvoll Fotos begehbare 3D-Szenen erzeugt, rekonstruiert und simuliert — bis zu eine Minute Video in 1440p mit frei gewählter Kameraführung, wahlweise als echte 3D-Geometrie. Verfügbar ist es bisher nur im Early Access, und alle Vergleichszahlen stammen von World Labs selbst.

Illustration einer Werkstattwaage mit Gewichtsscheiben, Messschieber und Notizzettel auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Werkstattwaage mit Gewichtsscheiben, Messschieber und Notizzettel auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·3. SEPTEMBER 2026

Muse Spark 1.3: Meta setzt auf sparsam statt Spitzenplatz

Meta hat Muse Spark 1.3 veröffentlicht: 62 Punkte im Artificial Analysis Intelligence Index, einen hinter Claude Opus 5 – aber zum Achtel des Preises von Claude Fable 5.1. Die beworbene Sparsamkeit stammt allerdings aus Metas eigener Messung, und die Open-Weights-Frage ist offener denn je.

Illustration einer Schlüsselwerkstatt mit Schlüsselfräse, Rohlingen an der Wand und offenem Vorhängeschloss, kinewsletter.ch Stil
Illustration einer Schlüsselwerkstatt mit Schlüsselfräse, Rohlingen an der Wand und offenem Vorhängeschloss, kinewsletter.ch Stil
NEUE MODELLE·3. SEPTEMBER 2026

Googles dritter Flash in sechs Wochen – plus ein Cyber-Modell

Gemini 3.8 Flash kostet gleich viel wie der Vorgänger – die Cyber-Variante gibt es nur für geprüfte Verteidiger. Das Frontier-Modell fehlt weiter.

Illustration einer mechanischen Rechenmaschine mit Papierstreifen und Lochkartenstapel auf einer Werkbank, kinewsletter.ch Stil
Illustration einer mechanischen Rechenmaschine mit Papierstreifen und Lochkartenstapel auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·2. SEPTEMBER 2026

Claude Fable 5.1: stärker beim Coden, günstiger im Betrieb

Anthropic hat Claude Fable 5.1 und Mythos 5.1 veröffentlicht: deutlich bessere Werte bei agentischem Coding und Recherche, dazu ein um 75 Prozent gesenkter Cache-Preis – doch bei voller Effort-Stufe rechnet Artificial Analysis vor, dass die Rechnung höher ausfällt als bei Opus 5.

Illustration einer offenen Tresortür mit Speichenrad vor hohen Archivregalen, kinewsletter.ch Stil
Illustration einer offenen Tresortür mit Speichenrad vor hohen Archivregalen, kinewsletter.ch Stil
NEUE MODELLE·31. AUGUST 2026

Tencent öffnet 770-Milliarden-Modell – Apache 2.0, 1 Million Token

Tencent hat Hy4 preview veröffentlicht: 770 Milliarden Parameter, 1 Million Token Kontext, Gewichte frei unter Apache 2.0. Das bisher grösste offene Modell des Konzerns – und der Lizenztext hat diesmal wirklich kein Kleingedrucktes.

Mehr aus Neue Modelle →