NewsKategorienWissenNewsletter-ArchivÜber uns
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

DeepSeek verschenkt seine Agenten-Software – und versechsfacht die Cache-Preise

DeepSeek hat gleich dreifach geliefert: Das Flaggschiff V4-Pro verlässt mit Build 0813 die Testphase, die hauseigene Agenten-Software Harness erscheint unter MIT-Lizenz – und ab Sonntagabend steigen die API-Preise. Am stärksten trifft es ausgerechnet die Cache-Hits, von denen Coding-Agenten leben.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
14. AUGUST 2026
5 MIN. LESEZEIT
Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
INHALT
01Drei Denkstufen statt einer02Zehn Punkte hinter Claude Opus 503Alles ist ein Plugin04Der Cache-Rabatt schrumpft von 1/120 auf 1/3005Zwischen 8 und 12 Uhr wird es teuer
INHALT
01Drei Denkstufen statt einer02Zehn Punkte hinter Claude Opus 503Alles ist ein Plugin04Der Cache-Rabatt schrumpft von 1/120 auf 1/3005Zwischen 8 und 12 Uhr wird es teuer
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die Software ist gratis, der Betrieb wird teurer: Der Cache-Rabatt schrumpft von einem Hundertzwanzigstel auf ein Dreissigstel des Input-Preises. Für Schweizer Teams gilt der teure Peak-Tarif nur vormittags von 8 bis 12 Uhr – der ganze Nachmittag ist halb so teuer.

DeepSeek hat am 13. August 2026 drei Ankündigungen auf einmal gemacht: Das Flaggschiff-Modell verlässt mit dem Build V4-Pro-0813 die Testphase, die hauseigene Agenten-Software DeepSeek Harness erscheint als Open Source unter MIT-Lizenz, und ab dem 16. August um 18 Uhr Schweizer Zeit steigen die API-Preise deutlich. Teurer wird ausgerechnet das, was Coding-Agenten am häufigsten tun: denselben Code-Kontext immer wieder einlesen. Cache-Hits kosten künftig das Sechs- bis Zwölffache.

Drei Denkstufen statt einer

Das Modell selbst bleibt äusserlich, wie es war. Laut DeepSeeks API-Dokumentation liefert der Endpunkt `deepseek-v4-pro` jetzt den Build 0813 – Modellname, Parameterzahl und das Kontextfenster von einer Million Token sind unverändert, bestehende Integrationen laufen ohne Anpassung weiter. In App und Web erscheint das Modell als «Expert Mode».

Neu ist, wie fein man das Nachdenken dosieren kann. Der Reasoning Effort – also wie lange das Modell intern rechnet, bevor es antwortet – lässt sich in drei Stufen setzen: `low`, `high` und `max`. In seiner Ankündigung auf X empfiehlt DeepSeek die mittlere Stufe: `low` für einfache Aufgaben, `high` für den täglichen Agenten-Betrieb, `max` nur für komplexe Fälle. Dazu kommt native Unterstützung der OpenAI Responses API samt Codex-Anbindung.

Bei den Agenten-Benchmarks meldet DeepSeek grosse Sprünge gegenüber der Preview-Version: Terminal Bench 2.1 klettert von 72,1 auf 87,9 Punkte, DeepSWE von 12,8 auf 62,7.

Zehn Punkte hinter Claude Opus 5

Die unabhängige Messung bestätigt die Richtung, relativiert aber die Höhe. Im Artificial Analysis Intelligence Index steigt V4-Pro von 45 auf 53 Punkte und liegt damit gleichauf mit GLM-5.2. Vor ihm rangieren allerdings Muse Spark mit 57, Qwen 3.8 Max mit 58, Kimi K3 mit 60 – und an der Spitze Claude Opus 5 mit 63 Punkten.

Und ein Detail für alle, die DeepSeek wegen der offenen Gewichte schätzen: Die Gewichte des neuen Builds sind bislang nicht veröffentlicht. Auf Hugging Face liegt weiterhin die April-Preview, zuletzt geändert am 22. Juni.

Alles ist ein Plugin

Der eigentliche Paukenschlag ist die Software drumherum. DeepSeek Harness v0.1 erscheint als Developer Preview unter MIT-Lizenz und positioniert sich damit direkt gegen OpenAI Codex und Claude Code. Ein «Harness» ist das Gerüst, das aus einem Sprachmodell erst einen handlungsfähigen Agenten macht: Es reicht dem Modell Werkzeuge, verwaltet Sitzungen und hält lange Arbeitsläufe am Laufen.

Das Leitprinzip lautet «Everything is a plugin». Auf Basis des Cordis-Kernels sind sämtliche Bausteine austauschbar – Modelle, Tools, Skills, Sessions, Sandboxes, Speicher, Schleifen, Scheduling und sogar die Oberfläche. Wer eine Komponente ersetzen will, ändert die Konfiguration statt den Quellcode.

Der zweite Grundsatz ist Nachvollziehbarkeit. Harness schreibt alles, was das Modell sieht, in ein fortlaufendes Session-Log: System-Prompts, Reasoning, Tool-Aufrufe, Resultate, Subagenten. Auf demselben Event-Stream lassen sich Läufe fortsetzen, verzweigen, durchsuchen und noch einmal abspielen. Vier Betriebsmodi stehen bereit, darunter ein Minimal-Modus mit nur zwei Werkzeugen – einer Shell und einem Datei-Editor –, den DeepSeek für die eigenen Benchmark-Läufe nutzt. Gestartet wird per `npx` über eine lokale Weboberfläche. Geleitet wird das Projekt von Cui Tianyi, der laut South China Morning Post im März 2026 von Jane Street zu DeepSeek wechselte.

Die Resonanz kam sofort: Keine 14 Stunden nach der Veröffentlichung stand das GitHub-Repository bei über 48'000 Sternen.

Der Cache-Rabatt schrumpft von 1/120 auf 1/30

Und dann die Rechnung. Ab dem 16. August, 16:00 UTC, wechselt DeepSeek auf Peak- und Off-Peak-Tarife. Off-Peak steigt der Input-Preis für V4-Pro von 0,435 auf 0,66 US-Dollar pro Million Token, der Output von 0,87 auf 1,98 Dollar. In den Peak-Stunden gilt jeweils das Doppelte: 1,32 und 3,96 Dollar.

Der Haken steckt beim Caching. Ein Cache-Hit – ein Textstück, das die API schon einmal verarbeitet hat und nicht neu berechnen muss – kostete bisher 0,003625 Dollar pro Million Token. Künftig sind es 0,022 Dollar off-peak und 0,044 in der Spitze. In DeepSeeks chinesischer Preistabelle, die die neuen Werte bereits ausweist, sind das exakt der sechs- respektive zwölffache Betrag. Gemessen am regulären Input-Preis schrumpft der Rabatt von einem Hundertzwanzigstel auf ein Dreissigstel.

Genau das trifft Agenten härter als Chatbots. Ein Coding-Agent liest dieselben Dateien in einem langen Lauf dutzendfach – bisher fast gratis, künftig zum vierfachen relativen Preis. Wie das Fachmagazin The Decoder einordnet, nimmt die Erhöhung die Preissenkung vom Mai teilweise zurück; Cache-Hits landen sogar über dem Niveau davor. Zeitlich passt das ins Bild: Laut einem Bloomberg-Bericht sammelt DeepSeek neues Kapital ein und bereitet einen Börsengang auf dem chinesischen Festland vor.

Zwischen 8 und 12 Uhr wird es teuer

Für dich als Schweizer Nutzer ist die Zeitzone der interessanteste Teil. Die Peak-Fenster orientieren sich am chinesischen Arbeitstag und liegen bei 01:00 bis 04:00 und 06:00 bis 10:00 UTC. In Sommerzeit heisst das hierzulande: 03:00 bis 06:00 Uhr nachts und 08:00 bis 12:00 Uhr morgens.

Konkret bedeutet das: Der Schweizer Vormittag ist die teure Zeit. Ab Mittag bis tief in die Nacht gilt der halbe Tarif. Wer grössere Agenten-Läufe, Code-Migrationen oder Batch-Auswertungen plant, legt sie also besser auf den Nachmittag – und spart damit die Hälfte, ohne eine Zeile Code zu ändern.

Quellen

DeepSeek API Pricing (Primärquelle)↗ EXTERNER LINKDeepSeek API 价格 – neue Tariftabelle (Primärquelle)↗ EXTERNER LINKDeepSeek Harness (Primärquelle)↗ EXTERNER LINKDeepSeek – Ankündigung V4-Pro-0813 (X)↗ EXTERNER LINKdeepseek-ai/deepseek-harness – Quellcode unter MIT (GitHub)↗ EXTERNER LINKCordis Plugin-System (GitHub)↗ EXTERNER LINKDeepSeek-V4-Pro – Model Weights (Hugging Face)↗ EXTERNER LINKDeepseek ships improved V4 Pro, open-sources its agent software, and raises API prices – The Decoder↗ EXTERNER LINKDeepSeek V4-Pro – Artificial Analysis Intelligence Index↗ EXTERNER LINKDeepSeek hires from Jane Street – South China Morning Post↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
DeepSeekOpenAIAnthropicHugging Face
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Skizze einer grossen runden Glaslinse in Elektroblau auf einem Messingstativ auf einer Holzwerkbank, daneben ein kleiner Schrank mit Vorhängeschloss und drei lose Linsen in einer Metallschale, kinewsletter.ch Stil
Handgezeichnete Skizze einer grossen runden Glaslinse in Elektroblau auf einem Messingstativ auf einer Holzwerkbank, daneben ein kleiner Schrank mit Vorhängeschloss und drei lose Linsen in einer Metallschale, kinewsletter.ch Stil
NEUE MODELLE·22. AUGUST 2026

DeepSeek gibt Flash Augen – und behält diesmal die Gewichte

DeepSeek hat sein günstiges V4-Flash um Bildverständnis erweitert – zum identischen Preis, ohne Aufschlag. Laut DeepSeeks eigener Tabelle kommt das experimentelle Modell nahe an Claude Opus 4.8 heran und schlägt es auf drei von elf Benchmarks. Zwei Details fehlen in den Schlagzeilen: Jedes Bild wird auf 0,64 Megapixel eingedampft – und die Gewichte veröffentlicht DeepSeek diesmal nicht.

Illustration einer geöffneten Tresortür mit Serverracks dahinter, kinewsletter.ch Stil
Illustration einer geöffneten Tresortür mit Serverracks dahinter, kinewsletter.ch Stil
NEUE MODELLE·16. AUGUST 2026

Qwen3.8 ist offen – Apache 2.0 aber nur für das kleine Modell

Alibabas Qwen-Team hat die Gewichte von Qwen3.8 freigegeben. Apache 2.0 gilt aber nur fürs 27B-Modell – beim Max steht Kleingedrucktes im Lizenztext.

Illustration einer Stoppuhr mit blauem Gehäuse und einem Messschieber auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Stoppuhr mit blauem Gehäuse und einem Messschieber auf einer Werkbank, kinewsletter.ch Stil
NEUE MODELLE·14. AUGUST 2026

Gemini 3.7 Flash: drei Wochen nach 3.6, halber Preis

Google hat Gemini 3.7 Flash veröffentlicht – nur drei Wochen nach dem Vorgänger und zum halben Einführungspreis. Beim Programmieren legt das Modell deutlich zu, bei Agenten-Benchmarks bleibt GPT-5.6 Terra vorn. Und der Consumer-Agent Gemini Spark, der ab sofort auf 3.7 Flash läuft, ist in der Schweiz gar nicht verfügbar.

Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
Handgezeichnete Illustration: eine einzelne Grafikkarte auf einem Schreibtisch, aus der ein Blitz und schnelle Linien schiessen – kinewsletter.ch Stil
NEUE MODELLE·12. AUGUST 2026

Nvidias schnellstes offenes Modell läuft auf einer einzigen GPU

Nemotron 3.5 Lightning erreicht bei Artificial Analysis dieselbe Punktzahl wie OpenAIs gpt-oss-120b – mit einem Viertel der Parameter und dem höchsten gemessenen Tempo unter 134 Modellen. Laut Modellsteckbrief genügt eine einzige H100 oder ein DGX Spark. Für Schweizer Firmen, die Daten im Haus behalten müssen, ist genau das die interessante Zahl.

Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
Illustration einer offenen Tresortür mit Schlüsselbund am Haken, kinewsletter.ch Stil
NEUE MODELLE·11. AUGUST 2026

OpenAI gibt GPT-5.6-Cyber frei – nur für geprüfte Verteidiger

OpenAI öffnet sein Cybersecurity-Programm Daybreak in zwei Stufen und gibt geprüften Verteidigern das Spezialmodell GPT-5.6-Cyber. Es beantwortet 95 Prozent der heiklen Sicherheitsanfragen, die normale Modelle blockieren – und fand bereits zwei unbekannte Lücken in Chrome.

Illustration eines offenen Vorhängeschlosses vor einem offenen PC-Gehäuse mit Grafikkarte, kinewsletter.ch Stil
Illustration eines offenen Vorhängeschlosses vor einem offenen PC-Gehäuse mit Grafikkarte, kinewsletter.ch Stil
NEUE MODELLE·11. AUGUST 2026

Muse Glimmer: Meta öffnet 30-Milliarden-Modell unter Apache 2.0

Meta Superintelligence Labs hat am 10. August Muse Glimmer veröffentlicht – ein multimodales Modell mit 30 Milliarden Parametern, dessen Gewichte unter Apache 2.0 frei verfügbar sind. Quantisiert läuft es auf einer einzelnen Consumer-Grafikkarte. Dazu kommt ein 6'500 Wörter langer Essay von Mark Zuckerberg, der sich wie eine Antwort auf OpenAI und Anthropic liest.

Mehr aus Neue Modelle →