NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·NEUE MODELLE

DeepSeek verschenkt seine Agenten-Software – und versechsfacht die Cache-Preise

DeepSeek hat gleich dreifach geliefert: Das Flaggschiff V4-Pro verlässt mit Build 0813 die Testphase, die hauseigene Agenten-Software Harness erscheint unter MIT-Lizenz – und ab Sonntagabend steigen die API-Preise. Am stärksten trifft es ausgerechnet die Cache-Hits, von denen Coding-Agenten leben.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
14. AUGUST 2026
5 MIN. LESEZEIT
Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
Illustration einer Schaltwand mit austauschbaren blauen Modulen auf einer Werkbank, kinewsletter.ch Stil
INHALT
01Drei Denkstufen statt einer02Zehn Punkte hinter Claude Opus 503Alles ist ein Plugin04Der Cache-Rabatt schrumpft von 1/120 auf 1/3005Zwischen 8 und 12 Uhr wird es teuer
INHALT
01Drei Denkstufen statt einer02Zehn Punkte hinter Claude Opus 503Alles ist ein Plugin04Der Cache-Rabatt schrumpft von 1/120 auf 1/3005Zwischen 8 und 12 Uhr wird es teuer
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Die Software ist gratis, der Betrieb wird teurer: Der Cache-Rabatt schrumpft von einem Hundertzwanzigstel auf ein Dreissigstel des Input-Preises. Für Schweizer Teams gilt der teure Peak-Tarif nur vormittags von 8 bis 12 Uhr – der ganze Nachmittag ist halb so teuer.

DeepSeek hat am 13. August 2026 drei Ankündigungen auf einmal gemacht: Das Flaggschiff-Modell verlässt mit dem Build V4-Pro-0813 die Testphase, die hauseigene Agenten-Software DeepSeek Harness erscheint als Open Source unter MIT-Lizenz, und ab dem 16. August um 18 Uhr Schweizer Zeit steigen die API-Preise deutlich. Teurer wird ausgerechnet das, was Coding-Agenten am häufigsten tun: denselben Code-Kontext immer wieder einlesen. Cache-Hits kosten künftig das Sechs- bis Zwölffache.

Drei Denkstufen statt einer

Das Modell selbst bleibt äusserlich, wie es war. Laut DeepSeeks API-Dokumentation liefert der Endpunkt `deepseek-v4-pro` jetzt den Build 0813 – Modellname, Parameterzahl und das Kontextfenster von einer Million Token sind unverändert, bestehende Integrationen laufen ohne Anpassung weiter. In App und Web erscheint das Modell als «Expert Mode».

Neu ist, wie fein man das Nachdenken dosieren kann. Der Reasoning Effort – also wie lange das Modell intern rechnet, bevor es antwortet – lässt sich in drei Stufen setzen: `low`, `high` und `max`. In seiner Ankündigung auf X empfiehlt DeepSeek die mittlere Stufe: `low` für einfache Aufgaben, `high` für den täglichen Agenten-Betrieb, `max` nur für komplexe Fälle. Dazu kommt native Unterstützung der OpenAI Responses API samt Codex-Anbindung.

Bei den Agenten-Benchmarks meldet DeepSeek grosse Sprünge gegenüber der Preview-Version: Terminal Bench 2.1 klettert von 72,1 auf 87,9 Punkte, DeepSWE von 12,8 auf 62,7.

Zehn Punkte hinter Claude Opus 5

Die unabhängige Messung bestätigt die Richtung, relativiert aber die Höhe. Im Artificial Analysis Intelligence Index steigt V4-Pro von 45 auf 53 Punkte und liegt damit gleichauf mit GLM-5.2. Vor ihm rangieren allerdings Muse Spark mit 57, Qwen 3.8 Max mit 58, Kimi K3 mit 60 – und an der Spitze Claude Opus 5 mit 63 Punkten.

Und ein Detail für alle, die DeepSeek wegen der offenen Gewichte schätzen: Die Gewichte des neuen Builds sind bislang nicht veröffentlicht. Auf Hugging Face liegt weiterhin die April-Preview, zuletzt geändert am 22. Juni.

Alles ist ein Plugin

Der eigentliche Paukenschlag ist die Software drumherum. DeepSeek Harness v0.1 erscheint als Developer Preview unter MIT-Lizenz und positioniert sich damit direkt gegen OpenAI Codex und Claude Code. Ein «Harness» ist das Gerüst, das aus einem Sprachmodell erst einen handlungsfähigen Agenten macht: Es reicht dem Modell Werkzeuge, verwaltet Sitzungen und hält lange Arbeitsläufe am Laufen.

Das Leitprinzip lautet «Everything is a plugin». Auf Basis des Cordis-Kernels sind sämtliche Bausteine austauschbar – Modelle, Tools, Skills, Sessions, Sandboxes, Speicher, Schleifen, Scheduling und sogar die Oberfläche. Wer eine Komponente ersetzen will, ändert die Konfiguration statt den Quellcode.

Der zweite Grundsatz ist Nachvollziehbarkeit. Harness schreibt alles, was das Modell sieht, in ein fortlaufendes Session-Log: System-Prompts, Reasoning, Tool-Aufrufe, Resultate, Subagenten. Auf demselben Event-Stream lassen sich Läufe fortsetzen, verzweigen, durchsuchen und noch einmal abspielen. Vier Betriebsmodi stehen bereit, darunter ein Minimal-Modus mit nur zwei Werkzeugen – einer Shell und einem Datei-Editor –, den DeepSeek für die eigenen Benchmark-Läufe nutzt. Gestartet wird per `npx` über eine lokale Weboberfläche. Geleitet wird das Projekt von Cui Tianyi, der laut South China Morning Post im März 2026 von Jane Street zu DeepSeek wechselte.

Die Resonanz kam sofort: Keine 14 Stunden nach der Veröffentlichung stand das GitHub-Repository bei über 48'000 Sternen.

Der Cache-Rabatt schrumpft von 1/120 auf 1/30

Und dann die Rechnung. Ab dem 16. August, 16:00 UTC, wechselt DeepSeek auf Peak- und Off-Peak-Tarife. Off-Peak steigt der Input-Preis für V4-Pro von 0,435 auf 0,66 US-Dollar pro Million Token, der Output von 0,87 auf 1,98 Dollar. In den Peak-Stunden gilt jeweils das Doppelte: 1,32 und 3,96 Dollar.

Der Haken steckt beim Caching. Ein Cache-Hit – ein Textstück, das die API schon einmal verarbeitet hat und nicht neu berechnen muss – kostete bisher 0,003625 Dollar pro Million Token. Künftig sind es 0,022 Dollar off-peak und 0,044 in der Spitze. In DeepSeeks chinesischer Preistabelle, die die neuen Werte bereits ausweist, sind das exakt der sechs- respektive zwölffache Betrag. Gemessen am regulären Input-Preis schrumpft der Rabatt von einem Hundertzwanzigstel auf ein Dreissigstel.

Genau das trifft Agenten härter als Chatbots. Ein Coding-Agent liest dieselben Dateien in einem langen Lauf dutzendfach – bisher fast gratis, künftig zum vierfachen relativen Preis. Wie das Fachmagazin The Decoder einordnet, nimmt die Erhöhung die Preissenkung vom Mai teilweise zurück; Cache-Hits landen sogar über dem Niveau davor. Zeitlich passt das ins Bild: Laut einem Bloomberg-Bericht sammelt DeepSeek neues Kapital ein und bereitet einen Börsengang auf dem chinesischen Festland vor.

Zwischen 8 und 12 Uhr wird es teuer

Für dich als Schweizer Nutzer ist die Zeitzone der interessanteste Teil. Die Peak-Fenster orientieren sich am chinesischen Arbeitstag und liegen bei 01:00 bis 04:00 und 06:00 bis 10:00 UTC. In Sommerzeit heisst das hierzulande: 03:00 bis 06:00 Uhr nachts und 08:00 bis 12:00 Uhr morgens.

Konkret bedeutet das: Der Schweizer Vormittag ist die teure Zeit. Ab Mittag bis tief in die Nacht gilt der halbe Tarif. Wer grössere Agenten-Läufe, Code-Migrationen oder Batch-Auswertungen plant, legt sie also besser auf den Nachmittag – und spart damit die Hälfte, ohne eine Zeile Code zu ändern.

Quellen

DeepSeek API Pricing (Primärquelle)↗ EXTERNER LINKDeepSeek API 价格 – neue Tariftabelle (Primärquelle)↗ EXTERNER LINKDeepSeek Harness (Primärquelle)↗ EXTERNER LINKDeepSeek – Ankündigung V4-Pro-0813 (X)↗ EXTERNER LINKdeepseek-ai/deepseek-harness – Quellcode unter MIT (GitHub)↗ EXTERNER LINKCordis Plugin-System (GitHub)↗ EXTERNER LINKDeepSeek-V4-Pro – Model Weights (Hugging Face)↗ EXTERNER LINKDeepseek ships improved V4 Pro, open-sources its agent software, and raises API prices – The Decoder↗ EXTERNER LINKDeepSeek V4-Pro – Artificial Analysis Intelligence Index↗ EXTERNER LINKDeepSeek hires from Jane Street – South China Morning Post↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
DeepSeekOpenAIAnthropicHugging Face
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Handgezeichnete Skizze eines grossen aufgeschlagenen Buchs auf einem Lesepult mit blauem Akzent, daneben Kisten mit Ordnern
Handgezeichnete Skizze eines grossen aufgeschlagenen Buchs auf einem Lesepult mit blauem Akzent, daneben Kisten mit Ordnern
NEUE MODELLE·6. OKTOBER 2026

Reflection AI zeigt Beam, offenes Modell gegen China

Das US-Start-up Reflection AI stellt Beam vor, ein Modell mit offenen Gewichten und 501 Milliarden Parametern. Es soll chinesischen Modellen mit deutlich weniger Rechenaufwand Konkurrenz machen. Alle Zahlen sind Herstellerangaben, die Gewichte folgen im Oktober.

Tuschezeichnung einer Marionettenbühne: Hinter einem leeren Bildschirmrahmen halten zwei Hände ein Spielkreuz, an dessen Fäden eine Maske hängt; die Maske ist leuchtend blau.
Tuschezeichnung einer Marionettenbühne: Hinter einem leeren Bildschirmrahmen halten zwei Hände ein Spielkreuz, an dessen Fäden eine Maske hängt
NEUE MODELLE·3. OKTOBER 2026

Tavus: Fast jeder Zweite hält KI-Avatar Griffin für echt

Das US-Startup Tavus meldet, dass 48 Prozent der Testpersonen seinen KI-Videoavatar Griffin nach einer Minute für einen Menschen hielten. Die Zahl stammt vom Hersteller, die Stichprobe war mit 54 Personen klein. Für die Schweiz ist sie trotzdem ein Warnsignal, weil Betrüger Video-Fälschungen bisher selten, Stimmklone dafür umso öfter einsetzen.

Handgezeichnete Skizze eines grossen blauen Schilds mit Schlüsselloch und Schaltkreisen vor Server-Racks, daneben eine Lupe über Code mit einem Käfer
Handgezeichnete Skizze eines grossen blauen Schilds mit Schlüsselloch und Schaltkreisen vor Server-Racks, daneben eine Lupe über Code mit einem Käfer
NEUE MODELLE·1. OKTOBER 2026

Gemini 4 Argon: Google startet bei den Cyber-Verteidigern

Google stellt Gemini 4 Argon vor, zunächst nur für ausgewählte Cybersecurity-Organisationen im Fairwind-Programm. Laut Google findet und patcht das Modell kritische Schwachstellen selbstständig. Wir ordnen Zahlen, Bloomberg-Zweifel und den Schweiz-Bezug ein.

Tuschezeichnung einer Balkenwaage: links fünf kleine Münzen, rechts ein grosses elektroblaues sonnenförmiges Gewicht
Tuschezeichnung einer Balkenwaage: links fünf kleine Münzen, rechts ein grosses elektroblaues sonnenförmiges Gewicht
NEUE MODELLE·30. SEPTEMBER 2026

GPT-6.1 Sol: fast Astra-Niveau zu einem Fünftel des Preises

OpenAI hat am DevDay GPT-6.1 Sol vorgestellt: laut Hersteller fast auf Astra-Niveau, aber für 2 statt 10 Dollar pro Million Eingabe-Tokens. Die Fehlerrate sinkt gegenüber GPT-6 Sol von 11,4 auf 7,7 Prozent. Verfügbar in ChatGPT Work, Codex und API, nicht im normalen Chat.

Handgezeichnete Skizze einer grossen blauen Stoppuhr neben einem Münzstapel und Zahnrädern, dahinter Tempo-Linien
Handgezeichnete Skizze einer grossen blauen Stoppuhr neben einem Münzstapel und Zahnrädern, dahinter Tempo-Linien
NEUE MODELLE·29. SEPTEMBER 2026

Sonnet 5.5: 30 % schneller zum gleichen Preis wie Sonnet 5

Anthropic bringt Claude Sonnet 5.5: mehr als 30 % schneller und laut Anthropic bis zu 30 % günstiger pro Aufgabe, bei unverändertem Token-Preis. Auf mehreren Benchmarks liegt es nur knapp hinter Opus 5.5. Wir zeigen, wo der Haken liegt und wann sich der Wechsel lohnt.

Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
Illustration einer geöffneten Enigma-Chiffriermaschine auf einem Holzschreibtisch mit freiliegenden Rotoren, leeren Papierbögen und einer Schreibtischlampe, kinewsletter.ch Stil
KI-FORSCHUNG·27. SEPTEMBER 2026

GPT-6 Astra knackt Enigma-Funkspruch von 1941 – in zwei Tagen

OpenAIs GPT-6 Astra hat einen deutschen Heeres-Funkspruch vom 10. Juli 1941 entschlüsselt, der seit 2005 als ungelöst galt. Das Modell suchte sich das Ziel selbst aus und schrieb Enigma-Simulator und Enigma-Bombe eigenständig in Python und C++. Dieselbe Autonomie ist der Grund, weshalb OpenAI seine leistungsfähigsten Modelle gerade gestoppt hat.

Mehr aus Neue Modelle →