Startseite / Blog / V4-Flash-0731
ENGINEERING BLOG · 2026.08.05

DeepSeek V4-Flash-0731:
Gleiche 284B — bessere Agent-Scores als V4-Pro

Am 31. Juli 2026 hat DeepSeek V4-Flash-0731 als offizielle API-Version ausgerollt — nicht als neues Modell, sondern als identische 284B/13B-Architektur mit frischem Post-Training. Das Ergebnis: Mehrere Agent- und Coding-Benchmarks liegen über dem größeren V4-Pro-Preview. Stand 5. August 2026 fehlen weiterhin die offizielle V4-Pro-Version und das erstmals benannte Agent-Framework Harness. Für Agent-Engineers, kostenbewusste Produktteams und Entscheider, die chinesische Open-Weight-Releases einordnen, liefert dieser Artikel Timeline, Preistabelle, Harness-Caveats, den Artificial Analysis Intelligence Index (50 vs. Kimi K3: 57) und den EU-relevanten Blick auf den chinesischen „Kill Line“-Preiskrieg. Kurzfassung: DeepSeek gewinnt nicht mit Platz 1 auf Leaderboards, sondern mit „gut genug + extrem günstig“ — und setzt damit eine Preisschwelle, unter der Wettbewerber ohne klaren Qualitätsvorsprung verschwinden.

01

„DeepSeek V4 official“ klingt nach einem Flaggschiff-Drop. Tatsächlich ist nur Flash-0731 offiziell geworden; V4-Pro bleibt Preview. Die Sequenz seit April:

  • 24. April: V4-Preview + MIT-Open-Weights (Pro 1,6T/49B aktiv, Flash 284B/13B aktiv, 1M Kontext).
  • 24. Juli: Legacy-Aliase deepseek-chat / deepseek-reasoner abgeschaltet.
  • 27. Juli: Kimi K3 (2,8T) vollständig auf Hugging Face — Druck auf DeepSeek Tage vor dem Flash-Update.
  • 31. Juli: V4-Flash-0731 API-Beta + Hugging-Face-Weights; Changelog nennt erstmals Harness. Nur API — App/Web unverändert.
  • 3. August: Alibaba Qwen3.8-Max GA — dichtes Release-Fenster in China.
  • 5. August (Redaktionsstand): Kein bestätigtes Datum für V4-Pro GA oder Harness. Gerüchte („10.–20. August“) stammen aus unbenannten Quellen.

In chinesischen Dev-Foren heißt DeepSeeks Kombination aus akzeptabler Leistung und Tiefstpreisen 斩杀线 (Kill Line): Wer weder klar besser noch billiger ist, verliert Relevanz. Vor dem Flash-Release spottete die Community über verzögerte Pro-Versprechen („Liang Baikai“); nach den überraschend starken Flash-Zahlen kehrte der Spitzname „Liang Sheng“ zurück. Parallel meldeten Medien OpenAI-Preissenkungen am Luna-Tier — typische Reaktion auf DeepSeeks Preisdruck.

02

DeepSeek-V4-Flash-0731 — veröffentlichte Specs (31.07.2026)
Merkmal V4-Flash-0731 V4-Pro (nur Preview)
StatusOffiziell (31.07.2026)Preview seit 24.04., GA ausstehend
Gesamt / aktiv pro Token284B / 13B (unverändert vs. April)1,6T / 49B
Kontext1 Mio. Token1 Mio. Token
Input (Cache-Miss / Hit, pro 1M)$0,14 / $0,0028$0,435 / $0,003625
Output (pro 1M)$0,28$0,87
LizenzMITMIT
Terminal Bench 2.0 (DeepSeek, Harness minimal)82,767,9 (Preview)
Artificial Analysis Intelligence Index50 (unabhängig)
Harness31.07. erstmals genannt; Agent-Benchmarks via minimal mode — Framework selbst noch nicht public (05.08.)

Agent-Scores (Terminal Bench 2.0 u. a.) stammen aus DeepSeeks noch nicht veröffentlichtem Harness minimal mode. Der Changelog warnt ausdrücklich: Ergebnisse sind „extrem harness-sensitiv“.

03

DeepSeek erklärt den Sprung explizit: keine Parameter-Skalierung, sondern erneutes Post-Training auf derselben Flash-Architektur. Das widerspricht der Branchenannahme „größer = besser“ und verschiebt 2026 den Wettbewerb Richtung Datenqualität und Trainingsmethodik.

Die April-Architektur bleibt in 0731 bestehen (Technical Report: „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“):

  • Hybrid Attention (CSA + HCA): Compressed Sparse Attention plus Heavy Compressed Attention — extern als DSA (DeepSeek Sparse Attention) vermarktet. Offizielle Effizienzclaims: bei 1M Kontext nur 27 % der Inference-FLOPs von V3.2, KV-Cache 10 % (Flash 7 %).
  • mHC (Manifold-Constrained Hyper-Connections): Vier Residual-Streams mit Mischmatrizen auf dem Birkhoff-Polytop — stabile Signale über 61 Layer.
  • Muon Optimizer: Ersetzt AdamW; Newton-Schulz-orthogonalisierte Gradienten für schnellere, stabilere Konvergenz.

Harness minimal mode im Detail: DeepSeek Harness ist das erste hauseigene Agent-Execution-Framework (Dateizugriff, Tool-Calls, mehrstufige Engineering-Tasks) — positioniert als Antwort auf Claude Code. Alle veröffentlichten Agent-Benchmarks für 0731 liefen unter minimal mode, max Reasoning, top_p=0,95, temperature=1,0. Bis unabhängige Teams dieselben Tasks mit Claude Code, Cursor oder OpenClaw reproduzieren, sind das Vendor-plus-Framework-Zahlen, keine portable Capability-Aussage.

Praxis-Feedback aus Entwicklerforen: niedrige Input-Cache-Hit-Rates und gelegentliche Safety-Classifier-Timeouts — ein Reminder, dass Post-Training allein Infrastruktur-Reibung nicht wegdefiniert.

04

V4-Flash-0731 vs. Kimi K3 vs. Qwen3.8-Max (Anfang August 2026)
Modell Gesamt / aktiv Preis In/Out (pro 1M) AA Intelligence Index AA Kosten/Task
DeepSeek V4-Flash-0731 284B / 13B $0,14 / $0,28 50 ~$0,03
Kimi K3 2,8T / ~104B (Schätzung) $3,00 / $15,00 57 ~$0,86
Qwen3.8-Max 2,4T / 95B $2,00 / $6,00 Stand Redaktion: nicht gelistet
GPT-5.6 Sol undisclosed +9 Pkt. vs. Flash ~$1,86
Claude Fable 5 undisclosed +9 Pkt. vs. Flash ~$3,15

Unabhängig misst Artificial Analysis Flash mit 50 unter Kimi K3 (57) — aber Kosten pro Task nur etwa 1/29 von Kimi und 1/105 von Claude Fable 5. DeepSeek zielt auf Hochfrequenz-Agent-Pipelines, nicht auf Benchmark-Krone.

Sechs Schritte vor der Produktionsmigration:

  1. Workload trennen: Routing, Batch-Summaries → Flash; tiefe Reasoning-Chains → Pro-Preview oder Closed Frontier.
  2. Harness-Benchmarks isolieren: Terminal Bench 82,7 ≠ Claude-Code-Score. Eigene A/B auf realen Repos.
  3. Cache-Ökonomie modellieren: $0,14 vs. $0,0028 Input ist ~50× — Agent-Loops ohne Cache treffen die Kill Line nicht.
  4. Legacy-Model-Namen prüfen: deepseek-chat ist tot; deepseek-v4-flash zeigt auf 0731.
  5. TCO gegen Kimi und Qwen: Bei 1B Input + 200M Output/Monat dominiert Flash die Rechnung — Qualitätsdelta (~7 Index-Punkte) einpreisen.
  6. Agent-Hosting absichern: API-Wechsel scheitert, wenn Claude Code auf virtualisierten Macs abstürzt. Pricing für Bare-Metal-Mac-mini prüfen.

05

V4-Flash-0731 markiert den Übergang von „billigem Preview“ zu „offiziellem Workhorse“ — mit offenen Fragen zu Pro, Harness und unabhängiger Agent-Reproduktion.

Ist V4-Flash-0731 ein neues Modell?

Nein — gleiche 284B/13B-Struktur wie im April-Preview. Der Sprung kommt aus Post-Training. deepseek-v4-flash routet automatisch auf Build 0731.

Wann kommen V4-Pro GA und Harness?

Stand 5. August 2026 unbestätigt. DeepSeek schreibt nur „so schnell wie möglich“. Konkrete August-Fenster sind Gerüchte.

Flash oder Kimi K3?

Index: Kimi 57, Flash 50. Kosten: Flash ~29× günstiger pro Task. Qualitäts-Obergrenze Kimi; Massen-Agent-Calls Flash.

Kann ich DeepSeeks Agent-Benchmarks vertrauen?

Teilweise. SWE-bench Verified hat breitere Adoption. Terminal Bench 2.0 etc. liefen mit unreleased Harness minimal mode — Vendor-Warnung ernst nehmen.

Wie viel günstiger als Claude?

Medienberichte nennen ~36× (Input Cache-Miss), ~179× (Cache-Hit), ~89× (Output) vs. Opus 4.8 — Listenpreise, keine Audit-TCO.

Zitierbare Fakten (05.08.2026):

  • Release: 31.07.2026 — V4-Flash-0731 official
  • 284B total / 13B active — architecture unchanged
  • Pricing: $0,14 / $0,0028 in, $0,28 out (per 1M tokens)
  • Terminal Bench 2.0: 82,7 vs. Pro preview 67,9 (Harness minimal, vendor)
  • Artificial Analysis Index: 50 vs. Kimi K3 57
  • V4-Pro GA + Harness: unreleased as of Aug 5

Externe Quellen (vor Go-Live verifizieren):

DeepSeek API Documentation

Artificial Analysis — Independent LLM Benchmarks

Hugging Face — deepseek-ai Organization

DeepSeek Platform

Günstige Token-Preise helfen nur, wenn Harness-abhängige Benchmarks nicht blind migriert werden, Cache in Agent-Loops greift und Claude Code / OpenClaw auf echter Apple-Hardware stabil laufen. ZUKCLOUD liefert Bare-Metal-Mac-mini-Cloud-Knoten ohne Hypervisor-Overhead, mit Root und 7×24-Agent-Tauglichkeit. Pricing, Bare-Metal-Manifest und V4-GA-Analyse ergänzen diesen Leitfaden. Unter der Kill Line gewinnt nicht der billigste API-Key — sondern wer zuerst eine Agent-Infrastruktur hat, die nicht jeden Nacht-Job abwürgt.