Am 31. Juli 2026 hat DeepSeek V4-Flash-0731 als offizielle API-Version ausgerollt — nicht als neues Modell, sondern als identische 284B/13B-Architektur mit frischem Post-Training. Das Ergebnis: Mehrere Agent- und Coding-Benchmarks liegen über dem größeren V4-Pro-Preview. Stand 5. August 2026 fehlen weiterhin die offizielle V4-Pro-Version und das erstmals benannte Agent-Framework Harness. Für Agent-Engineers, kostenbewusste Produktteams und Entscheider, die chinesische Open-Weight-Releases einordnen, liefert dieser Artikel Timeline, Preistabelle, Harness-Caveats, den Artificial Analysis Intelligence Index (50 vs. Kimi K3: 57) und den EU-relevanten Blick auf den chinesischen „Kill Line“-Preiskrieg. Kurzfassung: DeepSeek gewinnt nicht mit Platz 1 auf Leaderboards, sondern mit „gut genug + extrem günstig“ — und setzt damit eine Preisschwelle, unter der Wettbewerber ohne klaren Qualitätsvorsprung verschwinden.
01 31. Juli: Offizielles Flash — Pro, Harness und die Kill Line
„DeepSeek V4 official“ klingt nach einem Flaggschiff-Drop. Tatsächlich ist nur Flash-0731 offiziell geworden; V4-Pro bleibt Preview. Die Sequenz seit April:
- 24. April: V4-Preview + MIT-Open-Weights (Pro 1,6T/49B aktiv, Flash 284B/13B aktiv, 1M Kontext).
- 24. Juli: Legacy-Aliase
deepseek-chat/deepseek-reasonerabgeschaltet. - 27. Juli: Kimi K3 (2,8T) vollständig auf Hugging Face — Druck auf DeepSeek Tage vor dem Flash-Update.
- 31. Juli: V4-Flash-0731 API-Beta + Hugging-Face-Weights; Changelog nennt erstmals Harness. Nur API — App/Web unverändert.
- 3. August: Alibaba Qwen3.8-Max GA — dichtes Release-Fenster in China.
- 5. August (Redaktionsstand): Kein bestätigtes Datum für V4-Pro GA oder Harness. Gerüchte („10.–20. August“) stammen aus unbenannten Quellen.
In chinesischen Dev-Foren heißt DeepSeeks Kombination aus akzeptabler Leistung und Tiefstpreisen 斩杀线 (Kill Line): Wer weder klar besser noch billiger ist, verliert Relevanz. Vor dem Flash-Release spottete die Community über verzögerte Pro-Versprechen („Liang Baikai“); nach den überraschend starken Flash-Zahlen kehrte der Spitzname „Liang Sheng“ zurück. Parallel meldeten Medien OpenAI-Preissenkungen am Luna-Tier — typische Reaktion auf DeepSeeks Preisdruck.
02 Kerndaten: 284B/13B, API-Preise, Benchmarks mit Sternchen
| Merkmal | V4-Flash-0731 | V4-Pro (nur Preview) |
|---|---|---|
| Status | Offiziell (31.07.2026) | Preview seit 24.04., GA ausstehend |
| Gesamt / aktiv pro Token | 284B / 13B (unverändert vs. April) | 1,6T / 49B |
| Kontext | 1 Mio. Token | 1 Mio. Token |
| Input (Cache-Miss / Hit, pro 1M) | $0,14 / $0,0028 | $0,435 / $0,003625 |
| Output (pro 1M) | $0,28 | $0,87 |
| Lizenz | MIT | MIT |
| Terminal Bench 2.0 (DeepSeek, Harness minimal) | 82,7 | 67,9 (Preview) |
| Artificial Analysis Intelligence Index | 50 (unabhängig) | — |
| Harness | 31.07. erstmals genannt; Agent-Benchmarks via minimal mode — Framework selbst noch nicht public (05.08.) | |
Agent-Scores (Terminal Bench 2.0 u. a.) stammen aus DeepSeeks noch nicht veröffentlichtem Harness minimal mode. Der Changelog warnt ausdrücklich: Ergebnisse sind „extrem harness-sensitiv“.
03 Architektur unverändert — Gewinn durch Post-Training, CSA+HCA, mHC, Muon
DeepSeek erklärt den Sprung explizit: keine Parameter-Skalierung, sondern erneutes Post-Training auf derselben Flash-Architektur. Das widerspricht der Branchenannahme „größer = besser“ und verschiebt 2026 den Wettbewerb Richtung Datenqualität und Trainingsmethodik.
Die April-Architektur bleibt in 0731 bestehen (Technical Report: „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“):
- Hybrid Attention (CSA + HCA): Compressed Sparse Attention plus Heavy Compressed Attention — extern als DSA (DeepSeek Sparse Attention) vermarktet. Offizielle Effizienzclaims: bei 1M Kontext nur 27 % der Inference-FLOPs von V3.2, KV-Cache 10 % (Flash 7 %).
- mHC (Manifold-Constrained Hyper-Connections): Vier Residual-Streams mit Mischmatrizen auf dem Birkhoff-Polytop — stabile Signale über 61 Layer.
- Muon Optimizer: Ersetzt AdamW; Newton-Schulz-orthogonalisierte Gradienten für schnellere, stabilere Konvergenz.
Harness minimal mode im Detail: DeepSeek Harness ist das erste hauseigene Agent-Execution-Framework (Dateizugriff, Tool-Calls, mehrstufige Engineering-Tasks) — positioniert als Antwort auf Claude Code. Alle veröffentlichten Agent-Benchmarks für 0731 liefen unter minimal mode, max Reasoning, top_p=0,95, temperature=1,0. Bis unabhängige Teams dieselben Tasks mit Claude Code, Cursor oder OpenClaw reproduzieren, sind das Vendor-plus-Framework-Zahlen, keine portable Capability-Aussage.
Praxis-Feedback aus Entwicklerforen: niedrige Input-Cache-Hit-Rates und gelegentliche Safety-Classifier-Timeouts — ein Reminder, dass Post-Training allein Infrastruktur-Reibung nicht wegdefiniert.
04 China-Open-Weight-Vergleich und 6-Schritte vor dem API-Switch
| Modell | Gesamt / aktiv | Preis In/Out (pro 1M) | AA Intelligence Index | AA Kosten/Task |
|---|---|---|---|---|
| DeepSeek V4-Flash-0731 | 284B / 13B | $0,14 / $0,28 | 50 | ~$0,03 |
| Kimi K3 | 2,8T / ~104B (Schätzung) | $3,00 / $15,00 | 57 | ~$0,86 |
| Qwen3.8-Max | 2,4T / 95B | $2,00 / $6,00 | Stand Redaktion: nicht gelistet | — |
| GPT-5.6 Sol | undisclosed | — | +9 Pkt. vs. Flash | ~$1,86 |
| Claude Fable 5 | undisclosed | — | +9 Pkt. vs. Flash | ~$3,15 |
Unabhängig misst Artificial Analysis Flash mit 50 unter Kimi K3 (57) — aber Kosten pro Task nur etwa 1/29 von Kimi und 1/105 von Claude Fable 5. DeepSeek zielt auf Hochfrequenz-Agent-Pipelines, nicht auf Benchmark-Krone.
Sechs Schritte vor der Produktionsmigration:
- Workload trennen: Routing, Batch-Summaries → Flash; tiefe Reasoning-Chains → Pro-Preview oder Closed Frontier.
- Harness-Benchmarks isolieren: Terminal Bench 82,7 ≠ Claude-Code-Score. Eigene A/B auf realen Repos.
- Cache-Ökonomie modellieren: $0,14 vs. $0,0028 Input ist ~50× — Agent-Loops ohne Cache treffen die Kill Line nicht.
- Legacy-Model-Namen prüfen:
deepseek-chatist tot;deepseek-v4-flashzeigt auf 0731. - TCO gegen Kimi und Qwen: Bei 1B Input + 200M Output/Monat dominiert Flash die Rechnung — Qualitätsdelta (~7 Index-Punkte) einpreisen.
- Agent-Hosting absichern: API-Wechsel scheitert, wenn Claude Code auf virtualisierten Macs abstürzt. Pricing für Bare-Metal-Mac-mini prüfen.
05 FAQ, Einordnung, Quellen
V4-Flash-0731 markiert den Übergang von „billigem Preview“ zu „offiziellem Workhorse“ — mit offenen Fragen zu Pro, Harness und unabhängiger Agent-Reproduktion.
Ist V4-Flash-0731 ein neues Modell?
Nein — gleiche 284B/13B-Struktur wie im April-Preview. Der Sprung kommt aus Post-Training. deepseek-v4-flash routet automatisch auf Build 0731.
Wann kommen V4-Pro GA und Harness?
Stand 5. August 2026 unbestätigt. DeepSeek schreibt nur „so schnell wie möglich“. Konkrete August-Fenster sind Gerüchte.
Flash oder Kimi K3?
Index: Kimi 57, Flash 50. Kosten: Flash ~29× günstiger pro Task. Qualitäts-Obergrenze Kimi; Massen-Agent-Calls Flash.
Kann ich DeepSeeks Agent-Benchmarks vertrauen?
Teilweise. SWE-bench Verified hat breitere Adoption. Terminal Bench 2.0 etc. liefen mit unreleased Harness minimal mode — Vendor-Warnung ernst nehmen.
Wie viel günstiger als Claude?
Medienberichte nennen ~36× (Input Cache-Miss), ~179× (Cache-Hit), ~89× (Output) vs. Opus 4.8 — Listenpreise, keine Audit-TCO.
Zitierbare Fakten (05.08.2026):
- Release: 31.07.2026 — V4-Flash-0731 official
- 284B total / 13B active — architecture unchanged
- Pricing: $0,14 / $0,0028 in, $0,28 out (per 1M tokens)
- Terminal Bench 2.0: 82,7 vs. Pro preview 67,9 (Harness minimal, vendor)
- Artificial Analysis Index: 50 vs. Kimi K3 57
- V4-Pro GA + Harness: unreleased as of Aug 5
Externe Quellen (vor Go-Live verifizieren):
Artificial Analysis — Independent LLM Benchmarks
Hugging Face — deepseek-ai Organization
Günstige Token-Preise helfen nur, wenn Harness-abhängige Benchmarks nicht blind migriert werden, Cache in Agent-Loops greift und Claude Code / OpenClaw auf echter Apple-Hardware stabil laufen. ZUKCLOUD liefert Bare-Metal-Mac-mini-Cloud-Knoten ohne Hypervisor-Overhead, mit Root und 7×24-Agent-Tauglichkeit. Pricing, Bare-Metal-Manifest und V4-GA-Analyse ergänzen diesen Leitfaden. Unter der Kill Line gewinnt nicht der billigste API-Key — sondern wer zuerst eine Agent-Infrastruktur hat, die nicht jeden Nacht-Job abwürgt.