Nach drei Monaten Wartezeit ist DeepSeek V4 in der Vollversion (GA) am 20. Juli 2026 live. Dieser datengetriebene Leitfaden richtet sich an AI-Entwickler, Indie-Devs, Long-Context-Agent-Engineers und kostenbewusste Produktteams: Sie erhalten Architektur-Specs (CSA/HCA, mHC, Muon), Benchmark-Matrizen gegen GPT-5.6 und Claude Fable 5, die neue Peak/Off-Peak-Tariflogik und einen Migrationsplan mit Frist 24. Juli 2026.
01 DeepSeek V4 GA: Drei Druckpunkte für Produktionsumgebungen
Gegenüber der Preview vom April bringt die GA-Version messbare Verbesserungen bei Agent-Fähigkeiten, Mathe und Code — plus erstmals zeitabhängige Preise. DeepSeek wechselt damit von „quasi kostenlos“ zu disziplinierter Kommerzialisierung. Vier Fakten, die Sie sofort einplanen müssen:
- API-Migrations-Countdown:
deepseek-chatunddeepseek-reasonerwerden am 24. Juli 2026, 23:59 Uhr (Peking-Zeit) dauerhaft abgeschaltet. Nicht migrierte Produktionsservices brechen hart ab. - Peak/Off-Peak-Komplexität: Werktags 09:00–12:00 und 14:00–18:00 (Peking) verdoppeln sich die Sätze. 24/7-Agent-Pipelines brauchen ein neues Kostenmodell.
- Frontier bleibt vorn bei Hard Tasks: Claude Fable 5 führt SWE-bench Pro mit 80,3 % an. Wer nur Benchmarks liest und nicht pro Task rechnet, zahlt zu viel.
- Self-Hosting ≠ Zero Ops: MIT-Lizenz ja — aber 1,6T MoE in Produktion braucht GPU-Cluster. Die meisten Teams bleiben bei der API; Latenz, Quotas und bei personenbezogenen Daten DSGVO-Risiken bleiben.
Kurzfassung: Die Preview war stark; die GA liefert Agent-, Mathe- und Code-Upgrades plus ein formales Preissystem.
02 Von Preview zu GA: Zeitlinie und Architektur CSA/HCA/mHC/Muon
| Datum | Ereignis |
|---|---|
| 24. April | V4 Preview + Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B) |
| Mai | Produktions-tuned V4-Flash und V4-Pro; API allgemein verfügbar |
| Juni | V4-Pro Output dauerhaft −75 % ($0,87/M Tokens) |
| 29. Juni | E-Mail an alle API-Nutzer: GA Mitte Juli, erste Offenlegung Peak/Off-Peak |
| 19. Juli | GA-Grauzonen-Zugang für ausgewählte Entwickler; Medien: „Vollversion morgen“ |
| 20. Juli | GA-Release (Veröffentlichungsdatum dieses Artikels) |
| 24. Juli | deepseek-chat und deepseek-reasoner endgültig offline |
Modellfamilie
| Parameter | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter/Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Schichten | 61 | 43 |
| Kontextfenster | 1.000.000 Tokens | 1.000.000 Tokens |
| Max. Output | 384K Tokens | 384K Tokens |
| Präzision | FP4 (Experten) + FP8 (Rest) | FP4 + FP8 gemischt |
| Pretraining | 33T+ Tokens | 32T+ Tokens |
| Lizenz | MIT | MIT |
Architektur: 1M Kontext ohne linearen KV-Explosion
Klassische Transformer skalieren KV-Cache linear mit der Kontextlänge. DeepSeek V4 löst das mit drei Innovationen — im Gegensatz zur KDA-Route von Kimi K3 setzt V4 auf CSA + HCA:
① Hybride Aufmerksamkeit (CSA + HCA) — MLA aus V2/V3 wird abgelöst:
- Compressed Sparse Attention (CSA): KV-Sequenz per Softmax-Gating 4× komprimiert; FP4-„Lightning Indexer“ wählt top-k (Pro: top-1024, Flash: top-512); Sliding Window der letzten 128 Tokens. Bei 1M Kontext: Inferenz-FLOPs nur 27 % von V3.2.
- Heavily Compressed Attention (HCA): Tokens 128× komprimiert, dann globale Dense Attention; Flash nutzt HCA in den ersten 2 Schichten, danach CSA/HCA alternierend.
- Gesamteffekt: KV-Cache bei 1M nur 10 % von V3.2 (Flash: 7 %).
② Manifold-Constrained Hyper-Connections (mHC): 4-Kanal-Residual-Stream mit Mischmatrix unter Birkhoff-Polytope (doppelt-stochastisch) — stabile Signalpropagation über 61 Schichten.
③ Muon-Optimierer: Training mit Muon statt AdamW; Newton-Schulz-Orthogonalisierung der Gradienten — schnellere Konvergenz, stabilere Runs.
Inferenzmodi
| Modus | Eigenschaft | Anwendung |
|---|---|---|
| Non-think | Keine Chain-of-Thought, maximale Geschwindigkeit | Einfache Q&A, Routing |
| Think High | Explizites Reasoning (CoT-Tags) | Mittlere Komplexität, Code-Debug |
| Think Max | Maximale Reasoning-Tiefe, 384K+ Kontext | Schwere Mathe, Long-Chain-Agents |
Offizielle Sampling-Parameter: temperature=1.0, top_p=1.0 (alle Modi).
03 Benchmark-Matrix: Open-Source-Spitze vs. GPT-5.6 / Claude Fable 5
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % — Open-Source-Rekord | 96,0 % | nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified testet echte GitHub-Bugfixes — 80,6 % ist der aktuelle Open-Source-Höchstwert, gleichauf mit Gemini 3.1 Pro. SWE-bench Pro ist strenger; Fable 5 führt mit 80,3 %.
Kosten-Nutzen laut Artificial Analysis
Claude Fable 5: Strategy & Ops Index — $3,48/Task (Score 50). DeepSeek V4-Pro: $0,03/Task (Score 38). V4-Flash: unter $0,04 in allen sechs Index-Kategorien. Fable 5 kostet 116× mehr bei nur ~12 Punkten Vorsprung (31 %).
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source | MIT | Nein | Nein |
| Self-Hosting | Ja | Nein | Nein |
| Kontext | 1M Tokens | nicht veröffentlicht | 1M Tokens |
| API Output (Off-Peak) | $0,87/M | ~$15/M | $50/M |
| API Output (Peak) | $1,74/M | — | — |
| Agent-Fähigkeit | Stark, Multi-Agent | Stark | Stärkste Klasse |
| Empfehlung | Budget / Private Deploy / Long Context | Algorithmen + Mathe | Maximaler Code, Kosten egal |
- Budget / hohe Frequenz / Private Deploy: V4-Pro oder V4-Flash
- Maximaler Code, Kosten sekundär: Claude Fable 5 (SWE-bench Pro Spitze)
- Algorithmen + Mathe: GPT-5.6 Sol / Ultra
- Massen-Logs/Dokumente: V4-Flash Cache-Hit Input nur $0,0028/M
04 Peak/Off-Peak-Tarife: Vollständige Preistabelle und Sparmatrix
Die kontroverseste GA-Neuerung: Werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit verdoppeln die Sätze — analog zu Stromtarifen.
| Modell | Position | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache-Hit) | ¥0,025 / $0,0035 / 1M | verdoppelt |
| V4-Pro | Input (Cache-Miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 |
| V4-Flash | Input (Cache-Hit) | ¥0,02 / $0,0028 / 1M | verdoppelt |
| V4-Flash | Input (Cache-Miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Kosten minimieren — vier Hebel:
- Nicht-Echtzeit in Off-Peak: Batch-Docs, Labeling, Code-Review nach 18:00 oder vor 09:00
- Prompt Cache: Wiederholte System-Prompts; Flash Cache-Hit $0,0028/M
- Flash als Router: Intent/Routing mit Flash, schwere Reasoning an Pro
- Preisänderungs-Mail: DeepSeek kündigt Tarifupdates 24 Stunden vorher per E-Mail an
Selbst im Peak: V4-Pro Output ($1,74/M) ist 8,6× günstiger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).
05 deepseek-chat Abschaltung: API-Migration in 6 Schritten (Frist 24.07.)
Wichtig: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (23:59 Peking).
| Alt | Neu | Hinweis |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Schnell, leichte Tasks |
deepseek-reasoner | deepseek-v4-flash (Think-Modus) | oder Upgrade auf deepseek-v4-pro |
- Repository-Scan: Suche nach
deepseek-chatunddeepseek-reasonerin Code, CI und Env-Vars. - Zielmodell wählen: Leichte Dialoge →
deepseek-v4-flash(Non-think); ehemalige Reasoner-Szenarien → Flash Think oderdeepseek-v4-pro. - OpenAI SDK aktualisieren:
model-Parameter anpassen; Thinking viaextra_body. - Anthropic SDK prüfen:
base_urlbleibthttps://api.deepseek.com, nurmodeländern. - Staging-Lasttest: Vor dem 24.07. Peak- und Off-Peak-Abrechnung sowie Cache-Hit-Rate validieren.
- Produktions-Rollout: Grauzonen-Deploy, Error-Rate und Token-Kosten monitoren; Rollback-Fenster bis Deadline offen halten.
# Alt (ungültig ab 24.07.)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# Neu — OpenAI SDK
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
# Anthropic SDK kompatibel
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
06 Zitierbare Daten, Quellen und Engineering-Empfehlung
- SWE-bench Verified: 80,6 % — Open-Source-Rekord, gleichauf Gemini 3.1 Pro
- 1M KV-Cache: 10 % von V3.2 (Flash 7 %); Inferenz-FLOPs 27 % von V3.2
- V4-Pro Output: Off-Peak $0,87/M, Peak $1,74/M — ca. 1/10 bis 1/100 der Frontier-Preise
- Artificial Analysis Task-Kosten: V4-Pro $0,03 vs. Fable 5 $3,48 (116×)
- API-Migrationsfrist: 2026-07-24 23:59 Peking-Zeit
- Lizenz: MIT — Self-Hosting und Datenresidenz möglich
DeepSeek V4 GA ist 2026s wichtigster Open-Source-Meilenstein. Der Wert liegt nicht darin, Fable 5 oder GPT-5.6 heute zu schlagen, sondern Frontier-Leistung zum Bruchteil der Kosten als beste Open-Source-Option zu liefern. Peak/Off-Peak erhöht die Planungskomplexität — bleibt aber wettbewerbsfähig.
Preise, Modellfähigkeiten und Migrationsregeln können sich ändern — nach dem Release Links erneut prüfen:
Offizielle Quellen:
DeepSeek API — Offizielle Dokumentation
arXiv:2606.19348 — DeepSeek V4 Technisches Paper
Drittanalyse:
Artificial Analysis — Modell-Kostenvergleich
HuggingFace — DeepSeek Modell-Hub
Teams, die DeepSeek-V4-Agents mit Xcode und Metal dauerhaft betreiben, kämpfen mit API-Latenz und Quotas; geteilte Cloud-VMs bringen Hypervisor-Overhead und iOS-CI-Inkompatibilität. Für native Apple Silicon, 7×24-Betrieb und stabile iOS-CI/CD mit Multi-Model-Routing (Claude Code / Codex auf Bare Metal) sind ZUKCLOUD Bare-Metal-Mac-mini-Cloud-Nodes die kontrollierbare Wahl — dedizierte Physik, kein Virtualisierungsverlust, flexible Buchung. Preise, Bestellung, Bare-Metal-Manifest und DeepSeek-Compute-Ökosystem.
Wer noch deepseek-chat nutzt: Migration bis 24. Juli abschließen — sonst Serviceunterbrechung.