Startseite / Blog / DeepSeek V4
ENGINEERING BLOG · 2026.07.20

DeepSeek V4 GA:
Preise, Architektur und Performance-Lücke zu GPT-5.6

Nach drei Monaten Wartezeit ist DeepSeek V4 in der Vollversion (GA) am 20. Juli 2026 live. Dieser datengetriebene Leitfaden richtet sich an AI-Entwickler, Indie-Devs, Long-Context-Agent-Engineers und kostenbewusste Produktteams: Sie erhalten Architektur-Specs (CSA/HCA, mHC, Muon), Benchmark-Matrizen gegen GPT-5.6 und Claude Fable 5, die neue Peak/Off-Peak-Tariflogik und einen Migrationsplan mit Frist 24. Juli 2026.

01

Gegenüber der Preview vom April bringt die GA-Version messbare Verbesserungen bei Agent-Fähigkeiten, Mathe und Code — plus erstmals zeitabhängige Preise. DeepSeek wechselt damit von „quasi kostenlos“ zu disziplinierter Kommerzialisierung. Vier Fakten, die Sie sofort einplanen müssen:

  • API-Migrations-Countdown: deepseek-chat und deepseek-reasoner werden am 24. Juli 2026, 23:59 Uhr (Peking-Zeit) dauerhaft abgeschaltet. Nicht migrierte Produktionsservices brechen hart ab.
  • Peak/Off-Peak-Komplexität: Werktags 09:00–12:00 und 14:00–18:00 (Peking) verdoppeln sich die Sätze. 24/7-Agent-Pipelines brauchen ein neues Kostenmodell.
  • Frontier bleibt vorn bei Hard Tasks: Claude Fable 5 führt SWE-bench Pro mit 80,3 % an. Wer nur Benchmarks liest und nicht pro Task rechnet, zahlt zu viel.
  • Self-Hosting ≠ Zero Ops: MIT-Lizenz ja — aber 1,6T MoE in Produktion braucht GPU-Cluster. Die meisten Teams bleiben bei der API; Latenz, Quotas und bei personenbezogenen Daten DSGVO-Risiken bleiben.

Kurzfassung: Die Preview war stark; die GA liefert Agent-, Mathe- und Code-Upgrades plus ein formales Preissystem.

02

DeepSeek V4 — Schlüsselzeitlinie (2026)
Datum Ereignis
24. AprilV4 Preview + Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B)
MaiProduktions-tuned V4-Flash und V4-Pro; API allgemein verfügbar
JuniV4-Pro Output dauerhaft −75 % ($0,87/M Tokens)
29. JuniE-Mail an alle API-Nutzer: GA Mitte Juli, erste Offenlegung Peak/Off-Peak
19. JuliGA-Grauzonen-Zugang für ausgewählte Entwickler; Medien: „Vollversion morgen“
20. JuliGA-Release (Veröffentlichungsdatum dieses Artikels)
24. Julideepseek-chat und deepseek-reasoner endgültig offline

Modellfamilie

V4-Pro vs. V4-Flash — Spezifikationen
Parameter V4-Pro V4-Flash
Gesamtparameter1,6 Billionen (1,6T)284 Milliarden (284B)
Aktive Parameter/Token49 Milliarden (49B)13 Milliarden (13B)
Transformer-Schichten6143
Kontextfenster1.000.000 Tokens1.000.000 Tokens
Max. Output384K Tokens384K Tokens
PräzisionFP4 (Experten) + FP8 (Rest)FP4 + FP8 gemischt
Pretraining33T+ Tokens32T+ Tokens
LizenzMITMIT

Architektur: 1M Kontext ohne linearen KV-Explosion

Klassische Transformer skalieren KV-Cache linear mit der Kontextlänge. DeepSeek V4 löst das mit drei Innovationen — im Gegensatz zur KDA-Route von Kimi K3 setzt V4 auf CSA + HCA:

① Hybride Aufmerksamkeit (CSA + HCA) — MLA aus V2/V3 wird abgelöst:

  • Compressed Sparse Attention (CSA): KV-Sequenz per Softmax-Gating komprimiert; FP4-„Lightning Indexer“ wählt top-k (Pro: top-1024, Flash: top-512); Sliding Window der letzten 128 Tokens. Bei 1M Kontext: Inferenz-FLOPs nur 27 % von V3.2.
  • Heavily Compressed Attention (HCA): Tokens 128× komprimiert, dann globale Dense Attention; Flash nutzt HCA in den ersten 2 Schichten, danach CSA/HCA alternierend.
  • Gesamteffekt: KV-Cache bei 1M nur 10 % von V3.2 (Flash: 7 %).

② Manifold-Constrained Hyper-Connections (mHC): 4-Kanal-Residual-Stream mit Mischmatrix unter Birkhoff-Polytope (doppelt-stochastisch) — stabile Signalpropagation über 61 Schichten.

③ Muon-Optimierer: Training mit Muon statt AdamW; Newton-Schulz-Orthogonalisierung der Gradienten — schnellere Konvergenz, stabilere Runs.

Inferenzmodi

V4-Inferenzmodi und Einsatz
Modus Eigenschaft Anwendung
Non-thinkKeine Chain-of-Thought, maximale GeschwindigkeitEinfache Q&A, Routing
Think HighExplizites Reasoning (CoT-Tags)Mittlere Komplexität, Code-Debug
Think MaxMaximale Reasoning-Tiefe, 384K+ KontextSchwere Mathe, Long-Chain-Agents

Offizielle Sampling-Parameter: temperature=1.0, top_p=1.0 (alle Modi).

03

V4-Pro — Kerndaten Benchmarks
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified80,6 % — Open-Source-Rekord96,0 %nicht separat veröffentlicht~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified testet echte GitHub-Bugfixes — 80,6 % ist der aktuelle Open-Source-Höchstwert, gleichauf mit Gemini 3.1 Pro. SWE-bench Pro ist strenger; Fable 5 führt mit 80,3 %.

Kosten-Nutzen laut Artificial Analysis

Claude Fable 5: Strategy & Ops Index — $3,48/Task (Score 50). DeepSeek V4-Pro: $0,03/Task (Score 38). V4-Flash: unter $0,04 in allen sechs Index-Kategorien. Fable 5 kostet 116× mehr bei nur ~12 Punkten Vorsprung (31 %).

Positionierung: V4-Pro vs. GPT-5.6 Sol vs. Claude Fable 5
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open SourceMITNeinNein
Self-HostingJaNeinNein
Kontext1M Tokensnicht veröffentlicht1M Tokens
API Output (Off-Peak)$0,87/M~$15/M$50/M
API Output (Peak)$1,74/M
Agent-FähigkeitStark, Multi-AgentStarkStärkste Klasse
EmpfehlungBudget / Private Deploy / Long ContextAlgorithmen + MatheMaximaler Code, Kosten egal
  • Budget / hohe Frequenz / Private Deploy: V4-Pro oder V4-Flash
  • Maximaler Code, Kosten sekundär: Claude Fable 5 (SWE-bench Pro Spitze)
  • Algorithmen + Mathe: GPT-5.6 Sol / Ultra
  • Massen-Logs/Dokumente: V4-Flash Cache-Hit Input nur $0,0028/M

04

Die kontroverseste GA-Neuerung: Werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit verdoppeln die Sätze — analog zu Stromtarifen.

V4-Pro / V4-Flash — Peak/Off-Peak-Preise
Modell Position Off-Peak Peak
V4-ProInput (Cache-Hit)¥0,025 / $0,0035 / 1Mverdoppelt
V4-ProInput (Cache-Miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
V4-ProOutput¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput (Cache-Hit)¥0,02 / $0,0028 / 1Mverdoppelt
V4-FlashInput (Cache-Miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
V4-FlashOutput¥2,00 / $0,28 / 1M¥4,00 / $0,56

Kosten minimieren — vier Hebel:

  • Nicht-Echtzeit in Off-Peak: Batch-Docs, Labeling, Code-Review nach 18:00 oder vor 09:00
  • Prompt Cache: Wiederholte System-Prompts; Flash Cache-Hit $0,0028/M
  • Flash als Router: Intent/Routing mit Flash, schwere Reasoning an Pro
  • Preisänderungs-Mail: DeepSeek kündigt Tarifupdates 24 Stunden vorher per E-Mail an

Selbst im Peak: V4-Pro Output ($1,74/M) ist 8,6× günstiger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).

05

Wichtig: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (23:59 Peking).

Mapping alter zu neuer Modell-IDs
Alt Neu Hinweis
deepseek-chatdeepseek-v4-flash (Non-think)Schnell, leichte Tasks
deepseek-reasonerdeepseek-v4-flash (Think-Modus)oder Upgrade auf deepseek-v4-pro
  1. Repository-Scan: Suche nach deepseek-chat und deepseek-reasoner in Code, CI und Env-Vars.
  2. Zielmodell wählen: Leichte Dialoge → deepseek-v4-flash (Non-think); ehemalige Reasoner-Szenarien → Flash Think oder deepseek-v4-pro.
  3. OpenAI SDK aktualisieren: model-Parameter anpassen; Thinking via extra_body.
  4. Anthropic SDK prüfen: base_url bleibt https://api.deepseek.com, nur model ändern.
  5. Staging-Lasttest: Vor dem 24.07. Peak- und Off-Peak-Abrechnung sowie Cache-Hit-Rate validieren.
  6. Produktions-Rollout: Grauzonen-Deploy, Error-Rate und Token-Kosten monitoren; Rollback-Fenster bis Deadline offen halten.
migrate_deepseek_v4.py
# Alt (ungültig ab 24.07.)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# Neu — OpenAI SDK
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

# Anthropic SDK kompatibel
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

06

  • SWE-bench Verified: 80,6 % — Open-Source-Rekord, gleichauf Gemini 3.1 Pro
  • 1M KV-Cache: 10 % von V3.2 (Flash 7 %); Inferenz-FLOPs 27 % von V3.2
  • V4-Pro Output: Off-Peak $0,87/M, Peak $1,74/M — ca. 1/10 bis 1/100 der Frontier-Preise
  • Artificial Analysis Task-Kosten: V4-Pro $0,03 vs. Fable 5 $3,48 (116×)
  • API-Migrationsfrist: 2026-07-24 23:59 Peking-Zeit
  • Lizenz: MIT — Self-Hosting und Datenresidenz möglich

DeepSeek V4 GA ist 2026s wichtigster Open-Source-Meilenstein. Der Wert liegt nicht darin, Fable 5 oder GPT-5.6 heute zu schlagen, sondern Frontier-Leistung zum Bruchteil der Kosten als beste Open-Source-Option zu liefern. Peak/Off-Peak erhöht die Planungskomplexität — bleibt aber wettbewerbsfähig.

Preise, Modellfähigkeiten und Migrationsregeln können sich ändern — nach dem Release Links erneut prüfen:

Offizielle Quellen:

DeepSeek API — Offizielle Dokumentation

arXiv:2606.19348 — DeepSeek V4 Technisches Paper

Drittanalyse:

Artificial Analysis — Modell-Kostenvergleich

HuggingFace — DeepSeek Modell-Hub

Teams, die DeepSeek-V4-Agents mit Xcode und Metal dauerhaft betreiben, kämpfen mit API-Latenz und Quotas; geteilte Cloud-VMs bringen Hypervisor-Overhead und iOS-CI-Inkompatibilität. Für native Apple Silicon, 7×24-Betrieb und stabile iOS-CI/CD mit Multi-Model-Routing (Claude Code / Codex auf Bare Metal) sind ZUKCLOUD Bare-Metal-Mac-mini-Cloud-Nodes die kontrollierbare Wahl — dedizierte Physik, kein Virtualisierungsverlust, flexible Buchung. Preise, Bestellung, Bare-Metal-Manifest und DeepSeek-Compute-Ökosystem.

Wer noch deepseek-chat nutzt: Migration bis 24. Juli abschließen — sonst Serviceunterbrechung.