Три месяца ожидания — и DeepSeek V4 full GA вышел 20 июля 2026. Этот разбор для AI-разработчиков, indie-хакеров, инженеров long-context agents и cost-sensitive product-команд: архитектура (CSA/HCA, mHC, Muon), бенчмарки против GPT-5.6 и Claude Fable 5, новая схема peak/off-peak billing и дедлайн миграции API — 24 июля 2026.
01 DeepSeek V4 GA: три срочных bottleneck для production
Относительно preview апреля GA даёт измеримый прирост в agents, math reasoning и code gen — плюс впервые time-of-day pricing. DeepSeek переходит от «почти бесплатно» к дисциплинированной коммерциализации. Четыре факта, которые нужно закрыть сегодня:
- API migration countdown:
deepseek-chatиdeepseek-reasonerотключаются 24 июля 2026, 23:59 (Пекин). Немигрированный production — hard stop. - Peak/off-peak complexity: будни 09:00–12:00 и 14:00–18:00 (Пекин) — тариф ×2. 24/7 agent pipeline требует новой cost-модели.
- Closed frontier всё ещё впереди на hard tasks: Claude Fable 5 лидирует SWE-bench Pro с 80,3 %. Смотреть только leaderboard без $/task — переплата.
- Self-host ≠ zero ops: MIT да, но 1,6T MoE в production — GPU cluster. Большинство остаётся на API: latency, quotas, data residency.
One-liner: preview был сильным; GA добавляет agent/math/code upgrades и формальный pricing framework.
02 Preview → GA: таймлайн и архитектура CSA/HCA/mHC/Muon
| Дата | Событие |
|---|---|
| 24 апреля | V4 preview + open source (MIT): V4-Pro (1,6T) и V4-Flash (284B) |
| Май | Production-tuned V4-Flash и V4-Pro; API в general availability |
| Июнь | V4-Pro output −75 % навсегда ($0,87/M tokens) |
| 29 июня | Email всем API-пользователям: GA mid-July, первое раскрытие peak/off-peak |
| 19 июля | GA greylist для избранных devs; пресса: «full version завтра» |
| 20 июля | GA release (дата этой статьи) |
| 24 июля | deepseek-chat и deepseek-reasoner offline навсегда |
Model family
| Параметр | V4-Pro | V4-Flash |
|---|---|---|
| Total params | 1,6T | 284B |
| Active params/token | 49B | 13B |
| Transformer layers | 61 | 43 |
| Context window | 1 000 000 tokens | 1 000 000 tokens |
| Max output | 384K tokens | 384K tokens |
| Precision | FP4 (experts) + FP8 (rest) | FP4 + FP8 mixed |
| Pretrain data | 33T+ tokens | 32T+ tokens |
| License | MIT | MIT |
Архитектура: 1M context без линейного KV explosion
Классический Transformer масштабирует KV cache линейно с длиной контекста. DeepSeek V4 решает это тремя механизмами — в отличие от KDA-route Kimi K3, V4 идёт через CSA + HCA:
① Hybrid attention (CSA + HCA) — MLA из V2/V3 уходит:
- Compressed Sparse Attention (CSA): KV sequence сжимается 4× через Softmax gating; FP4 «lightning indexer» делает top-k (Pro: top-1024, Flash: top-512); sliding window последних 128 tokens. На 1M context inference FLOPs — 27 % от V3.2.
- Heavily Compressed Attention (HCA): tokens сжимаются 128×, затем global dense attention; Flash использует HCA в первых 2 слоях, далее CSA/HCA чередуются.
- Net effect: KV cache на 1M — 10 % от V3.2 (Flash: 7 %).
② Manifold-Constrained Hyper-Connections (mHC): 4-channel residual stream, mixing matrix под Birkhoff polytope constraint (doubly stochastic) — стабильная signal propagation через 61 layer stack.
③ Muon optimizer: training на Muon вместо AdamW; Newton-Schulz orthogonalization градиентов — faster convergence, stable training runs.
Inference modes
| Mode | Характеристика | Use case |
|---|---|---|
| Non-think | Без chain-of-thought, max speed | Simple Q&A, routing |
| Think High | Explicit reasoning (CoT tags) | Medium complexity, code debug |
| Think Max | Max reasoning depth, 384K+ context | Hard math, long-chain agents |
Official sampling: temperature=1.0, top_p=1.0 (все режимы).
03 Benchmark matrix: open-source record vs GPT-5.6 / Claude Fable 5
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % — open-source record | 96,0 % | не опубликован отдельно | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified — real GitHub bugfix harness. 80,6 % — текущий open-source max, паритет с Gemini 3.1 Pro. SWE-bench Pro строже; Fable 5 лидирует с 80,3 %.
Cost per task (Artificial Analysis)
Claude Fable 5: Strategy & Ops index — $3,48/task (score 50). DeepSeek V4-Pro: $0,03/task (score 38). V4-Flash: <$0,04 во всех шести index-категориях. Fable 5 — 116× дороже при ~12 пунктах разрыва (31 %).
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source | MIT | Нет | Нет |
| Self-host | Да | Нет | Нет |
| Context | 1M tokens | не раскрыт | 1M tokens |
| API output (off-peak) | $0,87/M | ~$15/M | $50/M |
| API output (peak) | $1,74/M | — | — |
| Agent capability | Сильный, multi-agent | Сильный | Top tier |
| Рекомендация | Budget / private deploy / long context | Algorithms + math | Max code, cost secondary |
- Budget / high-frequency / private deploy: V4-Pro или V4-Flash
- Max code, cost не критичен: Claude Fable 5 (SWE-bench Pro top)
- Algorithms + math reasoning: GPT-5.6 Sol / Ultra
- Mass log/doc processing: V4-Flash cache-hit input $0,0028/M
04 Peak/off-peak pricing: полная таблица и cost optimization
Самое обсуждаемое изменение GA: будни 09:00–12:00 и 14:00–18:00 (Пекин) — тариф ×2, как time-of-use electricity.
| Model | Item | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | ¥0,025 / $0,0035 / 1M | ×2 |
| V4-Pro | Input (cache miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 |
| V4-Flash | Input (cache hit) | ¥0,02 / $0,0028 / 1M | ×2 |
| V4-Flash | Input (cache miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Четыре рычага экономии:
- Non-realtime в off-peak: batch docs, labeling, code review после 18:00 или до 09:00
- Prompt cache: повторяющиеся system prompts; Flash cache hit $0,0028/M
- Flash как router: intent/routing на Flash, heavy reasoning на Pro
- Price change notice: DeepSeek шлёт email за 24 часа до изменения тарифов
Даже в peak V4-Pro output ($1,74/M) — 8,6× дешевле Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).
05 deepseek-chat sunset: миграция API в 6 шагов (deadline 24.07.)
Warning: deepseek-chat и deepseek-reasoner отключаются 24 июля 2026, 15:59 UTC (23:59 Пекин).
| Старый | Новый | Примечание |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Fast, light tasks |
deepseek-reasoner | deepseek-v4-flash (Think mode) | или upgrade deepseek-v4-pro |
- Repo-wide scan: grep
deepseek-chatиdeepseek-reasonerв коде, CI, env vars. - Выбор target model: light chat →
deepseek-v4-flash(Non-think); бывший reasoner → Flash Think илиdeepseek-v4-pro. - Update OpenAI SDK: поменять
model; thinking черезextra_body. - Проверка Anthropic SDK:
base_urlостаётсяhttps://api.deepseek.com, меняется толькоmodel. - Staging load test: до 24.07. проверить peak/off-peak billing и cache hit rate.
- Production rollout: canary deploy, monitor error rate и token cost; rollback window до deadline.
# Legacy (invalid after 24.07.)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# New — OpenAI SDK
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
# Anthropic SDK compatible
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
06 Citable hard data, sources и engineering takeaway
- SWE-bench Verified: 80,6 % — open-source record, паритет Gemini 3.1 Pro
- 1M KV cache: 10 % от V3.2 (Flash 7 %); inference FLOPs 27 % от V3.2
- V4-Pro output pricing: off-peak $0,87/M, peak $1,74/M — ~1/10–1/100 frontier rates
- Artificial Analysis $/task: V4-Pro $0,03 vs Fable 5 $3,48 (116×)
- API migration deadline: 2026-07-24 23:59 Пекин
- License: MIT — self-host и data residency on-prem
DeepSeek V4 GA — один из главных open-source milestones 2026. Ценность не в том, чтобы сегодня обогнать Fable 5 или GPT-5.6, а в лучшей open-source performance за долю frontier cost. Peak/off-peak усложняет планирование, но unit economics остаются агрессивными.
Цены, capabilities и migration policy могут меняться — перепроверьте ссылки после релиза:
Official sources:
arXiv:2606.19348 — DeepSeek V4 technical paper
Third-party analysis:
Artificial Analysis — model cost comparison
HuggingFace — DeepSeek model hub
Командам, которые гоняют DeepSeek V4 agents с Xcode, Metal toolchain и persistent agent state, чистый API даёт latency spikes и quota jitter; shared cloud VM — hypervisor overhead и iOS CI friction. Если production требует zero-loss Apple Silicon, 7×24 uptime и стабильный iOS CI/CD с multi-model API routing (Claude Code / Codex на bare metal с Metal compile chain), ZUKCLOUD bare-metal Mac mini cloud nodes — контролируемая база: dedicated physical host, no virtualization tax, flexible day/week/month billing. Тарифы, заказ, bare-metal manifesto и DeepSeek compute stack.
Если вы всё ещё на deepseek-chat — мигрируйте до 24 июля, иначе service outage.