Главная / Блог / DeepSeek V4
ENGINEERING BLOG · 2026.07.20

DeepSeek V4 GA:
цены, архитектура и разрыв с GPT-5.6

Три месяца ожидания — и DeepSeek V4 full GA вышел 20 июля 2026. Этот разбор для AI-разработчиков, indie-хакеров, инженеров long-context agents и cost-sensitive product-команд: архитектура (CSA/HCA, mHC, Muon), бенчмарки против GPT-5.6 и Claude Fable 5, новая схема peak/off-peak billing и дедлайн миграции API — 24 июля 2026.

01

Относительно preview апреля GA даёт измеримый прирост в agents, math reasoning и code gen — плюс впервые time-of-day pricing. DeepSeek переходит от «почти бесплатно» к дисциплинированной коммерциализации. Четыре факта, которые нужно закрыть сегодня:

  • API migration countdown: deepseek-chat и deepseek-reasoner отключаются 24 июля 2026, 23:59 (Пекин). Немигрированный production — hard stop.
  • Peak/off-peak complexity: будни 09:00–12:00 и 14:00–18:00 (Пекин) — тариф ×2. 24/7 agent pipeline требует новой cost-модели.
  • Closed frontier всё ещё впереди на hard tasks: Claude Fable 5 лидирует SWE-bench Pro с 80,3 %. Смотреть только leaderboard без $/task — переплата.
  • Self-host ≠ zero ops: MIT да, но 1,6T MoE в production — GPU cluster. Большинство остаётся на API: latency, quotas, data residency.

One-liner: preview был сильным; GA добавляет agent/math/code upgrades и формальный pricing framework.

02

DeepSeek V4 — ключевой таймлайн (2026)
Дата Событие
24 апреляV4 preview + open source (MIT): V4-Pro (1,6T) и V4-Flash (284B)
МайProduction-tuned V4-Flash и V4-Pro; API в general availability
ИюньV4-Pro output −75 % навсегда ($0,87/M tokens)
29 июняEmail всем API-пользователям: GA mid-July, первое раскрытие peak/off-peak
19 июляGA greylist для избранных devs; пресса: «full version завтра»
20 июляGA release (дата этой статьи)
24 июляdeepseek-chat и deepseek-reasoner offline навсегда

Model family

V4-Pro vs V4-Flash — specs
Параметр V4-Pro V4-Flash
Total params1,6T284B
Active params/token49B13B
Transformer layers6143
Context window1 000 000 tokens1 000 000 tokens
Max output384K tokens384K tokens
PrecisionFP4 (experts) + FP8 (rest)FP4 + FP8 mixed
Pretrain data33T+ tokens32T+ tokens
LicenseMITMIT

Архитектура: 1M context без линейного KV explosion

Классический Transformer масштабирует KV cache линейно с длиной контекста. DeepSeek V4 решает это тремя механизмами — в отличие от KDA-route Kimi K3, V4 идёт через CSA + HCA:

① Hybrid attention (CSA + HCA) — MLA из V2/V3 уходит:

  • Compressed Sparse Attention (CSA): KV sequence сжимается через Softmax gating; FP4 «lightning indexer» делает top-k (Pro: top-1024, Flash: top-512); sliding window последних 128 tokens. На 1M context inference FLOPs — 27 % от V3.2.
  • Heavily Compressed Attention (HCA): tokens сжимаются 128×, затем global dense attention; Flash использует HCA в первых 2 слоях, далее CSA/HCA чередуются.
  • Net effect: KV cache на 1M — 10 % от V3.2 (Flash: 7 %).

② Manifold-Constrained Hyper-Connections (mHC): 4-channel residual stream, mixing matrix под Birkhoff polytope constraint (doubly stochastic) — стабильная signal propagation через 61 layer stack.

③ Muon optimizer: training на Muon вместо AdamW; Newton-Schulz orthogonalization градиентов — faster convergence, stable training runs.

Inference modes

V4 inference modes
Mode Характеристика Use case
Non-thinkБез chain-of-thought, max speedSimple Q&A, routing
Think HighExplicit reasoning (CoT tags)Medium complexity, code debug
Think MaxMax reasoning depth, 384K+ contextHard math, long-chain agents

Official sampling: temperature=1.0, top_p=1.0 (все режимы).

03

V4-Pro — core benchmarks
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified80,6 % — open-source record96,0 %не опубликован отдельно~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified — real GitHub bugfix harness. 80,6 % — текущий open-source max, паритет с Gemini 3.1 Pro. SWE-bench Pro строже; Fable 5 лидирует с 80,3 %.

Cost per task (Artificial Analysis)

Claude Fable 5: Strategy & Ops index — $3,48/task (score 50). DeepSeek V4-Pro: $0,03/task (score 38). V4-Flash: <$0,04 во всех шести index-категориях. Fable 5 — 116× дороже при ~12 пунктах разрыва (31 %).

Positioning: V4-Pro vs GPT-5.6 Sol vs Claude Fable 5
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open sourceMITНетНет
Self-hostДаНетНет
Context1M tokensне раскрыт1M tokens
API output (off-peak)$0,87/M~$15/M$50/M
API output (peak)$1,74/M
Agent capabilityСильный, multi-agentСильныйTop tier
РекомендацияBudget / private deploy / long contextAlgorithms + mathMax code, cost secondary
  • Budget / high-frequency / private deploy: V4-Pro или V4-Flash
  • Max code, cost не критичен: Claude Fable 5 (SWE-bench Pro top)
  • Algorithms + math reasoning: GPT-5.6 Sol / Ultra
  • Mass log/doc processing: V4-Flash cache-hit input $0,0028/M

04

Самое обсуждаемое изменение GA: будни 09:00–12:00 и 14:00–18:00 (Пекин) — тариф ×2, как time-of-use electricity.

V4-Pro / V4-Flash — peak/off-peak prices
Model Item Off-peak Peak
V4-ProInput (cache hit)¥0,025 / $0,0035 / 1M×2
V4-ProInput (cache miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
V4-ProOutput¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput (cache hit)¥0,02 / $0,0028 / 1M×2
V4-FlashInput (cache miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
V4-FlashOutput¥2,00 / $0,28 / 1M¥4,00 / $0,56

Четыре рычага экономии:

  • Non-realtime в off-peak: batch docs, labeling, code review после 18:00 или до 09:00
  • Prompt cache: повторяющиеся system prompts; Flash cache hit $0,0028/M
  • Flash как router: intent/routing на Flash, heavy reasoning на Pro
  • Price change notice: DeepSeek шлёт email за 24 часа до изменения тарифов

Даже в peak V4-Pro output ($1,74/M) — 8,6× дешевле Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).

05

Warning: deepseek-chat и deepseek-reasoner отключаются 24 июля 2026, 15:59 UTC (23:59 Пекин).

Mapping старых model ID → новых
Старый Новый Примечание
deepseek-chatdeepseek-v4-flash (Non-think)Fast, light tasks
deepseek-reasonerdeepseek-v4-flash (Think mode)или upgrade deepseek-v4-pro
  1. Repo-wide scan: grep deepseek-chat и deepseek-reasoner в коде, CI, env vars.
  2. Выбор target model: light chat → deepseek-v4-flash (Non-think); бывший reasoner → Flash Think или deepseek-v4-pro.
  3. Update OpenAI SDK: поменять model; thinking через extra_body.
  4. Проверка Anthropic SDK: base_url остаётся https://api.deepseek.com, меняется только model.
  5. Staging load test: до 24.07. проверить peak/off-peak billing и cache hit rate.
  6. Production rollout: canary deploy, monitor error rate и token cost; rollback window до deadline.
migrate_deepseek_v4.py
# Legacy (invalid after 24.07.)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# New — OpenAI SDK
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

# Anthropic SDK compatible
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

06

  • SWE-bench Verified: 80,6 % — open-source record, паритет Gemini 3.1 Pro
  • 1M KV cache: 10 % от V3.2 (Flash 7 %); inference FLOPs 27 % от V3.2
  • V4-Pro output pricing: off-peak $0,87/M, peak $1,74/M — ~1/10–1/100 frontier rates
  • Artificial Analysis $/task: V4-Pro $0,03 vs Fable 5 $3,48 (116×)
  • API migration deadline: 2026-07-24 23:59 Пекин
  • License: MIT — self-host и data residency on-prem

DeepSeek V4 GA — один из главных open-source milestones 2026. Ценность не в том, чтобы сегодня обогнать Fable 5 или GPT-5.6, а в лучшей open-source performance за долю frontier cost. Peak/off-peak усложняет планирование, но unit economics остаются агрессивными.

Цены, capabilities и migration policy могут меняться — перепроверьте ссылки после релиза:

Official sources:

DeepSeek API — official docs

arXiv:2606.19348 — DeepSeek V4 technical paper

Third-party analysis:

Artificial Analysis — model cost comparison

HuggingFace — DeepSeek model hub

Командам, которые гоняют DeepSeek V4 agents с Xcode, Metal toolchain и persistent agent state, чистый API даёт latency spikes и quota jitter; shared cloud VM — hypervisor overhead и iOS CI friction. Если production требует zero-loss Apple Silicon, 7×24 uptime и стабильный iOS CI/CD с multi-model API routing (Claude Code / Codex на bare metal с Metal compile chain), ZUKCLOUD bare-metal Mac mini cloud nodes — контролируемая база: dedicated physical host, no virtualization tax, flexible day/week/month billing. Тарифы, заказ, bare-metal manifesto и DeepSeek compute stack.

Если вы всё ещё на deepseek-chat — мигрируйте до 24 июля, иначе service outage.