31 июля 2026 DeepSeek перевёл V4-Flash-0731 в статус официальной API-версии. Архитектура та же — 284B всего / 13B активных — но post-training перезапущен целиком, и на ряде Agent- и coding-бенчмарков Flash обходит более крупный V4-Pro preview. На 5 августа 2026 официальный V4-Pro и собственный Agent-фреймворк Harness по-прежнему «скоро», без даты. Материал для разработчиков Agent-пайплайнов, продуктовых команд с жёстким token-бюджетом и техлидов, отслеживающих китайские open-weight релизы: таймлайн, тарифы $0,14 / $0,0028 на input и $0,28 на output (за 1M tokens), Artificial Analysis Index 50 против 57 у Kimi K3, контекст «kill line» в ценовой войне. Вывод: DeepSeek не гонится за первым местом в рейтинге — он фиксирует связку «достаточный интеллект + дно по цене», под которую рынок вынужден подстраиваться.
01 31 июля: официальный Flash, отложенные Pro и Harness
Фраза «официальный V4» часто читается как релиз флагмана. На деле официальным стал только Flash-0731; Pro остаётся preview. Хронология с апреля:
- 24 апреля: preview V4 + MIT-веса (Pro 1,6T/49B active, Flash 284B/13B, контекст 1M).
- 24 июля: отключены
deepseek-chat/deepseek-reasoner. - 27 июля: Kimi K3 (2,8T) — полные веса на Hugging Face, давление на DeepSeek за дни до Flash.
- 31 июля: V4-Flash-0731 API-beta + веса HF; changelog впервые называет Harness. Только API — приложение и веб без изменений.
- 3 августа: GA Qwen3.8-Max (Alibaba).
- 5 августа (редакция): дата GA V4-Pro и публикации Harness не подтверждена. Окно «10–20 августа» — слухи из неофициальных источников.
В китайских dev-сообществах связку DeepSeek «приемлемая мощность + минимальная цена» называют 斩杀线 (kill line): без явного преимущества по качеству или тарифу модель теряет место на рынке. До 31 июля задержку Pro высмеивали («梁白开»); после сильных цифр Flash настроение снова сменилось на «梁圣». Параллельно СМИ фиксировали агрессивные скидки OpenAI на GPT-5.6 Luna — типичная реакция на ценовой прессинг DeepSeek.
02 Спеки, тарифы, бенчмарки с оговорками
| Параметр | V4-Flash-0731 | V4-Pro (только preview) |
|---|---|---|
| Статус | Официальный (31.07.2026) | Preview с 24.04., GA ожидается |
| Всего / active params | 284B / 13B (как в апреле) | 1,6T / 49B |
| Контекст | 1M tokens | 1M tokens |
| Input (cache miss / hit, за 1M) | $0,14 / $0,0028 | $0,435 / $0,003625 |
| Output (за 1M) | $0,28 | $0,87 |
| Лицензия | MIT | MIT |
| Terminal Bench 2.0 (DeepSeek, Harness minimal) | 82,7 | 67,9 (preview) |
| Artificial Analysis Intelligence Index | 50 (независимый) | — |
| Harness | Упомянут 31.07.; Agent-бенчмарки через minimal mode — фреймворк не опубликован (на 05.08.) | |
Agent-метрики (Terminal Bench 2.0 и др.) сняты в Harness minimal mode, который ещё не выпущен. В changelog DeepSeek прямо предупреждает: результаты «крайне зависят от harness».
03 Архитектура та же — выигрыш в post-training, CSA+HCA, mHC, Muon
Ключевой тезис DeepSeek: параметры не росли, перезапущен post-training. Это бьёт по интуиции «больше = лучше» и смещает гонку 2026 года в сторону качества данных и методов дообучения.
Архитектура V4 (отчёт «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence») включает:
- Гибридное внимание CSA + HCA: Compressed Sparse Attention + Heavy Compressed Attention (маркeting: DSA). З заявленные цифры: при 1M контекста FLOPs инференса ≈ 27 % от V3.2, KV cache ≈ 10 % (Flash ≈ 7 %).
- mHC: гиперсвязи на политопе Бирkhoff — четыре residual-потока, стабильность на 61 слое.
- Оптимизатор Muon: вместо AdamW; ортогонализованные градиенты Newton-Schulz.
Harness minimal mode: первый собственный Agent-фреймворк DeepSeek (файлы, tools, многошаговые инженерные задачи) — заявленная альтернатива Claude Code. Все Agent-бенчмарки Flash-0731: minimal mode, max reasoning, top_p 0,95, temperature 1,0. Пока нет независимой репродукции на Claude Code / Cursor / OpenClaw — это vendor + proprietary framework, а не переносимая capability.
Из практики: жалобы на низкий cache hit rate на input и таймауты safety-классификатора — рост бенчмарков не отменяет операционное трение.
04 Сравнение с Kimi K3 и Qwen3.8-Max — 6 шагов перед миграцией
| Модель | Всего / active | Цена in/out (за 1M) | AA Intelligence Index | Стоимость/task AA |
|---|---|---|---|---|
| DeepSeek V4-Flash-0731 | 284B / 13B | $0,14 / $0,28 | 50 | ~$0,03 |
| Kimi K3 | 2,8T / ~104B (оценка) | $3,00 / $15,00 | 57 | ~$0,86 |
| Qwen3.8-Max | 2,4T / 95B | $2,00 / $6,00 | не в индексе (редакция) | — |
| GPT-5.6 Sol | не раскрыто | — | +9 pts vs Flash | ~$1,86 |
| Claude Fable 5 | не раскрыто | — | +9 pts vs Flash | ~$3,15 |
Независимый Artificial Analysis ставит Flash на 50, Kimi K3 — 57, но стоимость задачи у Flash ~1/29 от Kimi и ~1/105 от Claude Fable 5. Целевая ниша — массовые Agent-вызовы, не корona leaderboard.
Шесть шагов перед production-переключением:
- Классифицировать нагрузку: высокочастотный routing / batch → Flash; глубокий reasoning → Pro preview или closed frontier.
- Отделить Harness-бенчмарки: Terminal Bench 82,7 ≠ Claude Code — A/B на своих репозиториях.
- Смоделировать cache: $0,14 vs $0,0028 input — ~50×; Agent-циклы без cache съедают преимущество kill line.
- Проверить legacy model names:
deepseek-chatотключён 24 июля;deepseek-v4-flash→ build 0731. - TCO vs Kimi и Qwen: при 1B input + 200M output/мес Flash доминирует в счёте — заложить разрыв ~7 пунктов индекса.
- Зафиксировать Agent-хост: API бессмыслен, если Claude Code падает на виртуализированном Mac. См. тарифы bare metal.
05 FAQ, kill line, ссылки
Flash-0731 превращает «дешёвый preview» в официальный workhorse — при трёх открытых вопросах: GA Pro, публичный Harness, независимая Agent-репродукция.
V4-Flash-0731 — новая модель?
Нет — та же 284B/13B, что в апрельском preview. Прирост от post-training. deepseek-v4-flash автоматически указывает на build 0731.
Когда выйдут V4-Pro GA и Harness?
На 5 августа 2026 дата не подтверждена. Changelog: «как можно скорее». Конкретные окна августа — слухи.
Flash или Kimi K3?
Index: Kimi 57, Flash 50. Стоимость: Flash ~29× дешевле за task. Потолок качества — Kimi; массовые Agent — Flash.
Можно ли доверять Agent-бенчмаркам DeepSeek?
Частично. SWE-bench Verified переносимее. Terminal Bench 2.0 и др. — unreleased Harness minimal mode; предупреждение вендора серьёзно.
Насколько дешевле Claude?
Пресса: ~36× (input cache miss), ~179× (cache hit), ~89× (output) vs Opus 4.8 — list price, не аудированный TCO.
Цитируемые факты (05.08.2026):
- Официальный релиз: 31.07.2026 — V4-Flash-0731
- 284B / 13B — архитектура без изменений
- Тарифы: $0,14 / $0,0028 input, $0,28 output (за 1M tokens)
- Terminal Bench 2.0: 82,7 vs Pro preview 67,9 (Harness minimal, vendor)
- Artificial Analysis Index: 50 vs Kimi K3 57
- V4-Pro GA + Harness: не выпущены на 05.08.
Внешние источники (перепроверить перед публикацией):
Artificial Analysis — независимые бенчмарки LLM
Hugging Face — организация deepseek-ai
Низкая цена token не спасает, если Harness-зависимые бенчмарки принимают за истину, cache в Agent-циклах не работает, а Claude Code на виртуальном Mac рвётся ночью. Облачные узлы bare metal Mac mini от ZUKCLOUD — настоящее Apple-железо, root, без overhead гипервизора, 7×24 для Agent. Тарифы, манифест bare metal и разбор V4 GA. За kill line побеждает не самый дешёвый API-ключ — а инфраструктура Agent, которая не падает в проде.