Главная / Блог / V4-Flash-0731
ENGINEERING BLOG · 2026.08.05

DeepSeek V4-Flash-0731:
те же 284B — Agent-метрики выше, чем у V4-Pro

31 июля 2026 DeepSeek перевёл V4-Flash-0731 в статус официальной API-версии. Архитектура та же — 284B всего / 13B активных — но post-training перезапущен целиком, и на ряде Agent- и coding-бенчмарков Flash обходит более крупный V4-Pro preview. На 5 августа 2026 официальный V4-Pro и собственный Agent-фреймворк Harness по-прежнему «скоро», без даты. Материал для разработчиков Agent-пайплайнов, продуктовых команд с жёстким token-бюджетом и техлидов, отслеживающих китайские open-weight релизы: таймлайн, тарифы $0,14 / $0,0028 на input и $0,28 на output (за 1M tokens), Artificial Analysis Index 50 против 57 у Kimi K3, контекст «kill line» в ценовой войне. Вывод: DeepSeek не гонится за первым местом в рейтинге — он фиксирует связку «достаточный интеллект + дно по цене», под которую рынок вынужден подстраиваться.

01

Фраза «официальный V4» часто читается как релиз флагмана. На деле официальным стал только Flash-0731; Pro остаётся preview. Хронология с апреля:

  • 24 апреля: preview V4 + MIT-веса (Pro 1,6T/49B active, Flash 284B/13B, контекст 1M).
  • 24 июля: отключены deepseek-chat / deepseek-reasoner.
  • 27 июля: Kimi K3 (2,8T) — полные веса на Hugging Face, давление на DeepSeek за дни до Flash.
  • 31 июля: V4-Flash-0731 API-beta + веса HF; changelog впервые называет Harness. Только API — приложение и веб без изменений.
  • 3 августа: GA Qwen3.8-Max (Alibaba).
  • 5 августа (редакция): дата GA V4-Pro и публикации Harness не подтверждена. Окно «10–20 августа» — слухи из неофициальных источников.

В китайских dev-сообществах связку DeepSeek «приемлемая мощность + минимальная цена» называют 斩杀线 (kill line): без явного преимущества по качеству или тарифу модель теряет место на рынке. До 31 июля задержку Pro высмеивали («梁白开»); после сильных цифр Flash настроение снова сменилось на «梁圣». Параллельно СМИ фиксировали агрессивные скидки OpenAI на GPT-5.6 Luna — типичная реакция на ценовой прессинг DeepSeek.

02

DeepSeek-V4-Flash-0731 — опубликованные характеристики (31.07.2026)
Параметр V4-Flash-0731 V4-Pro (только preview)
СтатусОфициальный (31.07.2026)Preview с 24.04., GA ожидается
Всего / active params284B / 13B (как в апреле)1,6T / 49B
Контекст1M tokens1M tokens
Input (cache miss / hit, за 1M)$0,14 / $0,0028$0,435 / $0,003625
Output (за 1M)$0,28$0,87
ЛицензияMITMIT
Terminal Bench 2.0 (DeepSeek, Harness minimal)82,767,9 (preview)
Artificial Analysis Intelligence Index50 (независимый)
HarnessУпомянут 31.07.; Agent-бенчмарки через minimal mode — фреймворк не опубликован (на 05.08.)

Agent-метрики (Terminal Bench 2.0 и др.) сняты в Harness minimal mode, который ещё не выпущен. В changelog DeepSeek прямо предупреждает: результаты «крайне зависят от harness».

03

Ключевой тезис DeepSeek: параметры не росли, перезапущен post-training. Это бьёт по интуиции «больше = лучше» и смещает гонку 2026 года в сторону качества данных и методов дообучения.

Архитектура V4 (отчёт «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence») включает:

  • Гибридное внимание CSA + HCA: Compressed Sparse Attention + Heavy Compressed Attention (маркeting: DSA). З заявленные цифры: при 1M контекста FLOPs инференса ≈ 27 % от V3.2, KV cache ≈ 10 % (Flash ≈ 7 %).
  • mHC: гиперсвязи на политопе Бирkhoff — четыре residual-потока, стабильность на 61 слое.
  • Оптимизатор Muon: вместо AdamW; ортогонализованные градиенты Newton-Schulz.

Harness minimal mode: первый собственный Agent-фреймворк DeepSeek (файлы, tools, многошаговые инженерные задачи) — заявленная альтернатива Claude Code. Все Agent-бенчмарки Flash-0731: minimal mode, max reasoning, top_p 0,95, temperature 1,0. Пока нет независимой репродукции на Claude Code / Cursor / OpenClaw — это vendor + proprietary framework, а не переносимая capability.

Из практики: жалобы на низкий cache hit rate на input и таймауты safety-классификатора — рост бенчмарков не отменяет операционное трение.

04

Китайские open-weight модели — начало августа 2026
Модель Всего / active Цена in/out (за 1M) AA Intelligence Index Стоимость/task AA
DeepSeek V4-Flash-0731 284B / 13B $0,14 / $0,28 50 ~$0,03
Kimi K3 2,8T / ~104B (оценка) $3,00 / $15,00 57 ~$0,86
Qwen3.8-Max 2,4T / 95B $2,00 / $6,00 не в индексе (редакция)
GPT-5.6 Sol не раскрыто +9 pts vs Flash ~$1,86
Claude Fable 5 не раскрыто +9 pts vs Flash ~$3,15

Независимый Artificial Analysis ставит Flash на 50, Kimi K357, но стоимость задачи у Flash ~1/29 от Kimi и ~1/105 от Claude Fable 5. Целевая ниша — массовые Agent-вызовы, не корona leaderboard.

Шесть шагов перед production-переключением:

  1. Классифицировать нагрузку: высокочастотный routing / batch → Flash; глубокий reasoning → Pro preview или closed frontier.
  2. Отделить Harness-бенчмарки: Terminal Bench 82,7 ≠ Claude Code — A/B на своих репозиториях.
  3. Смоделировать cache: $0,14 vs $0,0028 input — ~50×; Agent-циклы без cache съедают преимущество kill line.
  4. Проверить legacy model names: deepseek-chat отключён 24 июля; deepseek-v4-flash → build 0731.
  5. TCO vs Kimi и Qwen: при 1B input + 200M output/мес Flash доминирует в счёте — заложить разрыв ~7 пунктов индекса.
  6. Зафиксировать Agent-хост: API бессмыслен, если Claude Code падает на виртуализированном Mac. См. тарифы bare metal.

05

Flash-0731 превращает «дешёвый preview» в официальный workhorse — при трёх открытых вопросах: GA Pro, публичный Harness, независимая Agent-репродукция.

V4-Flash-0731 — новая модель?

Нет — та же 284B/13B, что в апрельском preview. Прирост от post-training. deepseek-v4-flash автоматически указывает на build 0731.

Когда выйдут V4-Pro GA и Harness?

На 5 августа 2026 дата не подтверждена. Changelog: «как можно скорее». Конкретные окна августа — слухи.

Flash или Kimi K3?

Index: Kimi 57, Flash 50. Стоимость: Flash ~29× дешевле за task. Потолок качества — Kimi; массовые Agent — Flash.

Можно ли доверять Agent-бенчмаркам DeepSeek?

Частично. SWE-bench Verified переносимее. Terminal Bench 2.0 и др. — unreleased Harness minimal mode; предупреждение вендора серьёзно.

Насколько дешевле Claude?

Пресса: ~36× (input cache miss), ~179× (cache hit), ~89× (output) vs Opus 4.8 — list price, не аудированный TCO.

Цитируемые факты (05.08.2026):

  • Официальный релиз: 31.07.2026 — V4-Flash-0731
  • 284B / 13B — архитектура без изменений
  • Тарифы: $0,14 / $0,0028 input, $0,28 output (за 1M tokens)
  • Terminal Bench 2.0: 82,7 vs Pro preview 67,9 (Harness minimal, vendor)
  • Artificial Analysis Index: 50 vs Kimi K3 57
  • V4-Pro GA + Harness: не выпущены на 05.08.

Внешние источники (перепроверить перед публикацией):

Документация DeepSeek API

Artificial Analysis — независимые бенчмарки LLM

Hugging Face — организация deepseek-ai

DeepSeek Platform

Низкая цена token не спасает, если Harness-зависимые бенчмарки принимают за истину, cache в Agent-циклах не работает, а Claude Code на виртуальном Mac рвётся ночью. Облачные узлы bare metal Mac mini от ZUKCLOUD — настоящее Apple-железо, root, без overhead гипервизора, 7×24 для Agent. Тарифы, манифест bare metal и разбор V4 GA. За kill line побеждает не самый дешёвый API-ключ — а инфраструктура Agent, которая не падает в проде.