ホーム / ブログ / V4-Flash-0731
ENGINEERING BLOG · 2026.08.05

DeepSeek V4-Flash-0731 正式版:
パラメータ据え置きでAgent性能がV4-Proを上回る理由

2026年7月31日、DeepSeekはV4-Flash-0731を公式版としてAPIに投入しました。総パラメータ284B、活性13Bという4月プレビューと同一のアーキテクチャのまま、後訓練(post-training)だけを刷新し、自社のより大きいV4-Proプレビューを複数のAgent・コード系ベンチマークで上回っています。一方、V4-Pro公式版と自社AgentフレームワークHarnessは、2026年8月5日時点でも未公開です。本記事はAgentパイプラインを組むAI開発者、APIコストに敏感なプロダクトチーム、中国オープンウェイト動向を追う技術リード向けに、公式タイムライン、Harness minimal modeのベンチ解釈、Artificial Analysis指数50対Kimi K3の57、入力$0.14/$0.0028・出力$0.28の料金体系を整理します。結論先行:DeepSeekは「スコア1位」ではなく「十分な知能+極端な低価格」で勝負しており、中国開発者コミュニティが「斩杀线(キルライン)」と呼ぶ価格下限が、Kimi K3やQwen3.8-Maxの選型判断にも直結します。

01

今回の更新は「新モデル登場」ではなく、同じFlashに新しい後訓練を載せ替えたリリースです。それでも市場へのインパクトは大きく、7月の密集リリースの文脈で読む必要があります。

  • 4月24日V4プレビューとMITオープンウェイト公開(V4-Pro 1.6T/49B、V4-Flash 284B/13B、100万tokenコンテキスト)。
  • 7月24日:レガシーdeepseek-chat / deepseek-reasonerを停止し、V4系命名へ全面移行。
  • 7月27日Kimi K3が2.8Tの全重量をHugging Faceに公開。DeepSeekに競争圧力を与えました。
  • 7月31日V4-Flash-0731が公式APIベータとして公開。Hugging Faceのウェイトも同期。changelogでHarnessが初めて名称公開。APIのみで、App・Webチャットは未更新。
  • 8月3日:AlibabaがQwen3.8-MaxをGA。中国勢の「万亿参数週」が続きます。
  • 8月5日(執筆時):V4-Pro公式版・Harness公開日は未確定。「8月10–20日GA」などの報道は非公式ソースに限られます。

中国の開発者コミュニティでは、DeepSeekの「十分な性能+極端な安さ」の組み合わせを斩杀线(キルライン)と呼びます。性能で明確に上回れず、価格も下回れないモデルは市場存在感を失いやすい、という閾値です。V4-Flash-0731公開前はV4-Pro遅延を「梁白开(空約束)」と揶揄する声もありましたが、Flashの実力が上振れしたことで評価は再び「梁圣(賢人)」側へ揺れ戻しています。OpenAIのGPT-5.6 Luna大幅値下げなど、同時期の価格調整もこの文脈で理解できます。

02

DeepSeek-V4-Flash-0731 核心仕様(2026年7月31日公式版)
項目 V4-Flash-0731 V4-Pro(プレビューのみ)
ステータス公式版(2026-07-31)プレビュー(4/24〜、公式版未公開)
総パラメータ / 活性284B / 13B(4月版と同一)1.6T / 49B
コンテキスト100万 token100万 token
API入力(キャッシュ未命中 / 命中)$0.14 / $0.0028(100万tokenあたり)$0.435 / $0.003625
API出力$0.28 / 100万token$0.87
ライセンスMIT(オープンウェイト)MIT
Terminal Bench 2.0(DeepSeek自報・Harness minimal)82.767.9(プレビュー)
Artificial Analysis Intelligence Index50(第三者)
Harness7/31 changelogで初公開、minimal modeベンチに使用、本体は未リリース(8/5時点)

Agent系スコア(Terminal Bench 2.0等)はDeepSeek自社Harnessのminimal modeで計測されています。公式も「harness選択に極めて敏感」と明記しており、Claude Code等への単純移植はできません。

03

なぜ小さいFlashが大きいProプレビューを超えられるのか。 DeepSeekは性能向上の理由を「パラメータ増加ではなく後訓練の再実施」と説明しています。2026年後半の競争軸は、単純なスケールよりデータ品質とpost-training手法へシフトしている、という読み方ができます。

アーキテクチャ面では、技術報告『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』に沿い、以下がV4ファミリーの基盤です(0731でも同一構造):

  • 混合注意力(CSA + HCA):Compressed Sparse AttentionとHeavy Compressed Attentionの組み合わせ。外部ではDSA(DeepSeek Sparse Attention)として説明され、100万token時のFLOPsをV3.2比27%、KV Cacheを10%(Flashは7%)まで圧縮、と公式は述べています。
  • mHC(Manifold-Constrained Hyper-Connections):Birkhoff多面体上に制約した4チャネル残差混合で、61層規模でも信号を安定化。
  • Muon Optimizer:AdamWの代わりにNewton–Schulz直交化勾配を用い、収束速度と安定性を改善。

Harness minimal modeについて。 7月31日のchangelogで初めて名称が出たDeepSeek Harnessは、ファイルI/O・ツール呼び出し・多段工程を担う自社Agent実行基盤で、Claude Codeの代替を目指す位置づけです。V4-Flash-0731のAgentベンチ(Terminal Bench 2.0、Toolathlon等)はすべて未公開のHarness minimal mode、推論max、top_p=0.95、temperature=1.0で計測されています。DeepSeek自身が「数字を過信しないで」と警告している点は、ベンダー自報+特定フレームワーク結果として扱うべきです。

実運用では、海外開発者コミュニティから入力キャッシュ命中率の低さ安全分類器のタイムアウトといったフィードバックも報告されています。ベンチの上振れと、本番の摩擦は別問題として切り分ける必要があります。

04

中国オープンウェイト勢 横並び比較(2026年8月初)
モデル 総/活性パラメータ 入力/出力(100万token) AA Intelligence Index AA 単タスク平均コスト
DeepSeek V4-Flash-0731 284B / 13B $0.14(未命中)/ $0.28 50 ~$0.03
Kimi K3 2.8T / ~104B(推定) $3.00 / $15.00 57 ~$0.86
Qwen3.8-Max 2.4T / 95B $2.00 / $6.00 未収録(執筆時) 未収録
GPT-5.6 Sol 非公開 Flashより+9pt以上 ~$1.86
Claude Fable 5 非公開 Flashより+9pt以上 ~$3.15

Artificial Analysisの独立指数では、V4-Flash(50)はKimi K3(57)に劣ります。しかし単タスクコストはKimiの約1/29、Claude Fable 5の約1/105です。DeepSeekは「最強」ではなくAgent大量呼び出し・バッチ処理向けの価格破壊を狙っています。プレビュー版がOpenRouterで7週連続1位だった背景もここにあります。

本番API選型前に、以下6ステップで自己診断することをおすすめします。

  1. ワークロードを分類する:高頻度ルーティング・バッチ要約ならFlash、深い推論・世界知識が必要ならV4-Proプレビューまたは上位クローズドモデルを検討します。
  2. Harness依存ベンチを切り分ける:Terminal Bench 2.0の82.7はminimal mode前提です。自社がClaude Code / OpenClaw / Cursorで動かすなら、同条件のA/Bテストが必須です。
  3. キャッシュ命中率を試算する:入力$0.14と$0.0028の差は約50倍です。Agentループでキャッシュが効かないと、斩杀线どおりの安さは出ません。
  4. レガシーmodel名を確認する:deepseek-chatは7/24停止済みです。deepseek-v4-flashが0731ビルドを指すか、SDKのデフォルトを確認してください。
  5. 競合3社とTCOを並べる:月10億input・2億output token想定では、Flashは出力$0.28でQwen3.8-Max($6)やKimi K3($15)より桁違いに安い一方、品質上限はAA指数で7pt差があります。
  6. Agent実行環境を固定する:API選型と並行して、Claude Code等のローカル連携Macが仮想化で落ちると、どのモデルも本番で使えません。料金ページで裸金属Mac miniノードを確認してください。

05

V4-Flash-0731は「安いFlash」以上の意味を持ちます。post-trainingだけでProプレビューを超えた事実は、パラメータ競争の終焉シグナルです。一方、Harness未公開・V4-Pro公式版待ち・ベンチのフレームワーク依存という3つの不確実性は8月5日時点でも残っています。

V4-Flash-0731は新しいモデルですか?

いいえ。284B/13Bのアーキテクチャは4月プレビューと同一で、性能向上は後訓練の再実施によるものです。APIのdeepseek-v4-flashは自動的に0731ビルドを指します。

V4-Pro公式版とHarnessはいつ使えますか?

2026年8月5日時点では未公開です。DeepSeek公式changelogは「できるだけ早く」とのみ記載しており、8月10–20日GAなどの具体日付は非公式報道に限られます。

Kimi K3と比べてどちらが強いですか?

Artificial Analysis Intelligence IndexではKimi K3が57、V4-Flashが50です。一方コストはFlashが約1/29。知能上限重視ならKimi、大量Agent呼び出し重視ならFlash、という切り分けが現実的です。

DeepSeekのAgentベンチは信頼できますか?

SWE-bench Verifiedなど第三者ベンチは参考になりますが、Terminal Bench 2.0等は未公開Harness minimal modeの自社計測です。公式もharness依存を警告しており、他ツールでの独立再現を待つべきです。

Claude Opus 4.8と比べてどれくらい安いですか?

メディア報道ベースでは、キャッシュ未命中入力で約36倍、キャッシュ命中で約179倍、出力で約89倍安い、とされています。いずれもリスト価格比較であり、実際のTCOはキャッシュと再試行コストに依存します。

引用可能データ(2026-08-05時点):

  • 公式版日付:2026-07-31(V4-Flash-0731)
  • パラメータ:284B総 / 13B活性(据え置き)
  • 料金:入力 $0.14 / $0.0028、出力 $0.28(100万token)
  • Terminal Bench 2.0:82.7 vs V4-Pro preview 67.9(Harness minimal、自社)
  • Artificial Analysis Index:50 vs Kimi K3 57
  • 未公開:V4-Pro公式版、Harness(8/5時点)

外部参考(公開前に再確認してください):

DeepSeek API ドキュメント

Artificial Analysis — 独立モデルベンチマーク

Hugging Face — deepseek-ai モデルカード

DeepSeek Platform — APIコンソール

API単価の差は表で一目瞭然ですが、Harness未公開のベンチを鵜呑みにした選型、キャッシュが効かないAgentループ、仮想化Mac上でClaude Codeが落ちる本番環境が重なると、どのモデルも期待どおり動きません。ZUKCLOUDの裸金属Mac miniクラウドノードは、Hypervisor损耗なし・Root権限・7×24 Agent自動化向けの固定インフラです。料金ページでプランを確認するか、裸金属アーキテクチャ宣言V4 GA解説を合わせて読んでください。斩杀线の先で勝つのは最安APIだけではなく、Agent基盤が落ちない環境を先に確保したチームです。