2026年7月31日、DeepSeekはV4-Flash-0731を公式版としてAPIに投入しました。総パラメータ284B、活性13Bという4月プレビューと同一のアーキテクチャのまま、後訓練(post-training)だけを刷新し、自社のより大きいV4-Proプレビューを複数のAgent・コード系ベンチマークで上回っています。一方、V4-Pro公式版と自社AgentフレームワークHarnessは、2026年8月5日時点でも未公開です。本記事はAgentパイプラインを組むAI開発者、APIコストに敏感なプロダクトチーム、中国オープンウェイト動向を追う技術リード向けに、公式タイムライン、Harness minimal modeのベンチ解釈、Artificial Analysis指数50対Kimi K3の57、入力$0.14/$0.0028・出力$0.28の料金体系を整理します。結論先行:DeepSeekは「スコア1位」ではなく「十分な知能+極端な低価格」で勝負しており、中国開発者コミュニティが「斩杀线(キルライン)」と呼ぶ価格下限が、Kimi K3やQwen3.8-Maxの選型判断にも直結します。
01 7月31日の公式版と「斩杀线」が示す価格戦の次章
今回の更新は「新モデル登場」ではなく、同じFlashに新しい後訓練を載せ替えたリリースです。それでも市場へのインパクトは大きく、7月の密集リリースの文脈で読む必要があります。
- 4月24日:V4プレビューとMITオープンウェイト公開(V4-Pro 1.6T/49B、V4-Flash 284B/13B、100万tokenコンテキスト)。
- 7月24日:レガシー
deepseek-chat/deepseek-reasonerを停止し、V4系命名へ全面移行。 - 7月27日:Kimi K3が2.8Tの全重量をHugging Faceに公開。DeepSeekに競争圧力を与えました。
- 7月31日:V4-Flash-0731が公式APIベータとして公開。Hugging Faceのウェイトも同期。changelogでHarnessが初めて名称公開。APIのみで、App・Webチャットは未更新。
- 8月3日:AlibabaがQwen3.8-MaxをGA。中国勢の「万亿参数週」が続きます。
- 8月5日(執筆時):V4-Pro公式版・Harness公開日は未確定。「8月10–20日GA」などの報道は非公式ソースに限られます。
中国の開発者コミュニティでは、DeepSeekの「十分な性能+極端な安さ」の組み合わせを斩杀线(キルライン)と呼びます。性能で明確に上回れず、価格も下回れないモデルは市場存在感を失いやすい、という閾値です。V4-Flash-0731公開前はV4-Pro遅延を「梁白开(空約束)」と揶揄する声もありましたが、Flashの実力が上振れしたことで評価は再び「梁圣(賢人)」側へ揺れ戻しています。OpenAIのGPT-5.6 Luna大幅値下げなど、同時期の価格調整もこの文脈で理解できます。
02 核心スペック:284B/13B、料金、未公開のV4-Pro/Harness
| 項目 | V4-Flash-0731 | V4-Pro(プレビューのみ) |
|---|---|---|
| ステータス | 公式版(2026-07-31) | プレビュー(4/24〜、公式版未公開) |
| 総パラメータ / 活性 | 284B / 13B(4月版と同一) | 1.6T / 49B |
| コンテキスト | 100万 token | 100万 token |
| API入力(キャッシュ未命中 / 命中) | $0.14 / $0.0028(100万tokenあたり) | $0.435 / $0.003625 |
| API出力 | $0.28 / 100万token | $0.87 |
| ライセンス | MIT(オープンウェイト) | MIT |
| Terminal Bench 2.0(DeepSeek自報・Harness minimal) | 82.7 | 67.9(プレビュー) |
| Artificial Analysis Intelligence Index | 50(第三者) | — |
| Harness | 7/31 changelogで初公開、minimal modeベンチに使用、本体は未リリース(8/5時点) | |
Agent系スコア(Terminal Bench 2.0等)はDeepSeek自社Harnessのminimal modeで計測されています。公式も「harness選択に極めて敏感」と明記しており、Claude Code等への単純移植はできません。
03 アーキテクチャは不変、勝因は後訓練とCSA+HCA・mHC・Muon
なぜ小さいFlashが大きいProプレビューを超えられるのか。 DeepSeekは性能向上の理由を「パラメータ増加ではなく後訓練の再実施」と説明しています。2026年後半の競争軸は、単純なスケールよりデータ品質とpost-training手法へシフトしている、という読み方ができます。
アーキテクチャ面では、技術報告『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』に沿い、以下がV4ファミリーの基盤です(0731でも同一構造):
- 混合注意力(CSA + HCA):Compressed Sparse AttentionとHeavy Compressed Attentionの組み合わせ。外部ではDSA(DeepSeek Sparse Attention)として説明され、100万token時のFLOPsをV3.2比27%、KV Cacheを10%(Flashは7%)まで圧縮、と公式は述べています。
- mHC(Manifold-Constrained Hyper-Connections):Birkhoff多面体上に制約した4チャネル残差混合で、61層規模でも信号を安定化。
- Muon Optimizer:AdamWの代わりにNewton–Schulz直交化勾配を用い、収束速度と安定性を改善。
Harness minimal modeについて。 7月31日のchangelogで初めて名称が出たDeepSeek Harnessは、ファイルI/O・ツール呼び出し・多段工程を担う自社Agent実行基盤で、Claude Codeの代替を目指す位置づけです。V4-Flash-0731のAgentベンチ(Terminal Bench 2.0、Toolathlon等)はすべて未公開のHarness minimal mode、推論max、top_p=0.95、temperature=1.0で計測されています。DeepSeek自身が「数字を過信しないで」と警告している点は、ベンダー自報+特定フレームワーク結果として扱うべきです。
実運用では、海外開発者コミュニティから入力キャッシュ命中率の低さや安全分類器のタイムアウトといったフィードバックも報告されています。ベンチの上振れと、本番の摩擦は別問題として切り分ける必要があります。
04 Kimi K3・Qwen3.8-Maxとの横並びと6ステップ選型ガイド
| モデル | 総/活性パラメータ | 入力/出力(100万token) | AA Intelligence Index | AA 単タスク平均コスト |
|---|---|---|---|---|
| DeepSeek V4-Flash-0731 | 284B / 13B | $0.14(未命中)/ $0.28 | 50 | ~$0.03 |
| Kimi K3 | 2.8T / ~104B(推定) | $3.00 / $15.00 | 57 | ~$0.86 |
| Qwen3.8-Max | 2.4T / 95B | $2.00 / $6.00 | 未収録(執筆時) | 未収録 |
| GPT-5.6 Sol | 非公開 | — | Flashより+9pt以上 | ~$1.86 |
| Claude Fable 5 | 非公開 | — | Flashより+9pt以上 | ~$3.15 |
Artificial Analysisの独立指数では、V4-Flash(50)はKimi K3(57)に劣ります。しかし単タスクコストはKimiの約1/29、Claude Fable 5の約1/105です。DeepSeekは「最強」ではなくAgent大量呼び出し・バッチ処理向けの価格破壊を狙っています。プレビュー版がOpenRouterで7週連続1位だった背景もここにあります。
本番API選型前に、以下6ステップで自己診断することをおすすめします。
- ワークロードを分類する:高頻度ルーティング・バッチ要約ならFlash、深い推論・世界知識が必要ならV4-Proプレビューまたは上位クローズドモデルを検討します。
- Harness依存ベンチを切り分ける:Terminal Bench 2.0の82.7はminimal mode前提です。自社がClaude Code / OpenClaw / Cursorで動かすなら、同条件のA/Bテストが必須です。
- キャッシュ命中率を試算する:入力$0.14と$0.0028の差は約50倍です。Agentループでキャッシュが効かないと、斩杀线どおりの安さは出ません。
- レガシーmodel名を確認する:
deepseek-chatは7/24停止済みです。deepseek-v4-flashが0731ビルドを指すか、SDKのデフォルトを確認してください。 - 競合3社とTCOを並べる:月10億input・2億output token想定では、Flashは出力$0.28でQwen3.8-Max($6)やKimi K3($15)より桁違いに安い一方、品質上限はAA指数で7pt差があります。
- Agent実行環境を固定する:API選型と並行して、Claude Code等のローカル連携Macが仮想化で落ちると、どのモデルも本番で使えません。料金ページで裸金属Mac miniノードを確認してください。
05 FAQ、論点整理、参考リンク
V4-Flash-0731は「安いFlash」以上の意味を持ちます。post-trainingだけでProプレビューを超えた事実は、パラメータ競争の終焉シグナルです。一方、Harness未公開・V4-Pro公式版待ち・ベンチのフレームワーク依存という3つの不確実性は8月5日時点でも残っています。
V4-Flash-0731は新しいモデルですか?
いいえ。284B/13Bのアーキテクチャは4月プレビューと同一で、性能向上は後訓練の再実施によるものです。APIのdeepseek-v4-flashは自動的に0731ビルドを指します。
V4-Pro公式版とHarnessはいつ使えますか?
2026年8月5日時点では未公開です。DeepSeek公式changelogは「できるだけ早く」とのみ記載しており、8月10–20日GAなどの具体日付は非公式報道に限られます。
Kimi K3と比べてどちらが強いですか?
Artificial Analysis Intelligence IndexではKimi K3が57、V4-Flashが50です。一方コストはFlashが約1/29。知能上限重視ならKimi、大量Agent呼び出し重視ならFlash、という切り分けが現実的です。
DeepSeekのAgentベンチは信頼できますか?
SWE-bench Verifiedなど第三者ベンチは参考になりますが、Terminal Bench 2.0等は未公開Harness minimal modeの自社計測です。公式もharness依存を警告しており、他ツールでの独立再現を待つべきです。
Claude Opus 4.8と比べてどれくらい安いですか?
メディア報道ベースでは、キャッシュ未命中入力で約36倍、キャッシュ命中で約179倍、出力で約89倍安い、とされています。いずれもリスト価格比較であり、実際のTCOはキャッシュと再試行コストに依存します。
引用可能データ(2026-08-05時点):
- 公式版日付:2026-07-31(V4-Flash-0731)
- パラメータ:284B総 / 13B活性(据え置き)
- 料金:入力 $0.14 / $0.0028、出力 $0.28(100万token)
- Terminal Bench 2.0:82.7 vs V4-Pro preview 67.9(Harness minimal、自社)
- Artificial Analysis Index:50 vs Kimi K3 57
- 未公開:V4-Pro公式版、Harness(8/5時点)
外部参考(公開前に再確認してください):
Artificial Analysis — 独立モデルベンチマーク
Hugging Face — deepseek-ai モデルカード
API単価の差は表で一目瞭然ですが、Harness未公開のベンチを鵜呑みにした選型、キャッシュが効かないAgentループ、仮想化Mac上でClaude Codeが落ちる本番環境が重なると、どのモデルも期待どおり動きません。ZUKCLOUDの裸金属Mac miniクラウドノードは、Hypervisor损耗なし・Root権限・7×24 Agent自動化向けの固定インフラです。料金ページでプランを確認するか、裸金属アーキテクチャ宣言とV4 GA解説を合わせて読んでください。斩杀线の先で勝つのは最安APIだけではなく、Agent基盤が落ちない環境を先に確保したチームです。