ホーム / ブログ / DeepSeek V4
ENGINEERING BLOG · 2026.07.20

DeepSeek V4 正式版リリース:
料金・アーキテクチャ・GPT-5.6との性能差

3か月の待機を経て、DeepSeek V4 GA(正式版)が2026年7月20日に正式リリースされました。本記事はAI開発者、個人開発者、長コンテキストAgentエンジニア、コストに敏感なAIプロダクトチームを対象に、技術アーキテクチャ、ベンチマークスコア、ピーク・オフピーク料金、GPT-5.6 / Claude Fable 5との横並び比較、および7月24日までのAPI移行の5つの観点から包括的に解説します。正式版へのアップグレードが価値あるか、商用課金下でコストを最小化する方法を判断する助けになります。

01

4月のプレビュー版と比べ、GA正式版はAgent能力、数学推論、コード生成の専門的強化に加え、初めてピーク・オフピーク差別課金を導入しました。これはDeepSeekが「ほぼ無料」から規律ある商用運営へ移行するシグナルです。喜びの一方で、本番環境の開発者は以下の痛みに直ちに対処する必要があります。

  • API移行カウントダウン:旧モデルID deepseek-chatdeepseek-reasoner2026年7月24日 15:59 UTC(北京時間7月24日 23:59) に永久停止します。未移行の本番サービスは即座に中断されます。
  • ピーク課金の複雑さ:平日 09:00–12:00 と 14:00–18:00(北京時間)の料金は2倍。24時間稼働のAgentパイプラインは請求モデルの再設計が必要です。
  • クローズドソース旗艦は最難タスクで依然リード:Claude Fable 5はSWE-bench Proで80.3%を維持。リーダーボードだけを追い、1タスクあたりのコストを計算しないと過払いのリスクがあります。
  • セルフホスト≠ゼロ運用:MITオープンソースですが、1.6T MoEの本番推論には専門GPUクラスタが必要。多くのチームはAPI経由のままで、ネットワークとクォータのリスクは残ります。

一言でまとめると:V4プレビューはすでに強力でした。正式版はAgent・数学・コードの専門強化に加え、正式な商用課金体系を整備しました。

02

DeepSeek V4 主要タイムライン(2026)
日付 イベント
4月24日V4プレビュー公開 + オープンソース(MIT):V4-Pro(1.6T)とV4-Flash(284B)
5月V4-FlashとV4-Proの本番チューニング版リリース、API正式利用可能
6月V4-Pro出力価格を永久に75%削減($0.87/M tokens)
6月29日全APIユーザーへメール:7月中旬GA、初のピーク課金開示
7月19日複数開発者がGAグレーテスト資格を取得、メディアが「正式版は明日にも」と報道
7月20日GA正式版リリース(本記事公開日)
7月24日旧API deepseek-chatdeepseek-reasoner 永久停止

モデルファミリー概要

V4-Pro と V4-Flash 仕様比較
仕様 V4-Pro V4-Flash
総パラメータ数1.6兆(1.6T)2840億(284B)
トークンあたり活性パラメータ490億(49B)130億(13B)
Transformer層数61層43層
コンテキストウィンドウ1,000,000 tokens1,000,000 tokens
最大出力384K tokens384K tokens
精度FP4(エキスパート重み)+ FP8(その他)FP4 + FP8 混合
事前学習データ量33T+ tokens32T+ tokens
ライセンスMITMIT

コアアーキテクチャ革新:100万tokenコンテキストを支える理由

従来のTransformerではKV Cacheのメモリ消費がコンテキスト長に線形増加します。DeepSeek V4は3つの革新でこれを解決しました(Kimi K3のKDAルートとは異なり、V4はCSA + HCAハイブリッド注意を採用):

① ハイブリッド注意機構(CSA + HCA)——V2/V3時代のMLAを廃止し、2つの新機構のハイブリッドを採用:

  • 圧縮スパース注意(CSA):KVシーケンスをSoftmaxゲート付きプーリングで4倍圧縮し、FP4「ライトニングインデクサー」でtop-kスパース選択(Pro: top-1024、Flash: top-512)、直近128 tokenのスライディングウィンドウを保持。1Mコンテキストでの推論FLOPsはV3.2の27%のみ。
  • 重度圧縮注意(HCA):トークンを128倍圧縮してグローバル密集注意を実行し、長距離依存を捕捉。Flashは最初の2層でHCA、その後CSA/HCAを交互に使用。
  • 総合効果:1M tokenシナリオでKV CacheメモリはV3.2の10%(Flashは7%まで低減)。

② 多様体制約ハイパーコネクション(mHC):4チャネル残差ストリームを導入し、双確率行列制約(Birkhoff多面体)を満たす混合行列で61層の深いネットワークでも信号を安定伝播。

③ Muonオプティマイザ:学習時にMuon(AdamWではなく)を採用し、ニュートン-シュルツ直交化で勾配を処理。収束が速く、学習が安定します。

3つの推論モード

V4 推論モードと適用シーン
モード 特徴 適用シーン
Non-think思考連鎖なし、最速応答簡単なQ&A、ルーティング
Think High明示的推論(思考連鎖タグ)中程度の複雑タスク、コードデバッグ
Think Max最大推論深度、384K+コンテキスト必要複雑な数学、長チェーンAgent

公式推奨サンプリングパラメータ:temperature=1.0, top_p=1.0(全モード共通)。

03

V4-Pro コアベンチマークデータ
ベンチマーク DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified80.6% ★ オープンソース最高96.0%個別未公開~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verifiedは「実際のGitHubリポジトリのバグ修正」テストです。80.6%は現時点のオープンソースモデル最高スコアで、Gemini 3.1 Proと並びます。SWE-bench Proはより厳格で、Claude Fable 5の80.3%が現在リードしています。

コストパフォーマンス横並び比較

Artificial Analysisの評価によると:Claude Fable 5はStrategy & Ops指数タスクで1回あたり$3.48(スコア50)。DeepSeek V4-Proは同種タスクで$0.03(スコア38)。V4-Flashは6カテゴリの指数タスクすべてで1回あたり$0.04未満。Fable 5のコストはV4-Proの116倍で、スコアは約12点(31%)のみ上回ります。

DeepSeek V4-Pro vs GPT-5.6 Sol vs Claude Fable 5 ポジショニング
次元 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
オープンソース✅ MIT❌ クローズド❌ クローズド
セルフホスト可能
コンテキストウィンドウ1M tokens未公開1M tokens
API出力価格(オフピーク)$0.87/M~$15/M$50/M
ピーク出力価格$1.74/M
Agent能力強力、マルチAgent編成対応強力最強
推奨シーン予算重視 / プライベートデプロイ / 長コンテキスト複雑アルゴリズム + 数学推論最高のコード能力、コスト不問
  • 予算重視 / 高頻度呼び出し / プライベートデプロイ:V4-ProまたはV4-Flashを推奨
  • 最高のコード能力、コスト不問:Claude Fable 5(SWE-bench Pro最高)
  • 複雑アルゴリズム + 数学推論:GPT-5.6 Sol / Ultra
  • 超大規模ログ/文書処理:V4-Flashキャッシュヒット入力は$0.0028/Mのみ

04

GA版で最も注目され議論を呼ぶ変更——電力の時間帯別料金に似て、ピーク時間帯(北京時間の平日 09:00–12:00 と 14:00–18:00)の料金は2倍になります。

V4-Pro / V4-Flash ピーク・オフピーク課金完全価格表
モデル 課金項目 オフピーク ピーク
V4-Pro入力(キャッシュヒット)¥0.025 / $0.0035 / 1M2倍
V4-Pro入力(キャッシュミス)¥3.00 / $0.435 / 1M¥6.00 / $0.87
V4-Pro出力¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash入力(キャッシュヒット)¥0.02 / $0.0028 / 1M2倍
V4-Flash入力(キャッシュミス)¥1.00 / $0.14 / 1M¥2.00 / $0.28
V4-Flash出力¥2.00 / $0.28 / 1M¥4.00 / $0.56

コストを最大化して節約する4つの方法:

  • 非リアルタイムタスクをオフピークに:バッチ文書処理、データラベリング、コードレビューを18:00以降または9:00前にスケジュール
  • キャッシュヒットを活用:繰り返しSystem PromptでPrompt Cacheを構築。Flashキャッシュヒットは$0.0028/Mでほぼ無料
  • Flashでルーティング:簡単な意図認識・ルーティング判断はV4-Flash、複雑な推論はV4-Proへ
  • 請求通知を事前取得:DeepSeekは課金変更の24時間前にメール通知を約束

ピーク時でもV4-Pro出力価格($1.74/M)はClaude Opus 4.8($15/M)より8.6倍安く、GPT-5.6 Sol(約$15/M)と同等の倍率です。

05

⚠️ 重要警告:旧モデル名 deepseek-chatdeepseek-reasoner2026年7月24日 15:59 UTC(北京時間7月24日 23:59) に永久停止します。

旧APIから新モデルへの移行マッピング
旧モデル名 新モデル名 備考
deepseek-chatdeepseek-v4-flash(非思考モード)高速、軽量タスク向け
deepseek-reasonerdeepseek-v4-flash(思考モード)または deepseek-v4-pro へアップグレードでより強力な推論
  1. 全リポジトリで旧モデル名を検索:コードリポジトリ、CI設定、環境変数で deepseek-chatdeepseek-reasoner を検索し、すべての呼び出し箇所をリスト化します。
  2. 移行先を決定:軽量チャットは deepseek-v4-flash(Non-think)。旧reasonerシーンはFlash思考モードまたは deepseek-v4-pro へアップグレード。
  3. OpenAI SDK呼び出しを更新:model パラメータを新名称に変更。思考モードは extra_body で有効化。
  4. Anthropic SDK互換性を検証:base_urlhttps://api.deepseek.com のまま、model のみ更新。
  5. Staging環境で負荷テスト:7月24日までにオフピークとピークの両方で課金を検証し、Prompt Cacheヒット率を確認します。
  6. 本番切り替えとモニタリング:新モデル名でカナリアデプロイ、エラー率とトークンコストを監視。期限前までロールバック窓を確保。
migrate_deepseek_v4.py
# ❌ 旧写法(7月24日以降無効)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# ✅ 新写法 — OpenAI SDK
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

# ✅ Anthropic SDK 互換
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

06

  • SWE-bench Verified:80.6%——現時点のオープンソースモデル最高スコア、Gemini 3.1 Proと並列
  • 1MコンテキストKV Cache:V3.2の10%(Flash 7%)、推論FLOPsはV3.2の27%
  • V4-Pro出力価格:オフピーク $0.87/M、ピーク $1.74/M——クローズドソース旗艦の約1/10〜1/100
  • Artificial Analysis 1タスクあたりコスト:V4-Pro $0.03 vs Fable 5 $3.48(116倍差)
  • API移行期限:2026-07-24 15:59 UTC
  • ライセンス:MIT、セルフホストとデータ国内保持に対応

間違いなく、DeepSeek V4 GAは2026年オープンソース大規模言語モデル分野で最も重要なマイルストーンの一つです。その価値はClaude Fable 5やGPT-5.6をすべての難タスクで打ち負かすこと(現時点ではまだできない)にあるのではなく、クローズドソース旗艦の1/10〜1/100のコストで、オープンソースモデル中で議論の余地のない最高性能を提供することにあります。ピーク課金はコストの複雑さを増しますが、本質的には依然として極めて競争力があります——「価格破壊者」から「ルールに基づく商用プラットフォーム」への成熟化のシグナルです。

以下が主要な参考来源です。料金、モデル能力、移行ポリシーは随時更新される可能性があるため、リリース後に再度リンクを確認してください。

公式・技術ドキュメント:

DeepSeek API 公式ドキュメント

arXiv:2606.19348 — DeepSeek V4 技術論文

第三者ベンチマークと分析:

Artificial Analysis — モデルコストパフォーマンス評価

HuggingFace — DeepSeek モデルページ

DeepSeek V4 AgentをXcode・Metalツールチェーンとともに安定した物理マシン上で長期稼働させるチームにとって、純粋なAPI呼び出しは依然としてネットワーク遅延とクォータ変動に直面します。共有VM / クラウド仮想MacはHypervisorオーバーヘッドとiOS CI互換性の問題があります。本番環境でゼロオーバーヘッドのApple Silicon、7×24稼働、安定したiOS CI/CDとAI Agent自動化(例:ベアメタルMac上でClaude Code / Codexを永続実行し、マルチモデルAPIルーティングと連携)が必要な場合、ZUKCLOUD ベアメタル Mac mini クラウドノードが通常より制御しやすい選択肢です——専用物理マシン、仮想化オーバーヘッドなし、日/週/月の柔軟な課金。料金注文をご確認いただくか、ベアメタルアーキテクチャ宣言DeepSeek 計算インフラの記事でAgent級ホスティングロジックをご覧ください。

現在 deepseek-chat を使用している場合は、7月24日までにAPI移行を完了してください。さもないとサービスが中断されます。