首頁 / 部落格 / V4-Flash
ENGINEERING BLOG · 2026.08.05

DeepSeek V4-Flash-0731 正式版:
官方 Benchmark 解讀、定價對比與 API 遷移指南

2026 年 7 月 31 日,DeepSeek 正式推出 V4-Flash-0731(API 專用,權重未開源):沿用 4 月預覽版的 284B 總參數/13B 激活 架構,僅靠後訓練(post-training) 就在多項 Agent 基準上超越自家 V4-Pro 預覽版。本文面向AI 工程師、Agent 基礎設施負責人與預算敏感的獨立開發者,一次講清楚4–8 月時間線、官方定價表、Artificial Analysis 橫向對比、Harness 評測爭議,以及從 deepseek-chat 遷移的實操步驟結論先行:Flash-0731 以每任務約 $0.03 的成本提供 Intelligence Index 50 分的水準,性價比極高;但 V4-Pro 正式版與 Harness 框架截至 8 月 5 日仍未釋出,跑分高度依賴評測 Harness,不宜在未驗證前全面替換生產 Agent 鏈路。

01

2026 年 4 月至 8 月初,DeepSeek 與國產大模型賽道節奏極快——幾乎每週都有模型迭代或介面下線,開發者若未跟進,生產服務可能在 48 小時內中斷:

  • 4 月 24 日:DeepSeek V4 預覽版上線,284B/13B MoE 架構首次公開,Agent 能力引發社群關注。
  • 7 月 24 日:舊介面 deepseek-chatdeepseek-reasoner 正式退役;未遷移的生產服務直接 404。詳見V4 滿血版發布解讀
  • 7 月 27 日:月之暗面按承諾開源 Kimi K3 權重,2.8T MoE 登陸 Hugging Face,國產開源陣營再增一員。
  • 7 月 31 日:V4-Flash-0731 正式版 API 上線;同日 DeepSeek 首次提及 Harness 評測框架,Agent 基準分數對 Harness 配置高度敏感。
  • 8 月 3 日:阿里 Qwen3.8-Max GA,2.4T 參數衝進 Arena 前五,國產旗艦競爭進入「萬億參數週」。
  • 8 月 5 日(本文發稿):V4-Pro 正式版與 Harness 框架仍未釋出;社群傳聞 8 月 10–20 日發布,官方未確認。

在興奮之餘,生產環境開發者需正視以下痛點:

  • 評測 Harness 依賴:官方 Agent 基準採「minimal mode」Harness 配置,分數對工具鏈版本、終端模擬器設定極度敏感——第三方複現難度高。
  • 快取命中率波動:7 月 31 日發布後,部分開發者回報 API 快取命中異常,導致實際帳單高於預期;需自行監控 token 消耗與快取策略。
  • V4-Pro 正式版真空期:Flash-0731 已超越 V4-Pro 預覽版,但旗艦 Pro 正式版與完整 Harness 仍缺席,長上下文(1M token)場景的 FLOPs 優勢無法驗證。
  • 開源權重缺席:Flash-0731 僅提供 API,無本地私有化部署路徑;對資料合規或離線推理有要求的團隊需另尋 Kimi K3 等開源方案。
  • 峰谷計費疊加:若 Agent 流水線 24×7 運行,需預留北京時間尖峰時段(09:00–12:00、14:00–18:00)費率翻倍的成本緩衝。

社群暱稱「梁白開/梁圣」的 DeepSeek 創辦人團隊,以「後訓練碾壓預覽版 Pro」再次刷新國產模型「斩杀线(kill line)」敘事——但 7 月 31 日發布當天,相關 AI 晶片概念股反應平淡,資本市場對「參數不變、分數大漲」的敘事已趨於理性。

02

DeepSeek V4-Flash-0731 核心規格(2026 年 7 月 31 日正式版)
項目 V4-Flash-0731
發布日期2026 年 7 月 31 日(API 正式版)
總參數 / 激活參數284B / 13B(與 4 月預覽版相同)
能力提升來源純後訓練(post-training),架構未變
架構CSA + HCA(DSA 稀疏注意力)、mHC、Muon 優化器
權重開源否(僅 API)
輸入定價(未命中 / 快取命中)$0.14 / $0.0028 每百萬 token
輸出定價$0.28 每百萬 token
Agent 基準 vs V4-Pro 預覽版多項官方基準超越 V4-Pro 預覽版
Artificial Analysis Intelligence Index50 分(第三方)
V4-Pro 正式版 / Harness 框架截至 2026 年 8 月 5 日仍未發布

廠商報告指出,V4-Pro 在 100 萬 token 上下文場景下,相較 V3.2 的 FLOPs 降低 27%、KV Cache 佔用降低 10%——但上述數據來自 DeepSeek 官方材料,Flash-0731 是否繼承同等長上下文效率,需等 Pro 正式版釋出後才能交叉驗證。

03

為什麼參數不變,Agent 分數卻大漲? V4-Flash-0731 沿用 4 月預覽版的 284B/13B MoE 骨架,能力提升完全來自後訓練階段的資料配方、強化學習與工具使用對齊——這與 DeepSeek 一貫的「架構效率優先」路線一致,也解釋了為何 Flash 能以極低 API 定價提供接近旗艦的 Agent 體驗。

CSA + HCA(DSA 稀疏注意力):DeepSeek 自研的稀疏注意力機制,透過 Content- Sparse Attention 與 Head-Content Attention 的組合,在長上下文場景下控制計算量。廠商稱 V4-Pro 在 1M token 下 FLOPs 較 V3.2 降 27%,Flash-0731 是否完整繼承此優化尚待 Pro 正式版驗證。

mHC 與 Muon 優化器:mHC(multi-Head Composition)強化多頭注意力的表達效率;Muon 則是 DeepSeek 在訓練穩定性上的重要創新,降低大規模 MoE 收斂難度。這些底層改進在 4 月預覽版已嵌入,Flash-0731 的躍升主要來自後續對齊與工具鏈訓練。

Harness 框架:7 月 31 日首次提及,評測爭議核心:DeepSeek 在 Flash-0731 發布時同步介紹 Harness——一套用於 Agent 基準評測的工具鏈框架。官方 Agent 跑分採「minimal mode」配置,分數對 Harness 版本、終端模擬器、工具權限設定高度敏感。這意味著:

  • 同一模型在不同 Harness 配置下,Terminal Bench、SWE-bench 等分數可能相差數個百分點。
  • 第三方機構(如 Artificial Analysis)使用自有 Harness,結果與官方數字不可直接對照。
  • Harness 框架本身截至 8 月 5 日未對外開源,開發者無法在本地復現官方基準環境。

若你的 Agent 工作流依賴 Claude Code、OpenClaw 等工具鏈,建議參考OpenRouter 7 月模型排行中的實際呼叫量與延遲數據,而非僅看廠商自報 Harness 分數。

04

國產旗艦大模型橫向對比(2026 年 8 月初)
模型 總參數 / 激活 輸入定價(未命中 / 命中,每百萬 token) 輸出定價(每百萬 token) Intelligence Index 每任務成本(估算)
DeepSeek V4-Flash-0731 284B / 13B $0.14 / $0.0028 $0.28 50 ≈ $0.03
DeepSeek V4-Pro 預覽版 未公開完整規格 $0.435 / $0.003625 $0.87
Kimi K3 2.8T / 約 500 億 $3 / $0.30 $15 57 ≈ $0.86
Qwen3.8-Max 2.4T / 950 億 $2(無分檔) $6 ≈ $1.86
GPT-5.6 Sol 閉源 +9 vs Flash ≈ $3.15
Claude Fable 5 閉源 +9 vs Flash 更高
性價比結論 Flash-0731 以 Index 50、每任務 $0.03 提供最高 CP 值;Kimi K3(57 分)與 GPT-5.6 Sol/Fable 5(+9 分)能力更強但成本高 28–105 倍

在將生產 Agent 工作流遷移至 V4-Flash-0731 之前,建議按以下六步自檢:

  1. 確認舊介面已下線:檢查程式碼與 CI 設定中是否仍引用 deepseek-chatdeepseek-reasoner;7 月 24 日後這兩個端點已永久停用,未遷移的請求會直接失敗。
  2. 切換模型名稱:輕量對話改用 deepseek-v4-flash(非思考模式);原 reasoner 場景選 Flash 思考模式,或等待 V4-Pro 正式版上線後升級至 deepseek-v4-pro
  3. 設計快取策略:Flash-0731 輸入定價分未命中($0.14/M)與快取命中($0.0028/M)兩檔,差距達 50 倍;對重複 system prompt 或固定上下文場景,啟用 API 快取可大幅壓低成本。
  4. 預留尖峰時段溢價:若 Agent 流水線 24×7 運行,北京時間 09:00–12:00 與 14:00–18:00 費率翻倍;排程非緊急批次任務至離峰時段,或設定成本告警閾值。
  5. 在業務場景驗證 Benchmark:不要僅憑官方 Harness 分數遷移;用真實程式碼庫、真實 Agent 鏈路做 A/B 測試,對照 Artificial Analysis 等第三方 Index 與實際 token 消耗。
  6. 穩定 Agent 執行環境:若需在 Mac 上穩定運行 Claude Code、OpenClaw 等 Agent 工具鏈做聯調與 Benchmark 複現,確保底層為裸機 Apple 硬體而非虛擬化環境——詳見定價頁下單頁

05

Flash-0731 發布後,社群與媒體圍繞以下爭議展開討論:

  • Harness 依賴性:官方 Agent 基準分數對 Harness 配置極度敏感,第三方難以在相同條件下複現;Artificial Analysis 使用自有評測流程,Index 50 與官方數字不可直接對照。
  • 快取命中異常:部分開發者回報 7 月 31 日後 API 快取命中率波動,實際帳單高於預期;建議在遷移初期密切監控 token 帳單與快取命中率指標。
  • V4-Pro 發布日期謠言:社群傳聞 8 月 10–20 日釋出 V4-Pro 正式版與 Harness 框架,DeepSeek 官方截至 8 月 5 日未確認任何日期。
  • 融資傳聞:部分媒體報導 DeepSeek 新一輪融資消息,官方未予證實或否認,不應作為技術選型依據。

可引用硬核數據:

  • 總參數 / 激活參數:284B / 13B(與 4 月預覽版相同,能力提升 100% 來自後訓練)
  • API 定價:輸入 $0.14(未命中)/ $0.0028(快取命中),輸出 $0.28 每百萬 token
  • Artificial Analysis Intelligence Index:Flash-0731 50 分;Kimi K3 57 分;GPT-5.6 Sol 與 Claude Fable 5 各 +9 分
  • 每任務成本估算:Flash ≈ $0.03;Kimi K3 ≈ $0.86;Qwen3.8-Max ≈ $1.86;GPT-5.6 Sol ≈ $3.15
  • 長上下文效率(V4-Pro 廠商報告):1M token 下 FLOPs 較 V3.2 降 27%,KV Cache 降 10%
  • 發布狀態:V4-Pro 正式版與 Harness 框架截至 2026 年 8 月 5 日仍未釋出
V4-Flash-0731 和 4 月預覽版有什麼不同?

架構完全相同(284B/13B),能力提升 100% 來自後訓練階段的優化。官方 Agent 基準多項超越 V4-Pro 預覽版,但權重仍未開源,僅提供 API 呼叫。

V4-Pro 正式版什麼時候發布?

截至 2026 年 8 月 5 日,DeepSeek 官方未公布 V4-Pro 正式版或 Harness 框架的發布日期。社群傳聞 8 月 10–20 日,但未獲官方確認。建議關注 DeepSeek 官方公告,而非依賴謠言做架構決策。

Harness 是什麼?為什麼跑分有爭議?

Harness 是 DeepSeek 在 7 月 31 日首次提及的 Agent 基準評測框架。官方跑分採「minimal mode」配置,分數對工具鏈版本、終端設定高度敏感。第三方機構使用不同 Harness,結果不可直接對照;框架本身截至 8 月 5 日未開源。

Flash-0731 比 Kimi K3 和 Qwen3.8-Max 更值得選嗎?

取決於場景。Flash-0731 性價比最高(每任務 ≈ $0.03,Index 50),適合預算敏感、Agent 任務為主的場景。Kimi K3(Index 57、已開源權重)適合需本地部署或更高能力的場景;Qwen3.8-Max 多模態更強但成本更高。建議在真實業務場景做 A/B 測試,而非僅看 Index 分數。

deepseek-chat 已停用,我該怎麼遷移?

輕量對話改用 deepseek-v4-flash(非思考模式);原 reasoner 場景選 Flash 思考模式,或等待 V4-Pro 正式版。遷移時注意更新 API 端點、模型名稱,並重新測試快取策略與尖峰計費影響。詳細步驟見本文第四節六步指南,或參考V4 滿血版 API 遷移文

官方與第三方參考來源(發版後請再次開啟連結核對):

DeepSeek API 官方文件

Artificial Analysis — Intelligence Index 公開排行榜

OpenRouter — 模型呼叫量與延遲排行

DeepSeek Platform — 模型定價與 API 控制台

Flash-0731 的 API 定價極具吸引力,但Harness 依賴的跑分難以獨立驗證、快取策略失誤可能讓帳單翻數十倍、以及 V4-Pro 正式版真空期內長上下文場景無法對標,在發版窗口期會集中暴露。對於需要零損耗原生算力、穩定 iOS CI/CD 與 Claude Code/OpenClaw 等 Agent 工具 7×24 自動化的生產環境,ZUKCLOUD 的裸機 Mac mini 雲端節點通常是更優解:真實 Apple 硬體、完整 Root 權限、無 Hypervisor 損耗。前往定價頁查看目前方案,或閱讀裸機架構宣言Kimi K3 全面開源解讀模型選型可以等第三方跑分,Agent 基礎設施不能等——先把跑 Agent 的 Mac 節點穩住,再談遷移哪家 API。