2026 年 7 月 31 日,DeepSeek 将 V4-Flash 升级为官方正式版(build 0731):参数规模不变,仅靠重新后训练就让 Agent 跑分反超自家更大的 V4-Pro 预览版,API 价格仅为 Claude Opus 4.8 的几十分之一。如果你是一名需要大规模低成本调用、正在评估 Agent 流水线选型的 AI 开发者或产品团队负责人,本文从完整时间线、核心定价对比、后训练与 Harness 架构拆解、中国开源大模型横向对比,以及跑分争议与「斩杀线」行业背景五个维度做完整解读——帮你判断 Flash 正式版是否值得立刻切换,以及旗舰 V4-Pro 官方版还要等多久。
01 DeepSeek V4 Flash 正式版上线:开发者面临的三重紧迫压力
这不是一次新模型发布,而是同一个 284B 参数模型重新做了一遍后训练。真正的旗舰 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍处于「即将发布」状态。在兴奋之余,生产环境开发者需要立刻正视以下痛点:
- API 与 App 不同步:7 月 31 日正式版仅限 API 公测,App 和网页端暂未同步更新——用网页版体验的用户可能误判「正式版没变化」。
- 旧模型名已停用:7 月 24 日
deepseek-chat与deepseek-reasoner已正式退役,未迁移的集成会在生产环境直接报错。 - 跑分与真实体验存在落差:官方 Agent 跑分全部基于尚未公开发布的 Harness「极简模式」测得,海外开发者社区还反馈了缓存命中率偏低、安全分类器偶发超时等问题。
- 竞争窗口极窄:7 月 27 日 Kimi K3 开源权重上线,8 月 2 日 Qwen3.8-Max GA——中国开源大模型进入「六边形混战」,选型决策不能再拖。
完整时间线如下:
- 2026 年 4 月 24 日:DeepSeek-V4 预览版首次发布并开源,含 V4-Pro(1.6T/49B 激活)与 V4-Flash(284B/13B 激活),均支持 100 万 token 上下文,MIT 协议。
- 2026 年 7 月 24 日:旧接口
deepseek-chat/deepseek-reasoner正式停用,全部流量切换至 V4 系列命名。 - 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力。
- 2026 年 7 月 31 日:V4-Flash-0731 正式版进入 API 公测,开源权重同步上线 Hugging Face;changelog 首次点名自研 Agent 框架「Harness」。
- 截至 2026 年 8 月 5 日(发稿时):V4-Pro 官方版仍是「尽快发布」,无官方确认日期;有媒体援引未署名消息源称 8 月 10–20 日 GA——未经 DeepSeek 官方证实,仅供参考。
02 核心数据一览:V4-Flash-0731 定价与竞品对比
| 模型 | 状态 | 总参数 / 激活 | 输入价格(缓存未命中/命中,每百万 token) | 输出价格 |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(07-31) | 284B / 13B | $0.14 / $0.0028 | $0.28 |
| DeepSeek-V4-Pro | 预览版(官方版未发布) | 1.6T / 49B | $0.435 / $0.003625 | $0.87 |
| Kimi K3 | 权重开源(07-27) | 2.8T / ~104B(社区估算) | $3.00 / $0.30 | $15.00 |
| Qwen3.8-Max | API GA(08-02),权重待放出 | 2.4T / 95B | $2.00 / ~$0.17–0.25 | $6.00 |
| 协议 | Flash / Pro 预览版均为 MIT;Kimi K3 含商用附加条款 | |||
以上定价均为厂商自报公开数据。DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期。
03 深度拆解:后训练、DSA 架构与 Harness 框架
架构没有变,变的是后训练。V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同,DeepSeek 官方明确说明性能提升「完全来自重新进行的后训练」。284B/13B 的 Flash 在多项 Agent 基准上反而超过了 1.6T/49B 的 V4-Pro 预览版——2026 年下半年大模型竞争,后训练数据质量的重要性正在逼近甚至超过单纯堆参数。
根据技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架构三处关键改动:
- 混合注意力(DSA):结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),降低长上下文场景的计算与显存开销;
- 流形约束超连接(mHC):对传统残差连接结构做了改进;
- Muon 优化器:替换传统优化器,提升训练收敛速度与稳定性。
DeepSeek 官方数据(尚未见独立第三方复现):在 100 万 token 上下文下,V4-Pro 相比 V3.2 单 token 推理所需 FLOPs 仅为 27%,KV Cache 占用仅为 10%。
Harness 首次亮相:7 月 31 日 changelog 第一次正式出现「DeepSeek Harness」——自研 Agent 执行框架,对标 Claude Code。此前 DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分(Terminal Bench 2.0 拿到 82.7 分,反超 V4-Pro 预览版 67.9)全部基于 Harness「极简模式」(max 档位、top_p=0.95、temperature=1.0)测得。官方主动提示:「跑分对 harness 的选择非常敏感」——这句话值得读者留意。
04 中国开源大模型六边形混战与六步 API 选型指南
| 模型 | Intelligence Index(第三方) | 单任务平均成本(第三方) | 备注 |
|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 50 | $0.03 | 07-31 官方版 |
| Kimi K3 | 57 | $0.86 | 07-27 权重开源 |
| GPT-5.6 Sol | 比 Flash 高 9+ 分 | $1.86 | 闭源 |
| Claude Fable 5 | 比 Flash 高 9+ 分 | $3.15 | 闭源 |
| 性价比结论 | Flash 智能分非最高,但单任务成本约为 Kimi 的 1/29、Claude 的 1/105——打的是「够用智能 + 极致价格」 | ||
据 OpenRouter 7 月排行榜,V4-Flash 预览版曾连续七周稳坐调用量第一——目标用户是需要大规模调用、对绝对智能上限没那么敏感的 Agent 和批量任务场景。
评估是否将生产 Agent 工作流迁移到 V4-Flash-0731 之前,建议按以下六步自检:
- 确认旧模型名已迁移:检查代码中是否仍引用
deepseek-chat或deepseek-reasoner,统一替换为deepseek-v4-flash或deepseek-v4-pro。 - 验证 API 端点兼容性:若使用 OpenAI ChatCompletions 或 Anthropic 格式接入,确认无需改代码——
deepseek-v4-flash会自动指向 0731 官方版。 - 设计缓存策略:缓存命中价 $0.0028/百万 token 极具吸引力,但海外开发者反馈正式版缓存命中率偏低——在业务侧实现 prompt 前缀复用与稳定 system prompt。
- 预留峰谷计费缓冲:DeepSeek 已预告北京时间 9–12 点、14–18 点高峰 2 倍加价,将批处理任务调度至低谷时段可显著降本。
- 用真实 Agent 链路做 A/B 测试:不要仅凭 Terminal Bench 等 Harness 依赖跑分迁移;用 Claude Code、Cursor 等自有工具链在真实代码库上盲审对比。
- 评估 Agent 运行环境:若需在 Mac 上稳定运行 Claude Code、OpenCode 等工具链做联调,确保底层是裸金属 Apple 硬件——详见定价页与下单页。
05 争议点、斩杀线背景、FAQ 与决策结论
几个值得明确标注、避免被过度解读的地方:
- 跑分依赖 Harness,官方自己都在提醒别只看数字。Terminal Bench 2.0 等 Agent 类跑分基于尚未公开发布的 Harness 极简模式,在独立社区复现之前应视为「厂商自报 + 特定框架」结果。
- 海外开发者反馈了具体可用性问题。据 21 世纪经济报道援引的社区反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。
- V4-Pro 与 Harness 上线时间未经证实。中文媒体流传的「8 月 10–20 日 GA」均为未署名消息源,DeepSeek 官方 changelog 原话只是「将尽快发布」。
- 融资与 IPO 传闻需谨慎对待。多家媒体报道约 74 亿美元融资、487 亿美元估值等信息,目前尚无 DeepSeek 官方或监管备案文件直接确认。
更值得关注的是中文开发者社区流传的「斩杀线」概念:DeepSeek 凭借「够用的性能 + 极端低价」给同行设下门槛——友商若性能没有明显超过 DeepSeek、又拿不出更低价格,就会在市场上失去存在感。这也解释了同期 GPT-5.6 Luna 降价 80% 等密集调价。V4-Flash 上线当天(7 月 31 日),英伟达、博通、AMD 等算力芯片股并未明显波动——市场已习惯「DeepSeek 式效率突破」,与 2025 年初 R1 发布时引发全球 AI 芯片股下跌形成鲜明对比。
在 Pro 版本迟迟未兑现「7 月中旬全量上线」预期时,中文 AI 社区曾把梁文锋戏称为「梁白开」;Flash-0731 超出预期后,「梁圣」称号又被还了回去——戏谑式昵称反转,是观察中国 AI 社区情绪风向的有趣侧面。
DeepSeek V4 和 V3.2 相比,最大的区别是什么?
最直接的区别是原生支持 100 万 token 上下文,且长上下文场景下计算和显存开销大幅降低(官方数据:V4-Pro 在百万 token 下所需 FLOPs 仅为 V3.2 的 27%,KV Cache 仅为 10%)。此外 V4 系列在 Agent 能力上做了专项优化,适配 Claude Code、OpenCode 等主流 Agent 工具。
日常使用应该选 V4 Flash 还是 V4 Pro?
如果只是普通对话、简单任务或需要大规模低成本调用(批量处理、Agent 流水线),V4-Flash-0731 官方版性价比更高,且 Agent 跑分已反超 V4-Pro 预览版。若任务涉及更深的世界知识或复杂推理且预算不敏感,可先用 V4-Pro 预览版,等官方版上线后再评估。
现在能用上 V4 Pro 官方版吗?
截至 2026 年 8 月 5 日,还不能。目前官方版只有 V4-Flash-0731,且仅限 API,App 和网页端仍是旧版本。V4-Pro 官方版和 Harness 官方口径是「尽快发布」,网上流传的「8 月 10–20 日」未经证实。
DeepSeek 公布的跑分能直接相信吗?
建议区分对待。SWE-bench Verified 等被广泛采用的第三方基准可信度相对较高;但 Terminal Bench 2.0 等 Agent 类跑分是用自研且未公开的 Harness 测出来的,官方也提示对框架选择高度敏感,建议等社区用 Claude Code、Cursor 等独立复现后再下结论。
这次更新对普通开发者有什么实际影响?
若用 OpenAI 或 Anthropic 格式 API 接入 DeepSeek,不需要改代码,deepseek-v4-flash 会自动指向新官方版。若此前用已停用的 deepseek-chat/deepseek-reasoner,需尽快切换到新命名。
可引用硬核数据:
- V4-Flash-0731 规格:284B 总参数 / 13B 激活,1M 上下文,MIT 协议
- API 定价:输入 $0.14(缓存未命中)/ $0.0028(命中),输出 $0.28 / 百万 token
- Terminal Bench 2.0:82.7(Harness 极简模式,厂商自报)vs V4-Pro 预览版 67.9
- 长上下文效率(厂商自报):V4-Pro 百万 token 下 FLOPs 为 V3.2 的 27%,KV Cache 为 10%
- Artificial Analysis:Intelligence Index 50,单任务成本 $0.03(约为 Claude Fable 5 的 1/105)
- 对比 Claude Opus 4.8(据 21 世纪经济报道):缓存未命中输入约便宜 36 倍,缓存命中约 179 倍,输出约 89 倍
官方与第三方参考来源(发版后请再次打开链接核对):
Hugging Face — DeepSeek-V4-Flash 模型卡
Artificial Analysis — 独立模型评测数据
21 世纪经济报道 — DeepSeek V4 正式版相关报道
云端 API 看似便宜,直到Harness 依赖跑分无法横向套用、缓存命中率不及预期、以及 Agent 工具链在不稳定虚拟化环境中频繁中断在发版窗口期集中暴露。对于需要零损耗原生算力、稳定 iOS CI/CD 与 Claude Code / OpenCode 等 Agent 工具 7×24 自动化的生产环境,ZUKCLOUD 的裸金属 Mac mini 云端节点通常是更优解:真实 Apple 硬件、完整 Root 权限、无 Hypervisor 损耗。前往定价页查看当前方案,或阅读裸金属架构宣言与DeepSeek V4 满血版 GA 解读。模型可以等 Pro 官方版,Agent 基础设施不能等——先把跑 Agent 的 Mac 节点稳住,再谈迁移哪家 API。