首页 / 博客 / Qwen3.8-Max
ENGINEERING BLOG · 2026.08.04

阿里 Qwen3.8-Max 发布:
2.4 万亿参数冲进 Arena 前五,「开源」标签背后的争议

2026 年 8 月 3 日,阿里巴巴正式发布旗舰大模型千问 Qwen3.8-Max:总参数 2.4 万亿、激活 950 亿100 万 token 上下文,同步上线 Agent 产品「千问办公」。如果你是一名关注前沿大模型选型的 AI 开发者或 Agent 基础设施负责人,本文一次讲清楚发布时间线、核心跑分、与 Kimi K3/DeepSeek V4 的横向对比,以及「开源」标签为何引发争议结论先行:Qwen3.8-Max 在 Arena 文本竞技场排名第 5(1496 分,标注 Preliminary),是前 8 名中唯一的非 Anthropic 模型;但截至发稿,权重尚未开源,所有跑分均来自阿里自测,第三方权威平台尚未收录正式复现结果。

01

2026 年 7–8 月,中国大模型赛道进入「万亿参数周」——几乎每周都有重磅发布,透明度与跑分可信度成为开发者最关心的问题:

  • 7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 专家中激活 16 个),主打独立评测与透明技术报告。
  • 7 月 19 日:Qwen3.8-Max 以「预览版」先行开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但未公布激活参数量、未提供跑分表,服务条款明确禁止自动化生产环境调用。
  • 7 月 27 日:Kimi K3 按承诺时间开源权重,上线 Hugging Face,并同步开源部分底层基础设施(注意力内核、MoE 通信库等)。
  • 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,在参数规模不变的前提下,靠架构与训练优化让智能体、代码类基准大幅超过自家上一代 V4-Pro 预览版。
  • 8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 产品同步上线,对标腾讯 WorkBuddy、Moonshot Kimi Work。当天阿里巴巴港股上涨约 7%,美股上涨约 4.5%。
  • 预计 8 月 10 日前后(官方口径「下周」):Qwen3.8-Max 及其精简版 Qwen3.8-27B 的权重计划登陆 Hugging Face 与 ModelScope,但截至发稿,具体日期与开源协议条款均未公布。

预览版阶段的透明度缺口——未公开激活参数、无 model card、禁止生产环境自动化调用——是多家独立评测机构在 7 月点名批评「信息不足」的原因之一。GA 阶段虽补充了 950 亿激活参数与完整跑分表,但第三方复现仍待观察。

02

Qwen3.8-Max 核心规格(2026 年 8 月 3 日 GA)
项目 Qwen3.8-Max
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价(国际)输入 $2/百万 token,输出 $6/百万 token
API 定价(国内)输入 12 元/百万 token,输出 36 元/百万 token
Arena 文本竞技场(8/1 快照)第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型
Arena 视觉竞技场第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代提升 28.2 分)
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0)
权重开源状态承诺「下周」,截至发稿未上线

表中带「阿里自测」标注的数据均来自阿里官方发布材料,尚无 Artificial Analysis、Arena.ai 等第三方平台的正式复现结果。

03

为什么是 MoE + 混合注意力,而不是单纯堆参数? Qwen3.8-Max 延续 Qwen3.5 的架构路线,通过稀疏 MoE 把总参数做到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这也是阿里能把 API 定价压到每百万 token 输入 $2、输出 $6,明显低于 Claude Opus 5($5/$25)和 Claude Fable 5($10/$50)的原因。

reasoning_effort 三档设计:模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可按任务复杂度调节速度与深度,支持通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用。

长程自主任务是本次发布的核心卖点:阿里给出的案例包括 16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化任务,以及自建的 RecreationBench——让模型在完全黑盒环境下仅凭交互和视觉反馈还原真实应用。部分过程记录在 GitHub 的 qwen-code-dev-bot/oh-my-cli 可查,但并非完整可复现的第三方审计。

生态卡位:Qwen3.8-Max 同步接入「千问办公」Agent 平台,API 同时兼容 OpenAI 和 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链——降低迁移成本,也是阿里抢占 Agent 生态位置的信号。值得注意的是,千问系列已通过与苹果的合作成为国行 Apple Intelligence 的核心生成式 AI 引擎。

04

旗舰大模型横向对比(2026 年 8 月初)
模型 总参数/激活 定价(输入/输出,每百万 token) 权重开源 独立第三方评测
Qwen3.8-Max 2.4T / 950 亿 $2 / $6 未开源(承诺中) 暂无
Kimi K3 2.8T / 约 500 亿 $3 / $15 已开源(7/27) Artificial Analysis ≈ 57.11
DeepSeek V4-Flash 较 V4-Pro 未变 未公开完整表 已开源 9 项智能体/代码基准超 V4-Pro
Claude Fable 5 未公开 $10 / $50 闭源 Arena 文本竞技场第 1 名
独立盲测(269 文件架构任务) Kimi K3 83 分 vs Qwen3.8-Max 预览版 80 分——同档位、互有胜负

在评估是否将生产 Agent 工作流迁移到 Qwen3.8-Max 之前,建议按以下六步自检:

  1. 明确工作负载类型:编码 Agent、多模态文档理解、还是长程自主任务?对照 SWE-bench Pro(67.7)与 HLE(43.6)等分项,而非只看总分。
  2. 核对 API 协议兼容性:确认现有工具链(Claude Code、OpenClaw、Codex)是否支持 OpenAI 或 Anthropic 兼容端点,并测试 reasoning_effort 档位对延迟的影响。
  3. 对比总拥有成本:以月均 10 亿 input + 2 亿 output token 估算,Qwen3.8-Max 约 $32/月,Kimi K3 约 $60/月——但需计入缓存命中率与失败重试成本。
  4. 等待或验证开源权重:若需本地私有化部署,关注 8 月 10 日前后 Hugging Face / ModelScope 仓库与许可证条款;完整版 2.4T 需数据中心级硬件,普通开发者更现实的选择是 Qwen3.8-27B。
  5. 在自己的业务场景做 A/B 测试:不要仅凭厂商自报跑分迁移生产系统;用真实代码库、真实 Agent 链路做盲审对比。
  6. 评估 Agent 运行环境:若需在本地 Mac 上稳定运行 Claude Code、OpenClaw 等 Agent 工具链做联调,确保底层是裸金属 Apple 硬件而非虚拟化环境——详见定价页下单页

05

这次发布最值得警惕的一点,不是性能,而是信息披露的时间差

  • 官网已标注「Open-Source」,但权重还没有发布。 qwen.ai 在 GA 当天就打上了开源标签,但 Hugging Face 和 ModelScope 上尚无对应仓库或许可证条款。
  • 所有跑分均来自阿里自建测试框架,包括 QwenSWEBench、RecreationBench 等内部基准;Arena 上的 1496 分标注为「Preliminary」。
  • 跑分表脚注暗指竞品数据存疑:「Fable 5 的结果可能涉及 fallback」——缺乏技术细节支撑,而阿里自己的测试方法论同样未公开到可供第三方复现的程度。
  • 预览阶段透明度不足:7 月 19 日预览版禁止生产环境自动化调用,多家独立评测机构当时建议「先在自己的业务场景里测试」。

往大了看:2026 年是万亿参数模型的「扩产年」,但 DeepSeek V4-Flash 已证明「不靠堆参数也能大幅提升智能体能力」——参数竞赛的叙事正在被「架构效率竞赛」取代。阿里罕见地承诺开源 Max 级模型权重,与 Kimi K3、DeepSeek 一起构成国产大模型「头部厂商集体转向开放权重」的格局。发布当天阿里港股涨约 7%、美股涨约 4.5%,资本市场用真金白银投票;同一周,OpenAI 与 Anthropic 披露 Agent 安全评测「越狱」事件,白宫 8 月 4 日召集巨头商讨自愿性网络安全测试框架——中美 AI 叙事形成鲜明对照。

Qwen3.8-Max 现在能直接用吗?开源了没有?

API 已可通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,官网虽标注「Open-Source」,实际 Hugging Face/ModelScope 仓库与开源协议条款要等到官方口径的「下周」(预计 8 月 10 日前后)。

Qwen3.8-Max 和 Kimi K3 到底谁更强?

目前没有权威的统一评测。唯一可比的独立盲测显示两者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 预览版 80 分),属于「同档位、互有胜负」。Kimi K3 优势是已开源、有第三方评测;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。

2.4 万亿参数是不是意味着普通开发者根本用不起?

需区分总参数和激活参数。实际激活 950 亿,通过 API 调用成本接近千亿级模型。本地私有化部署完整版需多节点数据中心级硬件;更现实的选择是等待 Qwen3.8-27B 开源权重。

阿里公布的跑分能信吗?

可作为参考,不能当作定论。所有数据目前均来自阿里自建测试框架,尚无中立平台对正式版给出独立复现。建议关注后续独立评测,或在自己的业务场景做 A/B 测试。

这次发布对普通用户有什么实际影响?

开发者能拿到更便宜的旗舰级 API;消费端方面,苹果国行 Apple Intelligence 的生成式 AI 能力基于千问模型(经压缩后本地运行),国内 iPhone 用户将在系统层面直接用到千问系列能力。

可引用硬核数据:

  • 总参数 / 激活参数:2.4 万亿 / 950 亿(MoE 稀疏激活约 4%)
  • API 定价:国际 $2/$6 per M tokens;国内 12/36 元 per M tokens
  • Arena 文本竞技场:第 5 名,1496 分(Preliminary,8/1 快照)
  • 独立盲测:Kimi K3 83 vs Qwen3.8-Max 预览版 80(269 文件架构任务)
  • 资本市场:发布日阿里港股 +7%、美股 +4.5%
  • 开源承诺:Qwen3.8-Max + Qwen3.8-27B,预计 8 月 10 日前后

官方与第三方参考来源(发版后请再次打开链接核对):

Alibaba Cloud — Qwen3.8-Max 官方新闻稿

Arena.ai — 文本/视觉竞技场公开排行榜

Alibaba Cloud Community — Qwen3.8-Max 技术博客

TechCrunch — Apple Intelligence 中国版与千问合作报道

云端 API 看似便宜,直到厂商自报跑分无法独立验证、开源标签先于权重上线、以及 Agent 工具链在不稳定虚拟化环境中频繁中断在发版窗口期集中暴露。对于需要零损耗原生算力、稳定 iOS CI/CD 与 Claude Code / OpenClaw 等 Agent 工具 7×24 自动化的生产环境,ZUKCLOUD 的裸金属 Mac mini 云端节点通常是更优解:真实 Apple 硬件、完整 Root 权限、无 Hypervisor 损耗。前往定价页查看当前方案,或阅读裸金属架构宣言Kimi K3 全面开源解读模型选型可以等第三方跑分,Agent 基础设施不能等——先把跑 Agent 的 Mac 节点稳住,再谈迁移哪家 API。