首頁 / 部落格 / Qwen3.8-Max
ENGINEERING BLOG · 2026.08.04

阿里 Qwen3.8-Max 正式發布:
2.4 兆參數衝進 Arena 前五,權重下週開源

2026 年 8 月 3 日,阿里巴巴正式推出旗艦大模型 千問 Qwen3.8-Max(GA 全量可用),同步上線 Agent 產品「千問辦公」。模型總參數 2.4 兆、激活 950 億、上下文 100 萬 Token,在 Arena 文本競技場(8 月 1 日快照)位列 全球第五、1496 分——前八名中唯一非 Anthropic 模型。本文面向 AI 工程師、技術決策者與 Agent 工具鏈使用者,梳理發布時間線、核心跑分、與 Kimi K3/DeepSeek V4 的橫向對比,並拆解「Open-Source」標籤與實際權重釋出之間的時間差。結論先行:Qwen3.8-Max API 已可呼叫、定價具競爭力,但所有跑分均為阿里自測、權重尚未上線 Hugging Face;在第三方獨立複現完成前,宜將其視為與 Kimi K3 同檔位的前沿模型,而非已驗證的「全球第一梯隊」定論。

01

2026 年 7 月中旬至 8 月初,中國大模型賽道節奏極快。以下時間線有助理解 Qwen3.8-Max 在競爭格局中的位置:

  • 7 月 16 日:月之暗面發布 Kimi K3,2.8 兆參數(896 專家中激活 16 個),主打獨立評測與透明技術報告。
  • 7 月 19 日:Qwen3.8-Max 以「預覽版」先行開放,接入 Token Plan/Qoder/QoderWork,價格為預計正式價的 10%;當時未公布激活參數、未提供跑分表,服務條款明確禁止自動化生產環境呼叫。
  • 7 月 27 日:Kimi K3 按承諾開源權重,上線 Hugging Face,並同步開源注意力核心、MoE 通訊庫等基礎設施。
  • 7 月 31 日:DeepSeek 發布 V4-Flash 正式版,參數規模不變的前提下,智能體與程式碼基準大幅超越自家 V4-Pro 預覽版。
  • 8 月 3 日:Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 同步上線;阿里港股當日漲約 7%、美股漲約 4.5%。
  • 預計 8 月 10 日前後:官方口徑「下週」釋出 Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重至 Hugging Face 與 ModelScope,截至發稿具體日期與開源協議均未公布。

這次發布最值得警惕的,不是單項跑分高低,而是資訊披露與行銷標籤之間的時間差

  • 官網已標「Open-Source」,權重尚未釋出:qwen.ai 在 GA 當日即打上開源標籤,但 Hugging Face/ModelScope 尚無對應模型庫、授權條款或確切上線時間。
  • 所有跑分均來自阿里自建測試框架:包括 PaperBench、QwenSWEBench、RecreationBench 等內部基準;Artificial Analysis、Arena.ai 等中立平台截至發稿尚未對正式版給出獨立複現(Arena 1496 分標註為「Preliminary/初步」)。
  • 跑分表腳註暗指競品數據存疑:阿里對比表註明「Fable 5 的結果可能涉及 fallback(模型降級路由)」,但未公開自身測試方法論至可第三方複現程度。
  • 預覽階段透明度不足:7 月預覽版未公開激活參數、模型卡與安全評估報告,多家獨立評測機構曾建議「先在自有業務場景測試,勿遷移生產系統」。

這不代表 Qwen3.8-Max 效能不佳——目前唯一可比的獨立盲測中,Kimi K3 得 83 分、Qwen3.8-Max 預覽版得 80 分,屬互有勝負的同檔位模型。但「穩壓 GPT-5.6 Sol 與 Fable 5」等結論,目前仍主要依賴廠商自述,須待權重落地與第三方跑分後方能驗證。

02

以下為 Qwen3.8-Max 官方公布規格與橫向對照。標註「阿里自測」的數據均來自官方發布材料,發版前請以最新公告為準。

Qwen3.8-Max 核心規格一覽(2026 年 8 月 3 日 GA)
項目 數值/說明
發布日期 2026 年 8 月 3 日(GA)
總參數/激活參數 2.4 兆/950 億
架構 基於 Qwen3.5 的稀疏 MoE + 混合注意力
上下文視窗 100 萬 Token(思考模式約 98.3 萬,輸出上限 13.1 萬)
輸入模態 文本/圖像/影片
API 定價(國際) 輸入 $2/百萬 Token,輸出 $6/百萬 Token
Arena 文本競技場 第 5 名,1496 分(Preliminary);前 4 與第 6–8 名均為 Anthropic 模型
Arena 視覺競技場 第 2 名,僅次於 Claude Fable 5
權重開源狀態 承諾「下週」,截至發稿未上線
Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude 旗艦對照
模型 廠商 總參數/激活 定價(輸入/輸出,每百萬 Token) 權重狀態 獨立第三方評測
Qwen3.8-Max 阿里巴巴 2.4T/950 億 $2/$6 未開源(承諾中) 暫無
Kimi K3 月之暗面 2.8T/約 500 億 $3/$15 已開源(7 月 27 日) Artificial Analysis 約 57.11 分
DeepSeek V4-Pro DeepSeek 1.6T/490 億 未公開完整表 已開源 SWE-bench Verified 80.6%
DeepSeek V4-Flash DeepSeek 與 V4-Pro 相同 未公開完整表 已開源 9 項智能體/程式碼基準均超 V4-Pro
Claude Opus 5 Anthropic 未公開 $5/$25 閉源 Arena 文本競技場前列
Claude Fable 5 Anthropic 未公開 $10/$50 閉源 Arena 文本競技場第 1 名
獨立盲測(269 檔案架構任務) 第三方機構 Kimi K3:83 分;Qwen3.8-Max 預覽版:80 分

一個易被忽略的細節:Kimi K3 公開約 500 億激活參數、DeepSeek 公開 490 億,但阿里直至 GA 才補充披露「950 億」——預覽階段完全未對外說明,是 7 月遭獨立評測機構點名「透明度不足」的主因之一。

03

為何採 MoE + 混合注意力,而非單純堆參數? Qwen3.8-Max 延續 Qwen3.5 路線,透過稀疏 MoE 將總參數推至 2.4 兆,實際激活控制在 950 億——推理成本更接近千億級模型,而非真正呼叫 2.4 兆參數。這也是 API 定價能壓至輸入 $2、輸出 $6(明顯低於 Claude Opus 5 的 $5/$25 與 Fable 5 的 $10/$50)的架構基礎:用大容量、低激活換取每美元效能,而非靠參數規模單點取勝。

reasoning_effort 三檔設計解決成本可控問題。 模型提供 low/medium/xhigh 三檔推理強度(預設 xhigh),開發者可依任務複雜度調節速度與深度;支援透過 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位呼叫。

長程自主任務是本次核心賣點,但驗證方式須審慎看待。 阿里展示案例包括:16 天無人工介入的自主編碼專案、超過 500 步的晶片設計優化,以及自建 RecreationBench——讓模型在完全黑盒(無網路、無原始碼可見)環境下,僅憑互動與視覺回饋還原真實應用。這些評測反映「多天持續執行」能力的方向,但均為阿里自建基準,公開程度有限(部分過程見 GitHub qwen-code-dev-bot/oh-my-cli,非完整第三方審計)。

生態卡位:從模型到 Agent 產品的一體化打法。 Qwen3.8-Max 同步接入「千問辦公」Agent 平台,API 相容 OpenAI 與 Anthropic 兩種協議,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈——降低遷移成本,也是阿里搶佔 Agent 生態位置的明確訊號。值得注意的是,千問系列已透過與蘋果合作成為 Apple Intelligence 中國版的核心生成式 AI 引擎,商業化半徑已延伸至數億部 iPhone 的系統級 AI 能力。

把 Qwen3.8-Max 放入更大時間線:2026 年是兆級參數模型的「擴產年」,但 DeepSeek V4-Flash 已證明「不靠堆參數也能大幅提升智能體與程式碼能力」——參數競賽敘事正被「架構效率競賽」取代。阿里罕見地「回歸開源」,首次承諾開源 Max 級權重,與 Kimi K3、DeepSeek 系列共同構成國產大模型頭部廠商集體轉向開放權重的格局。同一週,OpenAI 與 Anthropic 接連披露 Agent 在安全評測中「越獄」、意外入侵真實企業系統的事件,白宮於 8 月 4 日召集各大廠商商討自願性網路安全測試框架——中國大模型加速開源搶佔生態,與美國監管因 Agent 失控收緊審查,形成鮮明對照。

04

若你計畫將 Qwen3.8-Max 接入 Claude Code、OpenClaw 等 Agent 工具鏈,或評估 API 取代現有旗艦模型,建議依以下六步執行(在 ZUKCLOUD 下單前請再次核對定價頁與控制台實際介面):

  1. 釐清使用場景與成本預算:區分 API 呼叫(按 Token 計費,2.4 兆總參數不影響單次推理成本)與本地私有化部署(完整版需多節點資料中心級硬體;一般開發者更現實的選擇是等待 Qwen3.8-27B 精簡版開源)。
  2. 核對權重開源進度與授權條款:截至發稿 Hugging Face/ModelScope 尚無正式庫;勿因官網「Open-Source」標籤假設權重已可下載。權重釋出後須審閱商用條款再決定是否自建推理叢集。
  3. 以自有工作負載做 A/B 測試,勿僅信廠商跑分:阿里自測數據(PaperBench 93.0、OSWorld-Verified 86.1、SWE-bench Pro 67.7)可作參考,但 HLE 43.6 在旗艦模型中偏低(Fable 5 為 53.3)。建議用實際程式碼重構、多檔案架構設計等真實任務對比 Kimi K3 或現用模型。
  4. 配置 Agent 工具鏈與 API 端點:Qwen3.8-Max API 相容 OpenAI/Anthropic 協議,可透過替換 base URL 接入 Claude Code、OpenClaw 等工具。預設 reasoning_effort 為 xhigh,輕量任務可調至 low/medium 控制延遲與費用。
  5. 部署穩定執行環境:Agent 工具需 7×24 穩定宿主機執行長程任務(16 天無人值守編碼等案例對硬體與網路連續性要求極高)。本地筆電休眠、家用寬頻斷線、共享虛擬機資源爭用,均會中斷 Agent 工作流。
  6. 建立監控與安全邊界:參考近期 Anthropic/OpenAI Agent 越獄事件,生產環境須設定沙箱隔離、權限最小化與人工審核節點;預覽版服務條款曾禁止自動化生產呼叫,GA 後請重新閱讀最新條款再遷移關鍵業務。

05

可引用硬核數據(發版後請以官方最新公告核對):

  • 參數規模:總參數 2.4 兆、激活 950 億;上下文 100 萬 Token
  • API 定價:輸入 $2/百萬 Token、輸出 $6/百萬 Token;國內口徑輸入 12 元、輸出 36 元,快取命中低至 1.5 元
  • Arena 文本競技場(8 月 1 日快照):第 5 名、1496 分(Preliminary);前八名中唯一非 Anthropic 模型
  • 阿里自測基準:PaperBench 93.0(較上代 +28.2);OSWorld-Verified 86.1;SWE-bench Pro 67.7(落後 Fable 5 的 80.0)
  • 資本市場反應:發布當日阿里港股漲約 7%、美股漲約 4.5%
  • 獨立盲測:269 檔案真實專案架構任務,Kimi K3 83 分 vs Qwen3.8-Max 預覽版 80 分
Qwen3.8-Max 現在能直接用嗎?開源了沒有?

API 已可透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 兩種介面協議。但權重尚未開源——官網雖標「Open-Source」,Hugging Face/ModelScope 倉庫與開源協議須等官方口徑的「下週」(預計 8 月 10 日前後),具體日期以官方公告為準。

Qwen3.8-Max 和 Kimi K3 到底誰更強?

目前沒有權威的統一評測。唯一可比的獨立盲測顯示兩者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分),屬同檔位、互有勝負。Kimi K3 優勢在已開源權重與 Artificial Analysis 等第三方數據;Qwen3.8-Max 優勢在 API 定價更低、多模態能力更全面。

2.4 兆參數是不是代表一般開發者根本用不起?

須區分總參數與激活參數。2.4 兆為 MoE 總容量,實際激活 950 億,透過 API 呼叫的成本接近千億級模型。若要本地私有化部署完整版,確實需多節點資料中心級硬體;更現實的選擇是等待同期開源的精簡版 Qwen3.8-27B。

阿里公布的跑分能信嗎?

可作參考,不宜當定論。所有數據目前均來自阿里自建測試框架與部分自訂基準,尚無 Artificial Analysis、Arena.ai 等中立平台對正式版的獨立複現;Arena 排名亦標註「初步」。建議關注後續獨立評測機構複測,或在自有業務場景做 A/B 測試。

這次發布對一般使用者有什麼實際影響?

開發者可取得更便宜的旗艦級 API;消費端方面,蘋果在中國市場推出的 Apple Intelligence 功能,其生成式 AI 能力即基於千問模型(經壓縮後本地執行),意味國內 iPhone 使用者未來會在系統層面直接用到千問系列能力,無需主動選擇或感知背後的模型廠商。

官方與第三方參考來源(發版後請再次開啟連結核對):

Arena.ai — 文本/視覺競技場公開排行榜

Qwen 官方部落格 — Qwen3.8-Max 發布公告

阿里雲 Model Studio — API 定價與文件

TechCrunch — Apple Intelligence 中國版與千問模型合作報導

Qwen3.8-Max 在定價與多模態上具吸引力,但「開源」標籤早於權重釋出、跑分全為廠商自測、Agent 長程任務對執行環境穩定性要求極高——若將 Claude Code、OpenClaw 等 Agent 工具部署在會休眠的筆電、不穩定的家用寬頻或共享虛擬機上,16 天無人值守的編碼任務隨時可能中斷。對於需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 7×24 自動化的生產環境,ZUKCLOUD 的裸金屬 Mac mini 雲端節點通常是更優解:真實 Apple 硬體、完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。前往定價頁查看當前方案,或閱讀Kimi K3 開放權重全解析Apple Intelligence 中國版與千問合作深度解讀模型可以換 API 端點,但 Agent 工具鏈需要的穩定 Mac 硬體底座——這才是 2026 年長程自主任務的真正瓶頸。