首頁 / 部落格 / Kimi K3 開放權重
ENGINEERING BLOG · 2026.07.28

Kimi K3 全面開放權重:
2.8 兆參數、百萬上下文,月之暗面這次放了什麼大招?

2026 年 7 月 27 日 23 時左右,中國 AI 實驗室 月之暗面(Moonshot AI)正式釋出 Kimi K3 完整模型權重與技術報告,並同步開源支撐訓練的三項核心基礎設施:MoonEPFlashKDAAgentEnv。這是全球首個完整開放的 3 兆參數級模型——2.8 兆參數100 萬 Token 上下文,Hugging Face 下載量約 1.56TB,上線半小時內即登頂趨勢榜。本文面向 AI 工程師、技術決策者與產品負責人,釐清「開源」與「開放權重」的法律邊界、實際效能與現實導入路徑。結論先行:K3 是開放權重陣營的能力天花板,卻未必是性價比最優解——選型須同時審視工作負載與授權條款。

01

距 7 月 16 日 API 首發僅 11 天,權重即全面釋出。然而 Kimi K3 首發深度評測中的期待與實際商業條件之間仍有落差;發布時機又恰逢 中美「模型蒸餾」爭議升溫。以下四點最易被忽略:

  • 「開源」與「開放權重」混用:月之暗面官方材料從未使用「open source」,一律稱「open weight」。依 OSI 定義,真正開源須公開訓練資料與訓練程式碼,K3 僅釋出訓練完成後的權重與推理相關工具。
  • 授權兩道商業門檻:若營運 Model-as-a-Service 業務且連續 12 個月累計收入超過 2,000 萬美元,須另行簽署商業協議;若月活使用者超過 1 億或月收入超過 2,000 萬美元,須在產品介面顯著標示「Kimi K3」。
  • 自建伺服器現實性:2.8T 參數、896 專家規模決定 K3 幾乎無法在消費級硬體運行;官方建議 64 張以上加速卡的超節點叢集,個人與中小團隊短期只能走 API。
  • 能力與成本的權衡:K3 每任務成本約 $0.95,比 GLM-5.2(約 $0.47)更貴;它是開放權重最強者,卻不是最便宜選項。

一句話:K3 是「人人可下載的最強權重」,不是「人人可從零複現的完整開源」——這個區分是企業導入的起點。

02

公開後 30 分鐘內登頂 Hugging Face 趨勢榜的權重檔(約 1.56TB)核心規格如下。

Kimi K3 核心規格一覽
項目 規格
總參數量2.8 兆(2.8T)
啟用參數量約 1,040 億
架構MoE:896 個路由專家,每 Token 啟用 16 個
注意力機制Kimi Delta Attention(KDA)+ Gated MLA
上下文視窗100 萬 Token
多模態原生視覺理解(ViT-V2,27 層)
權重格式MXFP4 權重 + MXFP8 啟用(SFT 階段起量化感知訓練)
授權自訂授權(open weight,非 open source)
完整權重釋出日2026 年 7 月 27 日(API 首發 11 天後)
API 定價(每百萬 Token)
Token 類型 價格 備註
輸入(快取命中)$0.30程式設計工作負載快取命中率逾 90%
輸入(快取未命中)$3.00表頭價格
輸出(含推理過程)$15.00
實際成本感知多數接近 $0.30Mooncake 分離式推理架構
同步開源的三項 Infra 技術
技術 定位 關鍵數據
MoonEP超大規模細粒度 MoE 高效能通訊函式庫臨時複製過載專家,保證各運算節點 Token 數均等
FlashKDA基於 CUTLASS 的 KDA 高效能算子NVIDIA H20 上 prefill 加速 1.72–2.22 倍
AgentEnvFirecracker microVM 智慧體沙箱(與 KVCache.ai 聯合開發)checkpoint 133ms、恢復 49ms、記憶體超分 6.5 倍(官方數據,尚未獨立複現)

03

月之暗面並非單純堆參數,而是重構深度學習三大傳統元件——注意力、殘差連接與最佳化器。Kimi Delta Attention(KDA)以逐通道遺忘閘門壓低長序列 KV Cache 開銷;Attention Residuals(AttnRes)以不到 2% 的參數成本換取約 25% 訓練效率提升;Per-Head Muon讓每個注意力頭獨立收斂,使 1,040 億啟用參數逼近封閉前沿模型的表現。

以下優先引用獨立第三方評測數據。

SWE-bench Verified(Vals AI 獨立評測,2026 年 7 月)
模型 分數 發布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis Intelligence Index(max 推理檔):Claude Fable 5 60 分、GPT-5.6 Sol 59 分、Kimi K3 約 57 分(全球第 3、開放權重第 1)、GLM-5.2 51 分、DeepSeek V4 Pro 44 分。Arena.ai Frontend Code Arena 榜單目前亦由 K3 居首。每任務成本:K3 約 $0.95、Claude Fable 5 約 $2.4(便宜約 60%)、GLM-5.2 約 $0.47(比 K3 更便宜)——能力上限與性價比最優並不同軸

04

涵蓋 API 與自建路徑的現實導入流程如下。

  1. 法務審閱授權條款:確認是否營運 Model-as-a-Service 業務,以及月活/營收是否觸及 2,000 萬美元或 1 億使用者門檻;未觸及者大多可無額外協議商用。
  2. API 快速接入:OpenAI SDK 相容的 Chat Completions API(https://api.moonshot.ai/v1,模型 ID kimi-k3),多數專案僅需更換 base URL 與 API 金鑰。
  3. 快取策略最佳化:Mooncake 分離式推理在程式設計工作負載上快取命中率逾 90%;長上下文重複呼叫時,將提示詞設計為接近 $0.30/M 的實際輸入單價。
  4. 透過 OpenRouter 建立備援:若 64 卡叢集不現實,可將 OpenRouter 上 7 家託管商(多數與官方同價)設為主要或故障轉移路徑。
  5. 任務分層路由:高流量、容錯任務走 DeepSeek V4 Flash 或 GLM-5.2;僅在複雜程式設計與長文推理步驟升級至 K3,壓抑整體成本。
  6. 穩定本地 Agent 執行環境:Claude Code、Kilo Code 或自訂 Agent 需 7×24 運行時,僅靠雲端 API 無法解決本地工具鏈、Metal 加速與持續上線問題;虛擬化 Mac 環境帶來 Hypervisor 損耗與 iOS CI 相容性風險。

05

公開時間軸摘要:

  • 7 月 16 日:kimi.com、Kimi API API 限定首發(WAIC 2026 前夜)
  • 7 月 22–23 日:美方指控月之暗面對 Anthropic Fable 進行「工業化蒸餾」並威脅制裁
  • 7 月 27 日 23 時:完整權重、技術報告、MoonEP/AgentEnv 公開(FlashKDA 此前已開源)
  • 7 月 28 日:中國商務部回應「AI 霸權主義」並暗示反制措施
  • 權重體積:約 1.56TB(Hugging Face),公開 30 分鐘內趨勢榜第 1。
  • SWE-bench Verified:獨立評測 93.4%,開放權重最高,與封閉榜首(97%)差距 3.6 個百分點。
  • API 實效單價:快取命中時輸入 $0.30/M——約為表頭 $3.00 的十分之一;程式設計工作負載快取命中率逾 90%。
  • 自建部署門檻:官方建議 64 張以上加速卡——消費級硬體不具可行性。

常見問題 FAQ

Kimi K3 真的是開源模型嗎?

嚴格來說不是。月之暗面官方稱「open weight」,不符合 OSI 開源定義;訓練資料與完整訓練程式碼未公開。

Kimi K3 可以免費商用嗎?

絕大多數商業場景不受限制。MaaS 業務年營收逾 2,000 萬美元,或月活逾 1 億/月營收逾 2,000 萬美元時,須滿足額外授權條款。

自行部署 Kimi K3 需要多少硬體?

官方建議 64 張以上加速卡超節點。個人與中小團隊更現實的路徑是官方 API 或 OpenRouter 等第三方平台。

Kimi K3 效能與 GPT-5.6、Claude 相比如何?

SWE-bench Verified 93.4%,低於封閉榜首但為開放權重最強;Artificial Analysis Index 全球第 3(約 57 分)。

Kimi K3 與 Kimi K2 有何主要差異?

K3 參數約 3 倍、新增 AttnRes 與 Per-Head Muon、上下文與多模態大幅擴展,並新增 MaaS 營收門檻。

以下為發布時點的一手資訊;最新數據請以各官方連結為準。

月之暗面官方部落格:Kimi K3

Hugging Face:moonshotai 組織頁面

GitHub:moonshotai/FlashKDA

Kimi K3 全面開放權重標誌著 3T 級模型人人可下載的時代開啟。然而 64 卡叢集自建幾乎不現實,API 路徑又無法解決本地 Agent 工具鏈、Metal 加速與 7×24 持續上線的工程課題;虛擬化 Mac 環境則帶來 Hypervisor 損耗與 iOS CI/CD 相容性風險。對需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 7×24 自動化的生產環境,ZUKCLOUD 裸金屬 Mac mini 雲端節點通常是更優解:專屬 Apple Silicon 實體機、無 Hypervisor 稅、常時上線、按日/週/月彈性計費。詳見 裸金屬架構宣言