首頁 / 部落格 / Kimi K3
ENGINEERING BLOG · 2026.07.17

Kimi K3 深度評測:2.8 兆參數,
開源大模型新標竿

2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文件頂部悄然掛出橫幅——「Kimi K3 已上線!」。沒有大型發表會,沒有預熱轟炸,只有一份技術部落格、一個定價頁與一個可立刻呼叫的模型 ID。本文面向AI 開發者、技術愛好者與 AI 產品從業者,完整解析這款2.8 兆(2.8T)參數、目前全球規模最大的開源 AI 模型:它究竟是什麼、架構創新何在、與 Claude Fable 5 / GPT-5.6 Sol 的基準對比如何、API 怎麼定價、如何立即接入,以及7 月 27 日完整權重開源為何值得全產業關注。

01

Kimi K3 是目前全球參數規模最大的開源 AI 模型——2.8 兆(2.8T)參數,超越此前紀錄保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米開源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有餘。它採用稀疏混合專家(MoE)架構,推論時從 896 個專家中啟動 16 個;配合 100 萬 Token 超長上下文(約等於一次性讀完 5 本《紅樓夢》全文)與原生視覺理解,專為複雜程式設計、長文件推理與知識工作而設計。

一句話總結:Kimi K3 是一個開源的、可原生理解影像與影片的、擁有超長記憶的「重量級程式設計 AI」,定價比 Claude Opus 4.8 便宜 40%,且完整權重將於 7 月 27 日對外開源。

月之暗面在過去 18 個月經歷 DeepSeek 崛起帶來的巨大衝擊,市場佔有率一度大幅萎縮。K3 的發布堪稱一次漂亮的反擊——但開發者真正需要警惕的痛點仍在:

  • 閉源 API 依賴風險:無論 K3 多強,在 7 月 27 日權重開放前,生產環境仍完全依賴 Moonshot 雲端;區域網路、配額與定價變動不可控。
  • 超長上下文不等於零成本:1M Token 視窗在 flat 定價下可用,但 Agent 長任務若缺乏本地持久化開發環境,中斷恢復與工具鏈整合仍是工程瓶頸。
  • 自部署門檻極高:2.8T 參數意味著生產級推論需 64 張以上加速卡的超節點——個人開發者與中小團隊短期內只能走 API,無法真正「擁有」模型。
  • 基準數據自報偏差:月之暗面使用 Kimi Code harness,Claude 用 Claude Code、GPT 用 Codex,獨立第三方複現仍在進行中,不宜盲信單一榜單。

與此同時,這次發布的戰略訊號同樣清晰:

  • 過去 12 個月裡,Kimi 系列有 9 個月佔據開源模型規模上限;
  • 發布時機恰在 2026 世界人工智慧大會(WAIC)開幕前夜(7 月 17–20 日);
  • 截至 2026 年 6 月,月之暗面 ARR 已突破 3 億美元,今年內完成第 6 輪融資,投前估值達 315 億美元
  • API 收入占整體七成以上,海外付費使用者成長 400%

這不是一家「賣情懷」的公司在硬撐規模,而是一家商業化正在爆發的公司,在向全球宣示技術主權。

02

Kimi K3 不是簡單的參數堆疊,而是在架構層面做了三項可驗證的工程創新。相較OpenRouter 六月模型榜中 DeepSeek 與 Claude 的路線,K3 更側重長上下文下的推理效率極端稀疏 MoE 的穩定訓練

Kimi Delta Attention(KDA)—— 重新設計「注意力」機制

傳統 Transformer 全注意力在長上下文下計算量呈平方級成長——處理 100 萬 Token 時,KV 快取記憶體消耗是毀滅性的。KDA 是一種混合線性注意力機制

  • 3:1 比例交替使用線性注意力層與全注意力層——3 個線性層處理局部結構(計算廉價),1 個全注意力層保留全域資訊流;
  • KV 快取記憶體減少高達 75%
  • 百萬 Token 上下文下,解碼速度提升高達 6.3 倍
  • 在短上下文、長上下文與強化學習擴展三種場景中,均超越純全注意力基線。

簡單類比:全注意力像讓一個人同時記住所有對話細節;KDA 更像高效秘書——大部分時候用快速索引,關鍵時刻再精準回憶。

Attention Residuals(AttnRes)—— 解決深度資訊遺失

  • 標準殘差連接沿深度均勻累積資訊,早期層關鍵表徵在深層被稀釋;
  • AttnRes 引入選擇性檢索——模型可跨越深度直接拉取更早層的高價值表徵;
  • 月之暗面報告約 25% 訓練效率提升,額外計算開銷不足 2%。

Stable LatentMoE —— 超高稀疏度的穩定訓練

Kimi K3 共 896 個專家,每次推論只啟動 16 個(稀疏度 1.8%)。配套技術包括:

Stable LatentMoE 關鍵配套技術
技術 作用
Quantile Balancing從路由器得分分位數直接推導專家分配,消除啟發式超參
Per-Head Muon針對每個注意力頭獨立最佳化,使大規模訓練更自適應
Sigmoid Tanh Unit(SiTU)改進啟動函數控制
Gated MLA提升注意力選擇性
綜合效果相較 Kimi K2,整體擴展效率提升約 2.5 倍

03

以下為月之暗面自報核心基準數據。與Claude Fable 5 工程實踐中強調的 Repo 級修 Bug 場景對照閱讀,可更快判斷選型。

Kimi K3 核心基準對比(月之暗面自報,2026-07-16)
基準測試 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE67.570.073.059.0
Program Bench77.876.877.671.9
Terminal Bench 2.188.384.688.884.6
FrontierSWE81.286.671.366.7
SWE Marathon42.035.039.040.0
BrowseComp91.288.090.484.3
Automation Bench30.829.129.727.2
GPQA-Diamond93.592.694.191.0
MMMU-Pro(視覺)81.681.283.078.9
OmniDocBench(文件)91.189.885.887.9

解讀重點:

  • SWE Marathon(程式設計長任務):K3 以 42.0 大幅領先,專門測試持續性長程式碼工作,最接近「實際寫程式碼數小時」場景;
  • Program Bench:K3 以 77.8 微弱優勢第一;
  • FrontierSWE:Fable 5 領跑 86.6,K3(81.2)仍大幅超越 GPT-5.6 Sol(71.3);
  • OmniDocBench:K3 第一(91.1),體現視覺 + 長上下文協同;
  • 綜合智慧:Artificial Analysis Intelligence Index v4.1 中,K3 以 57.1 分排名第四,緊隨 Claude Fable 5(59.9)與 GPT-5.6 Sol(58.9)。

注意:上述為月之暗面自報數據,各模型使用不同推理 harness,獨立第三方複現仍在進行中。

04

主流模型 API 定價與上下文對比
模型 輸入 ($/M) 輸出 ($/M) 快取命中輸入 上下文
Kimi K3$3.00$15.00$0.301M
Claude Sonnet 5$3.00$15.00200K
Claude Opus 4.8$5.00$25.00200K
GPT-5.5$5.00$30.00400K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K2.6$0.95$4.00$0.16256K

關鍵資訊:K3 標準價與 Claude Sonnet 5 持平($3/$15),但上下文視窗是其 5 倍;快取命中低至 $0.30/M,月之暗面報告程式設計場景快取命中率超 90%。中國大陸 API:輸入 ¥20/M、輸出 ¥100/M、快取命中 ¥2/M;消費者版 kimi.com 免費帳號可用,預付費套餐 ¥199 起(優惠截至 8 月 11 日)。

6 步接入 Kimi K3(開發者路徑):

  1. 註冊 Moonshot 帳號:造訪 platform.kimi.aikimi.com,支援 Google 帳號登入。
  2. 建立 API Key:在控制台產生金鑰,妥善保存(僅顯示一次)。
  3. 確認模型 ID:使用 kimi-k3;OpenRouter 使用者可選 moonshotai/kimi-k3,官方定價無加價。
  4. 設定 OpenAI 相容用戶端:base_url 設為 https://api.moonshot.ai/v1
  5. 傳送首條測試請求:用短 prompt 驗證連通性與延遲,確認帳戶餘額或免費額度。
  6. 啟用快取感知工作流:在 Kimi Code 或 Agent 場景中複用 system prompt 與工具定義,利用 90%+ 快取命中率降低實際輸入成本。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)
print(response.choices[0].message.content)

05

依場景選擇 Kimi K3 或競品
場景 推薦模型 原因
持續性長程式碼任務Kimi K3SWE Marathon 第一,上下文最長
複雜 Repo 級修 BugClaude Fable 5FrontierSWE / SWE-bench Pro 領先
終端/工具鏈 AgentGPT-5.6 SolTerminal Bench 與 Coding Agent Index 領先
超長文件/多模態理解Kimi K3OmniDocBench 第一,原生視覺 + 1M 上下文
成本敏感DeepSeek V4 Pro輸出僅 $3.48/M,遠低於 K3
開源自部署(7/27 後)Kimi K3迄今最強開源權重

月之暗面在官方公告中明確承諾:2026 年 7 月 27 日在 Hugging Face 開放完整模型權重。屆時 K3 將成為:

  • 迄今參數最大的可下載開源模型;
  • 首個超 2 兆參數級別的開源權重;
  • 開源社群訓練/微調基座新標竿——預計 vLLM、SGLang 等框架第一時間支援,並出現 MXFP4/NVFP4 量化版本。

模型以 MXFP4 權重 + MXFP8 啟動訓練,量化感知設計,利於現代硬體高效推論。

關注時間節點:7 月 17–20 日(WAIC,更多發布預計)→ 7 月 27 日(K3 完整權重開源)。

06

  • 總參數量:2.8 兆(2.8T),全球最大開源模型
  • MoE 配置:896 專家,每次啟動 16 個(稀疏度 1.8%)
  • 上下文視窗:1,048,576 Tokens(1M)
  • KDA 效率:KV 快取 -75%,百萬 Token 解碼最高 +6.3×
  • AttnRes:訓練效率約 +25%,額外算力 <2%
  • 相對 K2 擴展效率:約 2.5×
  • API 定價:$3 / $15 per 1M Tokens(輸入/輸出);快取命中 $0.30/M
  • 中國大陸定價:¥20 / ¥100 / ¥2(輸入/輸出/快取)per M Tokens
  • ARR(2026-06):突破 3 億美元;投前估值 315 億美元
  • Artificial Analysis Index v4.1:K3 得分 57.1,全球第四
  • 開源日期:2026 年 7 月 27 日(Hugging Face)

以下為主要參考來源;模型能力、定價與開源時間表可能隨時更新,發版後請再次開啟連結核對:

官方來源:

Moonshot AI — Kimi K3 官方技術部落格

Kimi API Platform — 文件與定價

第三方報導與分析:

Artificial Analysis — Intelligence Index v4.1 排名

OpenRouter — moonshotai/kimi-k3 定價與用量

Kimi K3 在程式設計長任務與文件理解等關鍵賽道上對標乃至超越部分閉源旗艦,且承諾完整開源——但中國 AI 開源生態的競爭已從「以低價換市場」轉向「挑戰智慧前沿」。對工程團隊而言,純 API 呼叫仍面臨網路延遲、配額與工具鏈整合的隱性成本;2.8T 自部署在 7 月 27 日前不可行,之後也需超節點級算力;而共享虛擬 Mac / 雲端 VM執行 Xcode、Metal 與 Agent 工具鏈時,Hypervisor 損耗與相容性問題會拖累長任務 Agent 的穩定性。若您的生產環境需要零損耗 Apple Silicon、7×24 線上、穩定 iOS CI/CD 與 AI Agent 自動化(例如將 Kimi Code / Claude Code 跑在持久化實體 Mac 上對接多模型 API),ZUKCLOUD 裸金屬 Mac mini 雲端節點通常是更可控的選擇——獨占實體機、無虛擬化損耗、按天/週/月彈性下單。查看定價下單,或閱讀裸金屬架構宣言了解 Agent 級託管邏輯。

07

Q:Kimi K3 可以免費使用嗎?
A:可以。在 kimi.com 註冊免費帳號即可,K3 預設以最大推理力度執行;API 呼叫需付費($3/$15 per 1M Tokens)。

Q:能本地部署 Kimi K3 嗎?
A:完整權重將於 2026 年 7 月 27 日在 Hugging Face 開放。生產級推論需 64 張以上加速卡的超節點,不適合筆電或單卡環境。

Q:Kimi K3 和 DeepSeek V4 Pro 怎麼選?
A:K3 參數約 2 倍(2.8T vs 1.6T)、上下文 5 倍(1M vs 128K)、多項程式設計基準更強;DeepSeek 輸出僅 $3.48/M,成本敏感場景更優。詳見DeepSeek 算力布局一文中的生態背景。

Q:1M Token 上下文真的有用嗎?
A:對整庫程式碼分析、長篇法律/科研文件、多輪 Agent 長記憶等場景非常實用;K3 按 flat 定價無長度加價,配合高快取命中率,實際成本可控。

Q:低/高推理力度模式何時上線?
A:月之暗面表示 lowhigh 模式將在後續更新推出,目前僅 max 力度可用。