首页 / 博客 / Kimi K3
ENGINEERING BLOG · 2026.07.17

Kimi K3 深度评测:2.8 万亿参数,
国产开源大模型新纪录

2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文档顶部悄然挂出横幅——「🎉 Kimi K3 已上线!」。没有大型发布会,没有预热轰炸,只有一份技术博客、一个定价页和一个可立刻调用的模型 ID。本文面向AI 开发者、技术爱好者与 AI 产品从业者,完整解析这款2.8 万亿参数、目前全球规模最大的开源 AI 模型:它是什么、架构创新何在、与 Claude Fable 5 / GPT-5.6 Sol 的基准对比如何、API 怎么定价、如何立即接入,以及7 月 27 日完整权重开源为何值得全行业关注。

01

Kimi K3 是目前全球参数规模最大的开源 AI 模型——2.8 万亿(2.8T)参数,超越此前纪录保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米开源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有余。它采用稀疏混合专家(MoE)架构,推理时从 896 个专家中激活 16 个;配合 100 万 token 超长上下文(约等于一次性读完 5 本《红楼梦》全文)与原生视觉理解,专为复杂编程、长文档推理与知识工作而设计。

一句话总结:Kimi K3 是一个开源的、可原生理解图像与视频的、拥有超长记忆的「重量级编程 AI」,价格比 Claude Opus 4.8 便宜 40%,且完整权重将于 7 月 27 日对外开源。

月之暗面在过去 18 个月经历了 DeepSeek 崛起带来的巨大冲击,市场份额一度大幅缩水。K3 的发布堪称一次漂亮的反击——但开发者真正需要警惕的痛点仍在:

  • 闭源 API 依赖风险:无论 K3 多强,在 7 月 27 日权重开放前,生产环境仍完全依赖 Moonshot 云端;区域网络、配额与定价变动不可控。
  • 超长上下文 ≠ 零成本:1M token 窗口在 flat 定价下可用,但 Agent 长任务若缺乏本地持久化开发环境,中断恢复与工具链集成仍是工程瓶颈。
  • 自部署门槛极高:2.8T 参数意味着生产级推理需 64 张以上加速卡的超节点——个人开发者与中小团队短期内只能走 API,无法真正「拥有」模型。
  • 基准数据自报偏差:月之暗面使用 Kimi Code harness,Claude 用 Claude Code、GPT 用 Codex,独立第三方复现仍在进行中,不宜盲信单一榜单。

与此同时,这次发布的战略信号同样清晰:

  • 过去 12 个月里,Kimi 系列有 9 个月占据开源模型规模上限;
  • 发布时机恰在 2026 世界人工智能大会(WAIC)开幕前夜(7 月 17–20 日);
  • 截至 2026 年 6 月,月之暗面 ARR 已突破 3 亿美元,今年内完成第 6 轮融资,投前估值达 315 亿美元
  • API 收入占整体七成以上,海外付费用户增长 400%

这不是一家「卖情怀」的公司在硬撑规模,而是一家商业化正在爆发的公司,在向全球宣示技术主权。

02

Kimi K3 不是简单的参数堆砌,而是在架构层面做了三项可验证的工程创新。相较OpenRouter 六月模型榜中 DeepSeek 与 Claude 的路线,K3 更侧重长上下文下的推理效率极端稀疏 MoE 的稳定训练

Kimi Delta Attention(KDA)—— 重新设计「注意力」机制

传统 Transformer 全注意力在长上下文下计算量呈平方级增长——处理 100 万 token 时,KV 缓存内存消耗是毁灭性的。KDA 是一种混合线性注意力机制

  • 3:1 比例交替使用线性注意力层与全注意力层——3 个线性层处理局部结构(计算廉价),1 个全注意力层保留全局信息流;
  • KV 缓存内存减少高达 75%
  • 百万 token 上下文下,解码速度提升高达 6.3 倍
  • 在短上下文、长上下文与强化学习扩展三种场景中,均超越纯全注意力基线。

简单类比:全注意力像让一个人同时记住所有对话细节;KDA 更像高效秘书——大部分时候用快速索引,关键时刻再精准回忆。

Attention Residuals(AttnRes)—— 解决深度信息丢失

  • 标准残差连接沿深度均匀积累信息,早期层关键表征在深层被稀释;
  • AttnRes 引入选择性检索——模型可跨越深度直接拉取更早层的高价值表征;
  • 月之暗面报告约 25% 训练效率提升,额外计算开销不足 2%。

Stable LatentMoE —— 超高稀疏度的稳定训练

Kimi K3 共 896 个专家,每次推理只激活 16 个(稀疏度 1.8%)。配套技术包括:

Stable LatentMoE 关键配套技术
技术 作用
Quantile Balancing从路由器得分分位数直接推导专家分配,消除启发式超参
Per-Head Muon针对每个注意力头独立优化,使大规模训练更自适应
Sigmoid Tanh Unit(SiTU)改进激活函数控制
Gated MLA提升注意力选择性
综合效果相较 Kimi K2,整体扩展效率提升约 2.5 倍

03

以下为月之暗面自报核心基准数据。与Claude Fable 5 工程实践中强调的 Repo 级修 Bug 场景对照阅读,可更快判断选型。

Kimi K3 核心基准对比(月之暗面自报,2026-07-16)
基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE67.570.073.059.0
Program Bench77.876.877.671.9
Terminal Bench 2.188.384.688.884.6
FrontierSWE81.286.671.366.7
SWE Marathon42.035.039.040.0
BrowseComp91.288.090.484.3
Automation Bench30.829.129.727.2
GPQA-Diamond93.592.694.191.0
MMMU-Pro(视觉)81.681.283.078.9
OmniDocBench(文档)91.189.885.887.9

解读重点:

  • SWE Marathon(编程长任务):K3 以 42.0 大幅领先,专门测试持续性长代码工作,最接近「实际写代码数小时」场景;
  • Program Bench:K3 以 77.8 微弱优势第一;
  • FrontierSWE:Fable 5 领跑 86.6,K3(81.2)仍大幅超越 GPT-5.6 Sol(71.3);
  • OmniDocBench:K3 第一(91.1),体现视觉 + 长上下文协同;
  • HLE-Full(深度推理):Claude Fable 5 以 53.3 大幅领先,K3(43.5)与 GPT-5.6 Sol(44.5)接近;
  • 综合智能:Artificial Analysis Intelligence Index v4.1 中,K3 以 57.1 分排名第四,紧随 Claude Fable 5(59.9)与 GPT-5.6 Sol(58.9),榜首与第四仅差 2.8 分。

注意:上述为月之暗面自报数据,各模型使用不同推理 harness,独立第三方复现仍在进行中。

04

主流模型 API 定价与上下文对比
模型 输入 ($/M) 输出 ($/M) 缓存命中输入 上下文
Kimi K3$3.00$15.00$0.301M
Claude Sonnet 5$3.00$15.00200K
Claude Opus 4.8$5.00$25.00200K
GPT-5.5$5.00$30.00400K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K2.6$0.95$4.00$0.16256K

关键信息:K3 标准价与 Claude Sonnet 5 持平($3/$15),但上下文窗口是其 5 倍;缓存命中低至 $0.30/M,月之暗面报告编程场景缓存命中率超 90%,配合 Mooncake 分离推理架构,实际有效输入成本可降至约 $0.55/M tokens(OpenRouter 7 日加权均价可佐证)。相较 Claude Opus 4.8,K3 在多项基准上更优,输入成本仅其 60%、输出成本 40%。国内 API:输入 ¥20/M、输出 ¥100/M、缓存命中 ¥2/M;消费者版 kimi.com 免费账号可用,预付费套餐 ¥199 起(优惠截至 8 月 11 日)。

6 步接入 Kimi K3(开发者路径):

  1. 注册 Moonshot 账号:访问 platform.kimi.aikimi.com,支持 Google 账号登录。
  2. 创建 API Key:在控制台生成密钥,妥善保存(仅显示一次)。
  3. 确认模型 ID:使用 kimi-k3;OpenRouter 用户可选 moonshotai/kimi-k3,官方定价无加价。
  4. 配置 OpenAI 兼容客户端:base_url 设为 https://api.moonshot.ai/v1
  5. 发送首条测试请求:用短 prompt 验证连通性与延迟,确认账户余额或免费额度。
  6. 启用缓存感知工作流:在 Kimi Code 或 Agent 场景中复用 system prompt 与工具定义,利用 90%+ 缓存命中率降低实际输入成本。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)
print(response.choices[0].message.content)

05

按场景选择 Kimi K3 或竞品
场景 推荐模型 原因
持续性长代码任务Kimi K3SWE Marathon 第一,上下文最长
复杂 Repo 级修 BugClaude Fable 5FrontierSWE / SWE-bench Pro 领先
终端/工具链 AgentGPT-5.6 SolTerminal Bench 与 Coding Agent Index 领先
超长文档/多模态理解Kimi K3OmniDocBench 第一,原生视觉 + 1M 上下文
成本敏感DeepSeek V4 Pro输出仅 $3.48/M,远低于 K3
需要最深推理的研究Claude Fable 5HLE-Full 53.3,大幅领先
开源自部署(7/27 后)Kimi K3迄今最强开源权重

月之暗面在官方公告中明确承诺:2026 年 7 月 27 日在 Hugging Face 开放完整模型权重。届时 K3 将成为:

  • 迄今参数最大的可下载开源模型;
  • 首个超 2 万亿参数级别的开源权重;
  • 开源社区训练/微调基座新标杆——预计 vLLM、SGLang 等框架第一时间支持,并出现 MXFP4/NVFP4 量化版本。

模型以 MXFP4 权重 + MXFP8 激活训练,量化感知设计,利于现代硬件高效推理。

关注时间节点:7 月 17–20 日(WAIC,更多发布预计)→ 7 月 27 日(K3 完整权重开源)。

06

  • 总参数量:2.8 万亿(2.8T),全球最大开源模型
  • MoE 配置:896 专家,每次激活 16 个(稀疏度 1.8%)
  • 上下文窗口:1,048,576 tokens(1M)
  • KDA 效率:KV 缓存 -75%,百万 token 解码最高 +6.3×
  • AttnRes:训练效率约 +25%,额外算力 <2%
  • 相对 K2 扩展效率:约 2.5×
  • API 定价:$3 / $15 per 1M tokens(输入/输出);缓存命中 $0.30/M;Agent 场景有效输入约 $0.55/M
  • 国内定价:¥20 / ¥100 / ¥2(输入/输出/缓存)per M tokens
  • ARR(2026-06):突破 3 亿美元;投前估值 315 亿美元
  • Artificial Analysis Index v4.1:K3 得分 57.1,全球第四
  • 开源日期:2026 年 7 月 27 日(Hugging Face)

以下为主要参考来源;模型能力、定价与开源时间表可能随时更新,发版后请再次打开链接核对:

官方来源:

Moonshot AI — Kimi K3 官方技术博客

Kimi API Platform — 文档与定价

第三方报道与分析:

Artificial Analysis — Intelligence Index v4.1 排名

OpenRouter — moonshotai/kimi-k3 定价与用量

Kimi K3 在编程长任务与文档理解等关键赛道上对标乃至超越部分闭源旗舰,且承诺完整开源——但中国 AI 开源生态的竞争已从「以低价换市场」转向「挑战智能前沿」。对工程团队而言,纯 API 调用仍面临网络延迟、配额与工具链集成的隐性成本;2.8T 自部署在 7 月 27 日前不可行,之后也需超节点级算力;而共享虚拟 Mac / 云端 VM运行 Xcode、Metal 与 Agent 工具链时,Hypervisor 损耗与兼容性问题会拖累长任务 Agent 的稳定性。若你的生产环境需要零损耗 Apple Silicon、7×24 在线、稳定 iOS CI/CD 与 AI Agent 自动化(例如将 Kimi Code / Claude Code 跑在持久化物理 Mac 上对接多模型 API),ZUKCLOUD 裸金属 Mac mini 云端节点通常是更可控的选择——独占物理机、无虚拟化损耗、按天/周/月弹性下单。查看定价下单,或阅读裸金属架构宣言了解 Agent 级托管逻辑。

07

Q:Kimi K3 可以免费使用吗?
A:可以。在 kimi.com 注册免费账号即可,K3 默认以最大推理力度运行;API 调用需付费($3/$15 per 1M tokens)。

Q:能本地部署 Kimi K3 吗?
A:完整权重将于 2026 年 7 月 27 日在 Hugging Face 开放。生产级推理需 64 张以上加速卡的超节点,不适合笔记本或单卡环境。

Q:Kimi K3 和 DeepSeek V4 Pro 怎么选?
A:K3 参数约 2 倍(2.8T vs 1.6T)、上下文 5 倍(1M vs 128K)、多项编程基准更强;DeepSeek 输出仅 $3.48/M,成本敏感场景更优。详见DeepSeek 算力布局一文中的生态背景。

Q:1M token 上下文真的有用吗?
A:对整库代码分析、长篇法律/科研文档、多轮 Agent 长记忆等场景非常实用;K3 按 flat 定价无长度加价,配合高缓存命中率,实际成本可控。

Q:低/高推理力度模式何时上线?
A:月之暗面表示 lowhigh 模式将在后续更新推出,目前仅 max 力度可用。