2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文档顶部悄然挂出横幅——「🎉 Kimi K3 已上线!」。没有大型发布会,没有预热轰炸,只有一份技术博客、一个定价页和一个可立刻调用的模型 ID。本文面向AI 开发者、技术爱好者与 AI 产品从业者,完整解析这款2.8 万亿参数、目前全球规模最大的开源 AI 模型:它是什么、架构创新何在、与 Claude Fable 5 / GPT-5.6 Sol 的基准对比如何、API 怎么定价、如何立即接入,以及7 月 27 日完整权重开源为何值得全行业关注。
01 Kimi K3 是什么?为什么这次发布意义重大?
Kimi K3 是目前全球参数规模最大的开源 AI 模型——2.8 万亿(2.8T)参数,超越此前纪录保持者 DeepSeek V4 Pro(1.6T)近 75%,是小米开源模型(1.02T)的 2.7 倍,是阿里(397B)的 7 倍有余。它采用稀疏混合专家(MoE)架构,推理时从 896 个专家中激活 16 个;配合 100 万 token 超长上下文(约等于一次性读完 5 本《红楼梦》全文)与原生视觉理解,专为复杂编程、长文档推理与知识工作而设计。
一句话总结:Kimi K3 是一个开源的、可原生理解图像与视频的、拥有超长记忆的「重量级编程 AI」,价格比 Claude Opus 4.8 便宜 40%,且完整权重将于 7 月 27 日对外开源。
月之暗面在过去 18 个月经历了 DeepSeek 崛起带来的巨大冲击,市场份额一度大幅缩水。K3 的发布堪称一次漂亮的反击——但开发者真正需要警惕的痛点仍在:
- 闭源 API 依赖风险:无论 K3 多强,在 7 月 27 日权重开放前,生产环境仍完全依赖 Moonshot 云端;区域网络、配额与定价变动不可控。
- 超长上下文 ≠ 零成本:1M token 窗口在 flat 定价下可用,但 Agent 长任务若缺乏本地持久化开发环境,中断恢复与工具链集成仍是工程瓶颈。
- 自部署门槛极高:2.8T 参数意味着生产级推理需 64 张以上加速卡的超节点——个人开发者与中小团队短期内只能走 API,无法真正「拥有」模型。
- 基准数据自报偏差:月之暗面使用 Kimi Code harness,Claude 用 Claude Code、GPT 用 Codex,独立第三方复现仍在进行中,不宜盲信单一榜单。
与此同时,这次发布的战略信号同样清晰:
- 过去 12 个月里,Kimi 系列有 9 个月占据开源模型规模上限;
- 发布时机恰在 2026 世界人工智能大会(WAIC)开幕前夜(7 月 17–20 日);
- 截至 2026 年 6 月,月之暗面 ARR 已突破 3 亿美元,今年内完成第 6 轮融资,投前估值达 315 亿美元;
- API 收入占整体七成以上,海外付费用户增长 400%。
这不是一家「卖情怀」的公司在硬撑规模,而是一家商业化正在爆发的公司,在向全球宣示技术主权。
02 核心架构:KDA、AttnRes 与 Stable LatentMoE
Kimi K3 不是简单的参数堆砌,而是在架构层面做了三项可验证的工程创新。相较OpenRouter 六月模型榜中 DeepSeek 与 Claude 的路线,K3 更侧重长上下文下的推理效率与极端稀疏 MoE 的稳定训练。
Kimi Delta Attention(KDA)—— 重新设计「注意力」机制
传统 Transformer 全注意力在长上下文下计算量呈平方级增长——处理 100 万 token 时,KV 缓存内存消耗是毁灭性的。KDA 是一种混合线性注意力机制:
- 以 3:1 比例交替使用线性注意力层与全注意力层——3 个线性层处理局部结构(计算廉价),1 个全注意力层保留全局信息流;
- KV 缓存内存减少高达 75%;
- 百万 token 上下文下,解码速度提升高达 6.3 倍;
- 在短上下文、长上下文与强化学习扩展三种场景中,均超越纯全注意力基线。
简单类比:全注意力像让一个人同时记住所有对话细节;KDA 更像高效秘书——大部分时候用快速索引,关键时刻再精准回忆。
Attention Residuals(AttnRes)—— 解决深度信息丢失
- 标准残差连接沿深度均匀积累信息,早期层关键表征在深层被稀释;
- AttnRes 引入选择性检索——模型可跨越深度直接拉取更早层的高价值表征;
- 月之暗面报告约 25% 训练效率提升,额外计算开销不足 2%。
Stable LatentMoE —— 超高稀疏度的稳定训练
Kimi K3 共 896 个专家,每次推理只激活 16 个(稀疏度 1.8%)。配套技术包括:
| 技术 | 作用 |
|---|---|
| Quantile Balancing | 从路由器得分分位数直接推导专家分配,消除启发式超参 |
| Per-Head Muon | 针对每个注意力头独立优化,使大规模训练更自适应 |
| Sigmoid Tanh Unit(SiTU) | 改进激活函数控制 |
| Gated MLA | 提升注意力选择性 |
| 综合效果 | 相较 Kimi K2,整体扩展效率提升约 2.5 倍 |
03 基准测试:Kimi K3 vs Claude Fable 5 vs GPT-5.6 Sol
以下为月之暗面自报核心基准数据。与Claude Fable 5 工程实践中强调的 Repo 级修 Bug 场景对照阅读,可更快判断选型。
| 基准测试 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 |
| MMMU-Pro(视觉) | 81.6 | 81.2 | 83.0 | 78.9 |
| OmniDocBench(文档) | 91.1 | 89.8 | 85.8 | 87.9 |
解读重点:
- SWE Marathon(编程长任务):K3 以 42.0 大幅领先,专门测试持续性长代码工作,最接近「实际写代码数小时」场景;
- Program Bench:K3 以 77.8 微弱优势第一;
- FrontierSWE:Fable 5 领跑 86.6,K3(81.2)仍大幅超越 GPT-5.6 Sol(71.3);
- OmniDocBench:K3 第一(91.1),体现视觉 + 长上下文协同;
- HLE-Full(深度推理):Claude Fable 5 以 53.3 大幅领先,K3(43.5)与 GPT-5.6 Sol(44.5)接近;
- 综合智能:Artificial Analysis Intelligence Index v4.1 中,K3 以 57.1 分排名第四,紧随 Claude Fable 5(59.9)与 GPT-5.6 Sol(58.9),榜首与第四仅差 2.8 分。
注意:上述为月之暗面自报数据,各模型使用不同推理 harness,独立第三方复现仍在进行中。
04 Kimi K3 定价多少?6 步立即接入指南
| 模型 | 输入 ($/M) | 输出 ($/M) | 缓存命中输入 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
关键信息:K3 标准价与 Claude Sonnet 5 持平($3/$15),但上下文窗口是其 5 倍;缓存命中低至 $0.30/M,月之暗面报告编程场景缓存命中率超 90%,配合 Mooncake 分离推理架构,实际有效输入成本可降至约 $0.55/M tokens(OpenRouter 7 日加权均价可佐证)。相较 Claude Opus 4.8,K3 在多项基准上更优,输入成本仅其 60%、输出成本 40%。国内 API:输入 ¥20/M、输出 ¥100/M、缓存命中 ¥2/M;消费者版 kimi.com 免费账号可用,预付费套餐 ¥199 起(优惠截至 8 月 11 日)。
6 步接入 Kimi K3(开发者路径):
- 注册 Moonshot 账号:访问 platform.kimi.ai 或 kimi.com,支持 Google 账号登录。
- 创建 API Key:在控制台生成密钥,妥善保存(仅显示一次)。
- 确认模型 ID:使用
kimi-k3;OpenRouter 用户可选moonshotai/kimi-k3,官方定价无加价。 - 配置 OpenAI 兼容客户端:将
base_url设为https://api.moonshot.ai/v1。 - 发送首条测试请求:用短 prompt 验证连通性与延迟,确认账户余额或免费额度。
- 启用缓存感知工作流:在 Kimi Code 或 Agent 场景中复用 system prompt 与工具定义,利用 90%+ 缓存命中率降低实际输入成本。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)
print(response.choices[0].message.content)
05 怎么选模型?7 月 27 日开源意味着什么?
| 场景 | 推荐模型 | 原因 |
|---|---|---|
| 持续性长代码任务 | Kimi K3 | SWE Marathon 第一,上下文最长 |
| 复杂 Repo 级修 Bug | Claude Fable 5 | FrontierSWE / SWE-bench Pro 领先 |
| 终端/工具链 Agent | GPT-5.6 Sol | Terminal Bench 与 Coding Agent Index 领先 |
| 超长文档/多模态理解 | Kimi K3 | OmniDocBench 第一,原生视觉 + 1M 上下文 |
| 成本敏感 | DeepSeek V4 Pro | 输出仅 $3.48/M,远低于 K3 |
| 需要最深推理的研究 | Claude Fable 5 | HLE-Full 53.3,大幅领先 |
| 开源自部署(7/27 后) | Kimi K3 | 迄今最强开源权重 |
月之暗面在官方公告中明确承诺:2026 年 7 月 27 日在 Hugging Face 开放完整模型权重。届时 K3 将成为:
- 迄今参数最大的可下载开源模型;
- 首个超 2 万亿参数级别的开源权重;
- 开源社区训练/微调基座新标杆——预计 vLLM、SGLang 等框架第一时间支持,并出现 MXFP4/NVFP4 量化版本。
模型以 MXFP4 权重 + MXFP8 激活训练,量化感知设计,利于现代硬件高效推理。
关注时间节点:7 月 17–20 日(WAIC,更多发布预计)→ 7 月 27 日(K3 完整权重开源)。
06 可引用技术数据与参考来源
- 总参数量:2.8 万亿(2.8T),全球最大开源模型
- MoE 配置:896 专家,每次激活 16 个(稀疏度 1.8%)
- 上下文窗口:1,048,576 tokens(1M)
- KDA 效率:KV 缓存 -75%,百万 token 解码最高 +6.3×
- AttnRes:训练效率约 +25%,额外算力 <2%
- 相对 K2 扩展效率:约 2.5×
- API 定价:$3 / $15 per 1M tokens(输入/输出);缓存命中 $0.30/M;Agent 场景有效输入约 $0.55/M
- 国内定价:¥20 / ¥100 / ¥2(输入/输出/缓存)per M tokens
- ARR(2026-06):突破 3 亿美元;投前估值 315 亿美元
- Artificial Analysis Index v4.1:K3 得分 57.1,全球第四
- 开源日期:2026 年 7 月 27 日(Hugging Face)
以下为主要参考来源;模型能力、定价与开源时间表可能随时更新,发版后请再次打开链接核对:
官方来源:
第三方报道与分析:
Artificial Analysis — Intelligence Index v4.1 排名
OpenRouter — moonshotai/kimi-k3 定价与用量
Kimi K3 在编程长任务与文档理解等关键赛道上对标乃至超越部分闭源旗舰,且承诺完整开源——但中国 AI 开源生态的竞争已从「以低价换市场」转向「挑战智能前沿」。对工程团队而言,纯 API 调用仍面临网络延迟、配额与工具链集成的隐性成本;2.8T 自部署在 7 月 27 日前不可行,之后也需超节点级算力;而共享虚拟 Mac / 云端 VM运行 Xcode、Metal 与 Agent 工具链时,Hypervisor 损耗与兼容性问题会拖累长任务 Agent 的稳定性。若你的生产环境需要零损耗 Apple Silicon、7×24 在线、稳定 iOS CI/CD 与 AI Agent 自动化(例如将 Kimi Code / Claude Code 跑在持久化物理 Mac 上对接多模型 API),ZUKCLOUD 裸金属 Mac mini 云端节点通常是更可控的选择——独占物理机、无虚拟化损耗、按天/周/月弹性下单。查看定价与下单,或阅读裸金属架构宣言了解 Agent 级托管逻辑。
07 常见问题 FAQ
Q:Kimi K3 可以免费使用吗?
A:可以。在 kimi.com 注册免费账号即可,K3 默认以最大推理力度运行;API 调用需付费($3/$15 per 1M tokens)。
Q:能本地部署 Kimi K3 吗?
A:完整权重将于 2026 年 7 月 27 日在 Hugging Face 开放。生产级推理需 64 张以上加速卡的超节点,不适合笔记本或单卡环境。
Q:Kimi K3 和 DeepSeek V4 Pro 怎么选?
A:K3 参数约 2 倍(2.8T vs 1.6T)、上下文 5 倍(1M vs 128K)、多项编程基准更强;DeepSeek 输出仅 $3.48/M,成本敏感场景更优。详见DeepSeek 算力布局一文中的生态背景。
Q:1M token 上下文真的有用吗?
A:对整库代码分析、长篇法律/科研文档、多轮 Agent 长记忆等场景非常实用;K3 按 flat 定价无长度加价,配合高缓存命中率,实际成本可控。
Q:低/高推理力度模式何时上线?
A:月之暗面表示 low 与 high 模式将在后续更新推出,目前仅 max 力度可用。