Главная / Блог / Kimi K3 open weights
ENGINEERING BLOG · 2026.07.28

Kimi K3: полный релиз open weights —
2,8 трлн параметров и лицензия

27 июля 2026, около 23:00, китайская лаборатория Moonshot AI выложила полные веса и техотчёт Kimi K3, плюс open-source три инфраструктурных стека: MoonEP, FlashKDA, AgentEnv. Первый полностью открытый модель класса 3T — 2,8 трлн параметров, 1 млн токенов контекста, архив ~1,56 ТБ за 30 минут занял #1 в трендах Hugging Face. Для ML-инженеров, техлидов и тех, кто выбирает LLM в прод: разбираем границу «open source» vs «open weight», реальную производительность и практический путь внедрения. TL;DR: K3 — потолок open-weight по capability, но не обязательно лучший price/performance. Смотрите на workload и лицензию вместе.

01

Всего 11 дней после API-only запуска 16 июля — и веса на HF. Наш ранний разбор Kimi K3 закрывал спеки; релиз пришёлся на пик distillation gate US–China. Четыре пункта, которые обычно пропускают:

  • Open source vs open weight: Moonshot в официальных материалах ни разу не пишет «open source» — только «open weight». OSI требует публичные training data и training code. У K3 — только веса, отчёт и inference-adjacent infra.
  • Два коммерческих порога в лицензии: MaaS с выручкой >$20 млн за скользящие 12 месяцев — отдельный договор с Moonshot; MAU >100 млн или месячная выручка >$20 млн — обязательная атрибуция «Kimi K3» в UI.
  • Self-host на потребительском железе — фантазия: 2,8T params, 896 experts → официальная рекомендация 64+ GPU в суперузле. Mac mini M4 для inference K3 не масштабируется.
  • Capability ≠ cheapest option: ~$0.95/задача на Intelligence Index против ~$0.47 у GLM-5.2. Сильнейший open-weight — не самый дешёвый.

Коротко: K3 — самые мощные скачиваемые веса, но не воспроизводимый end-to-end open-source pipeline. Для compliance это принципиально.

02

Что внутри 1,56 ТБ, опубликованных 27 июля.

Ключевые спецификации Kimi K3
Параметр Значение
Всего параметров2,8 трлн (2,8T)
Активных параметров~104 млрд
АрхитектураMoE: 896 routed experts, 16 active/token
AttentionKimi Delta Attention (KDA) + Gated MLA
Контекст1 000 000 токенов
МультимодальностьNative vision (ViT-V2, 27 слоёв)
Формат весовMXFP4 weights + MXFP8 activations (QAT с SFT)
ЛицензияCustom (open weight, не open source)
Дата полных весов27 июля 2026 (через 11 дней после API)
API pricing (за 1M токенов)
Тип Цена Примечание
Input (cache hit)$0.30Cache hit rate >90% на coding workloads
Input (cache miss)$3.00Headline price
Output (с reasoning trace)$15.00
Effective costближе к $0.30Disaggregated Mooncake serving
Три co-released infra-стека
Стек Назначение Ключевая метрика
MoonEPHigh-perf comms для fine-grained MoEВременная репликация перегруженных experts для баланса tokens/rank
FlashKDAKDA kernel на CUTLASSPrefill 1,72×–2,22× быстрее на NVIDIA H20 vs flash-linear-attention baseline
AgentEnvFirecracker microVM sandbox (с KVCache.ai)Checkpoint 133 ms, resume 49 ms, memory overcommit 6,5× (данные Moonshot, не верифицированы независимо)

03

Moonshot переписала три дефолтных компонента DL — attention, residual connections, optimizer — вместо тупого scale-up. Kimi Delta Attention (KDA): channel-wise forgetting gate, линейный по времени recurrence через DPLR, KV cache на длинных seq сжимается агрессивно. Attention Residuals (AttnRes): selective aggregation вместо uniform residual stack — +~25% training efficiency при <2% param overhead. Per-Head Muon: per-head optimizer paths — почему 104B active params бьют выше веса в закрытых frontier.

Ниже — независимые оценки, vendor numbers — вторично.

SWE-bench Verified (независимая оценка Vals AI, июль 2026)
Модель Score Дата
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 — 60, GPT-5.6 Sol — 59, Kimi K3 ~57 (#3 global, #1 open-weight), GLM-5.2 — 51, DeepSeek V4 Pro — 44. K3 также #1 на Arena.ai Frontend Code Arena. Cost/task: K3 ~$0.95, Claude Fable 5 ~$2.4 (−60%), GLM-5.2 ~$0.47 (дешевле K3). Потолок capability и оптимальный TCO — разные оси.

04

Практический pipeline: API, routing, local agent env.

  1. Legal review лицензии: проверьте, попадаете ли под MaaS-порог $20M/12mo или MAU 100M / monthly revenue $20M. Большинство стартапов и mid-size команд — вне зоны.
  2. API quickstart: OpenAI SDK-compatible Chat Completions (https://api.moonshot.ai/v1, model ID kimi-k3) — меняете base URL и API key, остальное как было.
  3. Cache-aware prompt design: Mooncake disaggregated inference даёт >90% cache hit на coding. Структурируйте повторяющиеся контексты — effective input ближе к $0.30/M, не к headline $3.00.
  4. Fallback через OpenRouter: без 64-GPU кластера — один из 7 провайдеров OpenRouter (часто по официальному прайсу) как primary или failover.
  5. Task-tiered routing: high-volume tolerant work → DeepSeek V4 Flash / GLM-5.2; escalate на K3 только для hard code и long-context reasoning. Hybrid routing режет bill.
  6. Стабилизация local agent stack: Claude Code, Kilo Code, custom agents 24/7 требуют persistent toolchain, Metal acceleration, uptime. Cloud API alone не закрывает. Виртуализированный Mac = hypervisor tax + риски iOS CI compatibility.

05

Timeline релиза:

  • 16 июля: API-only на kimi.com и Kimi API (канун WAIC 2026)
  • 22–23 июля: обвинения США в industrial distillation Claude Fable, угрозы санкций
  • 27 июля 23:00: полные веса, техотчёт, MoonEP/AgentEnv (FlashKDA уже был в open source)
  • 28 июля: ответ Минкоммерции КНР, «AI hegemonism»
  • Размер весов: ~1,56 ТБ на Hugging Face, #1 trending за 30 минут.
  • SWE-bench Verified: 93,4% независимо — лучший open-weight, отставание от closed leader (97%) 3,6 п.п.
  • Effective API price: $0.30/M input при cache hit — ~1/10 от headline $3.00.
  • Self-host threshold: 64+ accelerators — consumer/prosumer hardware off the table.

FAQ

Kimi K3 — это open-source модель?

Нет по OSI. Moonshot говорит «open weight»: веса и техотчёт публичны, training data и полный training code — нет.

Можно ли использовать Kimi K3 в коммерции бесплатно?

Да в большинстве случаев. Пороги MaaS $20M/12mo или MAU 100M / monthly $20M — дополнительные условия.

Какое железо для self-host Kimi K3?

Суперузел 64+ GPU по рекомендации Moonshot. Официальный API или OpenRouter — реалистичный путь для большинства.

Kimi K3 vs GPT-5.6 и Claude?

93,4% SWE-bench Verified — ниже closed frontier, но #1 open-weight. Intelligence Index ~57, 3-е место глобально.

K3 vs K2 — главные отличия?

~3× params, AttnRes + Per-Head Muon, расширенный контекст/мультимодальность, новый MaaS revenue gate в лицензии.

Официальные источники на момент публикации; перед цитированием сверяйте актуальные данные по ссылкам.

Официальный блог Moonshot AI: Kimi K3

Hugging Face: организация moonshotai

GitHub: moonshotai/FlashKDA

Полный релиз open weights Kimi K3 открывает эру скачиваемых 3T-моделей — но 64-GPU self-host для большинства команд нереален, а API-only не решает local agent toolchain, Metal и 24/7 uptime. Виртуализированный Mac добавляет hypervisor overhead и ломает предсказуемость iOS CI/CD. Для zero-overhead native compute, стабильного iOS CI и AI agents 7×24 bare-metal Mac mini cloud nodes ZUKCLOUD — обычно лучший fit: dedicated Apple Silicon, без hypervisor tax, always-on, гибкий billing day/week/month. Подробнее — в манифесте bare-metal архитектуры.