27 июля 2026, около 23:00, китайская лаборатория Moonshot AI выложила полные веса и техотчёт Kimi K3, плюс open-source три инфраструктурных стека: MoonEP, FlashKDA, AgentEnv. Первый полностью открытый модель класса 3T — 2,8 трлн параметров, 1 млн токенов контекста, архив ~1,56 ТБ за 30 минут занял #1 в трендах Hugging Face. Для ML-инженеров, техлидов и тех, кто выбирает LLM в прод: разбираем границу «open source» vs «open weight», реальную производительность и практический путь внедрения. TL;DR: K3 — потолок open-weight по capability, но не обязательно лучший price/performance. Смотрите на workload и лицензию вместе.
01 «Полный релиз» ≠ open source: четыре скрытых ограничения
Всего 11 дней после API-only запуска 16 июля — и веса на HF. Наш ранний разбор Kimi K3 закрывал спеки; релиз пришёлся на пик distillation gate US–China. Четыре пункта, которые обычно пропускают:
- Open source vs open weight: Moonshot в официальных материалах ни разу не пишет «open source» — только «open weight». OSI требует публичные training data и training code. У K3 — только веса, отчёт и inference-adjacent infra.
- Два коммерческих порога в лицензии: MaaS с выручкой >$20 млн за скользящие 12 месяцев — отдельный договор с Moonshot; MAU >100 млн или месячная выручка >$20 млн — обязательная атрибуция «Kimi K3» в UI.
- Self-host на потребительском железе — фантазия: 2,8T params, 896 experts → официальная рекомендация 64+ GPU в суперузле. Mac mini M4 для inference K3 не масштабируется.
- Capability ≠ cheapest option: ~$0.95/задача на Intelligence Index против ~$0.47 у GLM-5.2. Сильнейший open-weight — не самый дешёвый.
Коротко: K3 — самые мощные скачиваемые веса, но не воспроизводимый end-to-end open-source pipeline. Для compliance это принципиально.
02 Спеки Kimi K3 и decision matrix
Что внутри 1,56 ТБ, опубликованных 27 июля.
| Параметр | Значение |
|---|---|
| Всего параметров | 2,8 трлн (2,8T) |
| Активных параметров | ~104 млрд |
| Архитектура | MoE: 896 routed experts, 16 active/token |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Контекст | 1 000 000 токенов |
| Мультимодальность | Native vision (ViT-V2, 27 слоёв) |
| Формат весов | MXFP4 weights + MXFP8 activations (QAT с SFT) |
| Лицензия | Custom (open weight, не open source) |
| Дата полных весов | 27 июля 2026 (через 11 дней после API) |
| Тип | Цена | Примечание |
|---|---|---|
| Input (cache hit) | $0.30 | Cache hit rate >90% на coding workloads |
| Input (cache miss) | $3.00 | Headline price |
| Output (с reasoning trace) | $15.00 | — |
| Effective cost | ближе к $0.30 | Disaggregated Mooncake serving |
| Стек | Назначение | Ключевая метрика |
|---|---|---|
| MoonEP | High-perf comms для fine-grained MoE | Временная репликация перегруженных experts для баланса tokens/rank |
| FlashKDA | KDA kernel на CUTLASS | Prefill 1,72×–2,22× быстрее на NVIDIA H20 vs flash-linear-attention baseline |
| AgentEnv | Firecracker microVM sandbox (с KVCache.ai) | Checkpoint 133 ms, resume 49 ms, memory overcommit 6,5× (данные Moonshot, не верифицированы независимо) |
03 KDA, AttnRes, Per-Head Muon: что под капотом и какие цифры
Moonshot переписала три дефолтных компонента DL — attention, residual connections, optimizer — вместо тупого scale-up. Kimi Delta Attention (KDA): channel-wise forgetting gate, линейный по времени recurrence через DPLR, KV cache на длинных seq сжимается агрессивно. Attention Residuals (AttnRes): selective aggregation вместо uniform residual stack — +~25% training efficiency при <2% param overhead. Per-Head Muon: per-head optimizer paths — почему 104B active params бьют выше веса в закрытых frontier.
Ниже — независимые оценки, vendor numbers — вторично.
| Модель | Score | Дата |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 — 60, GPT-5.6 Sol — 59, Kimi K3 ~57 (#3 global, #1 open-weight), GLM-5.2 — 51, DeepSeek V4 Pro — 44. K3 также #1 на Arena.ai Frontend Code Arena. Cost/task: K3 ~$0.95, Claude Fable 5 ~$2.4 (−60%), GLM-5.2 ~$0.47 (дешевле K3). Потолок capability и оптимальный TCO — разные оси.
04 Kimi K3 в прод: 6-шаговый runbook
Практический pipeline: API, routing, local agent env.
- Legal review лицензии: проверьте, попадаете ли под MaaS-порог $20M/12mo или MAU 100M / monthly revenue $20M. Большинство стартапов и mid-size команд — вне зоны.
- API quickstart: OpenAI SDK-compatible Chat Completions (
https://api.moonshot.ai/v1, model IDkimi-k3) — меняете base URL и API key, остальное как было. - Cache-aware prompt design: Mooncake disaggregated inference даёт >90% cache hit на coding. Структурируйте повторяющиеся контексты — effective input ближе к $0.30/M, не к headline $3.00.
- Fallback через OpenRouter: без 64-GPU кластера — один из 7 провайдеров OpenRouter (часто по официальному прайсу) как primary или failover.
- Task-tiered routing: high-volume tolerant work → DeepSeek V4 Flash / GLM-5.2; escalate на K3 только для hard code и long-context reasoning. Hybrid routing режет bill.
- Стабилизация local agent stack: Claude Code, Kilo Code, custom agents 24/7 требуют persistent toolchain, Metal acceleration, uptime. Cloud API alone не закрывает. Виртуализированный Mac = hypervisor tax + риски iOS CI compatibility.
05 Citable data, FAQ и вывод
Timeline релиза:
- 16 июля: API-only на kimi.com и Kimi API (канун WAIC 2026)
- 22–23 июля: обвинения США в industrial distillation Claude Fable, угрозы санкций
- 27 июля 23:00: полные веса, техотчёт, MoonEP/AgentEnv (FlashKDA уже был в open source)
- 28 июля: ответ Минкоммерции КНР, «AI hegemonism»
- Размер весов: ~1,56 ТБ на Hugging Face, #1 trending за 30 минут.
- SWE-bench Verified: 93,4% независимо — лучший open-weight, отставание от closed leader (97%) 3,6 п.п.
- Effective API price: $0.30/M input при cache hit — ~1/10 от headline $3.00.
- Self-host threshold: 64+ accelerators — consumer/prosumer hardware off the table.
FAQ
Kimi K3 — это open-source модель?
Нет по OSI. Moonshot говорит «open weight»: веса и техотчёт публичны, training data и полный training code — нет.
Можно ли использовать Kimi K3 в коммерции бесплатно?
Да в большинстве случаев. Пороги MaaS $20M/12mo или MAU 100M / monthly $20M — дополнительные условия.
Какое железо для self-host Kimi K3?
Суперузел 64+ GPU по рекомендации Moonshot. Официальный API или OpenRouter — реалистичный путь для большинства.
Kimi K3 vs GPT-5.6 и Claude?
93,4% SWE-bench Verified — ниже closed frontier, но #1 open-weight. Intelligence Index ~57, 3-е место глобально.
K3 vs K2 — главные отличия?
~3× params, AttnRes + Per-Head Muon, расширенный контекст/мультимодальность, новый MaaS revenue gate в лицензии.
Официальные источники на момент публикации; перед цитированием сверяйте актуальные данные по ссылкам.
Официальный блог Moonshot AI: Kimi K3
Hugging Face: организация moonshotai
Полный релиз open weights Kimi K3 открывает эру скачиваемых 3T-моделей — но 64-GPU self-host для большинства команд нереален, а API-only не решает local agent toolchain, Metal и 24/7 uptime. Виртуализированный Mac добавляет hypervisor overhead и ломает предсказуемость iOS CI/CD. Для zero-overhead native compute, стабильного iOS CI и AI agents 7×24 bare-metal Mac mini cloud nodes ZUKCLOUD — обычно лучший fit: dedicated Apple Silicon, без hypervisor tax, always-on, гибкий billing day/week/month. Подробнее — в манифесте bare-metal архитектуры.