Accueil / Blog / Kimi K3 open weights
ENGINEERING BLOG · 2026.07.28

Kimi K3 open weights complets :
2,8 billions de paramètres et licence expliquée

Le 27 juillet 2026, vers 23 h, le laboratoire chinois Moonshot AI a publié les poids complets et le rapport technique de Kimi K3, tout en open-sourçant trois briques d'infrastructure : MoonEP, FlashKDA et AgentEnv. Premier modèle de classe 3T entièrement téléchargeable — 2,8 billions de paramètres, 1 million de tokens de contexte, archive d'environ 1,56 To en tête des tendances Hugging Face en moins de trente minutes. Cet article s'adresse aux ingénieurs IA, responsables produit et décideurs techniques qui doivent trancher entre hype médiatique et contraintes réelles. Conclusion d'entrée : K3 est le plafond de capacité du segment open weight, pas nécessairement le meilleur rapport qualité-prix — la licence et le workload priment.

01

Onze jours seulement après le lancement API du 16 juillet, les poids arrivent. Notre analyse initiale de Kimi K3 avait anticipé les specs ; la publication intervient en pleine polémique de distillation US-Chine. Quatre points méritent une lecture attentive avant tout POC :

  • Open source vs open weight : Moonshot n'utilise jamais « open source » dans ses documents officiels. L'OSI exige données et code d'entraînement publics — K3 ne les fournit pas.
  • Deux seuils commerciaux dans la licence : au-delà de 20 millions de dollars de revenus cumulés sur 12 mois pour un service MaaS basé sur K3, accord séparé obligatoire ; au-delà de 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels, mention « Kimi K3 » requise dans l'interface.
  • Auto-hébergement hors de portée : 2,8T paramètres et 896 experts imposent un supernœud de plus de 64 accélérateurs selon Moonshot — loin du Mac mini M4 des workflows créatifs.
  • Capacité ≠ coût optimal : environ 0,95 $/tâche sur l'Intelligence Index, contre ~0,47 $ pour GLM-5.2. Le meilleur modèle open weight n'est pas le moins cher.

En une phrase : K3 offre les poids les plus puissants téléchargeables, pas une chaîne reproductible de bout en bout — distinction essentielle pour la conformité juridique.

02

Synthèse des caractéristiques du bundle publié le 27 juillet.

Spécifications clés de Kimi K3
Élément Valeur
Paramètres totaux2,8 billions (2,8T)
Paramètres actifs~104 milliards
ArchitectureMoE : 896 experts routés, 16 activés par token
AttentionKimi Delta Attention (KDA) + Gated MLA
Contexte1 000 000 tokens
MultimodalitéVision native (ViT-V2, 27 couches)
Format des poidsMXFP4 poids + MXFP8 activations (QAT dès le SFT)
LicenceDocument personnalisé (open weight, non open source)
Date des poids complets27 juillet 2026 (11 jours après l'API)
Tarification API (par million de tokens)
Type Prix Note
Entrée (cache hit)0,30 $Taux de cache >90 % sur workloads code
Entrée (cache miss)3,00 $Tarif affiché
Sortie (trace de raisonnement incluse)15,00 $
Coût effectif typiqueproche de 0,30 $Architecture Mooncake désagrégée
Trois technologies infra co-publiées
Technologie Rôle Chiffre clé
MoonEPBibliothèque de communication MoE à granularité fineDuplication temporaire d'experts surchargés pour équilibrer les tokens par rang
FlashKDANoyau KDA haute performance (CUTLASS)Prefill 1,72×–2,22× plus rapide sur NVIDIA H20
AgentEnvSandbox agentique Firecracker microVM (co-développé avec KVCache.ai)Checkpoint 133 ms, reprise 49 ms, surcommit mémoire 6,5× (chiffres Moonshot, non reproduits indépendamment)

03

Moonshot a reconstruit trois piliers du deep learning — attention, connexions résiduelles, optimiseur — plutôt que d'empiler des paramètres. Kimi Delta Attention (KDA) applique un oubli canal par canal pour réduire le KV cache sur séquences longues ; Attention Residuals (AttnRes) gagne ~25 % d'efficacité d'entraînement pour <2 % de coût paramétrique ; Per-Head Muon optimise chaque tête indépendamment, permettant à 104B paramètres actifs de rivaliser avec des modèles fermés plus massifs.

Données tierces prioritaires :

SWE-bench Verified (évaluation indépendante Vals AI, juillet 2026)
Modèle Score Date
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
Qwen3.7-Max79,4 %2026-05-19
DeepSeek-V476,2 %2026-04-23

Artificial Analysis Intelligence Index (max reasoning) : Claude Fable 5 à 60, GPT-5.6 Sol à 59, Kimi K3 ~57 (3e mondial, 1er open weight), GLM-5.2 à 51, DeepSeek V4 Pro à 44. K3 mène aussi le Frontend Code Arena d'Arena.ai. Coût par tâche : K3 ~0,95 $, Claude Fable 5 ~2,4 $ (−60 %), GLM-5.2 ~0,47 $ (moins cher que K3). Plafond de capacité et choix économique ne coïncident pas.

04

Parcours réaliste couvrant API, routage et environnement local :

  1. Revue juridique de la licence : vérifiez si votre activité MaaS ou vos métriques d'usage (MAU, revenus) déclenchent les seuils à 20 M$ ou 100 M d'utilisateurs. La majorité des startups et PME reste hors périmètre.
  2. Démarrage API rapide : API Chat Completions compatible OpenAI SDK (https://api.moonshot.ai/v1, ID modèle kimi-k3) — changez base URL et clé API dans vos intégrations existantes.
  3. Optimiser le cache : l'architecture Mooncake affiche >90 % de hits cache sur workloads de programmation. Structurez les prompts répétitifs pour approcher 0,30 $/M en entrée effective.
  4. Fallback via OpenRouter : sans cluster 64 GPU, configurez l'un des sept hébergeurs OpenRouter (souvent au tarif officiel) en primaire ou secours.
  5. Routage par niveau de tâche : volume tolérant aux erreurs sur DeepSeek V4 Flash ou GLM-5.2 ; escalade vers K3 uniquement pour code complexe et raisonnement long.
  6. Stabiliser l'environnement agent local : Claude Code, Kilo Code ou agents custom en 24/7 exigent toolchain locale, accélération Metal et uptime — l'API cloud seule ne suffit pas. Les Mac virtualisés ajoutent une taxe hyperviseur et des risques de compatibilité CI iOS.

05

Chronologie de la publication :

  • 16 juillet : lancement API sur kimi.com et Kimi API (veille de la WAIC 2026)
  • 22–23 juillet : accusations américaines de distillation industrielle sur Claude Fable, menaces de sanctions
  • 27 juillet 23 h : poids complets, rapport technique, MoonEP et AgentEnv (FlashKDA déjà publié)
  • 28 juillet : réponse du ministère du Commerce chinois, dénonciation de « l'hégémonisme IA »
  • Taille des poids : ~1,56 To sur Hugging Face, tendance n°1 en 30 minutes.
  • SWE-bench Verified : 93,4 % en évaluation indépendante — meilleur open weight, écart de 3,6 points avec le leader fermé (97 %).
  • Coût API effectif : 0,30 $/M en entrée avec cache — environ un dixième du tarif affiché de 3,00 $.
  • Seuil d'auto-hébergement : 64+ accélérateurs recommandés — matériel grand public exclu.

FAQ

Kimi K3 est-il un modèle open source ?

Non au sens OSI. Moonshot parle d'« open weight » : poids et rapport technique publics, données et code d'entraînement non.

Peut-on utiliser Kimi K3 commercialement gratuitement ?

Oui dans la plupart des cas. Seuils MaaS 20 M$ sur 12 mois ou MAU 100 M / revenus mensuels 20 M$ : clauses additionnelles.

Quel matériel pour auto-héberger Kimi K3 ?

Supernœud 64+ accélérateurs selon Moonshot. API officielle ou OpenRouter pour la majorité des équipes.

Kimi K3 face à GPT-5.6 et Claude ?

93,4 % SWE-bench Verified, derrière les frontier fermés mais leader open weight. Intelligence Index : ~57, 3e mondial.

Différences K3 vs K2 ?

~3× paramètres, AttnRes et Per-Head Muon, contexte et multimodal étendus, seuil MaaS nouveau dans la licence.

Sources officielles au moment de la publication ; vérifiez les liens pour les mises à jour.

Blog officiel Moonshot AI : Kimi K3

Hugging Face : organisation moonshotai

GitHub : moonshotai/FlashKDA

La publication intégrale des open weights Kimi K3 ouvre l'ère des modèles 3T téléchargeables — mais exploiter 64 GPU en propre reste irréaliste pour la plupart des studios, et l'API seule ne résout ni la toolchain agent locale, ni Metal, ni la disponibilité 24/7. Les environnements Mac virtualisés imposent une taxe hyperviseur et fragilisent la CI/CD iOS. Pour une charge native sans overhead, une CI iOS stable et des agents IA en continu, les nœuds cloud Mac mini bare-metal ZUKCLOUD constituent généralement la meilleure option : Apple Silicon dédié, pas de couche hyperviseur, disponibilité permanente, facturation jour/semaine/mois. Voir notre manifeste d'architecture bare-metal.