Accueil / Blog / Kimi K3
ENGINEERING BLOG · 2026.07.17

Kimi K3 :
le modèle open source de 2,8 billions de paramètres

Dans la nuit du 16 juillet 2026, Moonshot AI a activé Kimi K3 sans keynote — une bannière discrète dans la documentation API, un billet technique et un modèle immédiatement invocable. Pour les équipes produit, créatifs techniques et ingénieurs IA qui jonglent entre modèles frontier et contraintes Apple Silicon, cette analyse répond à trois questions : pourquoi 2,8 billions de paramètres changent la donne open source, comment l'architecture tient la promesse d'un contexte d'un million de tokens, et comment intégrer K3 avant la libération des poids complets le 27 juillet 2026.

01

Kimi K3 devient le plus grand LLM open source disponible : 2,8 billions (2,8T) de paramètres, soit environ 75 % de plus que DeepSeek V4 Pro (1,6T). Architecture MoE sparse : 896 experts, 16 activés par inférence (1,8 % de sparsité). Le modèle embarque un contexte de 1 048 576 tokens, la vision native (images et vidéo) et une orientation programmation longue durée — un profil qui intéresse autant les studios post-production sur Mac que les équipes CI/CD iOS.

En une phrase : K3 est un assistant de code open source multimodal, avec une mémoire de travail exceptionnelle, au prix d'un Claude Sonnet 5 — et ses poids complets arrivent le 27 juillet.

Les promesses marketing masquent des frictions réelles :

  • Dépendance cloud pré-27/07 : tant que les poids ne sont pas publics, votre pipeline repose entièrement sur l'infrastructure Moonshot — latence transpacifique, quotas, évolution tarifaire.
  • Contexte long ≠ workflow fluide : un million de tokens utiles pour analyser un dépôt entier, mais sans environnement de dev persistant (Mac dédié, Xcode stable), la reprise d'agent après interruption reste pénible.
  • Auto-hébergement hors de portée : Moonshot estime plus de 64 accélérateurs pour l'inférence production — loin des Mac mini M4 que les créatifs utilisent au quotidien.
  • Benchmarks auto-déclarés : harness Kimi Code vs Claude Code vs Codex — prudence jusqu'aux reproductions indépendantes.
  • Concurrence créative : pour Final Cut Pro, Metal et pipelines vidéo, le modèle API ne remplace pas une machine Apple native — il l'alimente.

Le signal stratégique est clair : Kimi a dominé la taille open source 9 mois sur 12 ; le lancement coïncide avec la WAIC 2026 (17–20 juillet). ARR >300 M$ (juin 2026), valorisation 31,5 Md$ pre-money, croissance payants internationaux +400 %.

Moonshot ne vend plus seulement de la taille — elle vend une souveraineté technique open source au moment où l'écosystème chinois passe du prix à la frontière.

02

Contrairement à une simple montée en paramètres, K3 innove sur trois axes — comparables aux choix décrits dans le classement OpenRouter de juin, mais orientés efficacité long contexte.

Kimi Delta Attention (KDA)

L'attention complète coûte quadratiquement ; à 1M tokens, le KV-cache sature la mémoire GPU. KDA alterne attention linéaire et complète en ratio 3:1 :

  • Trois couches linéaires pour la structure locale, une couche complète pour le flux global ;
  • Réduction mémoire KV jusqu'à −75 % ;
  • Décodage à 1M tokens : jusqu'à ×6,3 plus rapide ;
  • Performance supérieure aux baselines full-attention sur contextes courts, longs et en RL scaling.

Attention Residuals (AttnRes)

  • Les connexions résiduelles classiques diluent les représentations des premières couches ;
  • AttnRes permet une récupération sélective à travers la profondeur ;
  • Efficacité d'entraînement : +25 %, surcoût calcul <2 %.

Stable LatentMoE

Techniques d'accompagnement Stable LatentMoE
Technique Rôle
Quantile BalancingAllocation d'experts depuis les quantiles du routeur — sans hyperparamètres heuristiques
Per-Head MuonOptimisation par tête d'attention pour un grand entraînement stable
Sigmoid Tanh Unit (SiTU)Contrôle d'activation affiné
Gated MLASélectivité attention renforcée
Effet global~×2,5 efficacité de scaling vs Kimi K2

03

Données Moonshot du 16.07.2026. Pour les scénarios repo-level, croisez avec Claude Code sur Mac mini.

Benchmarks clés (auto-déclaration Moonshot)
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE67,570,073,059,0
Program Bench77,876,877,671,9
Terminal Bench 2.188,384,688,884,6
FrontierSWE81,286,671,366,7
SWE Marathon42,035,039,040,0
BrowseComp91,288,090,484,3
Automation Bench30,829,129,727,2
GPQA-Diamond93,592,694,191,0
MMMU-Pro81,681,283,078,9
OmniDocBench91,189,885,887,9

Lecture métier : K3 domine SWE Marathon (sessions code de plusieurs heures) et OmniDocBench (documents multimodaux). FrontierSWE reste le territoire de Fable 5. Intelligence Index v4.1 : K3 à 57,1, 4e mondial.

Ces chiffres proviennent de Moonshot avec des harness différents — attendez les retests indépendants avant de basculer toute la production.

04

Comparatif tarifs et contexte (USD / 1M tokens)
Modèle Entrée Sortie Cache Contexte
Kimi K33 $15 $0,30 $1M
Claude Sonnet 53 $15 $200K
Claude Opus 4.85 $25 $200K
GPT-5.55 $30 $400K
DeepSeek V4 Pro1,74 $3,48 $0,145 $128K
Kimi K2.60,95 $4 $0,16 $256K

K3 aligne Sonnet 5 (3 $/15 $) avec cinq fois plus de contexte. Cache à 0,30 $/M, taux de hit >90 % en coding selon Moonshot. Chine : ¥20 / ¥100 / ¥2. Interface consommateur gratuite sur kimi.com.

Six étapes pour brancher K3 :

  1. Créer un compte Moonshot sur platform.kimi.ai ou kimi.com.
  2. Générer une clé API dans la console (affichée une seule fois).
  3. Fixer l'ID modèle : kimi-k3 ; OpenRouter : moonshotai/kimi-k3.
  4. Configurer un client OpenAI-compatible : base_url = https://api.moonshot.ai/v1.
  5. Envoyer un test de fumée pour valider latence et quota.
  6. Activer le workflow cache-aware : réutiliser system prompts et définitions d'outils.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analyse ce code..."}]
)
print(response.choices[0].message.content)

05

Matrice de décision par scénario
Scénario Modèle Pourquoi
Code longue duréeKimi K3SWE Marathon #1, contexte maximal
Correctifs repo-levelClaude Fable 5FrontierSWE leader
Agents terminal/outilsGPT-5.6 SolTerminal Bench 2.1
Documents longs + visionKimi K3OmniDocBench 91,1
Budget serréDeepSeek V4 ProSortie 3,48 $/M
Self-host post-27/07Kimi K3Poids open source les plus puissants à ce jour

Moonshot confirme la publication intégrale sur Hugging Face le 27 juillet 2026 — premier modèle open source au-delà de 2T. Entraînement MXFP4 poids + MXFP8 activations. Calendrier : WAIC 17–20 juillet → 27 juillet open weights.

06

  • Paramètres totaux : 2,8T
  • MoE : 896 experts, 16 actifs (1,8 %)
  • Contexte : 1 048 576 tokens
  • KDA : KV −75 %, décodage ×6,3 à 1M
  • AttnRes : +25 % efficacité entraînement
  • Scaling vs K2 : ~×2,5
  • API : 3 $ / 15 $ / 0,30 $ par M tokens
  • Chine : ¥20 / ¥100 / ¥2
  • ARR juin 2026 : >300 M$ ; valorisation 31,5 Md$
  • AA Index v4.1 : 57,1 (4e)
  • Open weights : 27.07.2026

Vérifiez les liens après chaque mise à jour upstream :

Sources officielles :

Moonshot AI — blog technique Kimi K3

Kimi API Platform — documentation et tarifs

Analyses tierces :

Artificial Analysis — Intelligence Index v4.1

OpenRouter — moonshotai/kimi-k3

Kimi K3 redéfinit la frontière open source — mais l'appel API seul laisse des latences, des quotas et une intégration toolchain fragile ; l'auto-hébergement exige un super-nœud GPU ; les Mac virtuels partagés pénalisent Metal, Xcode et les agents longue durée. Pour les équipes créatives et dev qui exigent une puissance Apple Silicon native, un CI/CD iOS stable et des agents 7×24 (Kimi Code ou Claude Code sur Mac physique persistant), les nœuds cloud Mac mini bare metal ZUKCLOUD offrent la base la plus fiable : machine dédiée, zéro perte hyperviseur, commande flexible. Consultez les tarifs, passez commande, ou lisez le manifeste bare metal.

07

Q : Kimi K3 est-il gratuit ?
A : Interface kimi.com gratuite (mode max). API payante 3 $/15 $ par M tokens.

Q : Déploiement local ?
A : Poids complets le 27.07.2026 sur Hugging Face. Production : 64+ accélérateurs.

Q : K3 ou DeepSeek V4 Pro ?
A : K3 plus grand et plus contextuel ; DeepSeek moins cher — voir écosystème DeepSeek.

Q : Utilité du contexte 1M ?
A : Analyse de dépôt entier, documents juridiques, mémoire agent — tarif flat sans surcoût longueur.

Q : Modes low/high ?
A : Annoncés pour plus tard ; seul max disponible en juillet 2026.