Accueil / Blog / Classements OpenRouter
ENGINEERING BLOG · 2026.07.27

Classement OpenRouter juillet 2026 :
qui gagne vraiment la guerre du trafic IA ?

Dans l'écosystème des développeurs IA, choisir un LLM au regard d'un benchmark vieux de deux mois, c'est déjà prendre du retard. OpenRouter, la plus grande place de marché neutre de routage LLM, publie une métrique plus honnête que n'importe quel communiqué : le volume réel de tokens payés en production. Cet article décrypte les données au 25 juillet 2026 : la montée en tête du Mimo V2.5 de Xiaomi, le franchissement des 46 % de part de marché par les laboratoires chinois, et la structure en haltère entre leaders de volume et leaders de qualité. En résumé : la vraie question n'est pas qui est numéro un cette semaine, mais de quel côté de l'haltère se situent vos charges de travail.

01

Le tableau de juillet évolue plus vite que les classements OpenRouter de juin, avec une concurrence accrue au sein du camp chinois. Si vous partez encore du principe « big three américain = choix sûr », attendez-vous à ces coûts cachés :

  • Confondre volume n°1 et qualité n°1 : OpenRouter classe l'usage en tokens, pas la capacité. Le Mimo V2.5 à 1,4T tokens/jour ne signifie pas qu'il convient à votre planification agentique la plus exigeante — Claude domine toujours les dépenses sur le raisonnement difficile.
  • Ignorer un écart de prix d'environ 35x : DeepSeek V4 Flash affiche environ $0,05–0,14 par million de tokens en entrée ; GPT-5.5 avoisine $5,00. Le classement reflète autant la sensibilité au prix que la capacité brute.
  • Charts modèles uniquement, jamais apps : Hermes Agent à lui seul détient ~45 % du volume applicatif suivi ; roleplay et companions génèrent un trafic considérable que la presse enterprise mentionne à peine.
  • Verrouillage mono-fournisseur : Le « modèle du mois » tourne — MiniMax M2.5 en février, MiMo-V2-Pro en avril, Mimo V2.5 en juillet. Consultez notre guide d'intégration OpenRouter pour une architecture de repli.

En une phrase : capacité et popularité divergent — les modèles open chinois achètent le volume par le prix ; les labs fermiers américains défendent leur pouvoir de fixation sur les tâches difficiles.

02

Les chiffres de tokens ci-dessous datent du 25 juillet 2026 (classements quotidiens — vérifier sur openrouter.ai/rankings avant citation).

Top 12 modèles par volume quotidien de tokens (2026-07-25)
Rang Modèle Fournisseur Tokens/jour Total 30 jours
1Mimo V2.5Xiaomi1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3Tencent590B23.4T
4Nemotron 3 Ultra 550B (gratuit)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 FlashStepFun204.8B5.9T
9Kimi K3Moonshot AI157.6B1.6T (nouvelle entrée)
10Ling 3.0 FlashInclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

Sept des dix premières places reviennent aux labs chinois ; le camp américain tient surtout Nemotron 3 Ultra, Claude et Gemini. DeepSeek reste le fournisseur n°1 le plus stable en part (16–18 %), mais le champion mensuel du volume continue de tourner au sein du camp chinois.

Parts de tokens par fournisseur (estimations 7 jours)
Fournisseur Origine Part (approx.)
DeepSeekChine16%–18%
XiaomiChine8%–18% (pic Mimo V2.5)
AnthropicÉtats-Unis10%–15%
TencentChine8%–13%
GoogleÉtats-Unis8%–13%
Z.aiChine4%–7%
OpenAIÉtats-Unis6%–8%
Labs chinois combinés~46% (était <2% il y a un an)
Big three US combinés~30%–36% (était ~70%)
Tarifs et positionnement (juillet 2026)
Modèle Entrée/M Sortie/M Positionnement
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.28Meilleur rapport qualité-prix ; coding agentique
Nemotron 3 Ultra$0.42 (tier gratuit)$2.61Open US, stack NVIDIA
MiniMax M3$0.10$1.21Multimodal / long contexte budget
GLM 5.2$0.45$3.31Planification proche d'Opus en open
Kimi K3~$3~$151,4TB poids open, capacité tier fermé
Claude Opus 5$5 (rapide $10)$25 (rapide $50)Frontier fermé ; top benchmarks juillet

03

Chaque récap OpenRouter doit commencer par cette mise en garde : ces classements mesurent le volume de tokens, pas la capacité. Un modèle bon marché derrière une app grand public à fort trafic peut devancer un modèle plus fort réservé aux 10 % de travail les plus exigeants.

Les dépenses par catégorie de tâche racontent une autre histoire : chat général 35,7 %, workflows agentiques 30,4 %, code 26,5 %, données 7,5 %. Sur la classification et le raisonnement complexe — Claude Sonnet 4.6 et Claude Opus 4.7 à 13,5 % chacun, GPT-5.5 troisième à 11,6 % — les modèles open bon marché des charts de volume sont quasi absents.

Le marché se bifurque : les modèles open chinois bon marché absorbent les charges volumineuses et tolérantes aux erreurs (chat, création, roleplay, coding routinier), tandis que les modèles frontier fermés conservent le pouvoir de prix sur le travail difficile à faible tolérance d'erreur. Le lancement de Claude Opus 5 le 24 juillet — FrontierBench v0.1 à 43,3 % contre 37,5 % pour GPT-5.6 Sol, à $5/$25 par million de tokens — en est la preuve la plus nette. Voir Claude Opus 5 et la controverse Kimi K3 et analyse approfondie Kimi K3.

04

Le leaderboard applicatif (openrouter.ai/apps) montre ce que ces modèles font réellement :

  • Hermes Agent (agent auto-améliorant de Nous Research) détient ~45 % du volume applicatif suivi ;
  • Les agents de code occupent la majeure partie du top 10 : Kilo Code (~13 %), OpenClaw (~9 %), Claude Code (~6 %), Cline (~1,7 %) ;
  • La chaîne de forks Cline → Roo Code → Kilo Code montre que le plus jeune fork a dépassé ses ancêtres — l'avantage du first mover dans les outils dev open source ne dure pas ;
  • Roleplay et companions (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) génèrent un volume sérieux — le rapport OpenRouter × a16z State of AI estime le roleplay créatif à plus de la moitié de l'usage des modèles open.
Top 10 apps par part de tokens (approx.)
Rang App Catégorie Part
1Hermes AgentAgent personnel / CLI~45%
2Kilo CodeAgent de code~13%
3OpenClawAgent généraliste~9%
4Claude CodeAgent de code~6%
5DescriptProduction de contenu~4.5%
6piAgent~3.3%
7LemonadeCompanion / gaming~2.1%
8ISEKAI ZERORoleplay~2.0%
9Janitor AIRoleplay~1.8%
10ClineAgent de code (IDE)~1.7%

Six étapes pour construire un routage par paliers à partir du motif haltère de juillet :

  1. Inventorier tâches et tolérance aux erreurs : Répartir les charges en chat/créatif, orchestration agentique, code et raisonnement difficile ; taguer taux d'erreur acceptable et plafonds de latence par palier.
  2. Valider sur charts volume et dépenses : Par défaut, le volume élevé sur DeepSeek V4 Flash et GLM 5.2 ; réserver Claude Opus 5 / GPT-5.6 aux étapes où les modèles moins chers échouent réellement.
  3. Utiliser OpenRouter comme bac à sable : Une clé API sur des centaines de modèles pour des A/B rapides ; mesurer latence et qualité sur vos vraies tâches, pas le rang du leaderboard.
  4. Implémenter le routage hybride pour réduire les coûts : Démarrer les flux de code sur DeepSeek V4 Flash, n'escalader qu'en cas d'échec ; voir tarifs DeepSeek V4 GA et guide de migration.
  5. Intégrer la sécurité fournisseur au scorecard : La divulgation d'évasion de sandbox chez OpenAI et le projet de « AI Kill Switch Act » américain font de la traçabilité sécurité un critère formel pour les déploiements agentiques.
  6. Préparer une base compute stable pour la production agentique : Claude Code / Cursor agents locaux plus appels API cloud exigent une disponibilité 24/7 ; évaluer Mac mini bare metal vs stacks virtualisées pour l'overhead hyperviseur et la compatibilité toolchain Metal — un enjeu direct pour les workflows créatifs sur Apple Silicon.

05

Perspectives août selon la trajectoire de juillet :

  • La part combinée des modèles open chinois grimpera probablement vers ou au-delà de 50 %, sauf baisse de prix majeure d'un fournisseur US ;
  • Le champion mensuel du volume continuera de tourner — surveiller le rythme de sorties d'août chez Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot ;
  • Anthropic pourrait livrer un tier orienté volume moins cher ; Opus 5 est déjà leur quatrième flagship en moins de deux mois ;
  • Les poids 1,4TB de Kimi K3 devraient voir des versions quantifiées communautaires sous 2–4 semaines ;
  • Sécurité et gouvernance deviennent des critères réels d'achat enterprise.
  • Volume quotidien Mimo V2.5 : ~1,4 billion tokens/jour au 25 juillet ; 31,2T sur 30 jours.
  • Écart de prix US-Chine : DeepSeek V4 Flash ~$0,05–0,14/M entrée vs GPT-5.5 ~$5/M — environ 35x.
  • Migration de part chinoise : De moins de 2 % à ~46 % en 12 mois — l'une des bascules les plus abruptes de l'IA.
  • Benchmark Claude Opus 5 : FrontierBench v0.1 à 43,3 % ; tarifs $5/$25 par million de tokens (rapide $10/$50).

FAQ

Sur quoi se base le classement OpenRouter ?

Volume réel de tokens payés — choix de routage production que les développeurs financent — pas les benchmarks.

Quel modèle a dominé OpenRouter en juillet 2026 ?

Le Mimo V2.5 de Xiaomi à environ 1,4 billion de tokens par jour au 25 juillet 2026.

Quelle part détiennent les modèles chinois sur OpenRouter ?

Environ 46 % du volume de tokens identifié, contre moins de 2 % il y a un an.

Un rang d'usage élevé signifie-t-il une meilleure qualité ?

Pas nécessairement. Router le volume tolérant vers des modèles open bon marché ; réserver les modèles fermiers premium aux tâches difficiles.

Sources principales ci-dessous ; les classements évoluent quotidiennement — vérifier les chiffres actuels avant citation.

Classements officiels OpenRouter

Leaderboard OpenRouter Apps

OpenRouter Blog : DeepSeek V4 Adoption

Rapport OpenRouter × a16z State of AI

L'enseignement de juillet : capacité et popularité divergent. Pour les équipes qui font tourner Claude Code, Kilo Code ou des agents custom 24/7, le routage API seul ne résout ni la toolchain locale, ni l'accélération Metal, ni la disponibilité — les Mac virtualisés ajoutent de l'overhead hyperviseur et un risque de compatibilité iOS CI. Pour les environnements de production exigeant une compute native sans perte, un iOS CI/CD stable et une automatisation agentique IA 24/7, les nœuds cloud Mac mini bare metal ZUKCLOUD sont en général le meilleur choix : matériel Apple Silicon dédié, pas de taxe hyperviseur, always-on, facturation flexible jour/semaine/mois. Voir notre manifeste d'architecture bare metal.