En cinq jours, les équipes qui achètent des tokens API, hébergent des poids ouverts ou choisissent un modèle de code ont croisé trois mouvements qui, pris isolément, se contredisent. DeepSeek a relevé ses tarifs API jusqu'à 1 100 % sur certains postes. Alibaba, la même semaine, a publié les poids d'un flagship à 2,4 billions de paramètres qu'il n'avait jamais ouverts. Zhipu AI a livré GLM-5.3, qui fait progresser les benchmarks de code d'environ 6 fois sur la même base — sans réentraînement. Ce texte donne la chronologie, la grille tarifaire, les trois stratégies, une recette en six étapes pour recalculer la facture, et une FAQ. Ensemble, ces signaux marquent un basculement : les laboratoires chinois se disputent désormais le pouvoir de tarifer, pas seulement le prix le plus bas.
01 Chronologie : ce qui s'est passé, et quand
Le problème n'est pas « un modèle de plus ». C'est que le prix, la licence et le levier de performance ont bougé la même semaine. Les multiples des titres mélangent les postes. Les poids ouverts ne sont pas un sésame commercial. Un post-entraînement sur la même base peut faire sauter les scores du jour au lendemain. Facture, conformité et choix de modèle doivent être repris :
- Le pic officiel perd désormais face aux revendeurs : le tarif heures pleines de DeepSeek n'est plus le moyen le moins cher d'exécuter DeepSeek.
- Poids ouverts, licence sur mesure : franchissez un seuil de revenus et vous négociez une autorisation commerciale distincte.
- Le post-entraînement bat une nouvelle base : GLM-5.3 montre qu'il n'est pas nécessaire de réentraîner un fondement 743B pour relever les scores de code.
- États-Unis et Chine tarifient en sens inverse : la Chine ouvre les poids des flagships et remonte les paliers ; les laboratoires américains passent au gratuit et au moins cher côté grand public.
| Date | Événement |
|---|---|
| 16 juil. 2026 | Moonshot AI ouvre les poids de Kimi K3 (2,8 T de paramètres), ce qui attire l'attention des autorités de sécurité américaines |
| 30 juil. 2026 | OpenAI baisse GPT-5.6 Luna, son palier le moins cher, de 80 % |
| 2–3 août 2026 | Alibaba prévisualise, puis lance, Qwen3.8-Max en API hébergée |
| 6–7 août 2026 | OpenAI fait de Luna le défaut gratuit, avec des discussions texte illimitées |
| 10 août 2026 | Meta publie Muse Glimmer (30B, Apache 2.0) et évoque des poids ouverts pour le flagship Muse Spark 1.2 |
| 12 août 2026 | Alibaba publie les poids de Qwen3.8-2.4T-A95B sur Hugging Face/ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro passe en GA et annonce une hausse effective le 17 août ; Google livre Gemini 3.7 Flash à tarif réduit |
| 14 août 2026 | Zhipu livre GLM-5.3, en réutilisant la base 743B de GLM-5.2 |
| 17 août 2026, 00:00 heure de Pékin | La nouvelle grille DeepSeek entre en vigueur |
En recul : pendant que les laboratoires chinois relevaient les tarifs et ouvraient les poids des flagships, les laboratoires américains baissaient les prix et passaient au gratuit côté grand public — au même moment. Ce sont les deux faces d'une même bataille tarifaire. Contexte produit : sortie de Qwen3.8-Max, GA de DeepSeek V4 et la baisse tarifaire GPT-5.6.
02 Les chiffres : tarifs, spécifications, benchmarks
Commencez par la grille. Les heures pleines sont 9 h–12 h et 14 h–18 h, heure de Pékin. « 1 100 % », « 11x » et « 350 % » sont tous exacts — ils nomment simplement des lignes de facturation différentes :
| Poste de facturation | Ancien tarif | Nouveau hors pic | Nouveau pic | Hausse au pic |
|---|---|---|---|---|
| V4-Flash cache hit (entrée) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (entrée) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash sortie | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (entrée) | ¥0.025 | ¥0.15 | ¥0.30 | ~1,100% |
| V4-Pro cache miss (entrée) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro sortie | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Le chiffre « 1 100 % » des titres s'applique à l'entrée cache-hit en heures pleines — le poste qui partait le plus près de zéro. La sortie, qui domine la plupart des factures réelles, a augmenté de 350 %. Une modélisation indépendante des coûts montre qu'une charge lourde réaliste (environ 84 M de tokens/mois, surtout hors pic, moitié cache hits) voit une hausse de facture plus proche de 1,8x — réelle, mais très en deçà des titres les plus alarmistes.
| Spécification | Détail |
|---|---|
| Paramètres | 2,4 T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé) |
| Fenêtre de contexte | 262 144 tokens natifs (checkpoint ouvert), extensible à ~1,01 M ; la version Max hébergée vaut 1 M par défaut |
| Calendrier de sortie | Preview 2 août → API en ligne 3 août → poids ouverts 12 août |
| Tarif API (international) | 2 $/M entrée, 6 $/M sortie |
| Licence | Pas Apache 2.0 — une « Qwen3.8-Max License » sur mesure |
| Pourquoi cela compte | Première fois qu'Alibaba ouvre les poids d'un modèle de rang Max (flagship) ; Qwen3.5/3.6/3.7 Max sont restés API uniquement |
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Ce sont les chiffres déclarés par Zhipu — aucune reproduction tierce indépendante n'a encore été publiée. GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %) sur Terminal-Bench 3.0 ; c'est un très bon résultat à poids ouverts, pas une victoire frontier nette.
03 Trois stratégies, trois logiques
DeepSeek : du forfait plat au tarif selon l'heure — un problème de capacité, pas un virage stratégique
La lecture facile est : « le modèle chinois le moins cher a enfin cédé à la pression de marge ». La structure dit l'inverse : une entreprise qui rend, pour la première fois, la contrainte de calcul visible sur la grille. Un tarif plat, toujours bas, fonctionnait comme outil d'acquisition tant que la capacité GPU suivait. Une fois l'usage devenu exponentiel et la capacité non, quelque chose devait devenir explicite — et « encourager une planification plus souple des charges » est le langage d'entreprise pour « le calcul en heures pleines est désormais rare, décalez vous-mêmes ».
Un détail que la couverture internationale a surtout manqué : aux heures pleines, l'API officielle DeepSeek est désormais plus chère que plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres listent aujourd'hui V4 Pro sous le nouveau tarif pic DeepSeek). L'hypothèse « l'API officielle est toujours le moyen le moins cher d'exécuter DeepSeek » est rompue pour la première fois.
Alibaba : les poids ouverts achètent la bienveillance de l'écosystème ; une licence sur mesure protège le plafond de revenus
L'ouverture des poids de Qwen3.8-Max n'est pas un geste de générosité simple. Alibaba a fait deux choses à la fois : publier le checkpoint complet à 2,4 T de paramètres en téléchargement libre, et y attacher une licence sur mesure — pas l'Apache 2.0 permissive des plus petits Qwen — qui impose à toute activité « Model-as-a-Service » ou « AI Work Assistant » générant plus de 50 millions de dollars sur une période de 12 mois de négocier une licence commerciale distincte, et qui exige des produits à 100 M+ d'utilisateurs actifs mensuels ou 20 M$+ de revenus mensuels d'afficher clairement le nom du modèle.
La logique : offrir les poids pour gagner l'esprit des développeurs (surtout à l'international, où un « modèle made in China » hésite encore chez les acheteurs entreprise), tout en gardant un levier tarifaire sur la poignée d'acteurs capables de monter une activité d'inférence concurrente par-dessus. C'est un pari nettement différent de Muse Glimmer de Meta, livré sous Apache 2.0 sans restriction. Pour la vague précédente de poids ouverts, voir la publication complète des poids de Kimi K3.
Une rumeur à tuer explicitement : des messages ont affirmé que la licence Alibaba interdisait les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud. C'est faux. Le texte publié ne contient aucune clause géographique ou territoriale — rappel utile que, dans un cycle de sorties aussi rapide, lire le fichier LICENSE, pas le fil d'annonce, prend quelques secondes.
GLM-5.3 : pas de nouvelle base, seulement un plus gros pari de post-entraînement
Le fait le plus intéressant sur GLM-5.3 n'est pas le score, c'est la méthode : même base 743B que GLM-5.2, pas de réentraînement, et un saut d'environ 6 fois sur Terminal-Bench 3.0 (4,6 % → 28,3 %) uniquement en élargissant les environnements d'apprentissage par renforcement en post-entraînement. Alors que les lois d'échelle du préentraînement montrent des rendements décroissants, l'échelle du RL en post-entraînement devient un levier de performance indépendant, avec un plancher de coût bien plus bas que le réentraînement d'un nouveau fondement. C'est une barrière d'entrée nettement plus basse — des laboratoires de milieu de tableau, sans budget de calcul à l'échelle d'OpenAI, peuvent encore refermer l'écart sur les benchmarks agentiques et de code.
# trois labs, trois jeux, une semaine de pouvoir tarifaire
DeepSeek V4-Pro : forfait plat → pic/hors pic (capacité visible)
Qwen3.8-2.4T : premiers poids de rang Max + licence sur mesure
GLM-5.3 : même base 743B, post-entraînement seul
rumeur : interdiction géo US/UE/UK/KR — FAUX, aucune clause territoriale
note : « modèle chinois = le moins cher » n'est plus une hypothèse sûre
04 Six étapes pour recalculer votre facture modèles
Un laboratoire peut publier une nouvelle grille en une journée. L'ingénierie et les achats doivent encore recalculer la facture, la licence et la machine d'inférence. Six étapes, chacune liée à un chiffre public ci-dessus :
- Projetez d'abord la grille officielle sur votre fuseau. Le pic DeepSeek est 9 h–12 h et 14 h–18 h, heure de Pékin (01:00–04:00 et 06:00–10:00 UTC). Les heures de bureau américaines et européennes tombent surtout hors pic ; la journée chinoise est sur le pic. Même grille, facture différente.
- Séparez trois lignes de facturation. Ne restez pas fixé sur « 1 100 % ». L'entrée cache-hit a le plus monté en pourcentage et le moins en yuans absolus. La sortie (+350 %) et l'entrée cache-miss (+200 %) déplacent les vraies factures. Un modèle tiers d'environ 84 M de tokens/mois, surtout hors pic, moitié cache hits, aboutit plutôt à 1,8x.
- Lisez le fichier LICENSE. Ignorez la rumeur d'interdiction géographique. La Qwen3.8-Max License n'a aucune clause territoriale. Les déclencheurs sont une activité Model-as-a-Service / AI Work Assistant au-delà de 50 M$ sur 12 mois, ou 100 M MAU / 20 M$ de revenus mensuels pour l'affichage proéminent du nom du modèle.
- Retirez « réentraîner une plus grosse base » de la liste par défaut. GLM-5.3 a gardé la base 743B et a mis à l'échelle les environnements RL de post-entraînement. Demandez « la recette de post-entraînement peut-elle encore gagner un palier ? » avant « avons-nous besoin d'un nouveau fondement ».
- Comparez les fournisseurs. Abandonnez « modèle chinois = le moins cher ». L'entrée DeepSeek V4-Pro hors pic vaut environ 0,63 $/M — encore bien sous Claude Opus 5 (~5 $ / ~25 $, implicite d'après le ratio de comparaison d'Alibaba) — mais Qwen3.8-Max international (2 $/6 $) et GPT-5.6 Luna (0,20 $/1,20 $) le sous-cotent désormais sur au moins une dimension.
- Dimensionnez la vraie machine d'inférence. Un checkpoint 2,4 T représente environ 1,2 To de VRAM même en 4 bits. Un ordinateur portable ne l'hébergera pas. Les agents, les évaluations et les jobs long horizon exigent encore de vraies machines. Si le flux dépend d'Apple Silicon ou de la chaîne d'outils iOS, mesurez la taxe hyperviseur ; voir la note d'architecture bare-metal.
05 Comparatif, litiges, FAQ et enseignement
DeepSeek est-il encore le modèle frontier le moins cher ?
| Modèle | Entrée (par 1 M de tokens) | Sortie (par 1 M de tokens) | Poids ouverts ? |
|---|---|---|---|
| DeepSeek V4-Pro (pic) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Non |
| DeepSeek V4-Pro (hors pic) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Non |
| Qwen3.8-Max (API internationale) | $2.00 | $6.00 | Oui (licence sur mesure) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Non |
| Claude Opus 5 (implicite, selon le ratio Alibaba) | ~$5.00 | ~$25.00 | Non |
Réponse courte : non. Même après la hausse, le tarif hors pic de DeepSeek V4-Pro reste bien sous Claude Opus 5, mais ce n'est plus l'option la moins chère tout court. « Modèle chinois = modèle le moins cher » a tenu une bonne partie de 2025 et du début 2026. Ce n'est plus une hypothèse sûre.
Ce qui est contesté ou non vérifié
- Le titre « 1 100 % » est techniquement exact mais trompeur sans contexte. Il ne s'applique qu'à l'entrée cache-hit en heures pleines, le poste qui partait le plus près de zéro. La sortie — le coût qui domine la plupart des factures réelles — a augmenté de 350 %. Différents médias ont cité différents postes comme s'ils racontaient toute l'histoire.
- Les affirmations selon lesquelles Qwen3.8-Max tournerait sur les puces internes Zhenwu M890 d'Alibaba (et des supernodes « Pangu AL128 »), relayées par plusieurs médias financiers chinois comme preuve d'une pile d'inférence entièrement en silicium domestique, n'ont pas été confirmées de façon indépendante par la documentation technique d'Alibaba ni par des benchmarks tiers. Traitez cela comme un reporting adjacent au fournisseur, non vérifié jusqu'à confirmation.
- La découverte déclarée par GLM-5.3 d'une « vulnérabilité grave » dans Cursor provient du reporting de VentureBeat et de la divulgation de Zhipu ; les détails techniques n'ont pas été rendus publics, donc la revendication doit se lire comme une finding de sécurité issue du fournisseur, non auditée de façon indépendante.
- Les informations selon lesquelles le ministère chinois du Commerce (MOFCOM) préparerait des contrôles d'exportation de rétorsion sur les technologies IA/semi-conducteurs sont spéculatives et sourcées à des médias non confirmés, pas à une annonce officielle. Traitez-les comme un arrière-plan, pas comme un fait établi.
Pourquoi cela compte : deux guerres des prix en parallèle
Sur à peu près le mois écoulé, les principaux laboratoires chinois ont enchaîné des sorties majeures à un rythme que la presse financière intérieure a commencé à appeler « trois mises à jour de modèles par semaine » (一周三更) — DeepSeek, Alibaba et Zhipu, plus Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2,8 T de paramètres) et MiniMax H3 avant eux. La couverture chinoise présente largement cela comme des publications à poids ouverts chinoises « forçant une revalorisation mondiale de l'industrie de l'IA ».
Pendant ce temps, les laboratoires américains jouent le mouvement inverse côté grand public : OpenAI a baissé de 80 % son palier le moins cher (30 juillet) puis a rendu ce modèle gratuit et illimité pour tous les utilisateurs une semaine plus tard (6–7 août) ; Google a livré un modèle orienté code à la moitié du prix de son prédécesseur vieux de trois semaines (13 août). Ainsi, pendant que les laboratoires chinois ouvrent les poids des flagships et introduisent une tarification étagée, plus haute, sur le haut de gamme contraint en calcul, les laboratoires américains courent vers le gratuit et le bon marché côté consommateur. Les deux stratégies sont réelles ; elles optimisent simplement des parties différentes de l'entonnoir.
Il y a aussi une couche géopolitique à nommer avec soin. L'ouverture des poids de Kimi K3 de Moonshot en juillet a déjà attiré l'attention des autorités de sécurité américaines ; le choix d'Alibaba d'ouvrir, dans cette fenêtre précise, un flagship 2,4 T a été lu par certains analystes comme une manœuvre pour verrouiller l'esprit international et un récit de « parité technologique » avant un éventuel durcissement réglementaire. C'est une interprétation informée, pas un fait confirmé — mais c'est une part du contexte difficile à voir si l'on ne lit que la presse technique anglophone, qui a surtout couvert ces sorties comme des actualités produit isolées plutôt que comme un motif national coordonné.
Chiffres citables (à la date de publication)
- DeepSeek V4-Pro entrée cache-hit au pic : ¥0.025 → ¥0.30, ~1 100 % ; sortie ¥6.0 → ¥27.0, 350 %.
- Qwen3.8-2.4T-A95B : 2,4 T au total / 95B actifs, 262 144 tokens natifs, licence sur mesure.
- GLM-5.3 Terminal-Bench 3.0 : 4,6 % → 28,3 % (même base 743B, pas de relance de préentraînement).
- Référence de change : ~¥7.15/$1 ; hausse de facture usage lourd ~1,8x dans un modèle tiers (non officiel).
FAQ
DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude après la hausse ?
Son tarif heures creuses reste inférieur à Claude Opus 5, mais il n'est plus l'option la moins chère dans l'absolu — GPT-5.6 Luna d'OpenAI (0,20 $/1,20 $ par million de tokens) et le tarif international Qwen3.8-Max d'Alibaba (2 $/6 $) sous-cotent désormais DeepSeek heures creuses sur au moins une dimension. DeepSeek reste relativement abordable pour un modèle de classe frontier, sans être le moins cher tout court.
Puis-je utiliser gratuitement les poids ouverts de Qwen3.8-Max d'Alibaba dans un produit commercial ?
Oui, dans la plupart des cas — les projets personnels et l'usage interne en entreprise ne sont pas concernés. La contrainte ne s'applique que si vous exploitez une activité « Model-as-a-Service » ou « AI Work Assistant » ayant généré plus de 50 millions de dollars sur une période consécutive de 12 mois ; ce palier exige une licence commerciale distincte auprès d'Alibaba. Les produits à 100 M+ MAU ou 20 M$+ de revenus mensuels doivent aussi afficher clairement le nom du modèle.
Qwen3.8-Max est-il interdit ou restreint pour les utilisateurs des États-Unis, de l'UE ou du Royaume-Uni ?
Non. Cette affirmation a circulé en ligne, mais elle est fausse — la licence publiée ne contient aucune restriction géographique. Les seuils portent sur le chiffre d'affaires (le revenu de votre service), pas sur le lieu où vous ou vos utilisateurs vous trouvez.
Quelle est réellement la différence entre GLM-5.3 et GLM-5.2 ?
Aucune au niveau du modèle de base — les deux s'appuient sur le même fondement à 743 milliards de paramètres. Les gains (environ 6 fois sur Terminal-Bench 3.0) viennent entièrement de l'élargissement de l'apprentissage par renforcement en post-entraînement, sans réentraînement de la base.
Meta va-t-il vraiment ouvrir les poids de son modèle phare, et pas seulement le plus petit Muse Glimmer ?
Pas encore. Muse Glimmer est un modèle distillé 30B, pas le vrai flagship de Meta. Le PDG Mark Zuckerberg a indiqué que les poids ouverts du plus grand Muse Spark 1.2, encore fermé, arriveraient « bientôt » — ce qui, si cela se produit, en ferait le premier modèle américain de rang flagship publié ouvertement. À la date de rédaction, cette publication n'a pas eu lieu ; il s'agit d'une intention déclarée, pas d'un fait confirmé.
Les tarifs, les termes de licence et les chiffres de benchmarks reflètent les informations publiques disponibles à la date de publication. Vérifiez les derniers tarifs officiels et les termes de licence avant republication, et notez que les points signalés ci-dessus comme non vérifiés (revendications de puces domestiques, le signalement de vulnérabilité Cursor, et les rumeurs de contrôle à l'exportation) n'ont pas été confirmés de façon indépendante :
Sources officielles :
Tarifs officiels DeepSeek : Models & Pricing
Dépôt officiel Alibaba Qwen : Qwen3.8-2.4T-A95B sur Hugging Face
Texte de la Qwen3.8-Max License (LICENSE Hugging Face)
Page technique officielle GLM-5.3 de Zhipu (Z.ai)
Reporting tiers :
CNA / Reuters : DeepSeek raises API pricing for its V4 models
South China Morning Post : reporting sur les termes de licence Qwen
VentureBeat : couverture de GLM-5.3 et Muse Glimmer
Une API cloud peut imprimer « décalez votre charge » sur une grille. Les équipes d'ingénierie doivent encore faire tourner agents, évaluations et jobs long contexte sur de vraies machines — les tarifs revendeurs seront révisés, un checkpoint 2,4 T ne tiendra pas sur un ordinateur portable, et les instances cloud virtualisées vous taxent encore d'un surcoût hyperviseur et d'un mauvais ajustement Apple Silicon / chaîne d'outils iOS. Si vous avez besoin d'un calcul natif sans perte, d'une CI/CD iOS stable et d'une automatisation d'agents 7×24 dans un boîtier physique contrôlé — y compris pour des flux créatifs Final Cut, After Effects ou Xcode sur matériel Apple — les nœuds cloud Mac mini bare-metal de ZUKCLOUD sont en général le meilleur ajustement : Apple Silicon dédié, pas de taxe hyperviseur, 7×24 en ligne, facturé au jour, à la semaine ou au mois. Commencez par la page tarifs ou allez directement à la page commande.