Le 30 juillet 2026, OpenAI a mis à jour sa grille tarifaire API : GPT-5.6 Luna passe de 1,00 $/6,00 $ à 0,20 $/1,20 $ par million de tokens (−80 %), Terra de 2,50 $/15,00 $ à 2 $/12 $ (−20 %), tandis que Sol reste à 5 $/30 $ et Fast à 10 $/60 $. Parallèlement, OpenAI affirme que Sol a réécrit ses kernels d'inférence GPU via Codex, générant une réduction de 20 % des coûts de serving — sans baisser le prix client de Sol. Ce guide s'adresse aux ingénieurs IA et responsables techniques qui, après la sortie open weights de Kimi K3 et le GA de DeepSeek V4, doivent recalibrer leur stratégie de routage API. En synthèse : la baisse tarifaire est documentée — l'écart de qualité sur les tâches frontier reste dépendant du workload ; calculez le coût effectif par tâche, pas seulement le prix au token.
01 Quatre risques budgétaires si l'on lit mal la baisse tarifaire
Une annonce de −80 % sur Luna évoque des économies immédiates — en pratique, de nouveaux risques apparaissent si le routage et la gouvernance ne suivent pas :
- « Le modèle le moins cher gagne » est une erreur : Luna couvre les sous-tâches à fort volume ; les pipelines agentiques calibrés sur Sol peuvent dégrader qualité et taux de retry sur Luna — le coût net augmente malgré des tarifs plus bas.
- Stabilité du prix Sol ≠ baisse de coût client : OpenAI revendique 20 % d'économies internes via des kernels GPU réécrits par Codex, mais ne reverse pas cette marge. Les workloads frontier restent à 5 $/30 $.
- La concurrence redéfinit le benchmark : Kimi K3 (0,30 $ cache hit / 3 $ cache miss en entrée, 15 $ en sortie) et DeepSeek V4 (tarification peak/off-peak dès le GA) maintiennent une pression agressive — la baisse Luna est une réaction directe, pas un avantage structurel.
- Gouvernance des données : Des tarifs US moins chers ne modifient pas le traitement des données via l'infrastructure OpenAI. Les équipes européennes doivent valider DPA, transferts et journaux avant un routage massif vers Luna.
En une phrase : les tarifs ont baissé, la décision d'architecture s'est complexifiée — le prix au token seul ne suffit pas comme critère de routage.
02 Tarifs GPT-5.6 confirmés au 30 juillet 2026
Chronologie :
- 9 juillet 2026 : Lancement de la famille GPT-5.6 (Sol, Terra, Luna) et ChatGPT Work — Luna à 1,00 $/6,00 $, Terra à 2,50 $/15,00 $, Sol à 5 $/30 $.
- 16–27 juillet 2026 : Kimi K3 passe de la preview au release open weights complet — pression tarifaire et benchmark.
- 20 juillet 2026 : DeepSeek V4 GA avec logique peak/off-peak — nouvelle agressivité sur le segment volume.
- 30 juillet 2026 : OpenAI met à jour les tarifs API — Luna −80 %, Terra −20 %, Sol et Fast inchangés.
| Tier | Avant | Dès le 30.07.2026 | Variation | Rôle |
|---|---|---|---|---|
| Luna | 1,00 $ / 6,00 $ | 0,20 $ / 1,20 $ | −80 % | Économique, sous-tâches volume |
| Terra | 2,50 $ / 15,00 $ | 2,00 $ / 12,00 $ | −20 % | Tier intermédiaire équilibré |
| Sol | 5,00 $ / 30,00 $ | 5,00 $ / 30,00 $ | Inchangé | Raisonnement frontier |
| Fast | 10,00 $ / 60,00 $ | 10,00 $ / 60,00 $ | Inchangé | Faible latence premium |
Tarifs selon la page officielle OpenAI API Pricing au 30 juillet 2026. Vérifiez la page live avant tout engagement de production.
03 Kernels GPU Sol via Codex et pression des labs chinois
Kernels GPU via Codex : OpenAI indique que Sol a réécrit de manière autonome ses kernels d'inférence GPU via Codex — un workflow qui mobiliserait normalement des semaines d'ingénierie. La réduction de 20 % des coûts de serving revendiquée explique en partie pourquoi Sol reste à 5 $/30 $ : OpenAI capture la marge plutôt que de la transmettre. Pour les clients, Sol demeure le tier frontier coûteux ; l'économie est un signal interne, pas une remise.
Contexte concurrentiel : La baisse Luna intervient trois jours après le release open weights complet de Kimi K3 et dix jours après le GA de DeepSeek V4. Kimi K3 apporte 2,8 billions de paramètres MoE, 1M tokens de contexte et 93,4 % sur SWE-bench Verified. DeepSeek V4 propose l'architecture CSA/HCA, 1M de contexte et des tarifs peak/off-peak qui obligent les pipelines agent 24/7 à router selon l'heure. La réponse d'OpenAI est agressive sur Luna/Terra, défensive sur Sol.
| Modèle | Éditeur | Tarif (in / out) | Contexte | Note |
|---|---|---|---|---|
| GPT-5.6 Luna (nouveau) | OpenAI | 0,20 $ / 1,20 $ | — | −80 % dès le 30.07.2026 |
| GPT-5.6 Terra (nouveau) | OpenAI | 2,00 $ / 12,00 $ | — | −20 % dès le 30.07.2026 |
| GPT-5.6 Sol | OpenAI | 5,00 $ / 30,00 $ | — | Inchangé ; kernels GPU Codex |
| GPT-5.6 Fast | OpenAI | 10,00 $ / 60,00 $ | — | Tier faible latence |
| Kimi K3 | Moonshot AI | 0,30 $ (cache hit) / 3 $ (miss) in, 15 $ out | 1M | Open weights dès le 27.07.2026 |
| DeepSeek V4 Pro | DeepSeek | Peak/off-peak (variable) | 1M | GA dès le 20.07.2026 |
04 Six étapes de routage après la baisse tarifaire GPT-5.6
- Établir une baseline de coûts : Exportez 30 jours d'usage par tier (Sol/Terra/Luna). Sans baseline, −80 % sur Luna n'est pas mesurable.
- Tester Luna sur des sous-tâches définies : Classifiez les prompts (résumé, classification, extraction simple) et A/B-testez Luna contre l'ancien routage Terra — incluez taux de succès et coûts de retry.
- Évaluer Terra comme nouveau tier intermédiaire par défaut : À 2 $/12 $, Terra devient attractif pour l'ingénierie quotidienne ; mesurez latence et qualité contre Sol sur votre jeu de tâches réel.
- Réserver Sol aux tâches complexes : Agents multi-étapes, raisonnement avancé et sessions de code longues restent sur Sol — l'optimisation GPU Codex justifie le prix pour OpenAI, pas automatiquement votre budget.
- Benchmarker Kimi K3 et DeepSeek V4 en parallèle : Consultez nos guides Kimi K3 et DeepSeek V4 ; un routage 100 % OpenAI ignore les alternatives les plus compétitives par type de tâche.
- Sécuriser la toolchain locale : Le routage API ne remplace pas un environnement de production stable. Pour Cursor Agent, CI/CD iOS et automatisation agent 24/7 sur Apple Silicon dédié, voir notre manifeste bare-metal.
05 Données clés, FAQ et sources
La guerre tarifaire de juillet 2026 comprime la durée de vie utile de chaque grille API à quelques semaines. Pour les équipes en stack mixte (OpenAI + labs chinois + toolchain agent locale), le coût effectif par tâche — prix token × longueur de sortie × taux de retry — prime sur le tarif catalogue.
- Baisse Luna : 1,00 $/6,00 $ → 0,20 $/1,20 $ (−80 %), effectif 30.07.2026.
- Baisse Terra : 2,50 $/15,00 $ → 2,00 $/12,00 $ (−20 %), effectif 30.07.2026.
- Sol / Fast : 5 $/30 $ et 10 $/60 $ inchangés.
- Kernel GPU Sol : réécriture Codex, −20 % coûts de serving revendiqué (interne éditeur).
- Pression concurrentielle : Kimi K3 open weights (27.07.), DeepSeek V4 GA (20.07.) — contexte direct de la réaction OpenAI.
FAQ
Quels sont les nouveaux tarifs API GPT-5.6 au 30 juillet 2026 ?
Luna : 0,20 $/1,20 $ par million de tokens entrée/sortie (−80 %). Terra : 2 $/12 $ (−20 %). Sol : 5 $/30 $ inchangé. Fast : 10 $/60 $.
Pourquoi OpenAI a-t-il baissé Luna et Terra mais pas Sol ?
Luna et Terra ciblent les workloads à fort volume sous pression de Kimi K3 et DeepSeek V4. Sol reste le flagship ; OpenAI internalise les gains Codex sans baisser le tarif client.
Qu'est-ce que la réécriture des kernels GPU Sol via Codex ?
Sol a réécrit ses kernels d'inférence GPU via Codex, revendiquant −20 % de coûts de serving tout en maintenant le tarif API Sol à 5 $/30 $.
Comment les nouveaux tarifs se comparent-ils à Kimi K3 et DeepSeek V4 ?
Luna à 0,20 $/1,20 $ sous-cote Kimi K3 sur les tâches légères. Sol à 5 $/30 $ reste plus cher — qualité et retry dépendent du workload. DeepSeek V4 exige un calcul peak/off-peak.
Dois-je reconfigurer mon routage immédiatement ?
Oui, de manière structurée : baseline, A/B Luna/Terra, Sol pour les tâches complexes, benchmark des alternatives, validation gouvernance données.
Sources primaires ci-dessous. Vérifiez tarifs et affirmations éditeur via les canaux officiels OpenAI avant toute décision de production.
OpenAI API Pricing (page officielle)
Blog officiel Moonshot AI : Kimi K3
The Verge : couverture GPT-5.6 et Codex
Pour les équipes utilisant Cursor Agent, un routage mixte OpenAI/Kimi/DeepSeek ou une CI/CD iOS en continu, les API cloud seules ne garantissent ni stabilité de la toolchain Metal locale ni environnement de production fiable — les Mac virtualisés introduisent overhead hyperviseur et risques de compatibilité. Pour des workloads de production nécessitant un compute Apple Silicon natif sans perte, une CI/CD iOS stable et une automatisation agent 24/7, les nœuds cloud Mac mini bare-metal ZUKCLOUD constituent généralement le meilleur choix : matériel Apple Silicon dédié, pas de taxe hyperviseur, disponibilité permanente, facturation journalière/hebdomadaire/mensuelle flexible. Consultez notre manifeste d'architecture bare-metal pour le détail technique.