Trois mois d'attente ont pris fin : DeepSeek V4 en version complète (GA) est en ligne depuis le 20 juillet 2026. Cette analyse s'adresse aux développeurs IA, créateurs indépendants, ingénieurs d'agents long contexte et équipes produit sensibles au budget qui doivent arbitrer entre performance, coût et souveraineté. Vous y trouverez l'architecture (CSA/HCA, mHC, Muon), les benchmarks face à GPT-5.6 et Claude Fable 5, la nouvelle grille heures creuses / heures pleines, et le calendrier de migration API — échéance 24 juillet 2026.
01 DeepSeek V4 GA : trois urgences pour les environnements de production
Par rapport à la preview d'avril, la GA apporte des gains mesurables sur les agents, le raisonnement mathématique et la génération de code — et introduit pour la première fois une tarification différenciée dans le temps. DeepSeek franchit le pas d'une offre « quasi gratuite » vers une plateforme commerciale structurée. Quatre points à traiter immédiatement :
- Compte à rebours API :
deepseek-chatetdeepseek-reasonerseront définitivement coupés le 24 juillet 2026 à 23 h 59 (heure de Pékin). Les services non migrés s'arrêteront net. - Complexité heures pleines : en semaine, 09 h 00–12 h 00 et 14 h 00–18 h 00 (Pékin), les tarifs doublent. Les pipelines d'agents 24 h/24 doivent être repensés.
- Les modèles fermés restent devant sur les tâches les plus dures : Claude Fable 5 mène SWE-bench Pro à 80,3 %. Suivre le classement sans calculer le coût par tâche conduit à surpayer.
- Open source ne signifie pas zéro exploitation : licence MIT oui, mais un MoE 1,6T en production exige un cluster GPU ; la majorité reste sur l'API — latence et quotas inclus.
En une phrase : la preview était déjà solide ; la GA consolide agents, maths et code, avec un cadre tarifaire formel.
02 De la preview à la GA : chronologie et architecture CSA/HCA/mHC/Muon
| Date | Événement |
|---|---|
| 24 avril | Preview V4 + open source (MIT) : V4-Pro (1,6T) et V4-Flash (284B) |
| Mai | Versions production V4-Flash et V4-Pro ; API généralisée |
| Juin | Baisse permanente de 75 % sur la sortie V4-Pro ($0,87/M tokens) |
| 29 juin | E-mail à tous les utilisateurs API : GA mi-juillet, première annonce heures creuses/pleines |
| 19 juillet | Accès bêta GA pour certains développeurs ; presse : « version complète demain » |
| 20 juillet | Sortie GA (date de publication de cet article) |
| 24 juillet | deepseek-chat et deepseek-reasoner hors ligne définitivement |
Famille de modèles
| Paramètre | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion (1,6T) | 284 milliards (284B) |
| Paramètres actifs/token | 49 milliards (49B) | 13 milliards (13B) |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie max. | 384K tokens | 384K tokens |
| Précision | FP4 (experts) + FP8 (reste) | FP4 + FP8 mixte |
| Pré-entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
Architecture : tenir 1M tokens sans explosion KV
Les Transformers classiques font croître le KV cache linéairement. DeepSeek V4 y répond par trois innovations — à la différence de la voie KDA de Kimi K3, V4 adopte CSA + HCA :
① Attention hybride (CSA + HCA) — fin du MLA des versions V2/V3 :
- Compressed Sparse Attention (CSA) : séquence KV compressée 4× par gating Softmax ; indexeur FP4 « lightning » en top-k (Pro : top-1024, Flash : top-512) ; fenêtre glissante des 128 derniers tokens. À 1M tokens : FLOPs d'inférence à 27 % de V3.2.
- Heavily Compressed Attention (HCA) : compression 128× puis attention dense globale ; Flash utilise HCA sur les 2 premières couches, puis alternance CSA/HCA.
- Effet global : mémoire KV à 1M = 10 % de V3.2 (Flash : 7 %).
② Manifold-Constrained Hyper-Connections (mHC) : flux résiduel à 4 canaux, matrice de mélange sous contrainte Birkhoff (doublement stochastique) — propagation stable sur 61 couches.
③ Optimiseur Muon : entraînement avec Muon plutôt qu'AdamW ; orthogonalisation Newton-Schulz des gradients — convergence plus rapide.
Modes d'inférence
| Mode | Caractéristique | Usage |
|---|---|---|
| Non-think | Pas de chaîne de pensée, réponse rapide | Q&R simples, routage |
| Think High | Raisonnement explicite (tags CoT) | Tâches moyennes, debug code |
| Think Max | Raisonnement maximal, contexte 384K+ | Maths complexes, agents longue chaîne |
Paramètres d'échantillonnage officiels : temperature=1.0, top_p=1.0 (tous modes).
03 Benchmarks : record open source vs GPT-5.6 et Claude Fable 5
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % — record open source | 96,0 % | non publié séparément | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified évalue la correction de bugs sur de vrais dépôts GitHub — 80,6 % est le meilleur score open source actuel, à égalité avec Gemini 3.1 Pro. SWE-bench Pro est plus exigeant ; Fable 5 mène à 80,3 %.
Rapport coût-performance (Artificial Analysis)
Claude Fable 5 : tâches Strategy & Ops — 3,48 $/tâche (score 50). DeepSeek V4-Pro : 0,03 $/tâche (score 38). V4-Flash : moins de 0,04 $ sur les six indices. Fable 5 coûte 116× plus pour ~12 points d'écart (31 %).
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source | MIT | Non | Non |
| Auto-hébergement | Oui | Non | Non |
| Contexte | 1M tokens | non communiqué | 1M tokens |
| Sortie API (heures creuses) | 0,87 $/M | ~15 $/M | 50 $/M |
| Sortie API (heures pleines) | 1,74 $/M | — | — |
| Capacité agent | Forte, multi-agents | Forte | Classe maximale |
| Recommandation | Budget / déploiement privé / long contexte | Algorithmes + maths | Code maximal, coût secondaire |
- Budget / appels fréquents / déploiement privé : V4-Pro ou V4-Flash
- Code maximal, coût acceptable : Claude Fable 5 (sommet SWE-bench Pro)
- Algorithmes + raisonnement mathématique : GPT-5.6 Sol / Ultra
- Traitement massif de logs/documents : entrée cache V4-Flash à 0,0028 $/M
04 Tarification heures creuses/pleines : grille complète et leviers d'économie
Changement le plus commenté de la GA : en semaine, 09 h 00–12 h 00 et 14 h 00–18 h 00 (Pékin), les tarifs doublent — comme l'électricité heure pleine.
| Modèle | Poste | Heures creuses | Heures pleines |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | ¥0,025 / 0,0035 $ / 1M | ×2 |
| V4-Pro | Entrée (cache miss) | ¥3,00 / 0,435 $ / 1M | ¥6,00 / 0,87 $ |
| V4-Pro | Sortie | ¥6,00 / 0,87 $ / 1M | ¥12,00 / 1,74 $ |
| V4-Flash | Entrée (cache hit) | ¥0,02 / 0,0028 $ / 1M | ×2 |
| V4-Flash | Entrée (cache miss) | ¥1,00 / 0,14 $ / 1M | ¥2,00 / 0,28 $ |
| V4-Flash | Sortie | ¥2,00 / 0,28 $ / 1M | ¥4,00 / 0,56 $ |
Quatre leviers pour réduire la facture :
- Tâches non temps réel en heures creuses : traitement batch, annotation, revue de code après 18 h ou avant 9 h
- Prompt cache : system prompts répétés ; cache Flash à 0,0028 $/M
- Flash en routeur : intention/routage avec Flash, raisonnement lourd vers Pro
- Préavis tarifaire : DeepSeek annonce les changements 24 h à l'avance par e-mail
Même en heures pleines, la sortie V4-Pro (1,74 $/M) reste 8,6× moins chère que Claude Opus 4.8 (15 $/M) et GPT-5.6 Sol (~15 $/M).
05 Fin de deepseek-chat : migration API en 6 étapes (échéance 24 juillet)
Attention : deepseek-chat et deepseek-reasoner cessent le 24 juillet 2026 à 15 h 59 UTC (23 h 59 Pékin).
| Ancien | Nouveau | Note |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Rapide, tâches légères |
deepseek-reasoner | deepseek-v4-flash (mode Think) | ou upgrade deepseek-v4-pro |
- Audit du dépôt : rechercher
deepseek-chatetdeepseek-reasonerdans le code, la CI et les variables d'environnement. - Choisir le modèle cible : dialogues légers →
deepseek-v4-flash(Non-think) ; anciens scénarios reasoner → Flash Think oudeepseek-v4-pro. - Mettre à jour le SDK OpenAI : modifier le paramètre
model; activer le thinking viaextra_body. - Vérifier le SDK Anthropic :
base_urlrestehttps://api.deepseek.com, seulmodelchange. - Tests de charge en staging : valider facturation heures creuses/pleines et taux de cache avant le 24 juillet.
- Déploiement production : rollout progressif, surveillance erreurs et coût tokens ; fenêtre de rollback jusqu'à l'échéance.
# Ancien (invalide après le 24.07.)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# Nouveau — SDK OpenAI
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
# SDK Anthropic compatible
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
06 Données citables, sources et recommandation d'ingénierie
- SWE-bench Verified : 80,6 % — record open source, égal Gemini 3.1 Pro
- KV cache 1M : 10 % de V3.2 (Flash 7 %) ; FLOPs d'inférence 27 % de V3.2
- Sortie V4-Pro : heures creuses 0,87 $/M, pleines 1,74 $/M — environ 1/10 à 1/100 des tarifs frontier
- Coût par tâche (Artificial Analysis) : V4-Pro 0,03 $ vs Fable 5 3,48 $ (116×)
- Échéance migration API : 24 juillet 2026, 23 h 59 Pékin
- Licence : MIT — auto-hébergement et résidence des données possibles
DeepSeek V4 GA marque l'un des jalons open source les plus importants de 2026. Sa valeur n'est pas de battre Fable 5 ou GPT-5.6 aujourd'hui, mais d'offrir la meilleure performance open source à une fraction du coût frontier. Les heures pleines ajoutent de la complexité — le rapport qualité-prix reste convaincant.
Tarifs, capacités et politique de migration peuvent évoluer — revérifiez les liens après publication :
Sources officielles :
arXiv:2606.19348 — article technique DeepSeek V4
Analyses tierces :
Artificial Analysis — comparaison coût des modèles
HuggingFace — hub modèles DeepSeek
Pour les équipes qui couplent des agents DeepSeek V4 à Xcode, Metal et des workflows créatifs sur Mac, l'API seule impose latence et quotas ; les VM cloud partagées ajoutent l'overhead de l'hyperviseur et des incompatibilités CI iOS. Quand la production exige Apple Silicon natif, disponibilité 7 j/7 et CI/CD iOS stable avec routage multi-modèles (Claude Code / Codex sur bare metal), les nœuds cloud Mac mini bare metal ZUKCLOUD offrent la base maîtrisée : machine physique dédiée, zéro perte de virtualisation, réservation flexible. Tarifs, commande, manifeste bare metal et écosystème compute DeepSeek.
Si vous utilisez encore deepseek-chat, finalisez la migration avant le 24 juillet — sinon interruption de service.