Accueil / Blog / DeepSeek V4
ENGINEERING BLOG · 2026.07.20

DeepSeek V4 GA :
tarifs, architecture et écart de performance face à GPT-5.6

Trois mois d'attente ont pris fin : DeepSeek V4 en version complète (GA) est en ligne depuis le 20 juillet 2026. Cette analyse s'adresse aux développeurs IA, créateurs indépendants, ingénieurs d'agents long contexte et équipes produit sensibles au budget qui doivent arbitrer entre performance, coût et souveraineté. Vous y trouverez l'architecture (CSA/HCA, mHC, Muon), les benchmarks face à GPT-5.6 et Claude Fable 5, la nouvelle grille heures creuses / heures pleines, et le calendrier de migration API — échéance 24 juillet 2026.

01

Par rapport à la preview d'avril, la GA apporte des gains mesurables sur les agents, le raisonnement mathématique et la génération de code — et introduit pour la première fois une tarification différenciée dans le temps. DeepSeek franchit le pas d'une offre « quasi gratuite » vers une plateforme commerciale structurée. Quatre points à traiter immédiatement :

  • Compte à rebours API : deepseek-chat et deepseek-reasoner seront définitivement coupés le 24 juillet 2026 à 23 h 59 (heure de Pékin). Les services non migrés s'arrêteront net.
  • Complexité heures pleines : en semaine, 09 h 00–12 h 00 et 14 h 00–18 h 00 (Pékin), les tarifs doublent. Les pipelines d'agents 24 h/24 doivent être repensés.
  • Les modèles fermés restent devant sur les tâches les plus dures : Claude Fable 5 mène SWE-bench Pro à 80,3 %. Suivre le classement sans calculer le coût par tâche conduit à surpayer.
  • Open source ne signifie pas zéro exploitation : licence MIT oui, mais un MoE 1,6T en production exige un cluster GPU ; la majorité reste sur l'API — latence et quotas inclus.

En une phrase : la preview était déjà solide ; la GA consolide agents, maths et code, avec un cadre tarifaire formel.

02

DeepSeek V4 — chronologie clé (2026)
Date Événement
24 avrilPreview V4 + open source (MIT) : V4-Pro (1,6T) et V4-Flash (284B)
MaiVersions production V4-Flash et V4-Pro ; API généralisée
JuinBaisse permanente de 75 % sur la sortie V4-Pro ($0,87/M tokens)
29 juinE-mail à tous les utilisateurs API : GA mi-juillet, première annonce heures creuses/pleines
19 juilletAccès bêta GA pour certains développeurs ; presse : « version complète demain »
20 juilletSortie GA (date de publication de cet article)
24 juilletdeepseek-chat et deepseek-reasoner hors ligne définitivement

Famille de modèles

V4-Pro vs V4-Flash — spécifications
Paramètre V4-Pro V4-Flash
Paramètres totaux1,6 billion (1,6T)284 milliards (284B)
Paramètres actifs/token49 milliards (49B)13 milliards (13B)
Couches Transformer6143
Fenêtre de contexte1 000 000 tokens1 000 000 tokens
Sortie max.384K tokens384K tokens
PrécisionFP4 (experts) + FP8 (reste)FP4 + FP8 mixte
Pré-entraînement33T+ tokens32T+ tokens
LicenceMITMIT

Architecture : tenir 1M tokens sans explosion KV

Les Transformers classiques font croître le KV cache linéairement. DeepSeek V4 y répond par trois innovations — à la différence de la voie KDA de Kimi K3, V4 adopte CSA + HCA :

① Attention hybride (CSA + HCA) — fin du MLA des versions V2/V3 :

  • Compressed Sparse Attention (CSA) : séquence KV compressée par gating Softmax ; indexeur FP4 « lightning » en top-k (Pro : top-1024, Flash : top-512) ; fenêtre glissante des 128 derniers tokens. À 1M tokens : FLOPs d'inférence à 27 % de V3.2.
  • Heavily Compressed Attention (HCA) : compression 128× puis attention dense globale ; Flash utilise HCA sur les 2 premières couches, puis alternance CSA/HCA.
  • Effet global : mémoire KV à 1M = 10 % de V3.2 (Flash : 7 %).

② Manifold-Constrained Hyper-Connections (mHC) : flux résiduel à 4 canaux, matrice de mélange sous contrainte Birkhoff (doublement stochastique) — propagation stable sur 61 couches.

③ Optimiseur Muon : entraînement avec Muon plutôt qu'AdamW ; orthogonalisation Newton-Schulz des gradients — convergence plus rapide.

Modes d'inférence

Modes V4 et cas d'usage
Mode Caractéristique Usage
Non-thinkPas de chaîne de pensée, réponse rapideQ&R simples, routage
Think HighRaisonnement explicite (tags CoT)Tâches moyennes, debug code
Think MaxRaisonnement maximal, contexte 384K+Maths complexes, agents longue chaîne

Paramètres d'échantillonnage officiels : temperature=1.0, top_p=1.0 (tous modes).

03

V4-Pro — données benchmarks clés
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified80,6 % — record open source96,0 %non publié séparément~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified évalue la correction de bugs sur de vrais dépôts GitHub — 80,6 % est le meilleur score open source actuel, à égalité avec Gemini 3.1 Pro. SWE-bench Pro est plus exigeant ; Fable 5 mène à 80,3 %.

Rapport coût-performance (Artificial Analysis)

Claude Fable 5 : tâches Strategy & Ops — 3,48 $/tâche (score 50). DeepSeek V4-Pro : 0,03 $/tâche (score 38). V4-Flash : moins de 0,04 $ sur les six indices. Fable 5 coûte 116× plus pour ~12 points d'écart (31 %).

Positionnement : V4-Pro vs GPT-5.6 Sol vs Claude Fable 5
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open sourceMITNonNon
Auto-hébergementOuiNonNon
Contexte1M tokensnon communiqué1M tokens
Sortie API (heures creuses)0,87 $/M~15 $/M50 $/M
Sortie API (heures pleines)1,74 $/M
Capacité agentForte, multi-agentsForteClasse maximale
RecommandationBudget / déploiement privé / long contexteAlgorithmes + mathsCode maximal, coût secondaire
  • Budget / appels fréquents / déploiement privé : V4-Pro ou V4-Flash
  • Code maximal, coût acceptable : Claude Fable 5 (sommet SWE-bench Pro)
  • Algorithmes + raisonnement mathématique : GPT-5.6 Sol / Ultra
  • Traitement massif de logs/documents : entrée cache V4-Flash à 0,0028 $/M

04

Changement le plus commenté de la GA : en semaine, 09 h 00–12 h 00 et 14 h 00–18 h 00 (Pékin), les tarifs doublent — comme l'électricité heure pleine.

V4-Pro / V4-Flash — tarifs heures creuses et pleines
Modèle Poste Heures creuses Heures pleines
V4-ProEntrée (cache hit)¥0,025 / 0,0035 $ / 1M×2
V4-ProEntrée (cache miss)¥3,00 / 0,435 $ / 1M¥6,00 / 0,87 $
V4-ProSortie¥6,00 / 0,87 $ / 1M¥12,00 / 1,74 $
V4-FlashEntrée (cache hit)¥0,02 / 0,0028 $ / 1M×2
V4-FlashEntrée (cache miss)¥1,00 / 0,14 $ / 1M¥2,00 / 0,28 $
V4-FlashSortie¥2,00 / 0,28 $ / 1M¥4,00 / 0,56 $

Quatre leviers pour réduire la facture :

  • Tâches non temps réel en heures creuses : traitement batch, annotation, revue de code après 18 h ou avant 9 h
  • Prompt cache : system prompts répétés ; cache Flash à 0,0028 $/M
  • Flash en routeur : intention/routage avec Flash, raisonnement lourd vers Pro
  • Préavis tarifaire : DeepSeek annonce les changements 24 h à l'avance par e-mail

Même en heures pleines, la sortie V4-Pro (1,74 $/M) reste 8,6× moins chère que Claude Opus 4.8 (15 $/M) et GPT-5.6 Sol (~15 $/M).

05

Attention : deepseek-chat et deepseek-reasoner cessent le 24 juillet 2026 à 15 h 59 UTC (23 h 59 Pékin).

Correspondance anciens et nouveaux noms de modèle
Ancien Nouveau Note
deepseek-chatdeepseek-v4-flash (Non-think)Rapide, tâches légères
deepseek-reasonerdeepseek-v4-flash (mode Think)ou upgrade deepseek-v4-pro
  1. Audit du dépôt : rechercher deepseek-chat et deepseek-reasoner dans le code, la CI et les variables d'environnement.
  2. Choisir le modèle cible : dialogues légers → deepseek-v4-flash (Non-think) ; anciens scénarios reasoner → Flash Think ou deepseek-v4-pro.
  3. Mettre à jour le SDK OpenAI : modifier le paramètre model ; activer le thinking via extra_body.
  4. Vérifier le SDK Anthropic : base_url reste https://api.deepseek.com, seul model change.
  5. Tests de charge en staging : valider facturation heures creuses/pleines et taux de cache avant le 24 juillet.
  6. Déploiement production : rollout progressif, surveillance erreurs et coût tokens ; fenêtre de rollback jusqu'à l'échéance.
migrate_deepseek_v4.py
# Ancien (invalide après le 24.07.)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# Nouveau — SDK OpenAI
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

# SDK Anthropic compatible
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

06

  • SWE-bench Verified : 80,6 % — record open source, égal Gemini 3.1 Pro
  • KV cache 1M : 10 % de V3.2 (Flash 7 %) ; FLOPs d'inférence 27 % de V3.2
  • Sortie V4-Pro : heures creuses 0,87 $/M, pleines 1,74 $/M — environ 1/10 à 1/100 des tarifs frontier
  • Coût par tâche (Artificial Analysis) : V4-Pro 0,03 $ vs Fable 5 3,48 $ (116×)
  • Échéance migration API : 24 juillet 2026, 23 h 59 Pékin
  • Licence : MIT — auto-hébergement et résidence des données possibles

DeepSeek V4 GA marque l'un des jalons open source les plus importants de 2026. Sa valeur n'est pas de battre Fable 5 ou GPT-5.6 aujourd'hui, mais d'offrir la meilleure performance open source à une fraction du coût frontier. Les heures pleines ajoutent de la complexité — le rapport qualité-prix reste convaincant.

Tarifs, capacités et politique de migration peuvent évoluer — revérifiez les liens après publication :

Sources officielles :

Documentation API DeepSeek

arXiv:2606.19348 — article technique DeepSeek V4

Analyses tierces :

Artificial Analysis — comparaison coût des modèles

HuggingFace — hub modèles DeepSeek

Pour les équipes qui couplent des agents DeepSeek V4 à Xcode, Metal et des workflows créatifs sur Mac, l'API seule impose latence et quotas ; les VM cloud partagées ajoutent l'overhead de l'hyperviseur et des incompatibilités CI iOS. Quand la production exige Apple Silicon natif, disponibilité 7 j/7 et CI/CD iOS stable avec routage multi-modèles (Claude Code / Codex sur bare metal), les nœuds cloud Mac mini bare metal ZUKCLOUD offrent la base maîtrisée : machine physique dédiée, zéro perte de virtualisation, réservation flexible. Tarifs, commande, manifeste bare metal et écosystème compute DeepSeek.

Si vous utilisez encore deepseek-chat, finalisez la migration avant le 24 juillet — sinon interruption de service.