Le 31 juillet 2026, DeepSeek a promu V4-Flash-0731 en version officielle API : toujours 284B total / 13B actifs, mais un post-training entièrement refait qui place le petit Flash au-dessus du preview V4-Pro sur plusieurs benchmarks agent et code. Au 5 août 2026, la version officielle V4-Pro et le framework agent maison Harness restent annoncés « bientôt », sans date. Cet article s’adresse aux ingénieurs agent, équipes produit sensibles au coût token et décideurs tech qui comparent les open weights chinois. Nous couvrons la timeline, les tarifs $0,14 / $0,0028 en entrée et $0,28 en sortie (par million de tokens), l’index Artificial Analysis 50 contre 57 pour Kimi K3, et la notion de kill line dans la guerre des prix. En synthèse : DeepSeek ne vise pas le score maximal — il verrouille un couple « intelligence suffisante + coût plancher » qui force le marché à réagir.
01 Ce qui a ship le 31 juillet — et ce qui attend encore
Lire « V4 officiel » laisse penser à un flagship neuf. En réalité, seul Flash-0731 a changé de statut ; Pro reste en preview. Chronologie utile :
- 24 avril : preview V4 + poids MIT (Pro 1,6T/49B actifs, Flash 284B/13B, contexte 1M).
- 24 juillet : fin des alias
deepseek-chat/deepseek-reasoner. - 27 juillet : Kimi K3 (2,8T) en open weights complet sur Hugging Face.
- 31 juillet : V4-Flash-0731 beta API officielle + poids HF ; changelog mentionne Harness pour la première fois. API seulement — app et web inchangés.
- 3 août : GA de Qwen3.8-Max (Alibaba).
- 5 août (rédaction) : pas de date confirmée pour V4-Pro GA ni Harness public.
Dans la sphère dev chinoise, la 斩杀线 (kill line) décrit le seuil prix/perf imposé par DeepSeek : sans net avantage qualité ou tarif, un modèle disparaît du radar. Avant le 31 juillet, les retards Pro alimentaient des surnoms moqueurs (« Liang Baikai ») ; après les scores Flash, le pendule revient vers « Liang Sheng ». Les baisses agressives chez OpenAI (GPT-5.6 Luna) s’inscrivent dans la même dynamique concurrentielle.
02 Fiche technique, tarification, benchmarks étiquetés
| Élément | V4-Flash-0731 | V4-Pro (preview seulement) |
|---|---|---|
| Statut | Officiel (31.07.2026) | Preview depuis 24.04., GA en attente |
| Params total / actifs | 284B / 13B (identique à avril) | 1,6T / 49B |
| Contexte | 1M tokens | 1M tokens |
| Entrée (cache miss / hit, par 1M) | $0,14 / $0,0028 | $0,435 / $0,003625 |
| Sortie (par 1M) | $0,28 | $0,87 |
| Licence | MIT | MIT |
| Terminal Bench 2.0 (DeepSeek, Harness minimal) | 82,7 | 67,9 (preview) |
| Artificial Analysis Intelligence Index | 50 (tiers) | — |
| Harness | Nommé le 31.07. ; benchmarks agent en minimal mode — framework non public au 05.08. | |
Les scores agent (Terminal Bench 2.0, etc.) proviennent du Harness minimal mode, encore non publié. DeepSeek prévient que le choix de harness « influence extrêmement » les chiffres.
03 Même ossature CSA+HCA — la victoire est dans le post-training
Point central souvent manqué : aucun paramètre supplémentaire. DeepSeek attribue les gains agent à un post-training refondu, pas à du scaling. Tendance 2026 : la bataille se joue autant sur les données et méthodes de finition que sur le nombre de billions.
L’architecture V4 (rapport « DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence ») inclut :
- Attention hybride CSA + HCA : Compressed Sparse Attention + Heavy Compressed Attention (DSA côté marketing). Claims officiels : à 1M tokens, FLOPs d’inférence ≈ 27 % de V3.2, KV cache ≈ 10 % (Flash 7 %).
- mHC : hyper-connexions contraintes sur le polytope de Birkhoff — quatre flux résiduels stables sur 61 couches.
- Optimiseur Muon : remplace AdamW ; gradients orthogonalisés Newton-Schulz.
Harness minimal mode : framework agent maison (fichiers, outils, tâches multi-étapes), alternative annoncée à Claude Code. Tous les benchmarks agent Flash-0731 : minimal mode, effort max, top_p 0,95, temperature 1,0. Tant qu’aucune reproduction indépendante (Claude Code, Cursor, OpenClaw) n’existe, ce sont des résultats vendor + framework propriétaire.
Retours terrain : taux de cache entrée faibles, timeouts classificateur sécurité — le marketing « scores en hausse » ne garantit pas une prod sans friction.
04 Tableau comparatif et 6 étapes avant bascule API
| Modèle | Total / actifs | Prix in/out (par 1M) | AA Intelligence Index | Coût/task AA |
|---|---|---|---|---|
| DeepSeek V4-Flash-0731 | 284B / 13B | $0,14 / $0,28 | 50 | ~$0,03 |
| Kimi K3 | 2,8T / ~104B (est.) | $3,00 / $15,00 | 57 | ~$0,86 |
| Qwen3.8-Max | 2,4T / 95B | $2,00 / $6,00 | non listé (rédaction) | — |
| GPT-5.6 Sol | non divulgué | — | +9 pts vs Flash | ~$1,86 |
| Claude Fable 5 | non divulgué | — | +9 pts vs Flash | ~$3,15 |
Sur l’index indépendant Artificial Analysis, Flash (50) trail Kimi K3 (57), mais coûte ~1/29 par tâche vs Kimi et ~1/105 vs Claude Fable 5. Cible : pipelines agent à volume, pas la couronne benchmark.
Checklist en six étapes :
- Classifier la charge : routage haute fréquence → Flash ; raisonnement profond → Pro preview ou frontier fermé.
- Isoler les scores Harness : Terminal Bench 82,7 ≠ perf Claude Code — A/B sur vos dépôts.
- Modéliser le cache : entrée $0,14 vs $0,0028 ≈ facteur 50 — boucles agent sans cache annulent l’avantage kill line.
- Vérifier les noms legacy :
deepseek-chatmort depuis le 24 juillet ;deepseek-v4-flash→ build 0731. - TCO vs Kimi et Qwen : à 1Md tokens entrée + 200M sortie/mois, Flash domine la facture — intégrer l’écart ~7 points d’index.
- Fixer l’hôte agent : migration API vaine si Claude Code plante sur Mac virtualisé. Voir tarifs bare metal.
05 FAQ, kill line, liens
Flash-0731 officialise un modèle « workhorse » à prix cassé — avec trois incertitudes persistantes : Pro GA, Harness public, reproduction agent indépendante.
V4-Flash-0731 est-il un nouveau modèle ?
Non — même 284B/13B qu’en avril. Les gains viennent du post-training. deepseek-v4-flash pointe automatiquement sur 0731.
Quand V4-Pro officiel et Harness ?
Au 5 août 2026, pas de date confirmée. Le changelog dit « dès que possible ». Les fenêtres 10–20 août restent des rumeurs.
Flash ou Kimi K3 ?
Index : Kimi 57, Flash 50. Coût : Flash ~29× moins cher par tâche. Plafond qualité Kimi ; volume agent Flash.
Faut-il croire les benchmarks agent DeepSeek ?
Partiellement. SWE-bench Verified est plus portable. Terminal Bench 2.0 etc. = Harness minimal non public — traiter comme auto-déclaration framework-dépendante.
Combien moins cher que Claude ?
Presse : ~36× (entrée cache miss), ~179× (cache hit), ~89× (sortie) vs Opus 4.8 — tarifs catalogue, TCO réel variable.
Données citables (05.08.2026) :
- Release officielle : 31.07.2026 — V4-Flash-0731
- 284B / 13B — architecture inchangée
- Tarifs : $0,14 / $0,0028 entrée, $0,28 sortie (par 1M tokens)
- Terminal Bench 2.0 : 82,7 vs preview Pro 67,9 (Harness minimal, vendor)
- Artificial Analysis Index : 50 vs Kimi K3 57
- V4-Pro GA + Harness : non publiés au 05.08.
Sources externes (revérifier avant publication) :
Artificial Analysis — benchmarks indépendants
Hugging Face — organisation deepseek-ai
Un tarif token agressif ne compense pas des benchmarks Harness non reproductibles, des boucles agent sans cache, ni un Mac virtualisé qui tue Claude Code la nuit. Les nœuds cloud Mac mini bare metal ZUKCLOUD offrent du vrai silicium Apple, root complet, zéro overhead hyperviseur — adaptés aux agents 7×24. Consultez la page tarifs, le manifeste bare metal et l’article V4 GA. Au-delà de la kill line, ce n’est pas l’API la moins chère qui gagne — c’est l’infra agent qui ne lâche pas en prod.