Le 24 juin 2026, OpenAI et Broadcom ont présenté Jalapeño — une puce d'inférence personnalisée développée en seulement neuf mois. Le 2 juillet, Anthropic était signalé en négociation avec Samsung pour une puce 2 nm. Puis le 7 juillet, Reuters a cité trois sources indiquant que DeepSeek développe sa propre puce AI d'inférence. Il ne s'agit pas seulement d'une histoire chinoise — c'est un mouvement sectoriel mondial vers le silicium personnalisé. Cet article analyse ce qui est confirmé, ce qui reste rumeur, et pourquoi tous les grands laboratoires AI construisent désormais leurs propres puces.
01 La vague mondiale du silicium personnalisé
Les données TrendForce (2026) montrent : la croissance des livraisons de puces AI personnalisées par les hyperscalers est de 44,6 % — bien au-dessus de la croissance des GPU standard à 16,1 %. Pour la première fois, le silicium personnalisé devance significativement les GPU en termes de croissance.
| Entreprise | Projet de puce | Phase | Données clés |
|---|---|---|---|
| DeepSeek | ASIC d'inférence (sans nom) | R&D précoce | 7,4 Md$ levés ; recrutement discret ; non confirmé |
| Alibaba (T-Head) | Zhenwu 810E / M890 | Production en série | 560 000+ unités livrées ; CA annuel milliards RMB |
| OpenAI | Jalapeño (avec Broadcom) | Tape-out terminé, déploiement fin 2026 | 9 mois de la conception au tape-out |
| TPU v6/v7 | Usage commercial à grande échelle | Gemini de bout en bout sur TPU | |
| Amazon | Trainium3 / Inferentia | Commercial | Anthropic utilise Trainium pour l\'entraînement à grande échelle |
| Anthropic | Négociations avec Samsung pour une puce 2 nm | Phase exploratoire | The Information, juillet 2026 |
02 Rapport Reuters : ce qui est confirmé et ce qui ne l'est pas
Le rapport Reuters du 7 juillet 2026 contient cinq affirmations vérifiables :
- Cas d'usage ciblé : La puce est conçue pour l'inférence (inference), pas pour l'entraînement — cohérent avec tous les grands projets de puces personnalisées 2025–2026.
- Début du projet : Environ un an avant le rapport (mi-2025), toujours en phase initiale.
- Contacts avec la chaîne d'approvisionnement : DeepSeek est en discussion avec des concepteurs de puces, des fonderies et des fournisseurs de mémoire.
- Approche de recrutement : Les ingénieurs sont recrutés discrètement, sans offres d'emploi publiques.
- Double indépendance : Le succès réduirait la dépendance à la fois envers Nvidia et Huawei Ascend.
Non confirmé : DeepSeek n'a pas officiellement confirmé le programme de puces au moment de la rédaction de cet article.
Preuves indirectes : Le financement de série A de juin 2026 (environ 51 Md RMB / 7,4 Md USD) mentionne explicitement « développement de puces AI propriétaires » comme usage des fonds.
Sources primaires :
Reuters — DeepSeek developing own AI chip (7 juillet 2026)
Blog officiel OpenAI — Annonce de la puce d'inférence Jalapeño
Wall Street Journal — Alibaba AI chip to fill Nvidia void
03 Les déclarations de Liang Wenfeng et la motivation stratégique
Liang Wenfeng (梁文鋒), fondateur et PDG de DeepSeek, accorde très peu d'interviews publiques. Les plus substantielles sont deux entretiens approfondis avec la publication chinoise Waves (Angyong) en mai 2023 et juillet 2024. Déclarations clés relatives aux puces et à la capacité de calcul :
- La vraie contrainte : « Notre vrai défi n'a jamais été le financement — ce sont les contrôles à l'exportation sur les puces avancées. » (Juillet 2024, interview Waves)
- L'écart d'efficacité : Les laboratoires chinois ont besoin d'environ quatre fois plus de puissance de calcul que leurs homologues internationaux pour obtenir des résultats équivalents.
- Le problème d'écosystème : « Beaucoup de puces nationales échouent non pas à cause du matériel, mais parce qu'elles manquent d'une communauté de développeurs. La Chine a besoin de personnes à la frontière technologique. »
- La soif de puissance de calcul : « Pour les chercheurs, la soif de puissance de calcul est sans fin. Nous déploierons délibérément autant de puissance de calcul que possible. »
Distinction importante : les citations de Liang Wenfeng établissent une motivation stratégique. Reuters rapporte des actions d'entreprise (recrutement, négociations avec les fournisseurs). Ces deux dimensions ne doivent pas être confondues.
04 Alibaba T-Head : le pari de Jack Ma en 2018 porte ses fruits
Contrairement à la phase initiale de DeepSeek, le programme de puces d'Alibaba est une stratégie exécutée sur plusieurs années, désormais en production en série. En septembre 2018, Jack Ma a fondé T-Head Semiconductor (平頭哥) en intégrant CTP et l'équipe de puces de l'Académie Damo. Le nom « blaireau du miel » — intrépide et tenace — symbolise l'engagement à long terme dans le domaine des puces.
| Modèle | Lancement | Spécifications clés | Statut |
|---|---|---|---|
| Hanguang 800 | 2019 | Puce d'inférence AI précoce | Modèle ancien |
| Zhenwu 810E | Janvier 2026 | Entraînement + inférence ; 96 Go HBM2e ; performances entre Nvidia A800 et H20 ; écosystème compatible CUDA | Production en série |
| Zhenwu M890 | 2026 | 144 Go de mémoire ; interconnexion puce à puce 800 Go/s ; ~3× les performances du 810E | Lancement en cours |
| Zhenwu V900 | Prévu T3 2027 | 216 Go de mémoire ; interconnexion 1 200 Go/s | Feuille de route |
| Zhenwu J900 | Prévu T3 2028 | Architecture de calcul parallèle propriétaire | Feuille de route |
Métriques commerciales clés (S1 2026) : livraisons cumulées 560 000+ unités ; chiffre d'affaires annuel plusieurs milliards RMB ; 400+ clients entreprises utilisant des clusters Zhenwu ; capital social de T-Head porté à 1 Md RMB (juin 2026) ; Alibaba s'engage à investir 380 Md RMB (~52 Md USD) dans l'infrastructure cloud et AI sur 3 ans ; le Zhenwu 810E est compatible avec l'écosystème CUDA de Nvidia (WSJ).
Caixin Global — Alibaba\'s New Processor Shows Applications Are Key to AI Chip Success
05 5 raisons pour lesquelles les grandes entreprises AI développent leurs propres puces
Les entreprises ne développent pas des puces pour le plaisir — la compétition AI s'est déplacée de « qui a le meilleur modèle » vers « qui a la puissance de calcul la moins chère et la plus contrôlable ». Cinq moteurs, par ordre d'importance :
- 1. L'économie : le coût d'inférence est le loyer de l'AI. L'entraînement est l'apport initial (ponctuel) ; l'inférence est le loyer mensuel (continu, proportionnel aux utilisateurs). La marge brute de Nvidia sur les GPU de centre de données dépasse 70 %. Les ASIC personnalisés convertissent la « taxe Nvidia » permanente en un investissement R&D ponctuel. Pour les déploiements d'inférence à grande échelle sur plusieurs années, le TCO peut être réduit de 40 à 65 %.
- 2. Résilience de la chaîne d'approvisionnement et risques géopolitiques. Les contrôles à l'exportation américains sur les puces AI avancées (H100/H800/H20) forcent les entreprises AI chinoises à chercher des alternatives. La sécurité signifie également la prévisibilité de la chaîne d'approvisionnement — ne pas dépendre d'un seul fournisseur ou d'une politique gouvernementale.
- 3. Co-conception matériel-logiciel. Le format UE8M0 FP8 et l'architecture MLA de DeepSeek sont optimisés pour des caractéristiques matérielles spécifiques. Le Jalapeño d'OpenAI est conçu autour des patterns réels de serving de ChatGPT. Les GPU généralistes sacrifient l'efficacité à la flexibilité ; les ASIC personnalisés sacrifient la flexibilité à l'efficacité pour des charges de travail connues.
- 4. Avantage concurrentiel et pouvoir de négociation. Même une alternative partielle à Nvidia renforce la position dans les négociations d'approvisionnement et permet de construire une narration full-stack (modèle + cloud + puce).
- 5. Énergie et développement durable. Les puces d'inférence privilégient les performances par watt. Dans les data centers à l'échelle du gigawatt, les coûts d'énergie et de refroidissement égalent ou dépassent les coûts matériels. Les ASIC éliminent les circuits généralistes inutilisés des GPU.
06 Puces d'inférence vs GPU d'entraînement : pourquoi l'inférence d'abord ?
Presque tous les programmes de puces personnalisées 2025–2026 ciblent l'inférence. Le tableau suivant explique les raisons fondamentales :
| Dimension | Entraînement | Inférence |
|---|---|---|
| Caractère de la charge de travail | Dynamique, expérimental, architecture change fréquemment | Statique, modèle fixe, patterns de requêtes prévisibles |
| Dépendance à l'écosystème logiciel | Forte dépendance CUDA (cuDNN, NCCL) | Kernels personnalisés possibles ; faible dépendance |
| Échelle économique | Grand investissement ponctuel en cluster | 7×24 h continu, croît avec le nombre d\'utilisateurs |
| Avantage ASIC personnalisé | Limité (verrouillage CUDA) | Significatif (réduction TCO 40–65 %) |
| Leaders actuels | Nvidia H100/B200 dominant | TPU, Trainium, Maia, Jalapeño, DeepSeek (rumeur) |
Conclusion : l'entraînement reste le domaine de Nvidia. L'inférence est le champ de bataille principal pour les ASIC personnalisés. Le choix de DeepSeek de cibler l'inférence est économiquement rationnel.
Risques des projets en phase initiale :
- Taux d'échec élevé en phase initiale : Du tape-out à la production en série stable, il faut généralement 2 à 4 ans. Les projets peuvent échouer à cause du rendement, de changements d'architecture ou de contraintes de fonderie.
- Le refonte MTIA de Meta : Meta a entièrement reconçu sa puce MTIA avant de la déployer en production dans les systèmes de recommandation.
- Stratégie parallèle de DeepSeek : Poursuivre la collaboration avec Huawei Ascend tout en développant une puce propriétaire — une couverture de risque rationnelle.
07 Cadre d'action en 6 étapes pour les responsables technologiques
Un cadre pratique pour les responsables technologiques et architectes qui évaluent l'impact de la tendance du silicium personnalisé :
- Quantifier les coûts d'inférence actuels (calculer la taxe Nvidia) : Examinez les dépenses GPU des 12 derniers mois et séparez l'entraînement de l'inférence. Si l'inférence dépasse 50 %, les alternatives en silicium personnalisé méritent une évaluation sérieuse.
- Analyser les caractéristiques des charges de travail : Évaluez la stabilité des patterns de requêtes, la prévisibilité de la taille des lots et les exigences de latence. L'inférence stable et prévisible est la mieux adaptée à la migration ASIC.
- Évaluer la dépendance à l'écosystème CUDA : Cartographiez les dépendances aux API propriétaires CUDA dans le code d'inférence. Une dépendance plus élevée signifie des coûts de migration plus importants.
- Filtrer les feuilles de route des fournisseurs par exigences de conformité : Alibaba Zhenwu (compatible CUDA, fabrication nationale), Huawei Ascend (écosystème fermé), ASIC internationaux (Google TPU, AWS Trainium) — filtrer selon la juridiction commerciale et les exigences réglementaires.
- Concevoir une architecture de calcul hybride : Ne pas tout remplacer d'un coup. Maintenir GPU Nvidia (entraînement flexible) + ASIC personnalisé (inférence massive stable) + machines bare-metal (workflows AI Agent à faible latence).
- Construire une liste de diversification de la chaîne d'approvisionnement : Sécuriser au moins deux chaînes d'approvisionnement de calcul indépendantes. Réviser trimestriellement les évolutions des contrôles à l'exportation et mettre à jour les plans de contingence.
08 Questions fréquentes
Q : Le rapport Reuters sur le développement de puces DeepSeek est-il fiable ?
A : Reuters a cité trois sources le 7 juillet 2026, ce qui correspond à son protocole standard à haute crédibilité. DeepSeek n'a pas confirmé officiellement le projet. Il est en phase initiale.
Q : Le PDG Liang Wenfeng a-t-il officiellement annoncé un programme de puces ?
A : Non. Dans des interviews de 2024, il a décrit les contrôles à l'exportation comme la principale contrainte — montrant une motivation stratégique, pas une annonce officielle. Reuters rapporte des actions d'entreprise, pas des déclarations du fondateur.
Q : Quelle est la différence entre Alibaba et DeepSeek sur les puces ?
A : Phases complètement différentes. T-Head d'Alibaba développe des puces depuis 2018 et produit en série le Zhenwu 810E avec 560 000+ livraisons. DeepSeek est en phase R&D initiale sans confirmation officielle.
Q : Pourquoi commencer par les puces d'inférence, pas d'entraînement ?
A : Les charges d'inférence sont répétitives et prévisibles — idéales pour les ASIC. L'entraînement requiert la flexibilité CUDA où Nvidia domine. L'inférence est le loyer mensuel, l'entraînement l'apport initial.
Q : S'agit-il de sécurité nationale ou de réduction des coûts ?
A : Les deux, mais l'économie est le moteur principal. Les ASIC personnalisés peuvent réduire le TCO de 40 à 65 % pour l'inférence à grande échelle. Les contrôles à l'exportation accélèrent un mouvement déjà motivé économiquement.
Dernière mise à jour : 10 juillet 2026 | Clause de non-responsabilité : DeepSeek n'a pas officiellement confirmé le programme de puces au moment de la rédaction. Toutes les références sont basées sur des sources publiques (Reuters, WSJ, Caixin).
Les histoires de DeepSeek et d'Alibaba révèlent un changement structurel : le coût d'inférence est devenu la variable centrale de la commercialisation de l'AI. Le cloud GPU généraliste présente des limites connues — performance imprévisible dans des pools de ressources partagées aux heures de pointe, environnements restreints, coût élevé par token à grande échelle. Les nœuds cloud bare-metal Mac mini de ZUKCLOUD répondent à un besoin spécifique et croissant : des machines Apple Silicon physiques dédiées, zéro surcharge hyperviseur, fonctionnement AI Agent 7×24 h et tarification flexible par jour/semaine/mois — un environnement d'inférence stable et contrôlable pendant la période de transition avant la maturité du marché ASIC personnalisé.