Accueil / Blog / openPangu 2.0
ENGINEERING BLOG · 2026.07.01

Huawei openPangu 2.0 passe en open source :
MoE 505B, contexte 512K et ouverture complète Ascend

Le 30 juin 2026, Huawei a franchi une étape décisive pour l'écosystème IA souverain : la mise en ligne sur GitCode des poids Flash et du code d'inférence d'openPangu 2.0, annoncé au HDC 2026. Pour les architectes et décideurs IT qui évaluent en juillet un modèle open source à très long contexte, une conformité Xinchuang ou un déploiement natif Ascend, cet événement mérite une place immédiate en tête de shortlist. Cet article retrace la chronologie officielle, compare les versions Pro (505B) et Flash (92B), détaille les sept composants open source, analyse les innovations mHC/Muon/ModAttn et confronte openPangu à DeepSeek V4 Pro, Qwen 3.7 Max et Kimi K2.7. Notre lecture : openPangu 2.0 n'est pas le modèle open source le plus polyvalent en absolu, mais il occupe une position quasi unique sur le contexte 512K, la souveraineté matérielle, l'optimisation Ascend et l'ouverture full-stack.

01

La version Flash vient d'arriver, la Pro est attendue en juillet et les benchmarks indépendants restent en cours — une fenêtre d'attention où plusieurs erreurs de jugement se répètent :

  • Confondre « poids open source » et « chaîne complète open source » : DeepSeek V4 Pro, Qwen 3.7 Max et leurs pairs publient généralement poids et inférence ; openPangu 2.0 prévoit en plus le code de pré-entraînement, de post-entraînement (SFT/RLHF) et les opérateurs Ascend. Pour un re-pre-training vertical ou une reproduction académique, les seuls poids ne suffisent pas.
  • Sous-estimer l'ancrage matériel : openPangu 2.0 a été entièrement entraîné sur NPU Ascend 910B ; l'inférence est optimisée pour CANN et torch_npu. Flash peut être tenté hors Ascend (~96 Go de mémoire unifiée), mais sans le débit 2× annoncé.
  • Remplacer le choix par scénario par un seul benchmark : l'architecture suggère que Pro sera moins fort en génération de code et raisonnement complexe que DeepSeek V4 Pro (18B vs ~200B paramètres actifs). Pour des documents 512K, la conformité souveraine ou des agents HarmonyOS edge, le classement général ne reflète pas le ROI.
  • Ignorer la fenêtre médiatique : Flash est en ligne, Pro et le code de pré-entraînement arriveront ensuite — établir une base solide maintenant permet d'itérer vite à chaque release. Cela complète notre analyse du classement OpenRouter de juin 2026 : router avec souplesse, choisir la fondation avec précision.

02

La feuille de route est claire et vérifiable :

Chronologie clé openPangu 2.0
Date Événement
2026-06-12 HDC 2026 à Dongguan : keynote de Richard Yu, lancement officiel openPangu 2.0
2026-06-30 Poids Flash, code d'inférence de base et opérateurs train/inférence publiés sur GitCode
2026-07 (prévu) Poids et code d'inférence openPangu-2.0-Pro
S2 2026 (prévu) Code de pré-entraînement, post-entraînement et opérateurs supplémentaires
Paramètres clés Pro vs Flash
Indicateur openPangu 2.0 Pro openPangu 2.0 Flash
Paramètres totaux 505B 92B
Paramètres actifs 18B 6B
Ratio de sparsité ~28:1 ~15:1
Fenêtre de contexte 512K 512K
Disponibilité Prévu juillet 2026 En ligne depuis le 30/06/2026

Flash condense 92B paramètres totaux en 6B actifs grâce à DSA+SWA : une attention ultra-sparse qui rapproche la vitesse d'un dense 6B tout en conservant un réservoir de connaissances 92B. Le contexte 512K permet de traiter l'équivalent de huit romans complets en une seule passe.

Pro porte 505B paramètres totaux et 18B actifs — conçu pour contrats intégraux, bases de code massives et historiques de conversation extrêmes. À 512K, c'est l'un des plus longs contextes open source disponibles.

Sept composants open source et statut
Composant Statut
Architecture du modèle ✅ 30/06/2026
Poids du modèle (Flash) ✅ 30/06/2026
Rapport technique ✅ avec les poids
Code d'inférence + opérateurs train/inf ✅ 30/06/2026
Poids du modèle (Pro) 🔜 juillet 2026
Code de pré-entraînement 📋 S2 2026
Code de post-entraînement (SFT/RLHF) 📋 S2 2026

Les quatre premiers éléments suivent la pratique courante ; publier pré-entraînement, post-entraînement et opérateurs à cette échelle MoE reste exceptionnel — c'est une ouverture full-stack au sens fort.

03

openPangu 2.0 repose sur une architecture MoE (Mixture of Experts). Les piliers techniques :

  • mHC (Multi-Head Combinatorial) : routage d'experts plus efficace, moins de déséquilibre de charge.
  • Optimiseur Muon : schéma de momentum d'ordre deux (Microsoft) pour stabiliser l'entraînement à grande échelle.
  • ModAttn (Modular Attention) : attention modulaire adaptée aux séquences 512K.
  • DSA+SWA ultra-sparse (Flash) : ratio ~15:1, besoin compute d'inférence fortement réduit.

Premier grand modèle frontier sans NVIDIA : l'intégralité de l'entraînement s'est déroulée sur NPU Ascend 910B — aucun A100 ni H100. Dans un contexte de restrictions d'exportation, Huawei communique :

  • Débit monocarte vs modèles open source mainstream (environnement Ascend)
  • Efficacité super-nœud d'entraînement +30 %
  • Débit entraînement séquences 512K +50 %
  • Cohérence train/inférence >99 % (problème classique des MoE)
  • Flash-Int8 W4A8 : mémoire −40 %, perte de précision <10 %
  • Embedded 30B edge : inférence +50 %, mémoire −20 %, exécution offline sur Kirin

Stack logicielle : CANN (couche type CUDA) + torch_npu — un simple import torch_npu bascule PyTorch vers Ascend. Déploiement via ModelArts (API), GitCode Ascend Tribe (self-host) et intégration native HarmonyOS edge.

Comparaison paramétrique (juillet 2026)
Modèle Total Actif Contexte HW entraînement Profondeur open source
openPangu 2.0 Pro 505B 18B 512K Ascend NPU Full-stack (7 composants)
openPangu 2.0 Flash 92B 6B 512K Ascend NPU Full-stack (7 composants)
DeepSeek V4 Pro 1.6T ~200B 128K NVIDIA Poids + inférence
Qwen 3.7 Max ~400B+ variable 128K NVIDIA Poids + inférence + entraînement partiel
Kimi K2.7 1T 32B 256K NVIDIA Poids + inférence
Llama 4 405B 405B 128K NVIDIA Poids + inférence
Matrice de capacités (inférence architecturale, benchmarks en cours)
Dimension openPangu 2.0 Pro DeepSeek V4 Pro Qwen 3.7 Max Kimi K2.7
Génération de code ⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐
Raisonnement complexe ⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐
Tool-use / Agent ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
Ultra-long contexte ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐⭐
Efficacité d'inférence ⭐⭐⭐⭐⭐ ⭐⭐ ⭐⭐ ⭐⭐⭐⭐
Souveraineté / Xinchuang ⭐⭐⭐⭐⭐
Open source full-stack ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐
Guide de sélection par cas d'usage
Cas d'usage Recommandation Raison
Code / raisonnement complexe DeepSeek V4 Pro ~200B paramètres actifs, performance de référence
Agent / multi-outils Kimi K2.7 Écosystème MCP le plus mature
Documents >256K tokens openPangu 2.0 Pro 512K — choix naturel
Xinchuang / souveraineté openPangu 2.0 Seul frontier entièrement entraîné sur Ascend
Ascend / Huawei Cloud openPangu 2.0 Optimisation native, débit 2×
Edge / mobile openPangu Embedded (30B) Exécution offline Kirin
Inférence locale économique openPangu 2.0 Flash 6B actifs, ~96 Go suffisants

04

Deux trajectoires : API cloud pour la rapidité, self-host GitCode pour le contrôle opérationnel. Vérifier les commandes dans les README officiels après chaque release.

  1. Huawei Cloud et ModelArts (voie la plus rapide) : créer un compte, ModelArts → AI Gallery → s'abonner à « openPangu 2.0 », récupérer endpoint API et X-Auth-Token.
  2. API Chat Completions : requête REST vers l'endpoint ModelArts, champ model: "openpangu-2.0-flash", paramètres temperature et max_tokens standards.
  3. Cloner GitCode Ascend Tribe : dépôts openPangu-2.0-Flash, openPangu-2.0-Flash-Int8 (quant, −40 % RAM), openPangu-2.0-Infer, openPangu-2.0-Op.
  4. Inférence Flash monocarte (Ascend 910B) : python inference.py --model_path ./openPangu-Flash --device npu:0 --context_length 512000 --precision bf16 ; Flash-Int8 dès ~48 Go (Atlas A2).
  5. Inférence Pro multi-cartes (poids juillet) : python distributed_inference.py --model_path ./openPangu-Pro --num_devices 8 --context_length 512000 — cluster 4+ Ascend 910B recommandé.
  6. Finetune domaine et torch_npu : LoRA via python finetune.py --model_path ./openPangu-Pro --data_path ./domain_data --method lora --lora_rank 16 ; bascule Ascend par import torch_npu.
modelarts-api.sh
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "Présentez-vous brièvement"}],
    "max_tokens": 1024,
    "temperature": 0.7
  }'
Référence matérielle
Version Recommandé Minimum Note
Flash (6B actifs) 1× Ascend 910B ~96 Go mémoire unifiée Tests communautaires sur grands systèmes RAM
Flash-Int8 1× Ascend Atlas A2 ~48 Go VRAM W4A8, perte <10 %
Pro (18B actifs) 4+ Ascend 910B Cluster multi-cartes Validation après release juillet

05

Portée géopolitique : openPangu 2.0 est le premier grand modèle open source frontier entièrement entraîné sans matériel NVIDIA. Richard Yu au HDC 2026 : « Dans mon dictionnaire, il n'y a pas de deuxième place, seulement la première. » Sous embargo A100/H100, un MoE 505B sur Ascend démontre la viabilité d'une stack compute souveraine.

Ère Agent HarmonyOS : openPangu 2.0 est le moteur de la stratégie IA complète de Huawei. HarmonyOS 7 entre dans l'ère Agent ; le framework Agent 2.0 dépasse 90 % de succès sur tâches complexes ; le modèle edge 30B tourne offline sur smartphones Kirin.

Licence openPangu : usage commercial autorisé, sans redevance, non exclusif — détails dans le fichier LICENSE GitCode.

Données clés citables :

  • Paramètres : Pro 505B / 18B actifs (~28:1) ; Flash 92B / 6B actifs (~15:1) ; contexte 512K commun
  • Entraînement : Ascend 910B NPU, zéro A100/H100 NVIDIA
  • Performance : débit 2× monocarte ; entraînement 512K +50 % ; cohérence train/inf >99 % ; latence 1,2× meilleure que pairs
  • Quant/edge : Flash-Int8 −40 % RAM ; Embedded 30B +50 % vitesse, −20 % RAM
  • Roadmap : 30/06 Flash → juillet Pro → S2 pré/post-entraînement + opérateurs

DeepSeek V4 Pro reste devant en code et raisonnement complexe ; openPangu 2.0 domine sur cinq axes : ① contexte 512K ② souveraineté ③ débit Ascend 2× ④ open source full-stack ⑤ edge HarmonyOS.

Avertissement : les évaluations de capacité reposent sur une inférence architecturale ; mise à jour prévue après benchmarks indépendants. Date de publication : 1er juillet 2026.

Sources officielles (revérifier les liens avant déploiement) :

GitCode Ascend Tribe — dépôts openPangu 2.0

Huawei Cloud ModelArts

HDC 2026 — Huawei Developer Conference

Les équipes qui évaluent simultanément openPangu sur Ascend et le développement d'agents iOS/macOS subissent la taxe de l'hyperviseur et la bande passante mémoire tronquée — le jitter CI partagé érode même les API les moins chères. Pour un compute natif sans perte, un CI/CD iOS stable et une automatisation agent 24/7 en production, les nœuds cloud Mac mini bare metal ZUKCLOUD constituent en général la base la plus fiable : Apple Silicon dédié, sans hyperviseur, disponibilité permanente, commande flexible — idéal pour les workflows agent cross-platform. Voir le manifeste d'architecture bare metal.