Startseite / Blog / openPangu 2.0
ENGINEERING BLOG · 2026.07.01

Huawei openPangu 2.0 offiziell Open Source:
505B MoE, 512K Kontext und Ascend Full-Stack

Wer im Juli 2026 openPangu 2.0, Xinchuang-Compliance oder Ascend-Deployment evaluiert, sollte die GitCode-Veröffentlichung vom 30. Juni sofort einpreisen: Huawei openPangu 2.0 liefert Flash-Gewichte und Inferenzcode — Pro folgt im Juli. Dieser Artikel basiert auf HDC-2026-Offiziellen und Ascend-Tribe-Repos und deckt Timeline, Pro/Flash-Parameter, 7 Full-Stack-Komponenten, mHC/Muon/ModAttn-Architektur, Vergleich mit DeepSeek V4 Pro / Qwen 3.7 Max / Kimi K2.7 sowie ModelArts-API und Self-Hosting ab. Kernthese: openPangu 2.0 ist nicht das stärkste Open-Source-Modell insgesamt, aber in 512K-Kontext, souveräner Hardware, Ascend-Native-Optimierung und Full-Stack-Open-Source nahezu unschlagbar.

01

Flash ist frisch live, Pro kommt erst im Juli, unabhängige Benchmarks fehlen noch — in diesem Hype-Fenster lauern vier typische Fehler:

  • „Gewichte Open Source" mit „Full-Stack Open Source" verwechseln: DeepSeek V4 Pro, Qwen 3.7 Max u. a. geben meist nur Gewichte und Inferenzcode frei; openPangu 2.0 plant zusätzlich Pre-Training-, Post-Training-Code (SFT/RLHF) und Ascend-Trainingsoperatoren. Für vertikale Re-Pre-Trainings oder akademische Reproduktion reichen reine Gewichte nicht.
  • Hardware-Lock-in ignorieren: openPangu 2.0 wurde vollständig auf Ascend 910B NPU trainiert; Inferenz ist auf CANN + torch_npu optimiert. Flash läuft community-seitig auf ~96 GB Unified Memory ohne Ascend, aber ohne den behaupteten 2×-Durchsatz-Vorteil.
  • Einzel-Benchmark statt Szenario-ROI: Pro ist bei Code und komplexer Inferenz vermutlich schwächer als DeepSeek V4 Pro (18B vs. ~200B aktive Parameter). Für 512K-Dokumente, Xinchuang oder HarmonyOS-Edge-Agents spiegeln Rankings den Business-Case nicht wider.
  • DSGVO und Datenresidenz unterschätzen: ModelArts-API verarbeitet Prompts in Huawei-Cloud-Regionen — für EU-Unternehmen ohne AVV und klare Datenfluss-Dokumentation ist Self-Hosting auf eigener Ascend-Hardware oder ein EU-konformer Gateway oft die sicherere Route. Das passt zu unserer These in der OpenRouter-Juni-2026-Analyse: Routing flexibel halten, Basismodell präzise wählen.

02

Die Release-Roadmap ist messbar und nachverfolgbar:

openPangu 2.0 — Schlüssel-Timeline
Datum Ereignis
2026-06-12 HDC 2026 Dongguan: Richard Yu keynote — offizielle Ankündigung openPangu 2.0
2026-06-30 openPangu-2.0-Flash Gewichte, Basis-Inferenzcode und Train/Infer-Operatoren auf GitCode
2026-07 (geplant) openPangu-2.0-Pro Gewichte und Inferenzcode
H2 2026 (geplant) Pre-Training-Code, Post-Training-Code, weitere Operatoren
Pro vs. Flash — Kernparameter
Metrik openPangu 2.0 Pro openPangu 2.0 Flash
Gesamtparameter 505B 92B
Aktive Parameter 18B 6B
Sparsity-Ratio ~28:1 ~15:1
Kontextfenster 512K 512K
Verfügbarkeit Geplant Juli 2026 Live seit 30.06.2026

Flash: 92B gesamt, 6B aktiv — DSA+SWA Ultra-Sparse Attention, Inferenz nahe 6B-Dense-Speed bei 92B-Wissenspool. 512K entspricht grob acht Romanen à 80.000 Wörtern in einem Durchlauf.

Pro: 505B gesamt, 18B aktiv — für Vollverträge, große Codebasen und ultra-lange Chat-Historien; 512K ist unter Open-Source-Modellen Spitzenklasse.

7 Open-Source-Komponenten und Status
Komponente Status
Modellarchitektur (Strukturdefinition) ✅ 30.06.2026
Modellgewichte (Flash) ✅ 30.06.2026
Technical Report ✅ mit Gewichten
Inferenzcode + Train/Infer-Operatoren ✅ 30.06.2026
Modellgewichte (Pro) 🔜 Juli 2026
Pre-Training-Code 📋 H2 2026
Post-Training-Code (SFT/RLHF) 📋 H2 2026

Die ersten vier Punkte sind Branchenstandard; Pre-/Post-Training-Code plus Ascend-Operatoren bei MoE dieser Größenordnung sind selten — das ist echtes Full-Stack-Open-Source.

03

openPangu 2.0 nutzt MoE (Mixture of Experts). Die technischen Kernpunkte:

  • mHC (Multi-Head Combinatorial) Routing: Effizienteres Expert-Routing, weniger Load-Imbalance.
  • Muon-Optimierer: Microsofts Second-Order-Momentum-Ansatz für stabileres Large-Scale-Training.
  • ModAttn (Modular Attention): Modulare Attention für 512K-Sequenzen.
  • DSA+SWA Ultra-Sparse Attention (Flash-exklusiv): ~15:1 Sparsity, deutlich geringerer Inferenz-Compute.

Weltweit erstes Frontier-Modell ohne NVIDIA-Training: Gesamtes Training auf Huawei Ascend 910B NPU — kein A100/H100. Unter US-Exportkontrollen meldet Huawei:

  • Einzelkarten-Durchsatz gegenüber Mainstream-Open-Source (Ascend-Umgebung)
  • Super-Node-Trainingseffizienz +30 %
  • 512K-Long-Sequence-Training +50 % Durchsatz
  • Train/Infer-Distribution-Konsistenz >99 % (MoE-Hard-Problem)
  • Flash-Int8: W4A8, Speicher −40 %, Genauigkeitsverlust <10 %
  • Embedded 30B Edge: Inferenz +50 % Speed, Speicher −20 %, offline auf Kirin-Smartphones

Software-Stack: CANN (Huawei, CUDA-Analog) + torch_npuimport torch_npu wechselt den PyTorch-Backend. Deployment: Huawei Cloud ModelArts (API), GitCode Ascend Tribe (Self-Host), HarmonyOS Native Edge.

Parameter-Vergleich (Stand Juli 2026)
Modell Gesamt Aktiv Kontext Trainings-HW Open-Source-Tiefe
openPangu 2.0 Pro 505B 18B 512K Ascend NPU Full-Stack (7 Komponenten)
openPangu 2.0 Flash 92B 6B 512K Ascend NPU Full-Stack (7 Komponenten)
DeepSeek V4 Pro 1.6T ~200B 128K NVIDIA Gewichte + Inferenz
Qwen 3.7 Max ~400B+ variiert 128K NVIDIA Gewichte + Inferenz + Teile Training
Kimi K2.7 1T 32B 256K NVIDIA Gewichte + Inferenz
Llama 4 405B 405B 128K NVIDIA Gewichte + Inferenz
Capability-Matrix (Architektur-Inferenz, Benchmarks ausstehend)
Dimension openPangu 2.0 Pro DeepSeek V4 Pro Qwen 3.7 Max Kimi K2.7
Code-Generierung ⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐
Komplexe Inferenz ⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐
Tool-Use / Agent ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
Ultra-Langkontext ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐⭐
Inferenz-Effizienz ⭐⭐⭐⭐⭐ ⭐⭐ ⭐⭐ ⭐⭐⭐⭐
Souveränität / Xinchuang ⭐⭐⭐⭐⭐
Full-Stack Open Source ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐
Szenario-Picker
Szenario Empfehlung Begründung
Code / komplexe Inferenz DeepSeek V4 Pro ~200B aktive Parameter, Performance-Führerschaft
Agent / Multi-Tool Kimi K2.7 Stärkstes MCP-Ökosystem
Dokumente >256K Token openPangu 2.0 Pro 512K First Choice
Xinchuang / souveräne HW openPangu 2.0 Einziges Frontier-Modell rein auf Ascend trainiert
Ascend / Huawei Cloud openPangu 2.0 Native Optimierung, 2× Durchsatz
Edge / Smartphone openPangu Embedded (30B) Kirin offline-fähig
Günstige lokale Inferenz openPangu 2.0 Flash 6B aktiv, ~96 GB lauffähig

04

Zwei Pfade: Cloud-API (schnell) und Open-Source-Self-Host (Kontrolle, DSGVO-freundlicher bei On-Prem-Ascend). Befehle nach Release gegen offizielle READMEs prüfen.

  1. Huawei Cloud + ModelArts (schnellster Weg): Account anlegen, ModelArts → AI Gallery → „openPangu 2.0" abonnieren, API Endpoint und X-Auth-Token holen. Für EU: Region, AVV und Subprocessor-Liste vor Produktivbetrieb dokumentieren.
  2. Chat Completions API: REST an ModelArts-Inferenz-Endpoint, model: "openpangu-2.0-flash", Standardparameter temperature / max_tokens.
  3. GitCode Ascend Tribe klonen: openPangu-2.0-Flash (Gewichte), openPangu-2.0-Flash-Int8 (Quant, −40 % RAM), openPangu-2.0-Infer (Inferenz), openPangu-2.0-Op (Ascend-Operatoren).
  4. Flash Single-Card (Ascend 910B): python inference.py --model_path ./openPangu-Flash --device npu:0 --context_length 512000 --precision bf16; Flash-Int8 ab ~48 GB (Atlas A2).
  5. Pro Multi-Card (ab Juli-Gewichte): python distributed_inference.py --model_path ./openPangu-Pro --num_devices 8 --context_length 512000 — empfohlen 4+ Ascend 910B.
  6. Domain-Finetune + torch_npu: LoRA: python finetune.py --model_path ./openPangu-Pro --data_path ./domain_data --method lora --lora_rank 16; PyTorch via import torch_npu auf Ascend-Backend.
modelarts-api.sh
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "Stellen Sie sich kurz vor"}],
    "max_tokens": 1024,
    "temperature": 0.7
  }'
Hardware-Referenz
Version Empfohlen Minimum Hinweis
Flash (6B aktiv) 1× Ascend 910B ~96 GB Unified Memory Community-Tests auf großen RAM-Systemen
Flash-Int8 1× Ascend Atlas A2 ~48 GB VRAM W4A8, Genauigkeit <10 % Verlust
Pro (18B aktiv) 4+ Ascend 910B Multi-Card-Cluster Verifikation nach Juli-Release

05

Geopolitik und Meilenstein: openPangu 2.0 ist das weltweit erste Frontier-Open-Source-Modell, vollständig ohne NVIDIA-Hardware trainiert. Richard Yu auf HDC 2026: „In meinem Wörterbuch gibt es kein Zweites, nur Erstes." Unter A100/H100-Exportkontrolle beweist 505B MoE auf Ascend die Tragfähigkeit des chinesischen Compute-Stacks.

HarmonyOS Agent-Ära: openPangu 2.0 ist Motor der Huawei-AI-Strategie. HarmonyOS 7 im Agent-Zeitalter; Agent Framework 2.0 >90 % Erfolgsrate bei komplexen Tasks; Embedded 30B offline auf Kirin-Smartphones.

openPangu License: Kommerzielle Nutzung, lizenzgebührenfrei, nicht-exklusiv — Details in GitCode LICENSE.

Zitierbare Hard Data:

  • Parameter: Pro 505B / 18B aktiv (~28:1); Flash 92B / 6B aktiv (~15:1); beide 512K
  • Training: Ascend 910B NPU, null NVIDIA A100/H100
  • Performance: 2× Single-Card-Durchsatz; 512K-Training +50 %; Train/Infer >99 %; Latenz 1,2× besser als Peers
  • Quant/Edge: Flash-Int8 −40 % RAM; Embedded 30B +50 % Speed, −20 % RAM
  • Roadmap: 30.06 Flash → Juli Pro → H2 Pre/Post-Training + Operatoren

Bei Code und komplexer Inferenz führt DeepSeek V4 Pro — openPangu 2.0 dominiert in fünf Dimensionen: ① 512K Kontext ② Souveränität ③ Ascend 2× Durchsatz ④ Full-Stack Open Source ⑤ HarmonyOS Edge.

Disclaimer: Capability-Bewertungen basieren auf Architektur-Inferenz; wir aktualisieren nach unabhängigen Benchmarks. Veröffentlichungsdatum: 1. Juli 2026.

Offizielle Quellen (Links vor Deployment erneut prüfen):

GitCode Ascend Tribe — openPangu 2.0 Repos

Huawei Cloud ModelArts

HDC 2026 — Huawei Developer Conference

Teams, die parallel openPangu auf Ascend und iOS/macOS-Agent-Entwicklung evaluieren, kämpfen mit VM-Hypervisor-Overhead und gekürzter Unified-Memory-Bandbreite — geteiltes CI-Jitter frisst selbst günstige APIs. Für Zero-Loss-Native-Compute, stabiles iOS-CI/CD und 24/7-Agent-Automatisierung sind ZUKCLOUD Bare-Metal-Mac-mini-Nodes die robustere Basis: dedizierte Apple-Silicon-Hardware, kein Hypervisor, Always-on, flexible Bestellung — ideal für Cross-Platform-Agent-Workflows. Siehe Bare-Metal-Architektur-Manifest.