/ 블로그 / openPangu 2.0
ENGINEERING BLOG · 2026.07.01

Huawei openPangu 2.0 정식 오픈소스 공개:
505B MoE, 512K 컨텍스트, Ascend 풀스택

2026년 7월 기준으로 openPangu 2.0, 자주권 AI 기반, Ascend NPU 상의 추론·재학습을 검토하는 엔지니어와 IT 의사결정자에게 6월 30일 GitCode 공개는 선정 타임라인에 반영해야 할 사건입니다. Huawei openPangu 2.0은 Flash 가중치와 추론 코드가 먼저 공개되었고, Pro는 7월, 전체 훈련 파이프라인은 2026년 하반기에 이어집니다. 본 글은 HDC 2026 공식 발표와 Ascend Tribe 저장소를 바탕으로 로드맵, Pro/Flash 파라미터(505B/18B·92B/6B, 512K 컨텍스트), 7대 컴포넌트, mHC/Muon/ModAttn/DSA+SWA 아키텍처, DeepSeek V4 Pro / Qwen 3.7 Max / Kimi K2.7 비교, ModelArts와 GitCode 구현 절차를 정리합니다. 결론적으로 openPangu 2.0은 종합 벤치마크 1위는 아닐 수 있으나, 512K 초장문 컨텍스트, 국산 하드웨어 적합, Ascend 네이티브 최적화, 풀체인 오픈소스 4축에서는 대체가 거의 불가능합니다.

01

Flash는 막 공개되었고 Pro는 수주 앞, 제3자 벤치마크는 미확정——이런 열기 높은 시기에 자주 발생하는 오판은 다음 4가지입니다.

  • 「가중치 공개」와 「풀체인 오픈소스」를 혼동합니다: DeepSeek V4 Pro, Qwen 3.7 Max 등 주류 모델은 가중치와 추론 코드 중심입니다. openPangu 2.0은 사전학습 코드, 사후학습 코드(SFT/RLHF), Ascend 훈련 오퍼레이터까지 단계 공개를 예정합니다. 수직 도메인 재사전학습이나 학술 재현이 목적이라면 가중치만으로는 부족합니다.
  • 하드웨어 스택 종속을 간과합니다: openPangu 2.0은 Ascend 910B NPU에서 완결되어 훈련되었고, 추론도 CANN + torch_npu에 최적화되어 있습니다. Flash는 커뮤니티 환경에서 약 96GB 통합 메모리 실행 보고가 있으나, 공식 2배 처리량은 Ascend 환경 전제입니다.
  • 단일 벤치마크로 시나리오 적합을 대체합니다: 아키텍처 분석상 Pro는 코드 생성·복잡 추론에서 DeepSeek V4 Pro(18B 활성 vs 약 200B 활성)에 열세할 수 있습니다. 512K 문서 처리, 수출 규제 대응, HarmonyOS 에이전트 배포가 핵심이면 리더보드 순위는 ROI 대리 지표가 됩니다.
  • 데이터 거주지와 컴플라이언스를 미룹니다: ModelArts API는 Huawei Cloud 리전 내에서 프롬프트를 처리합니다. EU 기업은 DPA·데이터 흐름 문서 없이 본격 투입하는 것은 위험하며, 온프레 Ascend 또는 EU 준수 게이트웨이가 현실적입니다. 이는 OpenRouter 2026년 6월 랭킹 분석에서 말한 「라우팅은 유연하게, 기반 모델은 정밀하게」 원칙과 일치합니다.

02

openPangu 2.0 공개 일정은 추적 가능한 형태로 정리되어 있습니다.

openPangu 2.0 — 주요 타임라인
날짜 이벤트
2026-06-12 HDC 2026 동관: Richard Yu 기조연설로 openPangu 2.0 공식 발표
2026-06-30 openPangu-2.0-Flash 가중치, 기본 추론 코드, 훈련/추론 오퍼레이터 GitCode 공개
2026-07(예정) openPangu-2.0-Pro 가중치와 추론 코드 공개
2026년 하반기(예정) 사전학습 코드, 사후학습 코드, 추가 오퍼레이터 단계 공개
Pro vs Flash — 핵심 파라미터
지표 openPangu 2.0 Pro openPangu 2.0 Flash
총 파라미터 505B 92B
활성 파라미터 18B 6B
희소 비율 약 28:1 약 15:1
컨텍스트 창 512K 512K
제공 상태 2026년 7월 예정 2026.06.30부터 제공

Flash: 총 92B, 활성 6B. DSA+SWA 초희소 어텐션으로 92B 지식 풀을 유지하면서 6B 밀집 모델에 가까운 추론 속도를 구현합니다. 512K는 약 8만 단어 규모 장편 소설 8권을 1패스로 처리할 수 있는 규모입니다.

Pro: 총 505B, 활성 18B. 계약서 전문, 대규모 코드베이스, 장기 대화 이력을 512K로 다루는 용도——2026년 중반 오픈소스 모델 중 최장급 컨텍스트 창입니다.

7대 오픈소스 컴포넌트와 공개 현황
컴포넌트 상태
모델 아키텍처(구조 정의) 공개 완료(2026.06.30)
모델 가중치(Flash) 공개 완료(2026.06.30)
Technical Report 가중치와 동시 공개
추론 코드 + 훈련/추론 오퍼레이터 공개 완료(2026.06.30)
모델 가중치(Pro) 2026년 7월 예정
사전학습 코드 2026년 하반기 예정
사후학습 코드(SFT/RLHF) 2026년 하반기 예정

처음 4개 항목은 업계 표준 공개 범위입니다. 사전/사후학습 코드와 Ascend 오퍼레이터를 이 규모 MoE에서 여는 사례는 드물며, 진정한 풀체인 오픈소스라 할 수 있습니다.

03

openPangu 2.0은 Mixture-of-Experts(MoE) 아키텍처를 채택하며, 다음 기술 요소가 핵심입니다.

  • mHC(Multi-Head Combinatorial) 라우팅: 전문가 할당 효율을 높이고 MoE 부하 편향을 억제합니다.
  • Muon 옵티마이저: Microsoft 연구 기반 2차 모멘텀 최적화로 대규모 훈련 안정성을 높입니다.
  • ModAttn(Modular Attention): 512K 장시퀀스용 모듈형 어텐션 설계입니다.
  • DSA+SWA 초희소 어텐션(Flash 전용): 약 15:1 희소성으로 추론 연산량을 대폭 줄입니다.

NVIDIA GPU 없이 훈련된 프론티어급 모델: openPangu 2.0 훈련은 Huawei Ascend 910B NPU에서 완결되었으며 A100/H100은 사용되지 않았습니다. 미국 선단 AI 칩 수출 규제 하에서 Huawei는 다음 Ascend 네이티브 지표를 발표했습니다.

  • 단일 카드 처리량이 주류 오픈 모델의 2배(Ascend 환경)
  • 슈퍼노드 훈련 효율 +30%
  • 512K 장시퀀스 훈련 처리량 +50%
  • 훈련/추론 분포 일치도 99% 초과(MoE에서 어려운 과제)
  • Flash-Int8: W4A8 지원, 메모리 40% 절감, 정확도 손실 10% 미만
  • Embedded 30B 엣지: 추론 +50%, 메모리 20% 절감, Kirin 스마트폰 오프라인 동작

소프트웨어 스택은 CANN(Huawei CUDA급 런타임)과 torch_npu(PyTorch 어댑터)로 구성됩니다. import torch_npu 한 줄로 Ascend 백엔드로 전환할 수 있습니다. 배포 경로는 Huawei Cloud ModelArts(API), GitCode Ascend Tribe(셀프호스트), HarmonyOS 네이티브 엣지 3계열입니다.

파라미터 비교(2026년 7월 기준)
모델 총량 활성 컨텍스트 훈련 HW 공개 깊이
openPangu 2.0 Pro 505B 18B 512K Ascend NPU 풀체인(7 컴포넌트)
openPangu 2.0 Flash 92B 6B 512K Ascend NPU 풀체인(7 컴포넌트)
DeepSeek V4 Pro 1.6T 약 200B 128K NVIDIA 가중치 + 추론
Qwen 3.7 Max 약 400B+ 가변 128K NVIDIA 가중치 + 추론 + 일부 훈련
Kimi K2.7 1T 32B 256K NVIDIA 가중치 + 추론
Llama 4 405B 405B 128K NVIDIA 가중치 + 추론
역량 매트릭스(아키텍처 추정, 제3자 벤치마크 대기)
차원 openPangu 2.0 Pro DeepSeek V4 Pro Qwen 3.7 Max Kimi K2.7
코드 생성 우수 최상 매우 우수 매우 우수
복잡 추론 우수 최상 최상 매우 우수
도구 사용 / 에이전트 매우 우수 매우 우수 매우 우수 최상
초장문 컨텍스트 최상(512K) 보통 보통 우수
추론 효율 최상(Ascend) 보통 보통 우수
국산 HW / 자주권 최상 제한적 제한적 제한적
풀체인 OSS 최상 부분적 부분적 부분적
시나리오별 선정 가이드
시나리오 권장 이유
코드 생성 / 복잡 추론 DeepSeek V4 Pro 약 200B 활성 파라미터, 성능 1위
에이전트 / 멀티툴 Kimi K2.7 MCP 생태계 성숙도
256K 초과 문서 처리 openPangu 2.0 Pro 512K가 1순위 선택
자주권 AI / 수출 규제 대응 openPangu 2.0 비 NVIDIA HW만으로 훈련된 프론티어급 모델
Ascend / Huawei Cloud openPangu 2.0 네이티브 최적화, 2배 처리량
엣지 / 모바일 openPangu Embedded(30B) Kirin 칩 오프라인 동작
저비용 로컬 추론 openPangu 2.0 Flash 활성 6B, 약 96GB 통합 메모리 실행 가능

04

클라우드 API(신속)와 오픈소스 셀프호스트(통제·컴플라이언스) 두 경로를 정리합니다. 각 릴리스 후 공식 README에서 명령과 버전을 재확인하세요.

  1. Huawei Cloud + ModelArts(최단 경로): 계정 생성 후 ModelArts → AI Gallery →「openPangu 2.0」구독, API 엔드포인트와 X-Auth-Token을 취득합니다. EU 이용 시 리전, DPA, 서브프로세서 목록을 본격 투입 전 문서화하세요.
  2. Chat Completions API 호출: ModelArts 추론 엔드포인트로 REST 전송. model: "openpangu-2.0-flash", temperature / max_tokens 등 표준 파라미터 지원.
  3. GitCode Ascend Tribe 클론: openPangu-2.0-Flash(가중치), openPangu-2.0-Flash-Int8(양자화, 메모리 40% 절감), openPangu-2.0-Infer(추론), openPangu-2.0-Op(Ascend 오퍼레이터)가 주요 저장소입니다.
  4. Flash 단일 카드 추론(Ascend 910B): python inference.py --model_path ./openPangu-Flash --device npu:0 --context_length 512000 --precision bf16. Flash-Int8는 Atlas A2에서 약 48GB부터.
  5. Pro 다중 카드 분산 추론(7월 가중치 공개 후): python distributed_inference.py --model_path ./openPangu-Pro --num_devices 8 --context_length 512000——Ascend 910B 4카드 이상 권장.
  6. 도메인 미세조정 + torch_npu: LoRA 예: python finetune.py --model_path ./openPangu-Pro --data_path ./domain_data --method lora --lora_rank 16. 기존 PyTorch 프로젝트는 import torch_npu로 Ascend 백엔드 전환 가능.
modelarts-api.sh
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "간단히 자기소개를 해 주세요"}],
    "max_tokens": 1024,
    "temperature": 0.7
  }'
하드웨어 요구사항 참고
변형 권장 구성 최소 구성 비고
Flash(활성 6B) Ascend 910B × 1 약 96GB 통합 메모리 대용량 메모리 환경 커뮤니티 검증 있음
Flash-Int8 Ascend Atlas A2 × 1 약 48GB VRAM W4A8, 정확도 손실 10% 미만
Pro(활성 18B) Ascend 910B × 4 이상 다중 카드 클러스터 7월 릴리스 후 검증

05

지정학과 역사적 의미: openPangu 2.0은 NVIDIA 하드웨어 없이 훈련된 프론티어급 오픈 모델로 자리합니다. HDC 2026에서 Richard Yu는 「내 사전에 '두 번째'는 없고 '첫 번째'만 있다」고 말했으며, A100/H100 수출 규제 하에서도 505B MoE를 Ascend로 완수한 점이 중국 국산 컴퓨트 스택의 도달점을 보여줍니다.

HarmonyOS 에이전트 기반: openPangu 2.0은 Huawei AI 전략의 핵심입니다. HarmonyOS 7은 에이전트 시대로 전환하고, Agent Framework 2.0은 복잡 태스크에서 90% 초과 성공률을 보고합니다. Embedded 30B는 Kirin 스마트폰에서 네트워크 없이 로컬 추론이 가능합니다.

openPangu License: 상업적 이용 가능, 로열티 없음, 비독점——세부는 각 GitCode 저장소 LICENSE를 참조하세요.

인용 가능한 하드 데이터:

  • 파라미터: Pro 505B / 활성 18B(약 28:1); Flash 92B / 활성 6B(약 15:1); 모두 512K
  • 훈련: Ascend 910B NPU만 사용, NVIDIA A100/H100 제로
  • 성능: 단일 카드 2배 처리량; 512K 훈련 +50%; 훈련/추론 일치 99% 초과; 지연시간 동급 대비 1.2배 개선
  • 양자화/엣지: Flash-Int8 메모리 40% 절감; Embedded 30B 추론 +50%, 메모리 20% 절감
  • 로드맵: 6.30 Flash → 7월 Pro → 하반기 사전/사후학습 코드 + 오퍼레이터

코드 생성과 복잡 추론에서는 DeepSeek V4 Pro가 앞설 전망입니다. openPangu 2.0이 두드러지는 5축——512K 초장문 컨텍스트, 국산 하드웨어 적합, Ascend 2배 처리량, 훈련 코드 포함 풀체인 OSS, HarmonyOS 엣지 통합——입니다.

면책 조항: 본 글의 역량 평가는 아키텍처 추정에 기반합니다. 제3자 벤치마크 공개 후 업데이트합니다. 게시일: 2026년 7월 1일.

공식·참고 링크(배포 전 재확인하세요):

GitCode Ascend Tribe — openPangu 2.0 공식 저장소

Huawei Cloud ModelArts 제품 페이지

HDC 2026 — Huawei Developer Conference

openPangu Ascend 배포와 iOS/macOS 에이전트 개발을 병행 평가하는 팀은 공유 VM의 Xcode 빌드와 장시간 에이전트 실행에서 하이퍼바이저 오버헤드와 통합 메모리 대역폭 제약에 자주 부딪힙니다. API 비용을 낮춰도 CI 지터가 납기를 갉아먹습니다. 오버헤드 제로 네이티브 연산, 안정적 iOS CI/CD, 24/7 에이전트 자동화가 필요한 본격 환경에서는 ZUKCLOUD 베어메탈 Mac mini 클라우드 노드가 더 견고한 기반입니다——전용 Apple Silicon, 하이퍼바이저 없음, 상시 가동, 유연한 일/주/월 과금. HarmonyOS와 Apple 생태계를 아우르는 크로스플랫폼 에이전트 개발의 토대로 적합합니다. 자세한 내용은 베어메탈 아키텍처 선언을 참고하세요.