2026년 8월 3일, 알리바바(Alibaba)가 플래그십 LLM Qwen3.8-Max를 GA(정식 출시)하고 Agent 제품 「千问办公(Qwen Office)」을 동시 공개했습니다. 총 2.4조 파라미터·활성 950억·100만 토큰 컨텍스트를 갖추었고, Arena 텍스트 리더보드 잠정 5위(1496점)로 상위 8위 중 유일한 비(非)Anthropic 모델입니다. 본 글은 AI 엔지니어, 프로덕트 리더, Agent 개발팀을 대상으로 Kimi K3·DeepSeek V4와의 포지셔닝, 「Open-Source」 라벨과 가중치 미공개 간극, 실무 도입 판단 기준을 정리합니다. 핵심 결론: 1티어 후보 성능이나 벤치마크는 대부분 자체 측정, 가중치 공개 전 프로덕션 이전은 신중히——저렴한 API와 투명성 트레이드오프를 이해하고 선택하세요.
01 7월-8월 중국 AI 3파전: Kimi K3·DeepSeek V4·Qwen3.8-Max 타임라인
2026년 하반기 초, 중국 프론티어 모델 시장은 「파라미터 경쟁」에서 「아키텍처 효율 경쟁」으로 빠르게 전환되고 있습니다. Qwen3.8-Max를 읽으려면 직전 3주간의 경쟁 흐름이 필수입니다.
- 7월 16일: Moonshot AI가 Kimi K3 발표 — 2.8조 파라미터, 독립 벤치마크·기술 보고서 투명성 강조.
- 7월 19일: Qwen3.8-Max 프리뷰 공개 — 정가의 10% 요금, 활성 파라미터·벤치마크 미공개, 자동화 프로덕션 호출 금지 조항.
- 7월 27일: Kimi K3 Hugging Face 가중치 공개 — MoE 통신 라이브러리 등 인프라 일부 동시 오픈.
- 7월 31일: DeepSeek V4-Flash 정식판 — 파라미터 불변 상태에서 9개 Agent·코딩 벤치마크에서 V4-Pro 초과.
- 8월 3일: Qwen3.8-Max GA — 전체 벤치마크·Qwen Office 동시 공개. 알리바바 홍콩 주가 약 +7%, 미국 주가 약 +4.5%.
- 8월 10일 전후(예정): Qwen3.8-Max 및 Qwen3.8-27B 가중치 Hugging Face·ModelScope 등록 예정 — 라이선스·확정일 미공개.
이 흐름에서 Qwen3.8-Max는 「가장 먼저 오픈웨이트를 낸 모델」이 아니라 API·마케팅 선행 전략을 택했습니다. Apple Intelligence 중국판의 Qwen 채택이 보여주듯, 상용화 반경은 이미 수억 대 iPhone에 닿아 있습니다.
02 핵심 스펙·Arena 순위: 숫자 출처를 분리해서 읽기
아래 표는 알리바바 공식 발표 및 Arena 공개 데이터(2026년 8월 1일 스냅샷)를 정리한 것입니다. 벤더 자체 측정과 제3자 재현을 혼동하지 않는 것이 평가의 전제입니다.
| 항목 | 수치·상태 | 출처·비고 |
|---|---|---|
| GA 일자 | 2026년 8월 3일 | 알리바바 공식 |
| 총 / 활성 파라미터 | 2.4조 / 950억 | GA 단계 최초 공개 |
| 컨텍스트 | 100만 토큰 | 텍스트·이미지·영상 입력 |
| API 가격 | 입력 $2 / 출력 $6 (100만 토큰) | Claude Opus 5 대비 저가 |
| Arena 텍스트 | 5위·1496점 | 「Preliminary」표기·상위 8 중 유일 비Anthropic |
| Arena 비전 | 2위 | Claude Fable 5 다음 |
| PaperBench | 93.0 | 알리바바 자체 측정 |
| SWE-bench Pro | 67.7 | Fable 5(80.0)에 열세 |
| 가중치 공개 | 미공개(「다음 주」예정) | qwen.ai에 Open-Source 표기 |
Arena 5위는 주목할 만하지만 「잠정」표기이며, 나머지 수치 대부분은 알리바바 자체 테스트 프레임워크입니다. Artificial Analysis 등 GA 버전 독립 재현은 2026년 8월 4일 기준 미공개입니다.
03 2.4조 파라미터의 실체와 오픈소스 라벨 리스크
Qwen3.8-Max는 Qwen3.5 기반 희소 MoE + 하이브리드 어텐션을 채택합니다. 총 2.4조 중 추론 시 활성화되는 것은 950억에 가깝고, 이것이 API $2/$6 가격의 구조적 이유입니다.
reasoning_effort 3단계(low/medium/xhigh)로 Agent 작업에서 속도·깊이 트레이드오프를 API 파라미터로 제어합니다. enable_thinking 또는 Anthropic 호환 reasoning.effort로 호출 가능합니다.
이번 논쟁의 핵심은 성능이 아니라 정보 공개 시차입니다.
- 라벨 선행: GA 당일 qwen.ai에 「Open-Source」 표기, Hugging Face·ModelScope에는 리포지토리·라이선스·확정일 없음.
- 벤치마크 자체 의존: QwenSWEBench, RecreationBench, CoWorkBench 등 다수가 사내 벤치마크. 경쟁사 Fable 5 「fallback」 의심 각주는 있으나 자체 방법론 재현성은 미공개.
- 프리뷰 투명성 부족: 7월 19일 프리뷰 시 활성 파라미터·모델 카드·안전 평가 미공개. 독립 평가 기관들이 「프로덕션 이전 신중히」 권고.
- 유일한 독립 맹검: 269개 파일 실프로젝트 설계 태스크에서 Kimi K3 83점, Qwen3.8-Max 프리뷰 80점 — 압도적 우위 아님.
16일 무인 코딩·500단계 이상 칩 설계 최적화 등 장기 자율 태스크 데모는 인상적이나, 모두 알리바바 자체 벤치마크 사례입니다. GitHub qwen-code-dev-bot/oh-my-cli에 부분 트레이스가 있으나 제3자 감사 완료 재현은 아닙니다.
04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4: 매트릭스·6단계 도입
| 모델 | 총 / 활성 | 가격(입/출·100만 토큰) | 가중치 | 독립 검증 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950억 | $2 / $6 | 미공개(예정) | 없음(Arena 잠정만) |
| Kimi K3 | 2.8T / 약 500억 | $3 / $15 | 7월 27일 공개 | Artificial Analysis 약 57.11 |
| DeepSeek V4-Flash | 1.6T / 490억 | 미완전 공개 | 공개됨 | 9개 항목 V4-Pro 초과 |
| Claude Fable 5 | 비공개 | $10 / $50 | 클로즈드 | Arena 텍스트 1위 |
| 선택 요약 | API 비용→Qwen. 투명성·자체 호스트→K3/DeepSeek. 최고 성능→Claude | |||
Qwen3.8-Max는 OpenAI·Anthropic 호환 API를 모두 제공해 Claude Code·Codex·OpenClaw 등 기존 Agent 체인 연결 비용을 낮춥니다. 프로덕션 도입 전 아래 6단계로 리스크를 정리하세요(ZUKCLOUD 요금 페이지에서 자체 추론 인프라 대안 비용도 병행 확인).
- 유스케이스 우선순위 고정: 코딩 Agent, 멀티모달, 장문 RAG 중 핵심 목적을 문서화하고 SWE-bench Pro(67.7)·HLE(43.6) 약점 허용 범위를 판단합니다.
- API vs 자체 호스트 분기: 풀 2.4T 로컬 실행은 데이터센터급. Qwen3.8-27B 또는 Mac mini M4 Ollama 운영 등 현실적 대안을 병렬 검토합니다.
- 프리뷰 약관의 프로덕션 적용 여부 확인: GA 이후에도 자동화 호출 제한이 남아 있는지 QwenCloud 최신 약관을 재확인합니다.
- reasoning_effort로 비용 상한 설정: 기본 xhigh는 품질 우선. 배치 작업은 medium/low로 낮추고 월간 토큰 비용을 시뮬레이션합니다.
- 독립 벤치마크 대기 또는 자체 A/B: Artificial Analysis·Arena 공식 재현 전까지 프로덕션 트래픽 일부로 Kimi K3·DeepSeek V4와 맹검 비교합니다.
- 가중치 공개 후 라이선스 정밀 검토: 8월 10일 전후 Hugging Face 등록 시 상업 조건·재배포 제한 확인 후 온프레미스 계획을 확정합니다.
05 인용 데이터·FAQ·참고 링크·결론
인용 가능한 하드 데이터:
- 파라미터: 2.4조 총 / 950억 활성 (MoE 희소 설계)
- Arena 텍스트: 5위·1496점(Preliminary) — 상위 8 중 유일 비Anthropic
- API 가격: 입력 $2·출력 $6/100만 토큰
- 독립 맹검: Kimi K3 83 vs Qwen 프리뷰 80 (269파일 설계 태스크)
- 주가: GA 당일 알리바바 HK +7%, 미국 +4.5%
- 가중치: 2026년 8월 4일 기준 미공개
Qwen3.8-Max는 지금 바로 쓸 수 있나요?
API는 QwenCloud를 통해 사용 가능합니다. OpenAI·Anthropic 호환 프로토콜을 모두 지원합니다. 다만 2026년 8월 4일 기준 모델 가중치는 미공개이며, Hugging Face·ModelScope 공개는 8월 10일 전후로 예상됩니다.
Kimi K3와 비교하면 어떤가요?
권위 있는 통합 벤치마크는 아직 없습니다. 독립 맹검에서 Kimi K3 83점, Qwen3.8-Max 프리뷰 80점으로 동급입니다. K3는 오픈웨이트·제3자 스코어 보유, Qwen3.8-Max는 API 가격·멀티모달 우위입니다.
2.4조 파라미터를 로컬에서 돌릴 수 있나요?
풀 모델 자체 호스팅에는 멀티노드 데이터센터급 인프라가 필요합니다. 소규모 팀은 API, Qwen3.8-27B, 또는 Mac mini 경량 모델 운용이 현실적입니다.
알리바바 벤치마크를 믿어도 되나요?
참고용으로만 취급하세요. 대부분 자체 테스트 프레임워크이며 독립 재현은 GA 시점 미공개입니다. 자체 워크로드 A/B를 권장합니다.
Open-Source 라벨 논쟁은 왜 생겼나요?
GA 당일 qwen.ai에 Open-Source 표기가 붙었으나 가중치·라이선스·확정 일정이 없기 때문입니다. 리포지토리 실제 공개 전까지는 오픈웨이트 모델로 취급할 수 없습니다.
공식·제3자 참고 소스(발행 후 링크를 재확인하세요):
Qwen 공식 사이트 — Qwen3.8-Max 제품 페이지
Alibaba Cloud Model Studio — API 문서
TechCrunch — Apple Intelligence 중국판 Qwen 채택 보도
클라우드 API에 전면 의존하면 벤더 자체 벤치마크 의존, 가중치 미공개로 인한 검증 불가, 추론 비용 예측 곤란이라는 세 가지 리스크가 남습니다. Agent 7×24 자동화·iOS CI/CD·로컬 추론 검증 환경을 한 번에 갖추려는 팀에게 ZUKCLOUD의 베어메탈 Mac mini 클라우드 노드는 Hypervisor 손실 없는 Apple Silicon에서 Ollama·OpenClaw·Qwen3.8-27B(공개 후)를 자체 검증할 수 있는 현실적 선택입니다. 전용 물리 머신, 풀 Root 권한, 일/주/월 유연 계약 — 주문 페이지에서 시험 환경을 구축하고 베어메탈 아키텍처 선언으로 설계 철학을 확인하세요. API는 프로덕션, Mac mini는 검증과 엣지 — 2026년 현명한 Agent 운영의 이중 구조입니다.