ホーム / ブログ / Qwen3.8-Max
ENGINEERING BLOG · 2026.08.04

Qwen3.8-Max正式リリース:
Arena第5位・2.4兆パラメータと「オープンソース」の真実

2026年8月3日、阿里巴巴(Alibaba)がフラッグシップ大規模言語モデルQwen3.8-MaxをGA(一般提供)し、Agent製品「千問办公(Qwen Office)」を同時投入しました。総パラメータ2.4兆・アクティブ950億・100万tokenコンテキストを備え、Arenaテキスト競技場では暫定第5位(1496点)——上位8位中唯一の非Anthropicモデルです。本記事はAIエンジニア、技術選定担当、Agent開発者向けに、Kimi K3DeepSeek V4との位置づけ、「Open-Source」ラベルとウェイト未公開のギャップ、実務導入の判断基準を整理します。結論を先に述べます:性能は第一梯隊候補だが、ベンチマークはほぼ自社計測、ウェイト公開前に本番移行は慎重に——API価格の安さと透明性のトレードオフを理解した上で選定してください。

01

2026年7月中旬から8月初旬にかけて、中国系フロンティアモデルの公開ペースは異例の速さでした。Qwen3.8-Maxを正しく読むには、前後の競合動向を時系列で把握することが重要です。

  • 7月16日:月之暗面(Moonshot AI)がKimi K3を発表。2.8兆パラメータ(896エキスパート中16活性)、独立ベンチマークと技術レポートを前面に出した。
  • 7月19日:Qwen3.8-Maxがプレビュー版として先行公開。正式価格の10%で提供されたが、アクティブパラメータ数・ベンチマーク表は未公開。利用規約は自動化生産環境での呼び出しを明示的に禁止。
  • 7月27日:Kimi K3が予定通りHugging Faceでウェイト公開。注意力カーネル・MoE通信ライブラリなど一部インフラも同時オープンソース化。
  • 7月31日:DeepSeekがV4-Flash正式版をリリース。パラメータ規模を変えずにエージェント・コード系ベンチマークでV4-Proを上回る——「規模拡大だけではない」というメッセージ。
  • 8月3日:Qwen3.8-MaxがGA。完全ベンチマーク表と「千問办公」を公開。阿里巴巴の香港株は約7%、米国株は約4.5%上昇。
  • 8月10日前後(予定):Qwen3.8-Maxおよび軽量版Qwen3.8-27BのウェイトがHugging Face・ModelScopeに登場する見込み——ただし2026年8月4日時点ではライセンス条項・確定日は未公表。

この流れの中で、Qwen3.8-Maxは「最速でウェイトを出した」わけではなく、API先行・マーケティング先行の路線を取っています。Apple Intelligence中国版とQwenの連携が示すように、千問シリーズの商業化はすでにコンシューマー層まで及んでおり、今回のGAはその延長線上のイベントです。

02

以下は阿里巴巴公式発表およびArena公開データ(2026年8月1日スナップショット)に基づく整理です。ベンダー自社計測と第三者再現を混同しないことが、このモデル評価の前提になります。

Qwen3.8-Max — 主要仕様とベンチマーク(2026年8月時点)
項目 数値・状態 出所・注記
GA日 2026年8月3日 阿里巴巴公式
総 / アクティブパラメータ 2.4兆 / 950億 GA段階で初公開(プレビュー時は非開示)
コンテキスト 100万token(思考モード約98.3万) テキスト・画像・動画入力対応
API価格 入力 $2 / 出力 $6(100万tokenあたり) Claude Opus 5($5/$25)より低価格帯
Arenaテキスト 第5位・1496点 「Preliminary」表記・上位8中唯一の非Anthropic
Arenaビジョン 第2位 Claude Fable 5に次ぐ
PaperBench 93.0(+28.2) 阿里巴巴自社計測
SWE-bench Pro 67.7 自社計測。Fable 5(80.0)に劣後
ウェイト公開 未公開(「来週」予定) qwen.aiに「Open-Source」表記あり

Arena第5位は注目に値しますが、「暫定」表記であり、他の数値の多くは阿里巴巴自社テスト枠組み由来です。Artificial AnalysisやArena公式チームによるGA版の独立再現は、2026年8月4日時点では未公表です。

03

Qwen3.8-MaxはQwen3.5ベースのスパースMoE+ハイブリッドアテンションを採用しています。総パラメータ2.4兆の大半は推論時に活性化されず、実コストはアクティブ950億に近い——これがAPIを$2/$6に設定できる構造的理由です。

reasoning_effort三段階(low / medium / xhigh)により、Agentタスクでは速度と深度のトレードオフをAPIパラメータで制御できます。enable_thinkingまたはAnthropic互換のreasoning.effortフィールドから呼び出せます。

一方、今回の論争の中心は性能ではなく情報開示のタイムラグです。

  • ラベル先行:GA当日、qwen.aiに「Open-Source」表記が付いたが、Hugging Face・ModelScopeにリポジトリ・ライセンス・確定日は存在しない。
  • ベンチマークの自社依存:QwenSWEBench、RecreationBench、CoWorkBenchなど、複数が社内ベンチマーク。脚注で競合Fable 5の「fallback(モデル降格ルーティング)」を示唆する一方、自社手法の再現可能性は未公開。
  • プレビュー期の透明性不足:7月19日プレビュー時はアクティブパラメータ・モデルカード・安全評価が未開示。複数の独立評価機関が「本番移行は慎重に」と助言。
  • 唯一の独立盲審:269ファイルの実プロジェクト設計タスクで、Kimi K3が83点、Qwen3.8-Maxプレビューが80点——互角であり、一方の圧勝ではない。

長期自律タスク(16日間の無人コーディング、500ステップ超のチップ設計最適化など)は魅力的なデモですが、いずれも阿里巴巴自社ベンチマーク上の事例です。部分的なトレースはGitHubのqwen-code-dev-bot/oh-my-cliで確認できますが、第三者監査済みの完全再現ではありません。

04

フロンティア中国系モデル横断比較(2026年8月)
モデル 総 / アクティブ 価格(入/出・100万token) ウェイト 独立検証
Qwen3.8-Max 2.4T / 950億 $2 / $6 未公開(予定) なし(Arena暫定のみ)
Kimi K3 2.8T / 約500億 $3 / $15 7月27日公開済 Artificial Analysis 約57.11
DeepSeek V4-Flash 1.6T / 490億(V4-Pro同等) 未完全公開 公開済 9項目中V4-Pro超え(自社公表)
Claude Fable 5 非公開 $10 / $50 クローズド Arenaテキスト第1位
選定の要点 APIコスト重視→Qwen。透明性・自前ホスト→K3/DeepSeek。最高性能→Claude系

Qwen3.8-MaxはOpenAI互換・Anthropic互換の両APIを提供し、Claude Code・Codex・Qoder CLI・OpenClawなど既存Agentツールチェーンへの接続コストを下げています。本番導入前に、以下の6ステップでリスクを整理してください(ZUKCLOUD料金ページで自前推論インフラの代替コストも併せて確認できます)。

  1. ユースケースの優先順位を固定する:コーディングAgent、マルチモーダル推論、長文RAGのどれが主目的かを明文化し、SWE-bench Pro(67.7)とHLE(43.6)の弱点が許容範囲か判断します。
  2. APIと自前ホストの分岐を決める:フル2.4Tのローカル実行はデータセンター級。待機するQwen3.8-27Bか、Mac mini M4でのOllama運用など現実的な代替を並列検討します。
  3. プレビュー規約の本番適用可否を確認する:GA後も過去の利用制限が残っていないか、最新のQwenCloud利用規約を読み直します。
  4. reasoning_effortでコスト上限を設定する:デフォルトxhighは品質重視。バッチ処理ではmedium/lowに落とし、月次tokenコストを試算します。
  5. 独立ベンチマークの公開を待つか、自社A/Bを実施する:Artificial Analysis・Arena公式の再現が出るまで、本番トラフィックの一部でKimi K3やDeepSeek V4と盲審比較します。
  6. ウェイト公開後にライセンスを精査する:8月10日前後のHugging Face登場時、商用条件・再配布制限を確認してからオンプレミス計画を確定します。

05

引用可能なハードデータ:

  • パラメータ規模:2.4兆総 / 950億アクティブ(MoEスパース設計)
  • Arenaテキスト:第5位・1496点(Preliminary)——上位8中唯一の非Anthropic
  • API価格:入力$2・出力$6/100万token(Claude Opus 5比約60%安)
  • 独立盲審:Kimi K3 83点 vs Qwenプレビュー 80点(269ファイル設計タスク)
  • 資本市場:GA当日、阿里巴巴HK +7%、米国 +4.5%
  • ウェイト状態:2026年8月4日時点未公開。「来週」予定
Qwen3.8-Maxは今すぐ使えますか?ウェイトは公開されていますか?

APIはQwenCloud経由で利用可能です。OpenAI互換・Anthropic互換の両プロトコルに対応しています。ただしモデルウェイトは2026年8月4日時点で未公開で、Hugging Face・ModelScopeへの公開は「来週」(8月10日前後)とされています。ライセンス条項は公式発表を待ってください。

Qwen3.8-MaxとKimi K3はどちらが強いですか?

権威ある統一ベンチマークはまだありません。独立第三者の盲審テストではKimi K3が83点、Qwen3.8-Maxプレビューが80点で、同格と見なせます。K3は既にオープンウェイト公開済みで第三者スコアあり。Qwen3.8-MaxはAPI価格が低く、マルチモーダル面で優位です。

2.4兆パラメータはローカル実行に現実的ですか?

フルモデルの自前ホスティングにはマルチノードのデータセンター級インフラが必要です。推論コストはアクティブ950億に近い水準です。個人・小規模チームにはAPI利用、または同時公開予定のQwen3.8-27B、あるいはMac mini上の軽量モデル運用が現実的です。

阿里巴巴のベンチマーク数値は信頼できますか?

参考値として扱い、確定事実とは区別してください。PaperBench・RecreationBenchなど多くが社内テスト枠組み由来で、Artificial Analysis等の独立再現はGA時点で未公表です。Arenaの1496点も「Preliminary」表記です。自社ワークロードでのA/Bテストを推奨します。

「Open-Source」ラベルはなぜ物議を醸していますか?

GA当日にqwen.aiで「Open-Source」表記が付いた一方、ウェイト・ライセンス・確定公開日が未提示のためです。これはマーケティング上の意図表示であり、技術的な公開完了を意味しません。リポジトリが実際に公開されるまで、オープンウェイトモデルとしては扱えません。

公式・第三者参考ソース(発版後はリンクを再確認してください):

Qwen 公式サイト — Qwen3.8-Max 製品ページ

Arena.ai — テキスト・ビジョン競技場公開リーダーボード

Alibaba Cloud Model Studio — API ドキュメント

Hugging Face — Qwen モデルハブ(ウェイト公開待ち)

クラウドAPIに全面依存すると、ベンダー自社ベンチマークへの依存、ウェイト未公開による検証不能、推論コストの予測困難という三つのリスクが残ります。Agentの7×24自動化、iOS CI/CD、ローカル推論の検証環境を一体で持ちたいチームにとって、ZUKCLOUDの裸金属Mac miniクラウドノードは、Hypervisor損失のないApple Silicon上でOllama・OpenClaw・Qwen3.8-27B(公開後)を自前検証できる現実的な選択肢です。独占物理機、フルRoot権限、日/週/月の柔軟な契約——注文ページから試験環境を立ち上げ、裸金属アーキテクチャ宣言で設計思想を確認してください。APIは本番、Mac miniは検証とエッジ——この二層構成が2026年の賢いAgent運用です。