Главная / Блог / Qwen3.8-Max
ENGINEERING BLOG · 2026.08.04

Qwen3.8-Max GA:
Arena #5, 2,4T параметров — open source пока только на сайте

3 августа 2026 года Alibaba вывела флагманскую LLM Qwen3.8-Max в GA (общую доступность) и одновременно запустила агентский продукт «Qwen Office». Ключевые цифры: 2,4 трлн общих параметров, 95 млрд активных, контекст 1 млн токенов. В Arena Text (снимок 1 августа) модель занимает предварительное 5-е место (1496 очков) — единственная не-Anthropic в топ-8. Статья для ML-инженеров, архитекторов инференса и разработчиков агентов: разбор позиции Qwen3.8-Max относительно Kimi K3 и DeepSeek V4, механика sparse MoE, спор о метке open source и практика деплоя на Apple Silicon. Вывод: производительность уровня frontier, но бенчмарки — почти исключительно внутренние; веса не опубликованы — миграция в прод до независимой верификации рискованна.

01

Китайский рынок frontier-моделей в июле-августе 2026 сместился от гонки параметров к гонке архитектурной эффективности. Без этой хронологии оценка Qwen3.8-Max будет неполной.

  • 16 июля: Moonshot AI выпускает Kimi K3 (2,8T, 16 из 896 экспертов активны) с акцентом на независимые бенчмарки и технический отчёт.
  • 19 июля: Qwen3.8-Max в preview по 10 % будущей цены — без числа активных параметров, без таблицы бенчмарков, с запретом автоматизированного продакшн-использования.
  • 27 июля: Kimi K3 публикует веса на Hugging Face вместе с инфраструктурой (attention kernels, MoE communication library).
  • 31 июля: DeepSeek V4-Flash обходит V4-Pro на 9 агентских и кодовых бенчмарках без роста параметров.
  • 3 августа: Qwen3.8-Max GA, полная таблица бенчмарков, Qwen Office. Акции Alibaba: Гонконг +7 %, США +4,5 %.
  • ~10 августа (объявлено): Веса Qwen3.8-Max и Qwen3.8-27B на Hugging Face/ModelScope — лицензия и точная дата на 4 августа не подтверждены.

Alibaba выбрала стратегию API и маркетинг впереди прозрачности — в отличие от Kimi K3 и DeepSeek, для которых open weights стали конкурентным аргументом.

02

Qwen3.8-Max — ключевые данные (август 2026)
Параметр Значение Источник / примечание
Дата GA 3 августа 2026 Пресс-релиз Alibaba
Общие / активные 2,4T / 95B Раскрыто при GA (в preview отсутствовало)
Контекст 1M токенов Текст, изображение, видео
Цена API $2 / $6 за 1M (вход/выход) Значительно ниже Claude Opus 5 ($5/$25)
Arena Text #5, 1496 очков «Preliminary» — единственный не-Anthropic в топ-8
Arena Vision #2 После Claude Fable 5
PaperBench 93,0 Внутренние тесты Alibaba
SWE-bench Pro 67,7 Ниже Fable 5 (80,0)
Open weights Не опубликованы Метка «Open-Source» на qwen.ai

5-е место в Arena значимо, но помечено как «Preliminary». Остальные метрики — из внутренних фреймворков Alibaba. Независимое воспроизведение от Artificial Analysis на момент GA отсутствует.

03

Qwen3.8-Max построен на разреженном MoE с гибридным attention (база Qwen3.5). При инференсе активируется ~95 млрд параметров из 2,4 трлн — именно это определяет стоимость, а не полный размер чекпоинта. Отсюда API-цена $2/$6 за миллион токенов.

Параметр reasoning_effort (low / medium / xhigh, по умолчанию xhigh) — явный рычаг trade-off между латентностью и глубиной рассуждения. Вызывается через enable_thinking или поле reasoning.effort в Anthropic-совместимом API.

Инференс на Apple Silicon: полная 2,4T-модель не развернётся на Mac mini — для этого нужен мультинодовый GPU-кластер. Но после публикации весов Qwen3.8-27B станет реалистичной целью для Ollama на Mac mini M4: унифицированная память M4 позволяет CPU/GPU/Neural Engine делить пул RAM, а Metal обеспечивает ускорение без overhead гипервизора — при условии bare-metal доступа к железу.

Спор об open source — не о производительности, а о разрыве между заявлением и артефактом:

  • Метка раньше весов: «Open-Source» на qwen.ai с дня GA — без репозитория, лицензии и даты поставки.
  • Vendor-run бенчмарки: QwenSWEBench, RecreationBench, CoWorkBench — внутренние наборы. Сноска намекает на «fallbacks» у Fable 5 без публикации собственной методологии.
  • Preview без прозрачности: Нет активных параметров, model card, оценки безопасности — независимые оценщики советовали не мигрировать продакшн.
  • Единственный независимый слепой тест: Архитектурная задача (269 файлов) — Kimi K3: 83/100, Qwen Preview: 80/100.

Демонстрации длительной автономии (16 дней кодинга без вмешательства, 500+ шагов оптимизации чипа) интересны с точки зрения агентского исполнения, но оценены на внутренних бенчмарках Alibaba. Частичный трейс — в репозитории qwen-code-dev-bot/oh-my-cli на GitHub, но это не полностью аудируемое воспроизведение.

04

Сравнение frontier-моделей (август 2026)
Модель Общие / активные Цена (вход/выход за 1M) Веса Независимая проверка
Qwen3.8-Max 2,4T / 95B $2 / $6 Объявлены Нет (Arena предварительно)
Kimi K3 2,8T / ~50B $3 / $15 Опубликованы (27 июля) Artificial Analysis ~57,11
DeepSeek V4-Flash 1,6T / 49B Не полностью опубликована Опубликованы 9 бенчмарков > V4-Pro
Claude Fable 5 Не раскрыто $10 / $50 Закрытая Arena Text #1
Итог Стоимость API → Qwen. Прозрачность/self-host → K3/DeepSeek. Макс. качество → Claude

Шесть шагов перед продакшн-решением (стоимость собственной инфраструктуры: страница тарифов ZUKCLOUD):

  1. Определить workload: Кодовый агент, мультимодальный RAG или длительная автономия? Сопоставить слабые места SWE-bench Pro (67,7) и HLE (43,6) с требованиями.
  2. Разделить API и self-host: Полная модель требует мультинодового кластера. Альтернатива — Qwen3.8-27B или квантизованные модели на Apple Silicon.
  3. Проверить условия preview: Перечитать ToS QwenCloud после GA — нет ли остаточных ограничений на автоматизированные вызовы.
  4. Забюджетировать reasoning_effort: xhigh по умолчанию дорог. Для batch-задач — medium/low, смоделировать месячные расходы на токены.
  5. Дождаться независимых бенчмарков или запустить A/B: Параллельное слепое сравнение с Kimi K3/DeepSeek V4 на собственных датасетах.
  6. Аудит лицензии после публикации весов: При появлении репозитория на Hugging Face — проверить коммерческие условия и права на перераспределение.

05

  • Параметры: 2,4T общих / 95B активных (sparse MoE)
  • Arena Text: #5, 1496 очков (Preliminary)
  • API: $2 вход / $6 выход за 1M токенов
  • Слепой тест: Kimi K3 83 vs Qwen Preview 80 (269 файлов)
  • Биржа: Alibaba HK +7 %, US +4,5 % в день GA
  • Веса: Не опубликованы (на 4 августа 2026)
Qwen3.8-Max уже open source?

Нет. API доступен через QwenCloud, но веса модели на 4 августа 2026 не опубликованы на Hugging Face или ModelScope. Метка Open-Source на qwen.ai — это намерение, а не поставленный артефакт.

Как Qwen3.8-Max сравнивается с Kimi K3?

Единого авторитетного бенчмарка нет. Слепой тест: K3 — 83/100, Qwen Preview — 80/100. K3 с открытыми весами и данными Artificial Analysis; Qwen3.8-Max дешевле по API и сильнее в мультимодальности.

Нужен ли дата-центр для 2,4 трлн параметров?

Для полной модели — да. Стоимость инференса ближе к 95 млрд активных. Для локального деплоя реалистичнее Qwen3.8-27B или квантизованные модели на Mac mini.

Можно ли доверять бенчмаркам Alibaba?

Как заявлению вендора. PaperBench и RecreationBench — внутренние. Независимых воспроизведений на момент GA нет. Рекомендуем A/B на собственных workload'ах.

Как MoE влияет на инференс на Apple Silicon?

Полная 2,4T-модель не поместится на Mac mini. Квантизованный Qwen3.8-27B после релиза весов — реалистичная цель для Ollama на M4: унифицированная память и Metal-ускорение на bare-metal без overhead гипервизора.

Официальные и независимые источники (перед публикацией перепроверьте ссылки):

Qwen — официальная страница продукта

Arena.ai — публичные лидерборды Text и Vision

Alibaba Cloud Model Studio — документация API

Hugging Face — хаб моделей Qwen (ожидание весов)

Чистая зависимость от облачного API оставляет три структурных риска: неверифицируемые бенчмарки вендора, невозможность self-host для аудита, непредсказуемые расходы при reasoning_effort=xhigh. Для команд, которым нужна автоматизация агентов 7×24, стабильный iOS CI/CD и среда валидации на Apple Silicon без потерь от гипервизора, bare-metal облачные узлы Mac mini от ZUKCLOUD — оптимальное решение: выделенное железо Apple, полный root-доступ, гибкие контракты на день/неделю/месяц. Запустите тестовую среду через страницу заказа и изучите манифест bare-metal архитектуры. API — для продакшна, Mac mini — для валидации и edge: двухуровневая стратегия 2026 года.