3 августа 2026 года Alibaba вывела флагманскую LLM Qwen3.8-Max в GA (общую доступность) и одновременно запустила агентский продукт «Qwen Office». Ключевые цифры: 2,4 трлн общих параметров, 95 млрд активных, контекст 1 млн токенов. В Arena Text (снимок 1 августа) модель занимает предварительное 5-е место (1496 очков) — единственная не-Anthropic в топ-8. Статья для ML-инженеров, архитекторов инференса и разработчиков агентов: разбор позиции Qwen3.8-Max относительно Kimi K3 и DeepSeek V4, механика sparse MoE, спор о метке open source и практика деплоя на Apple Silicon. Вывод: производительность уровня frontier, но бенчмарки — почти исключительно внутренние; веса не опубликованы — миграция в прод до независимой верификации рискованна.
01 Таймлайн: Kimi K3, DeepSeek V4-Flash и ответ Alibaba
Китайский рынок frontier-моделей в июле-августе 2026 сместился от гонки параметров к гонке архитектурной эффективности. Без этой хронологии оценка Qwen3.8-Max будет неполной.
- 16 июля: Moonshot AI выпускает Kimi K3 (2,8T, 16 из 896 экспертов активны) с акцентом на независимые бенчмарки и технический отчёт.
- 19 июля: Qwen3.8-Max в preview по 10 % будущей цены — без числа активных параметров, без таблицы бенчмарков, с запретом автоматизированного продакшн-использования.
- 27 июля: Kimi K3 публикует веса на Hugging Face вместе с инфраструктурой (attention kernels, MoE communication library).
- 31 июля: DeepSeek V4-Flash обходит V4-Pro на 9 агентских и кодовых бенчмарках без роста параметров.
- 3 августа: Qwen3.8-Max GA, полная таблица бенчмарков, Qwen Office. Акции Alibaba: Гонконг +7 %, США +4,5 %.
- ~10 августа (объявлено): Веса Qwen3.8-Max и Qwen3.8-27B на Hugging Face/ModelScope — лицензия и точная дата на 4 августа не подтверждены.
Alibaba выбрала стратегию API и маркетинг впереди прозрачности — в отличие от Kimi K3 и DeepSeek, для которых open weights стали конкурентным аргументом.
02 Спецификации и Arena: разделять данные вендора и третьих сторон
| Параметр | Значение | Источник / примечание |
|---|---|---|
| Дата GA | 3 августа 2026 | Пресс-релиз Alibaba |
| Общие / активные | 2,4T / 95B | Раскрыто при GA (в preview отсутствовало) |
| Контекст | 1M токенов | Текст, изображение, видео |
| Цена API | $2 / $6 за 1M (вход/выход) | Значительно ниже Claude Opus 5 ($5/$25) |
| Arena Text | #5, 1496 очков | «Preliminary» — единственный не-Anthropic в топ-8 |
| Arena Vision | #2 | После Claude Fable 5 |
| PaperBench | 93,0 | Внутренние тесты Alibaba |
| SWE-bench Pro | 67,7 | Ниже Fable 5 (80,0) |
| Open weights | Не опубликованы | Метка «Open-Source» на qwen.ai |
5-е место в Arena значимо, но помечено как «Preliminary». Остальные метрики — из внутренних фреймворков Alibaba. Независимое воспроизведение от Artificial Analysis на момент GA отсутствует.
03 Sparse MoE, стоимость инференса и спор об open source
Qwen3.8-Max построен на разреженном MoE с гибридным attention (база Qwen3.5). При инференсе активируется ~95 млрд параметров из 2,4 трлн — именно это определяет стоимость, а не полный размер чекпоинта. Отсюда API-цена $2/$6 за миллион токенов.
Параметр reasoning_effort (low / medium / xhigh, по умолчанию xhigh) — явный рычаг trade-off между латентностью и глубиной рассуждения. Вызывается через enable_thinking или поле reasoning.effort в Anthropic-совместимом API.
Инференс на Apple Silicon: полная 2,4T-модель не развернётся на Mac mini — для этого нужен мультинодовый GPU-кластер. Но после публикации весов Qwen3.8-27B станет реалистичной целью для Ollama на Mac mini M4: унифицированная память M4 позволяет CPU/GPU/Neural Engine делить пул RAM, а Metal обеспечивает ускорение без overhead гипервизора — при условии bare-metal доступа к железу.
Спор об open source — не о производительности, а о разрыве между заявлением и артефактом:
- Метка раньше весов: «Open-Source» на qwen.ai с дня GA — без репозитория, лицензии и даты поставки.
- Vendor-run бенчмарки: QwenSWEBench, RecreationBench, CoWorkBench — внутренние наборы. Сноска намекает на «fallbacks» у Fable 5 без публикации собственной методологии.
- Preview без прозрачности: Нет активных параметров, model card, оценки безопасности — независимые оценщики советовали не мигрировать продакшн.
- Единственный независимый слепой тест: Архитектурная задача (269 файлов) — Kimi K3: 83/100, Qwen Preview: 80/100.
Демонстрации длительной автономии (16 дней кодинга без вмешательства, 500+ шагов оптимизации чипа) интересны с точки зрения агентского исполнения, но оценены на внутренних бенчмарках Alibaba. Частичный трейс — в репозитории qwen-code-dev-bot/oh-my-cli на GitHub, но это не полностью аудируемое воспроизведение.
04 Матрица: Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 — 6 шагов внедрения
| Модель | Общие / активные | Цена (вход/выход за 1M) | Веса | Независимая проверка |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | $2 / $6 | Объявлены | Нет (Arena предварительно) |
| Kimi K3 | 2,8T / ~50B | $3 / $15 | Опубликованы (27 июля) | Artificial Analysis ~57,11 |
| DeepSeek V4-Flash | 1,6T / 49B | Не полностью опубликована | Опубликованы | 9 бенчмарков > V4-Pro |
| Claude Fable 5 | Не раскрыто | $10 / $50 | Закрытая | Arena Text #1 |
| Итог | Стоимость API → Qwen. Прозрачность/self-host → K3/DeepSeek. Макс. качество → Claude | |||
Шесть шагов перед продакшн-решением (стоимость собственной инфраструктуры: страница тарифов ZUKCLOUD):
- Определить workload: Кодовый агент, мультимодальный RAG или длительная автономия? Сопоставить слабые места SWE-bench Pro (67,7) и HLE (43,6) с требованиями.
- Разделить API и self-host: Полная модель требует мультинодового кластера. Альтернатива — Qwen3.8-27B или квантизованные модели на Apple Silicon.
- Проверить условия preview: Перечитать ToS QwenCloud после GA — нет ли остаточных ограничений на автоматизированные вызовы.
- Забюджетировать reasoning_effort: xhigh по умолчанию дорог. Для batch-задач — medium/low, смоделировать месячные расходы на токены.
- Дождаться независимых бенчмарков или запустить A/B: Параллельное слепое сравнение с Kimi K3/DeepSeek V4 на собственных датасетах.
- Аудит лицензии после публикации весов: При появлении репозитория на Hugging Face — проверить коммерческие условия и права на перераспределение.
05 Цитируемые данные, FAQ, источники и вывод
- Параметры: 2,4T общих / 95B активных (sparse MoE)
- Arena Text: #5, 1496 очков (Preliminary)
- API: $2 вход / $6 выход за 1M токенов
- Слепой тест: Kimi K3 83 vs Qwen Preview 80 (269 файлов)
- Биржа: Alibaba HK +7 %, US +4,5 % в день GA
- Веса: Не опубликованы (на 4 августа 2026)
Qwen3.8-Max уже open source?
Нет. API доступен через QwenCloud, но веса модели на 4 августа 2026 не опубликованы на Hugging Face или ModelScope. Метка Open-Source на qwen.ai — это намерение, а не поставленный артефакт.
Как Qwen3.8-Max сравнивается с Kimi K3?
Единого авторитетного бенчмарка нет. Слепой тест: K3 — 83/100, Qwen Preview — 80/100. K3 с открытыми весами и данными Artificial Analysis; Qwen3.8-Max дешевле по API и сильнее в мультимодальности.
Нужен ли дата-центр для 2,4 трлн параметров?
Для полной модели — да. Стоимость инференса ближе к 95 млрд активных. Для локального деплоя реалистичнее Qwen3.8-27B или квантизованные модели на Mac mini.
Можно ли доверять бенчмаркам Alibaba?
Как заявлению вендора. PaperBench и RecreationBench — внутренние. Независимых воспроизведений на момент GA нет. Рекомендуем A/B на собственных workload'ах.
Как MoE влияет на инференс на Apple Silicon?
Полная 2,4T-модель не поместится на Mac mini. Квантизованный Qwen3.8-27B после релиза весов — реалистичная цель для Ollama на M4: унифицированная память и Metal-ускорение на bare-metal без overhead гипервизора.
Официальные и независимые источники (перед публикацией перепроверьте ссылки):
Qwen — официальная страница продукта
Arena.ai — публичные лидерборды Text и Vision
Alibaba Cloud Model Studio — документация API
Hugging Face — хаб моделей Qwen (ожидание весов)
Чистая зависимость от облачного API оставляет три структурных риска: неверифицируемые бенчмарки вендора, невозможность self-host для аудита, непредсказуемые расходы при reasoning_effort=xhigh. Для команд, которым нужна автоматизация агентов 7×24, стабильный iOS CI/CD и среда валидации на Apple Silicon без потерь от гипервизора, bare-metal облачные узлы Mac mini от ZUKCLOUD — оптимальное решение: выделенное железо Apple, полный root-доступ, гибкие контракты на день/неделю/месяц. Запустите тестовую среду через страницу заказа и изучите манифест bare-metal архитектуры. API — для продакшна, Mac mini — для валидации и edge: двухуровневая стратегия 2026 года.