За пять дней команды, которые покупают API-токены, поднимают open-weight чекпоинты или выбирают coding-модель, получили три хода, которые на поверхности противоречат друг другу. DeepSeek поднял API на отдельных строках до 1100%. Alibaba в ту же неделю открыла веса 2,4-триллионного флагмана, который раньше не выпускала. Zhipu AI выпустила GLM-5.3 и примерно в 6 раз подняла coding-бенчмарк на том же базисе — без переобучения. Ниже — хронология, прайс-лист, три логики, шестишаговый пересчёт счёта и FAQ. Вместе это сдвиг: китайские лаборатории конкурируют уже не только ценой, а ценовой властью.
01 Хронология: что случилось и в каком порядке
Боль не в том, что «вышла ещё одна модель». Боль в том, что цена, лицензия и рычаг качества сдвинулись в одну неделю. Заголовочные множители смешивают разные строки биллинга. Открытые веса — не бесплатный коммерческий пропуск. Post-training на том же базисе может прыгнуть за ночь. Счёт, комплаенс и выбор модели приходится пересобирать заново:
- Официальный пик уже проигрывает реселлерам: собственный peak-тариф DeepSeek больше не самый дешёвый способ гонять DeepSeek.
- Открытые веса, кастомная лицензия: пересекли порог выручки — отдельно договариваетесь о коммерческом гранте.
- Post-training бьёт новый базис: GLM-5.3 показывает, что 743B-фундамент не обязательно переучивать, чтобы поднять coding-скоры.
- США и Китай двигают цену в разные стороны: Китай открывает веса флагманов и поднимает тиры; американские лаборатории дешевеют и уходят в free на consumer-слое.
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot AI открывает веса Kimi K3 (2,8T параметров); релиз вызывает интерес US security |
| 30 июля 2026 | OpenAI режет GPT-5.6 Luna, самый дешёвый тир, на 80% |
| 2–3 августа 2026 | Alibaba сначала показывает preview, затем запускает Qwen3.8-Max как hosted API |
| 6–7 августа 2026 | OpenAI делает Luna бесплатным дефолтом с безлимитными текстовыми чатами |
| 10 августа 2026 | Meta выпускает Muse Glimmer (30B, Apache 2.0) и дразнит открытыми весами флагмана Muse Spark 1.2 |
| 12 августа 2026 | Alibaba публикует веса Qwen3.8-2.4T-A95B в репозиториях Hugging Face и ModelScope; xAI выпускает Grok 4.6 |
| 13 августа 2026 | DeepSeek-V4-Pro выходит в GA и объявляет повышение с 17 августа; Google выпускает более дешёвый Gemini 3.7 Flash |
| 14 августа 2026 | Zhipu выпускает GLM-5.3 на том же базисе 743B, что и GLM-5.2 |
| 17 августа 2026, 00:00 по пекинскому времени | Новый прайс DeepSeek вступает в силу |
Если отойти на шаг: китайские лаборатории поднимали тарифы и открывали веса флагманов, американские — резали цены и уходили в free на consumer-слое. Это две стороны одной ценовой войны. Продуктовый контекст: релиз Qwen3.8-Max, DeepSeek V4 GA и снижение цен GPT-5.6.
02 Цифры: тарифы, спецификации, бенчмарки
Сначала лист. Пиковые часы — 9:00–12:00 и 14:00–18:00 по пекинскому времени. «1100%», «11x» и «350%» все верны — они просто называют разные строки биллинга:
| Строка биллинга | Старый тариф | Новый внепик | Новый пик | Рост на пике |
|---|---|---|---|---|
| V4-Flash cache hit (input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (input) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash output | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1,100% |
| V4-Pro cache miss (input) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro output | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Заголовочные «1100%» относятся к пиковому cache-hit input — строке, которая начиналась ближе всего к нулю. Output, который доминирует в большинстве реальных счетов, вырос на 350%. Независимая модель затрат для тяжёлой нагрузки (примерно 84M токенов в месяц, в основном вне пика, половина cache hit) даёт рост счёта ближе к 1,8x — ощутимо, но далеко от самых пугающих заголовков.
| Параметр | Значение |
|---|---|
| Параметры | 2,4T всего, 95B активных на токен (MoE, 512 экспертов, 10 routed + 1 shared) |
| Контекст | 262144 токена native (открытый чекпоинт), расширяется до ~1.01M; hosted Max по умолчанию 1M |
| Каденция релиза | Preview 2 августа → API 3 августа → открытые веса 12 августа |
| API (international) | $2/M input, $6/M output |
| Лицензия | Не Apache 2.0 — кастомная «Qwen3.8-Max License» |
| Почему это важно | Первый раз Alibaba открыла веса Max-тира (флагмана); Qwen3.5/3.6/3.7 Max оставались только API |
| Бенчмарк | GLM-5.2 | GLM-5.3 | Дельта |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Это собственные цифры Zhipu — независимого стороннего перепрогона пока нет. На Terminal-Bench 3.0 GLM-5.3 всё ещё позади GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%); это сильный open-weight результат, не абсолютная победа на frontier.
03 Три стратегии, три логики
DeepSeek: с плоского тарифа на time-of-day — задача ёмкости, не разворот стратегии
Лёгкое неверное чтение: «самая дешёвая китайская модель наконец сдалась марже». Структура говорит об обратном: компания впервые делает compute-ограничение видимым на прайс-листе. Плоский всегда-дешёвый тариф работал как инструмент привлечения, пока GPU-ёмкость успевала за спросом. Когда usage рос экспоненциально, а ёмкость — нет, что-то должно было стать явным. Формула «поощряем более гибкое расписание нагрузки» на корпоративном языке значит: пиковый compute теперь дефицитен, сдвиньте нагрузку сами.
Деталь, которую международное покрытие почти пропустило: в пиковые часы официальный API DeepSeek теперь дороже нескольких сторонних реселлеров (GMI Cloud, Novita и другие сейчас ставят V4 Pro ниже нового пика DeepSeek). Допущение «официальный API всегда самый дешёвый способ гонять DeepSeek» сломано впервые.
Alibaba: открытые веса покупают goodwill экосистемы; кастомная лицензия держит потолок выручки
Открытие весов Qwen3.8-Max — не просто жест щедрости. Alibaba сделала два хода сразу: опубликовала полный 2,4T-чекпоинт для бесплатной загрузки и повесила кастомную лицензию — не permissive Apache 2.0, которую носят меньшие Qwen, — по которой любой бизнес «Model-as-a-Service» или «AI Work Assistant» с выручкой свыше $50 млн за любые 12 месяцев обязан отдельно согласовать коммерческую лицензию, а продукты с 100M+ MAU или $20M+ месячной выручки обязаны заметно указывать имя модели.
Логика: отдать веса, чтобы забрать mindshare разработчиков (особенно за рубежом, где «модель made-in-China» у enterprise-байеров всё ещё вызывает паузу), и сохранить ценовой рычаг над горсткой компаний, которые могут построить конкурирующий inference-бизнес поверх этого чекпоинта. Это другая ставка, чем Muse Glimmer у Meta, который идёт под неограниченным Apache 2.0. Про предыдущую open-weight волну — в разборе полного релиза весов Kimi K3.
Один слух стоит закрыть явно: по сети ходило, что лицензия Alibaba запрещает загрузки из США, ЕС, Великобритании и Южной Кореи. Это ложь. В опубликованном тексте лицензии нет географической или территориальной оговорки любого вида — полезное напоминание, что в таком темпе релиза проверка файла LICENSE, а не треда анонса, занимает секунды.
GLM-5.3: нового базиса нет, есть более крупная ставка на post-training
Самый интересный факт про GLM-5.3 — не скор, а метод: тот же базис 743B, что у GLM-5.2, без переобучения, и примерно 6× на Terminal-Bench 3.0 (4.6% → 28.3%) только за счёт масштабирования reinforcement-learning окружений на post-training. Пока pretraining scaling laws дают убывающую отдачу, масштаб post-training RL становится отдельным рычагом качества с гораздо более низким полом затрат, чем переобучение нового фундамента. Барьер входа заметно ниже: mid-tier лаборатории без compute-бюджета уровня OpenAI всё ещё могут сокращать разрыв на agentic и coding-бенчмарках.
# три лаборатории, три хода, одна неделя ценовой власти
DeepSeek V4-Pro : плоский дешёвый → peak/off-peak (ёмкость видна)
Qwen3.8-2.4T : первые веса Max-тира + кастомная лицензия
GLM-5.3 : тот же базис 743B, только post-training
rumor : geo-ban US/EU/UK/KR — FALSE, нет территориальной оговорки
note: «китайская модель = самая дешёвая» больше не безопасное допущение
04 Шесть шагов пересчёта модельного счёта
Лаборатория может выкатить новый прайс за день. Инженерия и закупки всё равно пересчитывают счёт, лицензию и inference-коробку. Шесть шагов, каждый привязан к публичной цифре выше:
- Пиковые окна DeepSeek привязаны к пекинскому времени, не к локальному. Пик — 9:00–12:00 и 14:00–18:00 по Пекину (01:00–04:00 и 06:00–10:00 UTC). Рабочие часы США и Европы в основном попадают во внепик; дневное время в Китае сидит на пике. Один лист — разные инвойсы.
- Три строки биллинга дают разные множители; заголовок «1100%» описывает одну из них. Cache-hit input вырос сильнее всех в процентах и слабее всех в абсолютных юанях. Output (+350%) и cache-miss input (+200%) двигают реальный счёт. Одна сторонняя модель на ~84M токенов в месяц, в основном вне пика, половина cache hit, даёт ближе к 1,8x.
- В LICENSE Qwen3.8-Max нет территориального запрета; пороги — выручка и MAU. Слух про geo-ban ложен. Триггеры — бизнес Model-as-a-Service / AI Work Assistant свыше $50M за любые 12 месяцев, либо 100M MAU / $20M месячной выручки для заметного указания имени модели.
- GLM-5.3 оставляет базис 743B и масштабирует post-training RL. Вопрос «выжмет ли post-train recipe ещё один тир?» стоит раньше вопроса «нужен ли новый фундамент».
- Внепиковый DeepSeek уже не минимум: Luna и Qwen обходят его хотя бы по одной оси. Off-peak input V4-Pro — около $0.63/M, всё ещё далеко ниже Claude Opus 5 (~$5/$25, implied из собственного comparison-ratio Alibaba), но международный Qwen3.8-Max ($2/$6) и GPT-5.6 Luna ($0.20/$1.20) теперь дешевле хотя бы по одному измерению. Допущение «китайская модель = самая дешёвая» больше не держится.
- Чекпоинт 2,4T требует реальной inference-машины, не ноутбука. Даже в 4-bit это примерно 1,2 ТБ VRAM. Агенты, eval и long-horizon джобы всё равно живут на железе. Если пайплайн завязан на Apple Silicon или iOS toolchain, измеряйте hypervisor tax; см. заметку по bare-metal архитектуре.
05 Сравнение, спорные пункты, FAQ и вывод
DeepSeek всё ещё самый дешёвый frontier-класс?
| Модель | Input (за 1M токенов) | Output (за 1M токенов) | Открытые веса? |
|---|---|---|---|
| DeepSeek V4-Pro (пик) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Нет |
| DeepSeek V4-Pro (внепик) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Нет |
| Qwen3.8-Max (international API) | $2.00 | $6.00 | Да (кастомная лицензия) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Нет |
| Claude Opus 5 (implied, по ratio Alibaba) | ~$5.00 | ~$25.00 | Нет |
Короткий ответ: нет. Даже после повышения внепиковый V4-Pro всё ещё далеко ниже Claude Opus 5, но это уже не абсолютный минимум. Формула «китайская модель = самая дешёвая» держалась большую часть 2025 и начала 2026. Теперь это небезопасное допущение.
Что спорно или не подтверждено
- Заголовок «1100%» технически верен, но без контекста вводит в заблуждение. Он относится только к пиковому cache-hit input — строке, которая стартовала ближе всего к нулю. Output — статья, которая доминирует в большинстве реальных счетов, — вырос на 350%. Разные издания цитировали разные строки так, будто это вся история.
- Утверждения, что Qwen3.8-Max крутится на собственных чипах Alibaba Zhenwu M890 (и супернодах «Pangu AL128»), которые несколько китайских финансовых изданий подавали как доказательство полностью отечественного silicon-стека инференса, Alibaba в собственной технической документации и сторонние бенчмарки независимо не подтвердили. Пока это vendor-adjacent, неверифицированный репортаж.
- Сообщение Zhipu о «серьёзной уязвимости» в Cursor приходит из репортажа VentureBeat и собственного раскрытия вендора; конкретных технических деталей в открытом доступе нет, поэтому это vendor-sourced находка без независимого аудита, а не разобранный инцидент.
- Сообщения, что Министерство коммерции КНР (MOFCOM) готовит ответные экспортные ограничения на AI/полупроводниковые технологии, спекулятивны и опираются на неподтверждённые медиа, не на официальный анонс. Это фон, не установленный факт.
Почему это важно: две ценовые войны идут параллельно
Примерно за последний месяц топ-лаборатории Китая выпускали крупные релизы в темпе, который внутренняя финансовая пресса уже называет «три обновления модели в неделю» (一周三更) — DeepSeek, Alibaba и Zhipu, плюс раньше Moonshot с Kimi K3 (открытые веса 16 июля, 2,8T параметров) и MiniMax H3. Китайское покрытие в целом читает это как open-weight релизы, которые «принуждают отрасль к глобальному пересмотру цен».
Американские лаборатории на consumer-слое играют в обратную сторону: OpenAI 30 июля резанула самый дешёвый тир на 80%, а через неделю (6–7 августа) сделала эту модель бесплатной и безлимитной для всех; Google 13 августа выпустила coding-модель вдвое дешевле трёхнедельного предшественника. Пока Китай открывает веса флагманов и вводит ступенчатый, более высокий прайс на compute-ограниченном верхе, США бегут к free и cheap на потребительском конце. Обе стратегии реальны; они просто оптимизируют разные части воронки.
Есть и геополитический слой, который стоит назвать аккуратно. Открытие весов Kimi K3 в июле уже вызвало интерес US security; выбор Alibaba именно этого окна для 2,4T-флагмана часть аналитиков читает как ход закрепить международный mindshare и нарратив «технологического паритета» до возможного ужесточения регулирования. Это обоснованная интерпретация, не подтверждённый факт — но это часть контекста, которую легко пропустить, если читать только англоязычную tech-прессу: там релизы чаще идут как изолированные продуктовые новости, а не как согласованный национальный паттерн.
Цитируемые цифры (на момент публикации)
- DeepSeek V4-Pro, пиковый cache-hit input: ¥0.025 → ¥0.30, ~1100%; output ¥6.0 → ¥27.0, 350%.
- Qwen3.8-2.4T-A95B: 2,4T всего / 95B активных, 262144 native-токена, кастомная лицензия.
- GLM-5.3 Terminal-Bench 3.0: 4.6% → 28.3% (тот же базис 743B, без повторного pretraining).
- FX-ориентир: ~¥7.15/$1; рост счёта на тяжёлой нагрузке ~1,8x в одной сторонней модели (не официальная цифра).
FAQ
DeepSeek после повышения всё ещё дешевле GPT-5.6 и Claude?
Внепиковый тариф всё ещё ниже Claude Opus 5, но это уже не самый дешёвый вариант в целом — GPT-5.6 Luna ($0.20/$1.20 за миллион токенов) и международный API Qwen3.8-Max ($2/$6) обходят новый внепиковый DeepSeek хотя бы по одной оси. Для frontier-класса DeepSeek всё ещё относительно дёшев, просто больше не абсолютный минимум.
Можно ли бесплатно использовать открытые веса Qwen3.8-Max в коммерческом продукте?
Да, в большинстве сценариев — личные проекты и внутреннее корпоративное использование не затронуты. Ограничение срабатывает только если вы ведёте бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50 млн за любые последовательные 12 месяцев; этому уровню нужна отдельная коммерческая лицензия Alibaba. Продукты с 100M+ MAU или $20M+ месячной выручки также обязаны заметно указывать имя модели.
Qwen3.8-Max запрещён или ограничен для пользователей США, ЕС или Великобритании?
Нет. Утверждение ходило по сети, но оно ложно — в опубликованной лицензии нет географических ограничений любого вида. Ограничения привязаны к выручке (сколько зарабатывает ваш сервис), а не к тому, где находитесь вы или ваши пользователи.
Чем GLM-5.3 реально отличается от GLM-5.2?
На уровне базовой модели — ничем: обе используют один и тот же фундамент на 743 млрд параметров. Прирост (примерно 6× на Terminal-Bench 3.0) целиком из масштабирования reinforcement learning на этапе post-training, без переобучения базиса.
Meta реально откроет веса флагмана, а не только меньший Muse Glimmer?
Пока нет. Muse Glimmer — дистиллированная 30B-модель, не настоящий флагман Meta. CEO Марк Цукерберг заявил, что открытые веса более крупной закрытой Muse Spark 1.2 появятся вскоре; если это случится, это будет первый открытый флагман США. На момент публикации релиза нет; это заявленное намерение, не подтверждённый факт.
Тарифы, условия лицензии и цифры бенчмарков отражают публично доступную информацию на момент публикации. Перед перепечаткой сверяйте актуальный официальный прайс и текст лицензии и учитывайте, что пункты выше, помеченные как неподтверждённые (заявления про отечественные чипы, сообщение об уязвимости Cursor и слухи про экспортный контроль), независимо не верифицированы:
Официальные источники:
Официальный прайс DeepSeek: Models & Pricing
Официальный репозиторий Alibaba Qwen: Qwen3.8-2.4T-A95B на Hugging Face
Текст Qwen3.8-Max License (LICENSE в репозитории Hugging Face)
Официальная техническая страница GLM-5.3 от Zhipu (Z.ai)
Сторонние репортажи:
CNA / Reuters: DeepSeek raises API pricing for its V4 models
South China Morning Post о условиях лицензии Qwen
VentureBeat о GLM-5.3 и Muse Glimmer
Облачный API может написать на прайс-листе «сдвиньте нагрузку». Инженерным командам всё равно гонять агентов, eval и long-context джобы на реальных машинах: реселлерские тарифы перепишутся, 2,4T-чекпоинт не влезет в ноутбук, а виртуализированные cloud-инстансы по-прежнему берут hypervisor tax и слабо стыкуются с Apple Silicon / iOS toolchain. Если нужен native compute без потерь, стабильный iOS CI/CD и круглосуточная автоматизация агентов в контролируемом физическом боксе, bare-metal узлы Mac mini в облаке ZUKCLOUD обычно лучше подходят: выделенный Apple Silicon, без hypervisor tax, 7×24 online, биллинг по дню, неделе или месяцу. Старт на странице тарифов или сразу на странице заказа.