Главная / Блог / Ценовая война
ENGINEERING BLOG · 2026.08.17

Почему DeepSeek поднял API на 1100%
в ту же неделю, когда Китай открыл веса флагманов

За пять дней команды, которые покупают API-токены, поднимают open-weight чекпоинты или выбирают coding-модель, получили три хода, которые на поверхности противоречат друг другу. DeepSeek поднял API на отдельных строках до 1100%. Alibaba в ту же неделю открыла веса 2,4-триллионного флагмана, который раньше не выпускала. Zhipu AI выпустила GLM-5.3 и примерно в 6 раз подняла coding-бенчмарк на том же базисе — без переобучения. Ниже — хронология, прайс-лист, три логики, шестишаговый пересчёт счёта и FAQ. Вместе это сдвиг: китайские лаборатории конкурируют уже не только ценой, а ценовой властью.

01

Боль не в том, что «вышла ещё одна модель». Боль в том, что цена, лицензия и рычаг качества сдвинулись в одну неделю. Заголовочные множители смешивают разные строки биллинга. Открытые веса — не бесплатный коммерческий пропуск. Post-training на том же базисе может прыгнуть за ночь. Счёт, комплаенс и выбор модели приходится пересобирать заново:

  • Официальный пик уже проигрывает реселлерам: собственный peak-тариф DeepSeek больше не самый дешёвый способ гонять DeepSeek.
  • Открытые веса, кастомная лицензия: пересекли порог выручки — отдельно договариваетесь о коммерческом гранте.
  • Post-training бьёт новый базис: GLM-5.3 показывает, что 743B-фундамент не обязательно переучивать, чтобы поднять coding-скоры.
  • США и Китай двигают цену в разные стороны: Китай открывает веса флагманов и поднимает тиры; американские лаборатории дешевеют и уходят в free на consumer-слое.
Июль–август 2026: открытые веса, повышение тарифов и post-training
Дата Событие
16 июля 2026 Moonshot AI открывает веса Kimi K3 (2,8T параметров); релиз вызывает интерес US security
30 июля 2026 OpenAI режет GPT-5.6 Luna, самый дешёвый тир, на 80%
2–3 августа 2026 Alibaba сначала показывает preview, затем запускает Qwen3.8-Max как hosted API
6–7 августа 2026 OpenAI делает Luna бесплатным дефолтом с безлимитными текстовыми чатами
10 августа 2026 Meta выпускает Muse Glimmer (30B, Apache 2.0) и дразнит открытыми весами флагмана Muse Spark 1.2
12 августа 2026 Alibaba публикует веса Qwen3.8-2.4T-A95B в репозиториях Hugging Face и ModelScope; xAI выпускает Grok 4.6
13 августа 2026 DeepSeek-V4-Pro выходит в GA и объявляет повышение с 17 августа; Google выпускает более дешёвый Gemini 3.7 Flash
14 августа 2026 Zhipu выпускает GLM-5.3 на том же базисе 743B, что и GLM-5.2
17 августа 2026, 00:00 по пекинскому времени Новый прайс DeepSeek вступает в силу

Если отойти на шаг: китайские лаборатории поднимали тарифы и открывали веса флагманов, американские — резали цены и уходили в free на consumer-слое. Это две стороны одной ценовой войны. Продуктовый контекст: релиз Qwen3.8-Max, DeepSeek V4 GA и снижение цен GPT-5.6.

02

Сначала лист. Пиковые часы — 9:00–12:00 и 14:00–18:00 по пекинскому времени. «1100%», «11x» и «350%» все верны — они просто называют разные строки биллинга:

Повышение DeepSeek (с 17 августа, 00:00 по пекинскому времени; за 1M токенов, RMB)
Строка биллинга Старый тариф Новый внепик Новый пик Рост на пике
V4-Flash cache hit (input) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash cache miss (input) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash output ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro cache hit (input) ¥0.025 ¥0.15 ¥0.30 ~1,100%
V4-Pro cache miss (input) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro output ¥6.0 ¥13.5 ¥27.0 350%

Заголовочные «1100%» относятся к пиковому cache-hit input — строке, которая начиналась ближе всего к нулю. Output, который доминирует в большинстве реальных счетов, вырос на 350%. Независимая модель затрат для тяжёлой нагрузки (примерно 84M токенов в месяц, в основном вне пика, половина cache hit) даёт рост счёта ближе к 1,8x — ощутимо, но далеко от самых пугающих заголовков.

Qwen3.8-2.4T-A95B (открытые веса Qwen3.8-Max): ключевые спецификации
Параметр Значение
Параметры 2,4T всего, 95B активных на токен (MoE, 512 экспертов, 10 routed + 1 shared)
Контекст 262144 токена native (открытый чекпоинт), расширяется до ~1.01M; hosted Max по умолчанию 1M
Каденция релиза Preview 2 августа → API 3 августа → открытые веса 12 августа
API (international) $2/M input, $6/M output
Лицензия Не Apache 2.0 — кастомная «Qwen3.8-Max License»
Почему это важно Первый раз Alibaba открыла веса Max-тира (флагмана); Qwen3.5/3.6/3.7 Max оставались только API
GLM-5.3 vs GLM-5.2: тот же базис, только post-training (самоотчёт Zhipu)
Бенчмарк GLM-5.2 GLM-5.3 Дельта
Terminal-Bench 3.0 4.6% 28.3% +23.7 pts
DeepSWE v1.1 46.2% 66.9% +20.7 pts
Agents' Last Exam (CLI) 23.8% 28.5% +4.7 pts
CyberGym 77.2% 84.5% +7.3 pts
AutomationBench 26.2% 48.2% +22.0 pts

Это собственные цифры Zhipu — независимого стороннего перепрогона пока нет. На Terminal-Bench 3.0 GLM-5.3 всё ещё позади GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%); это сильный open-weight результат, не абсолютная победа на frontier.

03

DeepSeek: с плоского тарифа на time-of-day — задача ёмкости, не разворот стратегии

Лёгкое неверное чтение: «самая дешёвая китайская модель наконец сдалась марже». Структура говорит об обратном: компания впервые делает compute-ограничение видимым на прайс-листе. Плоский всегда-дешёвый тариф работал как инструмент привлечения, пока GPU-ёмкость успевала за спросом. Когда usage рос экспоненциально, а ёмкость — нет, что-то должно было стать явным. Формула «поощряем более гибкое расписание нагрузки» на корпоративном языке значит: пиковый compute теперь дефицитен, сдвиньте нагрузку сами.

Деталь, которую международное покрытие почти пропустило: в пиковые часы официальный API DeepSeek теперь дороже нескольких сторонних реселлеров (GMI Cloud, Novita и другие сейчас ставят V4 Pro ниже нового пика DeepSeek). Допущение «официальный API всегда самый дешёвый способ гонять DeepSeek» сломано впервые.

Alibaba: открытые веса покупают goodwill экосистемы; кастомная лицензия держит потолок выручки

Открытие весов Qwen3.8-Max — не просто жест щедрости. Alibaba сделала два хода сразу: опубликовала полный 2,4T-чекпоинт для бесплатной загрузки и повесила кастомную лицензию — не permissive Apache 2.0, которую носят меньшие Qwen, — по которой любой бизнес «Model-as-a-Service» или «AI Work Assistant» с выручкой свыше $50 млн за любые 12 месяцев обязан отдельно согласовать коммерческую лицензию, а продукты с 100M+ MAU или $20M+ месячной выручки обязаны заметно указывать имя модели.

Логика: отдать веса, чтобы забрать mindshare разработчиков (особенно за рубежом, где «модель made-in-China» у enterprise-байеров всё ещё вызывает паузу), и сохранить ценовой рычаг над горсткой компаний, которые могут построить конкурирующий inference-бизнес поверх этого чекпоинта. Это другая ставка, чем Muse Glimmer у Meta, который идёт под неограниченным Apache 2.0. Про предыдущую open-weight волну — в разборе полного релиза весов Kimi K3.

Один слух стоит закрыть явно: по сети ходило, что лицензия Alibaba запрещает загрузки из США, ЕС, Великобритании и Южной Кореи. Это ложь. В опубликованном тексте лицензии нет географической или территориальной оговорки любого вида — полезное напоминание, что в таком темпе релиза проверка файла LICENSE, а не треда анонса, занимает секунды.

GLM-5.3: нового базиса нет, есть более крупная ставка на post-training

Самый интересный факт про GLM-5.3 — не скор, а метод: тот же базис 743B, что у GLM-5.2, без переобучения, и примерно 6× на Terminal-Bench 3.0 (4.6% → 28.3%) только за счёт масштабирования reinforcement-learning окружений на post-training. Пока pretraining scaling laws дают убывающую отдачу, масштаб post-training RL становится отдельным рычагом качества с гораздо более низким полом затрат, чем переобучение нового фундамента. Барьер входа заметно ниже: mid-tier лаборатории без compute-бюджета уровня OpenAI всё ещё могут сокращать разрыв на agentic и coding-бенчмарках.

PRICE-WAR-2026.LOG
# три лаборатории, три хода, одна неделя ценовой власти
DeepSeek V4-Pro  : плоский дешёвый → peak/off-peak (ёмкость видна)
Qwen3.8-2.4T     : первые веса Max-тира + кастомная лицензия
GLM-5.3          : тот же базис 743B, только post-training
rumor            : geo-ban US/EU/UK/KR — FALSE, нет территориальной оговорки
note: «китайская модель = самая дешёвая» больше не безопасное допущение

04

Лаборатория может выкатить новый прайс за день. Инженерия и закупки всё равно пересчитывают счёт, лицензию и inference-коробку. Шесть шагов, каждый привязан к публичной цифре выше:

  1. Пиковые окна DeepSeek привязаны к пекинскому времени, не к локальному. Пик — 9:00–12:00 и 14:00–18:00 по Пекину (01:00–04:00 и 06:00–10:00 UTC). Рабочие часы США и Европы в основном попадают во внепик; дневное время в Китае сидит на пике. Один лист — разные инвойсы.
  2. Три строки биллинга дают разные множители; заголовок «1100%» описывает одну из них. Cache-hit input вырос сильнее всех в процентах и слабее всех в абсолютных юанях. Output (+350%) и cache-miss input (+200%) двигают реальный счёт. Одна сторонняя модель на ~84M токенов в месяц, в основном вне пика, половина cache hit, даёт ближе к 1,8x.
  3. В LICENSE Qwen3.8-Max нет территориального запрета; пороги — выручка и MAU. Слух про geo-ban ложен. Триггеры — бизнес Model-as-a-Service / AI Work Assistant свыше $50M за любые 12 месяцев, либо 100M MAU / $20M месячной выручки для заметного указания имени модели.
  4. GLM-5.3 оставляет базис 743B и масштабирует post-training RL. Вопрос «выжмет ли post-train recipe ещё один тир?» стоит раньше вопроса «нужен ли новый фундамент».
  5. Внепиковый DeepSeek уже не минимум: Luna и Qwen обходят его хотя бы по одной оси. Off-peak input V4-Pro — около $0.63/M, всё ещё далеко ниже Claude Opus 5 (~$5/$25, implied из собственного comparison-ratio Alibaba), но международный Qwen3.8-Max ($2/$6) и GPT-5.6 Luna ($0.20/$1.20) теперь дешевле хотя бы по одному измерению. Допущение «китайская модель = самая дешёвая» больше не держится.
  6. Чекпоинт 2,4T требует реальной inference-машины, не ноутбука. Даже в 4-bit это примерно 1,2 ТБ VRAM. Агенты, eval и long-horizon джобы всё равно живут на железе. Если пайплайн завязан на Apple Silicon или iOS toolchain, измеряйте hypervisor tax; см. заметку по bare-metal архитектуре.

05

DeepSeek всё ещё самый дешёвый frontier-класс?

Сравнение лоб в лоб (RMB→USD по ~¥7.15/$1, оценка)
Модель Input (за 1M токенов) Output (за 1M токенов) Открытые веса?
DeepSeek V4-Pro (пик) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Нет
DeepSeek V4-Pro (внепик) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Нет
Qwen3.8-Max (international API) $2.00 $6.00 Да (кастомная лицензия)
OpenAI GPT-5.6 Luna $0.20 $1.20 Нет
Claude Opus 5 (implied, по ratio Alibaba) ~$5.00 ~$25.00 Нет

Короткий ответ: нет. Даже после повышения внепиковый V4-Pro всё ещё далеко ниже Claude Opus 5, но это уже не абсолютный минимум. Формула «китайская модель = самая дешёвая» держалась большую часть 2025 и начала 2026. Теперь это небезопасное допущение.

Что спорно или не подтверждено

  • Заголовок «1100%» технически верен, но без контекста вводит в заблуждение. Он относится только к пиковому cache-hit input — строке, которая стартовала ближе всего к нулю. Output — статья, которая доминирует в большинстве реальных счетов, — вырос на 350%. Разные издания цитировали разные строки так, будто это вся история.
  • Утверждения, что Qwen3.8-Max крутится на собственных чипах Alibaba Zhenwu M890 (и супернодах «Pangu AL128»), которые несколько китайских финансовых изданий подавали как доказательство полностью отечественного silicon-стека инференса, Alibaba в собственной технической документации и сторонние бенчмарки независимо не подтвердили. Пока это vendor-adjacent, неверифицированный репортаж.
  • Сообщение Zhipu о «серьёзной уязвимости» в Cursor приходит из репортажа VentureBeat и собственного раскрытия вендора; конкретных технических деталей в открытом доступе нет, поэтому это vendor-sourced находка без независимого аудита, а не разобранный инцидент.
  • Сообщения, что Министерство коммерции КНР (MOFCOM) готовит ответные экспортные ограничения на AI/полупроводниковые технологии, спекулятивны и опираются на неподтверждённые медиа, не на официальный анонс. Это фон, не установленный факт.

Почему это важно: две ценовые войны идут параллельно

Примерно за последний месяц топ-лаборатории Китая выпускали крупные релизы в темпе, который внутренняя финансовая пресса уже называет «три обновления модели в неделю» (一周三更) — DeepSeek, Alibaba и Zhipu, плюс раньше Moonshot с Kimi K3 (открытые веса 16 июля, 2,8T параметров) и MiniMax H3. Китайское покрытие в целом читает это как open-weight релизы, которые «принуждают отрасль к глобальному пересмотру цен».

Американские лаборатории на consumer-слое играют в обратную сторону: OpenAI 30 июля резанула самый дешёвый тир на 80%, а через неделю (6–7 августа) сделала эту модель бесплатной и безлимитной для всех; Google 13 августа выпустила coding-модель вдвое дешевле трёхнедельного предшественника. Пока Китай открывает веса флагманов и вводит ступенчатый, более высокий прайс на compute-ограниченном верхе, США бегут к free и cheap на потребительском конце. Обе стратегии реальны; они просто оптимизируют разные части воронки.

Есть и геополитический слой, который стоит назвать аккуратно. Открытие весов Kimi K3 в июле уже вызвало интерес US security; выбор Alibaba именно этого окна для 2,4T-флагмана часть аналитиков читает как ход закрепить международный mindshare и нарратив «технологического паритета» до возможного ужесточения регулирования. Это обоснованная интерпретация, не подтверждённый факт — но это часть контекста, которую легко пропустить, если читать только англоязычную tech-прессу: там релизы чаще идут как изолированные продуктовые новости, а не как согласованный национальный паттерн.

Цитируемые цифры (на момент публикации)

  • DeepSeek V4-Pro, пиковый cache-hit input: ¥0.025 → ¥0.30, ~1100%; output ¥6.0 → ¥27.0, 350%.
  • Qwen3.8-2.4T-A95B: 2,4T всего / 95B активных, 262144 native-токена, кастомная лицензия.
  • GLM-5.3 Terminal-Bench 3.0: 4.6% → 28.3% (тот же базис 743B, без повторного pretraining).
  • FX-ориентир: ~¥7.15/$1; рост счёта на тяжёлой нагрузке ~1,8x в одной сторонней модели (не официальная цифра).

FAQ

DeepSeek после повышения всё ещё дешевле GPT-5.6 и Claude?

Внепиковый тариф всё ещё ниже Claude Opus 5, но это уже не самый дешёвый вариант в целом — GPT-5.6 Luna ($0.20/$1.20 за миллион токенов) и международный API Qwen3.8-Max ($2/$6) обходят новый внепиковый DeepSeek хотя бы по одной оси. Для frontier-класса DeepSeek всё ещё относительно дёшев, просто больше не абсолютный минимум.

Можно ли бесплатно использовать открытые веса Qwen3.8-Max в коммерческом продукте?

Да, в большинстве сценариев — личные проекты и внутреннее корпоративное использование не затронуты. Ограничение срабатывает только если вы ведёте бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50 млн за любые последовательные 12 месяцев; этому уровню нужна отдельная коммерческая лицензия Alibaba. Продукты с 100M+ MAU или $20M+ месячной выручки также обязаны заметно указывать имя модели.

Qwen3.8-Max запрещён или ограничен для пользователей США, ЕС или Великобритании?

Нет. Утверждение ходило по сети, но оно ложно — в опубликованной лицензии нет географических ограничений любого вида. Ограничения привязаны к выручке (сколько зарабатывает ваш сервис), а не к тому, где находитесь вы или ваши пользователи.

Чем GLM-5.3 реально отличается от GLM-5.2?

На уровне базовой модели — ничем: обе используют один и тот же фундамент на 743 млрд параметров. Прирост (примерно 6× на Terminal-Bench 3.0) целиком из масштабирования reinforcement learning на этапе post-training, без переобучения базиса.

Meta реально откроет веса флагмана, а не только меньший Muse Glimmer?

Пока нет. Muse Glimmer — дистиллированная 30B-модель, не настоящий флагман Meta. CEO Марк Цукерберг заявил, что открытые веса более крупной закрытой Muse Spark 1.2 появятся вскоре; если это случится, это будет первый открытый флагман США. На момент публикации релиза нет; это заявленное намерение, не подтверждённый факт.

Тарифы, условия лицензии и цифры бенчмарков отражают публично доступную информацию на момент публикации. Перед перепечаткой сверяйте актуальный официальный прайс и текст лицензии и учитывайте, что пункты выше, помеченные как неподтверждённые (заявления про отечественные чипы, сообщение об уязвимости Cursor и слухи про экспортный контроль), независимо не верифицированы:

Официальные источники:

Официальный прайс DeepSeek: Models & Pricing

Официальный репозиторий Alibaba Qwen: Qwen3.8-2.4T-A95B на Hugging Face

Текст Qwen3.8-Max License (LICENSE в репозитории Hugging Face)

Официальная техническая страница GLM-5.3 от Zhipu (Z.ai)

Сторонние репортажи:

CNA / Reuters: DeepSeek raises API pricing for its V4 models

South China Morning Post о условиях лицензии Qwen

VentureBeat о GLM-5.3 и Muse Glimmer

Облачный API может написать на прайс-листе «сдвиньте нагрузку». Инженерным командам всё равно гонять агентов, eval и long-context джобы на реальных машинах: реселлерские тарифы перепишутся, 2,4T-чекпоинт не влезет в ноутбук, а виртуализированные cloud-инстансы по-прежнему берут hypervisor tax и слабо стыкуются с Apple Silicon / iOS toolchain. Если нужен native compute без потерь, стабильный iOS CI/CD и круглосуточная автоматизация агентов в контролируемом физическом боксе, bare-metal узлы Mac mini в облаке ZUKCLOUD обычно лучше подходят: выделенный Apple Silicon, без hypervisor tax, 7×24 online, биллинг по дню, неделе или месяцу. Старт на странице тарифов или сразу на странице заказа.