Если в июле 2026 вы всё ещё выбираете LLM по бенчмарку двухмесячной давности, вы уже отстаёте. OpenRouter — крупнейший нейтральный маркетплейс LLM-маршрутизации — публикует метрику честнее любого пресс-релиза: реальный оплаченный продакшен-объём токенов. В статье разбираются данные на 25 июля 2026: лидерство Mimo V2.5 от Xiaomi, переход китайских лабораторий за 46% доли рынка и гантелеобразное разделение между лидерами по объёму и по качеству. Главный вывод: важнее не кто №1 на этой неделе, а на какой стороне гантели лежат ваши нагрузки.
01 Всё ещё мыслите по шаблону 2025 года? Четыре болевые точки выбора
Июльская доска движется быстрее, чем рейтинг OpenRouter за июнь, с более жёсткой конкуренцией внутри китайского лагеря. Если по умолчанию считаете «US big three = безопасный выбор», ожидайте скрытых издержек:
- Путать объём №1 с качеством №1: OpenRouter ранжирует по токен-объёму, а не по capability. Mimo V2.5 с 1,4T токенов/день не означает, что он подходит для вашего hardest agentic planning — Claude лидирует по расходам на сложный reasoning.
- Игнорировать ~35-кратный ценовой разрыв: DeepSeek V4 Flash — около $0,05–0,14 за миллион input-токенов; GPT-5.5 — около $5,00. Рейтинг отражает ценовую чувствительность не меньше, чем чистую способность модели.
- Смотреть только charts моделей, не apps: один Hermes Agent держит ~45% отслеживаемого app-токен-объёма; roleplay и companion-приложения двигают серьёзный трафик, который enterprise-СМИ почти не освещают.
- Lock-in на одного вендора: «модель месяца» меняется — MiniMax M2.5 в феврале, MiMo-V2-Pro в апреле, Mimo V2.5 в июле. См. гайд по интеграции OpenRouter для fallback-архитектуры.
Коротко: capability и popularity расходятся — китайские open-weight модели покупают объём ценой; US closed-frontier лаборатории держат pricing power на сложных задачах.
02 OpenRouter июль 2026: топ моделей и доли вендоров
Цифры токенов ниже — на 25 июля 2026 (рейтинги меняются ежедневно — проверяйте на openrouter.ai/rankings перед цитированием).
| Ранг | Модель | Вендор | Токены/день | Сумма за 30 дней |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | Tencent | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B (бесплатно) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | StepFun | 204.8B | 5.9T |
| 9 | Kimi K3 | Moonshot AI | 157.6B | 1.6T (новый вход) |
| 10 | Ling 3.0 Flash | InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
Семь из десяти верхних мест — китайские лаборатории; US-сторона в основном Nemotron 3 Ultra, Claude и Gemini. DeepSeek остаётся самым стабильным №1 вендором по доле (16–18%), но месячный volume-чемпион продолжает ротироваться внутри китайского лагеря.
| Вендор | Регион | Доля (прибл.) |
|---|---|---|
| DeepSeek | Китай | 16%–18% |
| Xiaomi | Китай | 8%–18% (скачок Mimo V2.5) |
| Anthropic | США | 10%–15% |
| Tencent | Китай | 8%–13% |
| США | 8%–13% | |
| Z.ai | Китай | 4%–7% |
| OpenAI | США | 6%–8% |
| Китайские лаборатории суммарно | — | ~46% (год назад <2%) |
| US big three суммарно | — | ~30%–36% (год назад ~70%) |
| Модель | Input/M | Output/M | Позиция |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | Лучшая цена/качество; agentic coding |
| Nemotron 3 Ultra | $0.42 (есть free tier) | $2.61 | US open-weight, стек NVIDIA |
| MiniMax M3 | $0.10 | $1.21 | Мультимодал / длинный контекст, бюджет |
| GLM 5.2 | $0.45 | $3.31 | Ближе всего к Opus planning среди open |
| Kimi K3 | ~$3 | ~$15 | 1,4TB open weights, closed-tier capability |
| Claude Opus 5 | $5 (fast $10) | $25 (fast $50) | Closed frontier; топ бенчмарков июля |
03 Цена/качество LLM: чемпион по объёму — не чемпион по качеству
Любой разбор OpenRouter должен начинаться с оговорки: рейтинг измеряет токен-объём, а не capability. Дешёвая модель за high-traffic consumer-приложением может обогнать более сильную, которую команды резервируют для hardest 10% работы.
Расходы по категориям задач рисуют другую картину: общий чат 35,7%, agentic workflows 30,4%, код 26,5%, данные 7,5%. Если смотреть classification и сложный reasoning — Claude Sonnet 4.6 и Claude Opus 4.7 делят по 13,5% расходов, GPT-5.5 третий с 11,6% — дешёвые open-модели с volume-чартов здесь почти не видны.
Рынок бифуркируется: дешёвые китайские open-weight модели поглощают объёмные, error-tolerant нагрузки (чат, креатив, roleplay, рутинный coding), а closed frontier модели держат pricing power на сложной работе с низкой толерантностью к ошибкам. Запуск Claude Opus 5 24 июля — FrontierBench v0.1 43,3% против 37,5% у GPT-5.6 Sol при Opus-ценах $5/$25 за миллион токенов — самое яркое доказательство. Контекст: Claude Opus 5 и спор вокруг Kimi K3 и глубокий разбор Kimi K3.
04 App-leaderboard и 6-шаговый гайд по tiered routing
App-leaderboard (openrouter.ai/apps) показывает, для чего модели реально используются:
- Hermes Agent (self-improving agent от Nous Research) держит ~45% отслеживаемого app-токен-объёма;
- Coding-агенты заполняют большую часть top 10: Kilo Code (~13%), OpenClaw (~9%), Claude Code (~6%), Cline (~1,7%);
- Цепочка форков Cline → Roo Code → Kilo Code показывает: младший форк обогнал предков — first-mover advantage в open-source dev tooling не долговечен;
- Roleplay и companion (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) двигают серьёзный объём — отчёт OpenRouter × a16z State of AI: креативный roleplay — более половины использования open-моделей.
| Ранг | Приложение | Категория | Доля |
|---|---|---|---|
| 1 | Hermes Agent | Личный agent / CLI | ~45% |
| 2 | Kilo Code | Coding agent | ~13% |
| 3 | OpenClaw | Универсальный agent | ~9% |
| 4 | Claude Code | Coding agent | ~6% |
| 5 | Descript | Производство контента | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | Companion / gaming | ~2.1% |
| 8 | ISEKAI ZERO | Roleplay | ~2.0% |
| 9 | Janitor AI | Roleplay | ~1.8% |
| 10 | Cline | Coding agent (IDE) | ~1.7% |
Шесть шагов для построения task-tiered routing по июльскому гантелеобразному паттерну:
- Инвентаризировать задачи и допустимую ошибку: разделить нагрузки на чат/креатив, agent orchestration, код и сложный reasoning; зафиксировать допустимый error rate и потолки latency по tier.
- Валидировать на volume- и spend-чартах: high-volume по умолчанию на DeepSeek V4 Flash и GLM 5.2; Claude Opus 5 / GPT-5.6 — для шагов, где дешёвые модели реально падают.
- Использовать OpenRouter как sandbox прототипирования: один API key на сотни моделей для быстрых A/B; измерять latency и качество на реальных задачах, а не rank в leaderboard.
- Внедрить hybrid routing для снижения cost: coding flows стартуют на DeepSeek V4 Flash, эскалация только при failure; см. цены DeepSeek V4 GA и гайд по миграции.
- Добавить vendor security в scorecard: sandbox escape у OpenAI и предложенный US «AI Kill Switch Act» делают security track record формальным критерием для agentic deployments.
- Подготовить стабильную compute-базу для agent production: локальные Claude Code / Cursor agents плюс cloud API требуют 24/7 uptime; оценить bare-metal Mac mini vs виртуализированные стеки по hypervisor overhead и совместимости Metal toolchain.
05 Прогноз на август, цитируемые данные и FAQ
Прогноз на август по траектории июля:
- Суммарная доля китайских open-weight, вероятно, приблизится к 50% или превысит, если US-вендор не сделает крупное снижение цен;
- Месячный volume-чемпион продолжит ротироваться — следить за августовским release cadence Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax и Moonshot;
- Anthropic может выпустить более дешёвый volume-focused tier; Opus 5 уже четвёртый flagship менее чем за два месяца;
- Веса Kimi K3 1,4TB, вероятно, получат community quantization за 2–4 недели;
- Security и governance становятся реальными критериями enterprise-закупок.
- Дневной объём Mimo V2.5: ~1,4 трлн токенов/день на 25 июля; 31,2T за 30 дней.
- Ценовой разрыв US–Китай: DeepSeek V4 Flash ~$0,05–0,14/M input vs GPT-5.5 ~$5/M — примерно в 35 раз.
- Миграция китайской доли: с менее 2% до ~46% за 12 месяцев — одна из крутейших смен долей в AI.
- Бенчмарк Claude Opus 5: FrontierBench v0.1 43,3%; цены $5/$25 за миллион токенов (fast $10/$50).
FAQ
По какому критерию ранжирует OpenRouter?
По реальному оплаченному токен-объёму — продакшен routing, за который платят разработчики — а не по бенчмаркам.
Какая модель лидировала в OpenRouter в июле 2026?
Mimo V2.5 от Xiaomi с примерно 1,4 трлн токенов в день на 25 июля 2026.
Какую долю занимают китайские модели на OpenRouter?
Около 46% идентифицированного токен-объёма, год назад было менее 2%.
Высокий ранг по использованию означает лучшее качество?
Не обязательно. Объёмные толерантные задачи — на дешёвые open-модели; сложные — на премиальные closed-модели.
Основные источники ниже; рейтинги меняются ежедневно — проверяйте актуальные цифры перед цитированием.
Официальный рейтинг OpenRouter
OpenRouter Blog: DeepSeek V4 Adoption
Отчёт OpenRouter × a16z State of AI
Главный урок июля: capability и popularity расходятся. Для команд, которые 24/7 гоняют Claude Code, Kilo Code или custom agents, одного API routing недостаточно для локального toolchain, Metal-ускорения и uptime — виртуализированные Mac добавляют hypervisor overhead и риск совместимости iOS CI. Для продакшен-сред, где нужны native compute без потерь, стабильный iOS CI/CD и 24/7 автоматизация AI agents, bare-metal Mac mini cloud nodes ZUKCLOUD обычно лучший выбор: выделенное железо Apple Silicon, без hypervisor tax, always-on, гибкая оплата по дням/неделям/месяцам. См. манифест bare-metal архитектуры.