Главная / Блог / Grok 4.5
ENGINEERING BLOG · 2026.07.11

Обзор Grok 4.5:
модель SpaceXAI для кодинга vs Claude Opus & GPT-5.6 (2026)

Если вы крутите Cursor, Claude Code или API-routing для agent-пайплайнов, с 8 июля 2026 встал практический вопрос: стоит ли переключаться на Grok 4.5? SpaceXAI позиционирует модель как Opus-класс за долю цены — Musk назвал её «Opus-level, но быстрее и эффективнее по токенам». Этот обзор для разработчиков и CTO: таблицы цен, бенчмарки, реальный coding-тест TryAI и честная матрица — без launch-PR.

01

8 июля 2026 SpaceXAI выпустила Grok 4.5 — первую frontier-модель после IPO. Модель co-trained с Cursor на триллионах токенов реальных dev-взаимодействий (code review, debug, agent ↔ codebase). SpaceX купила Anysphere (родитель Cursor) в июне 2026 — co-training один из первых видимых результатов сделки.

Фокус оптимизации:

  • Программирование и code-агенты: bugfix, крупные рефакторы, end-to-end приложения
  • Agentic tasks: многошаговая автоматизация через tools и enterprise-приложения
  • Knowledge-intensive work: право, медицина, образование, data analysis

Типичные friction points перед миграцией:

  • Маркетинг vs метрики: «Opus-class» звучит убедительно, но SWE-Bench Pro показывает ~16 п.п. отставания от Claude Fable 5.
  • CursorBench contamination: snapshot codebase Cursor попал в training data; цифры сняты с launch.
  • Token efficiency vs peak accuracy: 4,2× меньше output-токенов экономит деньги — хватит ли для security-critical кода?
  • EU-доступность: API только us-east-1 и us-west-2; EU ожидается mid-July 2026.
  • Hallucination rate: AA-Omniscience Index 54 % — выше предшественника; нужна жёсткая валидация output.
  • Неясная multi-model стратегия: когда роутить на Grok, когда эскалировать на Fable 5?
Спецификация Grok 4.5 (июль 2026)
Параметр Значение
Архитектура Mixture of Experts (MoE)
Контекстное окно 500 000 tokens
Режимы reasoning Low / Medium / High (default: High)
Скорость инференса 80 TPS официально, ~90 измерено; TryAI stream ~110 tok/s
Training infra Десятки тысяч NVIDIA GB300 GPU (Memphis, TN)
Число параметров Не раскрыто (MoE)

02

Цены API (за 1M tokens)
Модель Input Output
Grok 4.5 $2,00 $6,00
Grok 4.5 (cache hit) $0,50
Grok 4.5 Fast $4,00 $18,00
Claude Opus 4.7 $5,00 $25,00
Claude Fable 5 Выше Выше
GPT-5.6 Sol $5,00 $30,00
GPT-5.6 Luna $1,00 $6,00
Оценка стоимости programming agent task
Модель / платформа Средние tokens Стоимость задачи
Grok 4.5 / Grok Build ~1,9M $2,49
GPT-5.5 / Codex ~6,2M $5,07
Claude Fable 5 / Claude Code ~7,2M $11,80

На SWE-Bench Pro Grok 4.5 в среднем 15 954 output tokens на задачу — Claude Opus 4.8 67 020. Разрыв 4,2× по token efficiency. При 500 задачах/день: ~$1 245 vs ~$5 900.

03

Coding-бенчмарки
Benchmark Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0 (provider harness) 62,0 % 66,1 % 55,75 % 64,31 %
DeepSWE 1.1 (neutral harness) 53 % 70 % 59 % 67 %
Terminal Bench 2.1 83,3 % 84,3 % 78,9 % 83,4 %
SWE-Bench Pro 64,7 % 80,4 % 69,2 % 58,6 %

С neutral harness Grok 4.5 падает на 4-е место (17 п.п. behind Fable 5). Terminal Bench: все четыре модели в пределах 5,4 п.п. SWE-Bench Pro: Grok 4.5 — 3-е место, ~16 п.п. behind Fable 5.

CursorBench: снят из-за contamination training data кодом Cursor.

Agent-бенчмарки — сильная сторона Grok 4.5
Benchmark Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA (657 enterprise workflows) 51,4 % 48,6 % 48,5 %
Snorkel GDPVal+ (professional work) 29 % 21 %

AutomationBench-AA симулирует 40 enterprise-приложений (Gmail, Slack, Salesforce, HubSpot). Grok 4.5 — первая модель, выполнившая >50 % workflow objectives без нарушения business constraints. Snorkel: лидерство в legal (40 % vs 27–28 %), education (58 % vs 35–42 %), healthcare (35 % vs 23–25 %).

Artificial Analysis Intelligence Index: 54 балла (4-е место) — после Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55); +16 к предыдущему Grok.

04

TryAI — интерактивные browser-apps из одного prompt
Тест Результат
3D cube render (самый сложный) Opus 4.8 & Fable 5: OK с первого раза; Grok 4.5: title/buttons без cube, OK на retry; GPT-5.5: fail
Скорость Grok 4.5: first token <0,5 s, ~110 tok/s (~2×); Fable 5: самый медленный/дорогой
Вывод One-shot precision → Claude; high-volume repetition → Grok 4.5

Платформы (EU ожидается mid-July 2026): Grok Build; Cursor (все планы, удвоенный quota первую неделю); SpaceXAI Console API (us-east-1, us-west-2; 150 req/s, 50M tok/min); Office add-ins; gateways OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic.

  1. Создать аккаунт SpaceXAI Console и сгенерировать API key.
  2. Зафиксировать model ID: grok-4.5 (или Fast для latency-critical paths).
  3. Smoke test через curl к Responses API (ниже).
  4. Включить cache routing: prompt_cache_key (Responses) или header x-grok-conv-id (Chat Completions) — input $0,50/M вместо $2,00.
  5. Оптимизировать agent loops: Context Compaction; режимы Low/Med/High под сложность задачи.
  6. Monitoring и fallback: anti-hallucination checks; SWE-Bench-Pro tasks эскалировать на Claude Fable 5.
grok-api-smoke-test.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Найди и исправь баг: function median(a){a.sort();return a[a.length/2]}"
  }'

05

Матрица решений
Сценарий Рекомендация Обоснование
High-volume agent pipelines (100–1000+ tasks/day) Grok 4.5 $2,49 vs $11,80; token efficiency 4,2×
Terminal & tool-use workflows Grok 4.5 Terminal Bench 83,3 %; AutomationBench-AA лидер
Cursor-native команды Grok 4.5 Co-training, сразу в model picker
Mixed strategy (routine + architecture) Grok + Fable 5 Subtasks на Grok, критика на Claude
SWE-Bench-Pro precision (finance/security code) Осторожно — Fable 5 80,4 % vs 64,7 %
Production с низкой tolerance к hallucinations Осторожно AA-Omniscience 54 %
EU-команды Осторожно до EU region Пока только US API regions
  • Стоимость задачи: Grok ~$2,49 vs Claude Code ~$11,80; 500 tasks/day ≈ $3 655 экономии.
  • Token efficiency: 15 954 vs 67 020 output tokens (SWE-Bench Pro).
  • Intelligence Index: Artificial Analysis 54 (+16 к predecessor).
  • Инференс: 80 TPS официально, ~90 measured; TryAI ~110 tok/s, first token <500 ms.
  • API limits: 150 req/s, 50M tokens/min.

Официальные и независимые источники — перепроверить после обновлений:

SpaceXAI: анонс Grok 4.5

Cursor: co-training Grok 4.5

SpaceXAI API docs: Grok 4.5

TechCrunch: SpaceXAI releases Grok 4.5

Awesome Agents: независимый обзор

APIdog: разбор бенчмарков

Snorkel AI: professional work evaluation

Grok 4.5 — не самая точная coding-модель: Claude Fable 5 лидирует SWE-Bench Pro. Ценность — в intelligence per dollar для agentic workflows. Чистый API-routing экономит деньги, но не закрывает локальные toolchain: Xcode builds, компиляция с Metal, 7×24 Cursor-агенты на macOS требуют стабильного хоста без hypervisor overhead. Shared VM, sleeping Mac и нестабильный remote desktop рвут длинные agent loops — именно там Grok 4.5 выигрывает token efficiency. Для стабильного iOS/macOS CI, native compiler chains и persistent agent automation bare-metal Mac mini cloud nodes ZUKCLOUD дают предсказуемую базу: dedicated Apple Silicon, zero hypervisor loss, 7×24, гибкий заказ по дням/неделям/месяцам. См. манифест bare-metal архитектуры и аренда vs покупка Mac Mini M4.

06

В: Grok 4.5 лучше Claude Opus 4.8?
О: Opus выигрывает SWE-Bench Pro (69,2 % vs 64,7 %). Grok — скорость, token efficiency и cost (часто 4×). На AutomationBench-AA Grok слегка ahead Opus.

В: Бесплатно?
О: Ограниченный free tier в Grok Build/Cursor; далее $2/M input, $6/M output.

В: Как в Cursor?
О: Model picker → Grok 4.5; первую неделю quota ×2.

В: Context window?
О: 500 000 tokens.

В: Почему нет CursorBench?
О: Training data contamination кодом Cursor.

В: OpenRouter?
О: Да — см. также наш отчёт OpenRouter июнь 2026.