Startseite / Blog / Grok 4.5
ENGINEERING BLOG · 2026.07.11

Grok 4.5 Review:
SpaceXAI Programmiermodell vs Claude Opus & GPT-5.6 (2026)

Wenn Sie Cursor, Claude Code oder API-Routing für Agent-Pipelines betreiben, stellt sich seit dem 8. Juli 2026 eine konkrete Frage: Lohnt sich der Wechsel zu Grok 4.5? SpaceXAI positioniert das Modell als Opus-Klasse zum Bruchteil der Kosten — Musk nannte es explizit „Opus-level, aber schneller und günstiger“. Dieser Review richtet sich an Entwickler und CTOs, die Benchmarks, Preistabellen, TryAI-Echtprogrammierung und eine ehrliche Entscheidungsmatrix brauchen — nicht nur Launch-PR.

01

Am 8. Juli 2026 veröffentlichte SpaceXAI Grok 4.5 — das erste Frontier-Modell nach dem Börsengang. Es ist nicht bloß ein Increment: Das Modell wurde gemeinsam mit Cursor trainiert und mit Billionen Tokens echter Entwickler-Interaktionen gefüttert (Code-Review, Debugging, Agent-Codebase-Zugriff). SpaceX hatte im Juni 2026 Cursor-Mutter Anysphere übernommen; das Co-Training ist eines der ersten sichtbaren Ergebnisse.

Optimierungsziele laut Hersteller:

  • Programmierung & Code-Agenten: Bugfixes, große Refactors, End-to-End-Apps
  • Agentische Tasks: Multi-Step-Automatisierung über Tools und Enterprise-Apps
  • Wissensintensive Arbeit: Recht, Medizin, Bildung, Datenanalyse

Typische Entscheidungsschmerzen vor dem Wechsel:

  • Marketing vs. Messdaten: „Opus-Klasse“ klingt gut — aber SWE-Bench Pro zeigt 15+ Punkte Abstand zu Claude Fable 5.
  • CursorBench-Kontamination: Ein Cursor-Codebase-Snapshot landete in Trainingsdaten; veröffentlichte CursorBench-Zahlen wurden zurückgezogen.
  • Token-Effizienz vs. Peak-Genauigkeit: 4,2× weniger Output-Tokens pro Task spart Geld — reicht das für sicherheitskritischen Code?
  • EU-Verfügbarkeit: API nur in us-east-1 und us-west-2; EU voraussichtlich Mitte Juli 2026 — relevant für DSGVO-konforme Datenverarbeitung und Auftragsverarbeitungsverträge.
  • Halluzinationsrate: AA-Omniscience Index bei 54 % — deutlich höher als Vorgänger; Output-Validierung ist Pflicht.
  • Gemischte Modell-Strategie unklar: Wann Grok routen, wann Claude Fable 5 eskalieren?
Grok 4.5 Kerndaten (Stand Juli 2026)
Parameter Wert
Architektur Mixture of Experts (MoE)
Kontextfenster 500.000 Tokens
Reasoning-Modi Low / Medium / High (Standard: High)
Inferenzgeschwindigkeit 80 TPS offiziell, ~90 TPS gemessen; TryAI ~110 tok/s Stream
Trainings-Hardware Zehntausende NVIDIA GB300 GPUs (Memphis, TN)
Parameterzahl Nicht veröffentlicht (MoE)

02

Listenpreise allein täuschen — entscheidend ist die Kombination aus Token-Preis und Token-Verbrauch pro Agent-Task.

API-Token-Preise (pro 1M Tokens)
Modell Input Output
Grok 4.5 $2,00 $6,00
Grok 4.5 (Cache-Hit) $0,50
Grok 4.5 Fast $4,00 $18,00
Claude Opus 4.7 $5,00 $25,00
Claude Fable 5 Höher Höher
GPT-5.6 Sol $5,00 $30,00
GPT-5.6 Luna $1,00 $6,00
Geschätzte Kosten pro Programmier-Agent-Task
Modell / Plattform Ø Tokens pro Task Ø Kosten pro Task
Grok 4.5 / Grok Build ~1,9M $2,49
GPT-5.5 / Codex ~6,2M $5,07
Claude Fable 5 / Claude Code ~7,2M $11,80

Bei SWE-Bench Pro verbraucht Grok 4.5 im Schnitt 15.954 Output-Tokens pro Task — Claude Opus 4.8 67.020. Das ist eine 4,2× Token-Effizienz-Lücke, die bei 500 Tasks/Tag den Unterschied zwischen ~$1.245 und ~$5.900 pro Tag bedeutet.

03

3.1 Programmier-Benchmarks

Coding-Benchmarks (Resolve Rate / Score)
Benchmark Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0 (Provider-Harness) 62,0 % 66,1 % 55,75 % 64,31 %
DeepSWE 1.1 (neutraler Harness) 53 % 70 % 59 % 67 %
Terminal Bench 2.1 83,3 % 84,3 % 78,9 % 83,4 %
SWE-Bench Pro 64,7 % 80,4 % 69,2 % 58,6 %

Interpretation: Mit neutralem DeepSWE-Harness fällt Grok 4.5 auf Platz 4 (17 Punkte hinter Fable 5). Terminal Bench: alle vier Frontier-Modelle innerhalb von 5,4 Punkten — hier zählen Kosten und Fit mehr als der Score. SWE-Bench Pro: Grok 4.5 Platz 3, ~16 Punkte hinter Fable 5.

CursorBench-Hinweis: Ergebnisse wurden vom Launch zurückgezogen, weil Cursor-Code in Trainingsdaten landete — ein Transparenzproblem, das unabhängige Retests erfordert.

3.2 Agent-Benchmarks (Stärke von Grok 4.5)

Agent- und Wissens-Benchmarks
Benchmark Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA (657 Enterprise-Workflows) 51,4 % 48,6 % 48,5 %
Snorkel GDPVal+ (professionelle Arbeit) 29 % 21 %

AutomationBench-AA simuliert 40 Enterprise-Apps (Gmail, Slack, Salesforce, HubSpot). Grok 4.5 ist das erste Modell, das über 50 % der Workflow-Ziele ohne Verletzung von Business-Constraints erfüllt. Snorkel zeigt Vorsprünge in Recht (40 % vs. 27–28 %), Bildung (58 % vs. 35–42 %) und Medizin (35 % vs. 23–25 %).

Artificial Analysis Intelligence Index: Grok 4.5 erreicht 54 Punkte (Platz 4) — hinter Fable 5 (60), Opus 4.8 (56) und GPT-5.5 (55), aber +16 gegenüber dem Vorgänger-Grok.

04

TryAI: identische Prompts, vier Modelle

TryAI — interaktive Browser-Apps aus einem Prompt
Test Ergebnis
3D-Würfel (schwerster Test) Opus 4.8 & Fable 5: erster Versuch OK; Grok 4.5: erster Versuch ohne Würfel, Retry OK; GPT-5.5: gescheitert
Geschwindigkeit Grok 4.5: First Token <0,5 s, ~110 tok/s (~2× schneller); GPT-5.5 schnell bei Kurzantworten; Fable 5 langsamste/teuerste
Fazit Einmalige Präzision → Claude; Hochvolumen-Repetition → Grok 4.5

Verfügbare Plattformen (EU voraussichtlich Mitte Juli 2026)

  • Grok Build: SpaceXAI Coding-Agent-Plattform, Grok 4.5 als Standardmodell
  • Cursor: alle Pläne (Desktop, Web, iOS, CLI, SDK); erste Woche doppeltes Kontingent
  • SpaceXAI Console API: Chat Completions & Responses API; Regionen us-east-1, us-west-2; Limits 150 req/s, 50M tok/min
  • Office-Add-ins: Word, PowerPoint, Excel
  • Third-Party-Gateways: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic

6-Schritte-Anbindung für Produktions-API:

  1. SpaceXAI Console-Konto anlegen und API-Key generieren; für EU-Teams vorab DSGVO-Folgenabschätzung (Datenübermittlung in US-Regionen, AV-Vertrag).
  2. Modell-ID festlegen: grok-4.5 (oder Fast-Variante für Latenz-kritische Pfade).
  3. Ersten Smoke-Test per curl gegen Responses API ausführen (siehe unten).
  4. Cache-Routing aktivieren: prompt_cache_key (Responses) oder Header x-grok-conv-id (Chat Completions) — Input sinkt von $2,00 auf $0,50/M.
  5. Agent-Loops optimieren: Context Compaction für lange Zyklen; Reasoning-Modus Low/Med/High je nach Task-Komplexität.
  6. Monitoring & Fallback: Halluzinations-Checks, Kosten-Dashboard pro Task; komplexe SWE-Bench-Pro-Tasks an Claude Fable 5 eskalieren.
grok-api-smoke-test.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Finde und behebe den Bug: function median(a){a.sort();return a[a.length/2]}"
  }'

05

Entscheidungsmatrix: geeignet vs. vorsichtig
Szenario Empfehlung Begründung
Hochvolumen-Agent-Pipelines (100–1000+ Tasks/Tag) Grok 4.5 $2,49 vs. $11,80 pro Task; 4,2× Token-Effizienz
Terminal- & Tool-Use-Workflows Grok 4.5 Terminal Bench 83,3 %; AutomationBench-AA führend
Cursor-native Teams Grok 4.5 Co-Training, sofort in Modellauswahl
Gemischte Strategie (Routine + Architektur) Grok + Claude Fable 5 Subtasks an Grok, kritische Entscheidungen an Fable 5
SWE-Bench-Pro-Präzision (Finanz-/Security-Code) Vorsicht — Claude Fable 5 80,4 % vs. 64,7 % — ~16 Punkte Lücke
Halluzinations-sensible Produktion Vorsicht AA-Omniscience 54 %; robuste Validierung nötig
EU-Teams mit DSGVO-Pflicht Vorsicht bis EU-Region live Nur US-Regionen; AV-Vertrag & Transfer Impact Assessment prüfen

EEAT — zitierbare Kennzahlen

  • Task-Kosten: Grok 4.5 ~$2,49 vs. Claude Code ~$11,80 pro Agent-Task; bei 500 Tasks/Tag ~$3.655 Ersparnis.
  • Token-Effizienz: 15.954 vs. 67.020 Output-Tokens (SWE-Bench Pro) = Faktor 4,2.
  • Intelligence Index: Artificial Analysis 54 (+16 vs. Vorgänger); Fable 5 führt mit 60.
  • Inferenz: 80 TPS offiziell, ~90 gemessen; TryAI-Stream ~110 tok/s, First Token <500 ms.
  • API-Limits: 150 Requests/s, 50M Tokens/min (SpaceXAI Console).

Offizielle und unabhängige Quellen — nach Release erneut prüfen:

SpaceXAI: Grok 4.5 Launch-Blog

Cursor: Grok 4.5 Co-Training-Ankündigung

SpaceXAI API-Dokumentation: Grok 4.5

TechCrunch: SpaceXAI veröffentlicht Grok 4.5

Awesome Agents: unabhängiger Grok-4.5-Review

APIdog: Benchmark-Tiefenanalyse Grok 4.5

Snorkel AI: professionelle Arbeitsszenarien

Grok 4.5 ist nicht das genaueste Coding-Modell — Claude Fable 5 führt SWE-Bench Pro. Sein Wert liegt in Intelligence pro Dollar für agentische Workflows. Reine Cloud-API-Routing spart Geld, löst aber nicht das Problem lokaler Toolchains: Xcode-Builds, Metal-Shader-Tests und 7×24-Cursor-Agenten brauchen eine stabile macOS-Host-Umgebung. Geteilte VMs mit Hypervisor-Overhead, schlafende Laptops und instabile Remote-Desktops brechen lange Agent-Loops — genau dort, wo Grok 4.5 durch Token-Effizienz glänzt. Für produktive iOS/macOS-CI, native Compiler-Ketten und dauerhafte Agent-Automatisierung sind ZUKCLOUD Bare-Metal-Mac-mini-Cloud-Nodes die stabilere Basis: exklusive Apple-Silicon-Physik, kein Hypervisor-Verlust, 7×24 online, flexibel nach Tag/Woche/Monat. Details: Bare-Metal-Architektur-Manifest, Mac Mini M4 Miete vs. Kauf.

06

F: Ist Grok 4.5 besser als Claude Opus 4.8?
A: Opus 4.8 gewinnt bei SWE-Bench Pro (69,2 % vs. 64,7 %). Grok 4.5 gewinnt bei Geschwindigkeit, Token-Effizienz und Kosten — oft 4× günstiger pro Task. Bei Agent-Workflows (AutomationBench-AA) liegt Grok knapp vor Opus.

F: Ist Grok 4.5 kostenlos?
A: Zeitlich begrenzt in Grok Build und Cursor. Danach API $2/M Input, $6/M Output. Cursor-Abos enthalten Grok 4.5.

F: Wie aktiviere ich Grok 4.5 in Cursor?
A: Modellauswahl → Grok 4.5. Erste Launch-Woche: doppeltes Kontingent.

F: Kontextfenster?
A: 500.000 Tokens.

F: Warum fehlt CursorBench?
A: Trainingsdaten-Kontamination durch Cursor-Codebase-Snapshot; Ergebnisse zurückgezogen.

F: OpenRouter?
A: Ja — auch Vercel, Cloudflare, Snowflake, Databricks Mosaic. Siehe auch unseren OpenRouter-Rankings-Report.