Startseite / Blog / Grok 4.6
ENGINEERING BLOG · 2026.07.30

Grok 4.6 Release-Datum:
Ist xAIs 7.-August-Ziel realistisch?

Wer als AI-Ingenieur oder Tech Lead auf Grok 4.6 wartet, um Agent- oder Coding-Workflows zu upgraden, hat derzeit nur eine belastbare Quelle: Elon Musks Antwort an Vercel-CEO Guillermo Rauch auf X vom 28. Juli 2026. xAI zielt auf Grok 4.6 um den 7. August mit 1,5 Billionen Parametern, gefolgt wenige Wochen später von Grok 4.7 mit 2,1 Billionen — etwa einen Monat nach dem Grok-4.5-Release, drei Frontier-Modelle in zwei Monaten. Dieser Artikel ordnet die Timeline ein, erklärt warum xAI SFT/RL statt reiner Skalierung betont, vergleicht die angekündigten Specs mit Kimi K3 und dem Gerücht um Claude Fable 5.1 und markiert Unbestätigtes klar. Fazit vorweg: Keine Benchmarks, keine Preise, kein Model Card — „um den 7. August" ist ein Zieltermin, keine Garantie.

01

Anders als Grok 4.5, das mit vollständiger Model Card und 15 getrackten Benchmarks startete, haben Grok 4.6 und 4.7 weder unabhängige Evaluation noch eine offizielle Produktseite. Wer den Produktionsstack auf Social-Media-Leaks aufbaut, trägt messbares Risiko:

  • Einzelquelle, unbestätigt: Alles — „1,5 Billionen Parameter", „significantly improved SFT & RL", das 2,1T-Grok-4.7-Follow-up — stammt aus einem X-Post. Kein xAI-Blogpost oder Model Card hat es bestätigt.
  • „Musk time" hat Historie: Timelines von Musk-geführten Unternehmen verschieben sich typischerweise um Tage bis Wochen. „Um den 7. August" ist ein Ziel, kein Vertragsdatum.
  • Benchmarks und Preise fehlen: Grok 4.5 lieferte detaillierte Scores; Grok 4.6 hat null Drittpartei-Daten. Ein Head-to-Head mit Kimi K3 — das bereits verifizierte Zahlen hat — ist noch unmöglich.
  • Safety und Branchentempo kollidieren: Am selben Tag wie Musks Roadmap veröffentlichten über 1.200 Mitarbeitende von OpenAI, Anthropic, Google DeepMind und Meta den „Pacing the Frontier"-Brief mit der Bitte an die US-Regierung, automatisierte AI-Entwicklung zu verlangsamen — auf Unternehmensebene von OpenAI und Anthropic unterstützt. xAI fehlt auf der Unterzeichnerliste. Im Juli verklagte xAI zudem einen Nutzer wegen mutmaßlicher Nutzung von Grok zur CSAM-Generierung — relevantes Vendor-Risk-Kontext für Enterprise-Buyer und DSGVO-konforme Datenverarbeitung.

Kurz gesagt: Die Narrative ist klar, verifizierbare Daten sind null — jede „bestes Modell"-Behauptung vor offizieller Model Card ist Spekulation.

02

Kern-Timeline:

  • 8. Juli 2026: xAI shippt Grok 4.5 — für Coding und agentische Arbeit, Co-Training mit Cursor auf echten Developer-Sessions. 500K-Token-Kontext, 2/6 USD pro Million Input/Output-Tokens, veröffentlichte Model Card.
  • 16.–26. Juli 2026: Moonshot AIs Kimi K3 wechselt von gehosteter Preview zu vollständigem Open-Weight-Release — 2,8T Parameter, 1M-Token-Kontext, Spitze auf Hugging Faces Trending-Chart.
  • 28. Juli 2026: Musk postet die Grok-4.6/4.7-Roadmap als Antwort an Rauch — Primärquelle dieses Artikels.
  • ~7. August 2026 (Ziel): Grok 4.6, 1,5T Parameter, positioniert als SFT/RL-Upgrade statt reiner Scale-up.
  • Ende August–Anfang September 2026 (geschätzt): Grok 4.7, 2,1T Parameter — Musk: „besser als 4.6 in jeder Hinsicht, außer etwas langsamer zu serven, aber mit noch besserer Token-Effizienz."
Grok-Familie: Specs (inkl. angekündigter, unveröffentlichter Modelle)
Modell Datum Parameter Fokus Status
Grok 4.3 Beta17. Apr. 2026Nicht offengelegtBaselineShipped
Grok 4.58. Juli 2026Nicht offengelegt (Single SKU, kein MoE)Coding/agentisch, Cursor Co-TrainingShipped, benchmarked
Grok 4.6~7. Aug. 20261,5TSFT/RL-UpgradeAngekündigt per Tweet, unveröffentlicht
Grok 4.7~Ende Aug.–Anf. Sep. 20262,1TBreites Upgrade über 4.6, bessere Token-EffizienzAngekündigt per Tweet, unveröffentlicht

Alle Grok-4.6/4.7-Zahlen sind unverifizierte Vendor-Claims aus einem Social-Media-Post — als Richtwert behandeln, nicht als bestätigte Specs.

03

SFT und RL in Klartext: Supervised Fine-Tuning (SFT) trainiert ein Modell auf kuratierten Beispiel-Outputs zur Verhaltenssteuerung; Reinforcement Learning (RL) nutzt Reward-Signale, um zu lehren, welche Aktionssequenzen tatsächlich funktionieren — kritisch für mehrstufige agentische Tasks. Musks Formulierung — „significantly improved SFT & RL" — signalisiert, dass xAI dieselbe Strategie wie bei Grok 4.5 verfolgt: ca. 15.954 Output-Tokens pro SWE-Bench-Pro-Task gegenüber 67.020 bei Opus 4.8 — ein 4,2×-Effizienzgap, größtenteils Post-Training auf echten Cursor-Developer-Sessions zugeschrieben.

Scale-vs.-Speed-Trade-off: Grok 4.6s Sprung auf 1,5T ist ein reales Scale-up, aber Musks Framing von Grok 4.7 — größer bei 2,1T, „besser in jeder Hinsicht außer etwas langsamer zu serven" — deutet auf zwei SKUs mit unterschiedlichen Trade-offs hin, ähnlich Anthropics Sonnet/Opus-Split oder OpenAIs Mini/Full-Tiers.

Wettbewerbsdruck, den die Timeline nicht erwähnt: Grok 4.6s Zieltermin liegt fast exakt 10 Tage nach Kimi K3s vollständigem Open-Weight-Release. Moonshots Modell führte das Frontend Code Arena Leaderboard mit 1.679 Punkten an — erstes Open-Weight-Modell, das jedes Closed Model auf dem Board schlägt — und rangierte global #3 im Artificial Analysis Intelligence Index. Musk kommentierte Kimi-K3-Benchmark-Posts mit „impressive". Chinesische Finanzmedien berichteten, der Release habe geschätzte 314 Mrd. USD an kombinierten OpenAI/Anthropic-Bewertungserwartungen abgeschrieben — Analystenschätzungen über Medien, nicht unabhängig bestätigt, aber die Stimmungsrichtung ist klar.

Grok vs. Zeitgenossen (Pre-Release-Claims — keine verifizierten Benchmarks)
Modell Anbieter Parameter Kontext Preis (Input/Output pro 1M Token)
Grok 4.5xAINicht offengelegt500K2 / 6 USD
Grok 4.6 (angekündigt)xAI1,5TNicht offengelegtNicht offengelegt
Kimi K3Moonshot AI2,8T (MoE, ~16/896 Experten aktiv)1M0,30 (Cache Hit) / 3 (Cache Miss) in, 15 out
Claude Fable 5.1 (Gerücht)AnthropicNicht offengelegtNicht offengelegtGerücht: unverändert zu Fable 5 (10 / 50 USD)
GPT-5.6 SolOpenAINicht offengelegtNicht offengelegtNicht offengelegt

04

  1. Verifikations-Checkliste aufbauen: Musks X-Account, xAI-Blog und Model-Card-Seite monitoren. „1,5T Parameter" nicht in SLAs einbacken, bis eine offizielle Ankündigung vorliegt.
  2. Baseline auf Grok 4.5 heute: Falls Grok 4.5 noch nicht integriert — echten Task-Satz auf Cursor oder xAI API (2/6 USD pro Million Token) laufen lassen und Token-Verbrauch sowie Pass-Raten als Vergleichsbaseline dokumentieren.
  3. Kimi K3 parallel benchmarken: Kimi K3 hat bereits Drittpartei-Scores (SWE-bench Verified 93,4 %, Frontend Code Arena 1.679). Das Auswahlfenster nicht leer auf ein unveröffentlichtes Model Card warten lassen.
  4. Dual-SKU-Routing reservieren: Musk deutete bereits 4.6 (schneller) vs. 4.7 (stärker, etwas langsamer) an. Latenz/Qualitäts-Fallback-Logik im Agent-Gateway einplanen — siehe unseren OpenRouter-Dual-Route-Integrationsleitfaden.
  5. Vendor-Safety-Risiko bewerten: xAIs jüngste CSAM-Klage und Common Sense Medias Child-Safety-Ratings prüfen. Bei consumer-facing Produkten oder Verarbeitung personenbezogener Daten in der Cloud: Compliance und DSGVO Art. 28 Auftragsverarbeitung in den TCO einrechnen, nicht nur Leaderboard-Rang.
  6. Stabile Compute für Agent-Produktion sichern: Ob Routing zur Grok-4.6-API oder Mixed Stack — lokaler Cursor Agent und CI-Pipelines brauchen 24/7 stabile Umgebungen. Bare-Metal vs. virtualisierter Mac hinsichtlich Hypervisor-Overhead evaluieren.

05

Hält Musks Timeline, landen Grok 4.6 und Grok 4.7 im selben Monat wie das Gerücht um Claude Fable 5.1 (laut Leaks von 36kr und WinCentral, zeitlich vor OpenAIs erwartetem GPT-6) und nur Wochen nach Kimi K3s Open-Weight-Schock. Für Teams, die Modelle evaluieren, verkürzt sich die Nutzungsdauer jedes einzelnen Flaggschiffs auf Wochen — Token-Effizienz und realer Task-Cost zählen mehr als Leaderboard-Rang allein.

  • Grok 4.5 Coding-Benchmarks (shipped): Terminal-Bench 2.1 83,3 %, SWE-Bench Pro 64,7 %; ~4,2× Output-Token-Effizienz vs. Claude Opus 4.8 (~15.954 vs. 67.020 Token/Task).
  • Grok 4.6 angekündigte Specs: 1,5T Parameter, SFT/RL-Post-Training-Upgrade — von Dritten unverifiziert.
  • Grok 4.7 angekündigte Specs: 2,1T Parameter, „besser als 4.6 außer etwas langsamer, bessere Token-Effizienz" — unverifiziert.
  • Kimi K3 Referenz-Benchmarks (verifiziert): Frontend Code Arena 1.679 Punkte (Top Open-Weight), Artificial Analysis Intelligence Index Rang #3 global.

FAQ

Wann genau erscheint Grok 4.6?

Musk nannte in einem X-Post „um den 7. August 2026", xAI hat kein offizielles Datum bestätigt. Als verschiebbares Ziel behandeln.

Was ist der Unterschied zwischen Grok 4.6 und Grok 4.7?

Grok 4.6 ist ein 1,5T-Parameter-Modell mit Fokus auf SFT/RL-Post-Training. Grok 4.7, einige Wochen später erwartet, hat 2,1T Parameter und soll laut Musk in allen Bereichen besser sein als 4.6, außer bei der Serving-Geschwindigkeit.

Schlägt Grok 4.6 Kimi K3 oder Claude Fable 5.1?

Zu früh. Grok 4.6 hat keine veröffentlichten Benchmarks, Kimi K3 hat verifizierte Drittpartei-Scores, Claude Fable 5.1 ist von Anthropic nicht offiziell bestätigt.

Was kostet Grok 4.6?

Unbekannt. Grok 4.5 startete bei 2 USD/M Input und 6 USD/M Output — sinnvoller Referenzpunkt, aber xAI hat keine Grok-4.6-Preise veröffentlicht.

Wo kann ich Grok 4.6 nutzen?

Basierend auf Grok 4.5: voraussichtlich zuerst Grok Build, xAI API und xAI Console, danach Drittplattform-Integrationen — für 4.6 noch nicht bestätigt.

Primärquellen unten. Alle Grok-4.6/4.7-Details sind Vendor-Ankündigungen oder Branchenleaks — vor Verlass auf konkrete Daten, Specs oder Preise offizielle xAI-Kanäle prüfen.

xAI offizieller Blog: Introducing Grok 4.5

xAI Grok 4.5 Model Card (media.x.ai)

Moonshot AI offizieller Blog: Kimi K3

The Verge: „Pacing the Frontier"-Brief-Berichterstattung

Für Teams mit Cursor Agent, Grok-API-Mixed-Routing oder iOS CI/CD im Dauerbetrieb lösen Cloud-APIs allein weder lokale Metal-Toolchain-Stabilität noch DSGVO-konforme Datenpfade — virtualisierte Mac-Setups bringen Hypervisor-Overhead und Kompatibilitätsrisiken, schneller Modellwechsel belastet die darunterliegende Umgebung. Für Produktionsworkloads mit Zero-Loss-Native-Compute, stabilem iOS CI/CD und 24/7 AI-Agent-Automatisierung sind ZUKCLOUD Bare-Metal-Mac-mini-Cloud-Nodes in der Regel die bessere Wahl: dedizierte Apple-Silicon-Hardware, kein Hypervisor-Tax, Always-on, flexible Tages-/Wochen-/Monatsabrechnung. Details in unserem Bare-Metal-Architektur-Manifest.