首頁 / 部落格 / Grok 4.5
ENGINEERING BLOG · 2026.07.11

Grok 4.5 深度評測
SpaceXAI 最強程式設計模型 vs Claude Opus vs GPT-5.5(2026)

若您是使用 CursorClaude Code 的開發者、或負責評估 AI Agent 成本的技術決策者,2026 年 7 月 8 日 SpaceXAI 正式發布的 Grok 4.5 很可能已進入您的採購清單。馬斯克稱其為「Opus 級智慧、速度更快、Token 效率更高、成本更低」——本文不帶濾鏡,完整梳理官方與第三方 benchmark、$2/$6 定價表、真實任務成本($2.49 vs $11.80)、Cursor 聯合訓練背景、API 接入步驟與適合/謹慎場景決策矩陣,協助您判斷是否值得切換。

01

2026 年 7 月 8 日,SpaceXAI 正式推出 Grok 4.5——上市後首款旗艦模型。馬斯克在 X 上稱其為「Opus 級別模型,但速度更快、Token 效率更高、成本更低」。這不是普通版本迭代:模型與 AI 程式設計工具 Cursor 聯合訓練,注入數兆 Token 的真實開發者互動資料(程式碼審查、除錯流程、Agent 與程式碼庫互動紀錄)。SpaceX 於 2026 年 6 月宣布以約 600 億美元全股票交易收購 Cursor 母公司 Anysphere,Grok 4.5 是此合作的首批可見成果。

許多團隊在發布稿後仍卡在以下痛點:

  • 標榜 Opus 級、benchmark 卻非第一: SWE-Bench Pro 落後 Claude Fable 5 約 16 個百分點,難以判斷「性價比」是否足以彌補準確率差距。
  • 定價低但 Token 消耗不透明: $2/$6 單價看似便宜,若輸出 Token 是競品的 4 倍,實際帳單可能反超。
  • CursorBench 資料污染: Cursor 程式碼庫快照意外混入訓練資料,相關分數已撤除,可信度存疑。
  • 歐盟地區尚未開放: API 僅 us-east-1 / us-west-2,EU 預計 7 月中旬才可用。
  • 幻覺率上升: 獨立評測顯示 AA-Omniscience Index 幻覺率達 54%,生產環境需加強輸出驗證。
  • 垂直整合鎖定風險: 同一集團掌控算力(Colossus)、模型(Grok)、工具(Cursor)與分發(Grok Build),長期議價空間可能縮小。
Grok 4.5 核心規格一覽
參數 數值 備註
架構 Mixture of Experts(MoE) 混合專家,參數量未公開
上下文視窗 500,000 Tokens 超過 200K 有較高計費層級
推理模式 低 / 中 / 高(預設:高) reasoning_effort 參數可調
推理速度 官方 80 TPS,實測約 90 TPS TryAI 測得首 Token <0.5 秒、約 110 tokens/秒
訓練硬體 數萬塊 NVIDIA GB300 GPU 孟菲斯(Memphis)資料中心
模型 ID grok-4.5 別名 grok-4.5-latestgrok-build-latest
優化場景 程式設計 / Agent / 知識密集型工作 法律、醫療、教育、資料分析等專業情境

Grok 4.5 不是「最強的程式設計模型」,而是 SpaceXAI 迄今針對高頻 Agent 工作流性價比最激進的產品定位。

02

定價是 Grok 4.5 最核心的賣點。單看每百萬 Token 單價不夠——必須結合 Token 效率每任務實際成本 才能做出採購決策。

API 單價對比(每百萬 Tokens)
模型 輸入 輸出 快取輸入
Grok 4.5(標準) $2.00 $6.00 $0.50
Grok 4.5 Fast(Cursor 優先) $4.00 $18.00
Claude Opus 4.8(標準) $5.00 $25.00 $0.50
Claude Fable 5 $10.00 $50.00
GPT-5.6 Sol(旗艦) $5.00 $30.00
GPT-5.6 Luna(經濟) $1.00 $6.00
上下文視窗 Grok 4.5:500K;Claude Opus/Fable:1M
真實程式設計 Agent 任務成本對比
模型 / 平台 每任務平均 Token 消耗 每任務實際成本
Grok 4.5 / Grok Build 約 1.9M tokens $2.49
GPT-5.5 / Codex 約 6.2M tokens $5.07
Claude Fable 5 / Claude Code 約 7.2M tokens $11.80
Token 效率(SWE-Bench Pro) Grok 4.5 平均 15,954 輸出 Token/任務 Opus 4.8 為 67,020——差距 4.2 倍

以開發團隊每日 500 次 Agent 任務估算:Grok 4.5 約 $1,245/日,Claude Code 約 $5,900/日。在高頻呼叫場景下,Token 效率優勢會被指數級放大。SpaceXAI 官方亦稱 Grok 4.5 達到約 2 倍 Token 效率,以不到一半的步驟完成同類任務。

03

SpaceXAI 官方公布 4 項程式設計評測;我們同步整理第三方獨立測試與 Agent 任務 benchmark,並標註資料可信度風險。

3.1 程式設計 Benchmark

程式設計 Benchmark 對照(官方與第三方)
評測項目 Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0(各廠商 harness) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1(中立 harness) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro(解決率) 64.7% 80.4% 69.2% 58.6%

解讀: DeepSWE 1.0 用各廠商自有 harness 時 Grok 4.5 排第三;換成中立 harness(DeepSWE 1.1)後跌至第四,Fable 5 領先 17 個百分點。Terminal Bench 2.1 四款頂級模型差距在 5.4 個百分點以內,幾乎平局。SWE-Bench Pro 是最嚴苛測試,Grok 4.5 排第三,落後 Fable 5 約 16 個百分點——對高精度多檔案重構任務,差距真實存在。

3.2 Agent 任務 Benchmark(Grok 4.5 高光舞台)

Agent 與企業工作流 Benchmark
評測項目 Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA(657 個企業工作流) 51.4% 48.6% 48.5%
Snorkel GDPVal+(專業工作場景) 29% 21%
Snorkel 法律場景 40% 27–28%
Snorkel 教育場景 58% 35–42%
Snorkel 醫療場景 35% 23–25%

AutomationBench-AA 涵蓋 Gmail、Slack、Salesforce、HubSpot 等 40 個模擬企業應用程式。Grok 4.5 是首個在不違反業務約束下完成超過一半工作流目標的模型,且每任務成本約為 Fable 5 的四分之一。

3.3 綜合智慧指數與 CursorBench 污染

  • Artificial Analysis Intelligence Index: Grok 4.5 得分 54(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之後;較上一代 Grok 大幅提升 16 分。
  • CursorBench 撤除: Cursor 官方承認 Grok 4.5 訓練資料中意外包含 Cursor 程式碼庫早期快照,在 CursorBench 上造成不公平優勢。相關分數已從發布材料撤除,訓練資料已剔除,CursorBench 本身亦將大幅改版。這是本次發布的明顯瑕疵,但主動揭露污染反而比隱瞞更具可信度。
  • AA-Omniscience 幻覺率: 獨立評測顯示 Grok 4.5 幻覺率達 54%,明顯高於前代,生產環境須建立輸出驗證管線。

3.4 TryAI 真實程式設計對比

獨立測評機構 TryAI 讓 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 以相同提示詞從零建構相同互動應用程式:

TryAI 同場實測結果摘要
測試維度 Grok 4.5 Claude Opus / Fable 5 GPT-5.5
3D 立方體渲染(最難) 第一次失敗,重試成功 一次成功 失敗
首 Token 延遲 <0.5 秒 較慢 短回答最快
串流速度 約 110 tokens/秒(約 2 倍) Fable 5 最慢、最貴 中等
每次測試成本 最低 最高 中等

結論: 高頻重複性程式設計任務,Grok 4.5 的速度與成本優勢壓倒性;需一次搞定複雜狀態管理的高精度任務,Claude 系列仍更可靠。

04

Grok 4.5 已在以下平台上線(歐盟地區預計 7 月中旬開放):

Grok 4.5 可用平台與分發管道
平台 說明 備註
Grok Build SpaceXAI 自家 Coding Agent 平台 Grok 4.5 為預設模型;限時免費
Cursor 所有訂閱方案可用 桌面、Web、iOS、CLI、SDK;首週用量加倍
SpaceXAI Console API 直接 API 呼叫 支援 Chat Completions 與 Responses API
Office 外掛 Word、PowerPoint、Excel 預設模型;可組裝試算表、簡報、文件
第三方閘道 OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic API 區域:us-east-1、us-west-2;限速 150 req/s、50M tokens/min
grok-api.sh
# SpaceXAI Responses API 快速接入
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "幫我找出這段程式碼的 bug 並修復:function median(a){a.sort();return a[a.length/2]}"
  }'

最佳實踐(成本優化):

  • Responses API 設定 prompt_cache_key,或 Chat Completions 使用 x-grok-conv-id Header,確保對話路由至同一伺服器——快取命中後輸入價格降至 $0.50/M tokens
  • 長 Agent 迴圈建議開啟 Context Compaction,減少 Token 累積成本。
  • 高吞吐量任務用標準版($2/$6);需優先排程時再選 Cursor Fast 版($4/$18)。

首次接入建議按以下 6 步實操指南 進行:

  1. 取得 API 金鑰: 登入 SpaceXAI Console(console.x.ai),建立專案並產生 API Key;確認帳戶區域為 us-east-1 或 us-west-2。
  2. 驗證基礎連通: 以上方 curl 範例發送單輪請求,確認 grok-4.5 模型 ID 回應正常。
  3. 在 Cursor 啟用模型: 開啟 Cursor → 模型選擇器 → 選 Grok 4.5;首週加倍額度可用於壓力測試。
  4. 設定快取路由: 為長對話設定 prompt_cache_keyx-grok-conv-id,觀察快取命中率與帳單變化。
  5. 跑自有評測: 選 3–5 個團隊真實 repo 任務(修 bug、重構、測試生成),對比 Grok 4.5 與現用模型(如 Fable 5)的每任務成本與一次成功率
  6. 建立混合路由策略: 將高頻、成本敏感子任務路由至 Grok 4.5;最複雜的架構決策保留 Claude Fable 5——記錄路由規則供團隊共用。

05

Grok 4.5 適合 vs 謹慎場景決策矩陣
場景 建議 理由
高頻 Agent 任務(每日數百至數千次) 適合 Grok 4.5 每任務 $2.49 vs $11.80,成本節省立竿見影
終端機與工具呼叫密集型工作流 適合 Grok 4.5 Terminal Bench 2.1 與 AutomationBench 頂級表現
已深度整合 Cursor 的團隊 適合 Grok 4.5 原生支援、無縫切換;聯合訓練針對 IDE 工作流優化
混合模型策略(路由分層) 適合 Grok 4.5 作為二線 常規子任務交 Grok,架構決策留 Fable 5
SWE-Bench Pro 級高精度程式設計 謹慎,優先 Fable 5 Fable 5 領先約 16 個百分點,多檔案重構差距真實
幻覺率敏感生產系統(金融、安全關鍵) 謹慎,加強驗證 AA-Omniscience 幻覺率 54%,須建立輸出驗證管線
歐盟地區團隊 暫緩至 7 月中旬 目前 API 與產品均 geo-blocked,僅 us-east-1 / us-west-2
CursorBench 相關效能宣稱 暫不採信 訓練資料污染已確認,等待獨立重測

可引用技術數據(EEAT)

  • 每任務成本: Grok 4.5 約 $2.49/任務,Claude Code 約 $11.80/任務(SWE-Bench Pro 實測折算)。
  • Token 效率: SWE-Bench Pro 平均輸出 Token Grok 4.5 為 15,954,Opus 4.8 為 67,020——4.2 倍差距。
  • 推理速度: 官方 80 TPS,TryAI 實測約 110 tokens/秒,首 Token <0.5 秒。
  • 綜合智慧指數: Artificial Analysis 54 分(第四名),較上一代 +16 分。
  • Agent 工作流: AutomationBench-AA 51.4%——首個超過 50% 且不違反業務約束的模型。
  • API 限速: 預設 150 requests/秒50M tokens/分鐘

以下為主要參考來源;發版後請以官方頁面為準:

官方發布與技術文件:

SpaceXAI 官方發布:Introducing Grok 4.5

Cursor 聯合發布聲明:Introducing Grok 4.5

SpaceXAI API 文件:Grok 4.5 Model Reference

第三方報導與獨立評測:

TechCrunch:SpaceXAI Releases Grok 4.5

Awesome Agents 獨立評測:Grok 4.5 Review

APIdog:Grok 4.5 Benchmark 深度解讀

Snorkel AI:Grok 4.5 專業場景測試結果

Artificial Analysis Intelligence Index

Grok 4.5 的真正價值不在 benchmark 第一,而在於:把 Token 效率與 API 定價折算成實際任務成本時,它能在主流 Agent 工作流上以七八折甚至更低價格完成與 Opus 4.8 相近品質的工作。但長時間 Agent 任務對執行環境穩定性要求極高——本機 Mac 休眠中斷、共用雲端桌面爭奪頻寬與算力、虛擬化 Hypervisor 損耗都會拖慢 Cursor CLI 與多倉庫開發吞吐。純 SaaS Agent 也無法取代需要獨佔 Apple Silicon、原生 macOS 工具鏈的情境(Xcode 建置、Claude Code / Codex 持久化開發機、本地模型推論)。相較之下,對需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 7×24 自動化的生產環境,ZUKCLOUD 裸金屬 Mac mini 雲端節點通常是更優解:獨佔實體機、無 Hypervisor 損耗、7×24 在線、按天/週/月彈性下單。延伸閱讀:裸金屬架構宣言 · Mac Mini M4 租用 vs 購買 2026 · OpenRouter 2026 年 6 月模型流量榜

06

問:Grok 4.5 比 Claude Opus 4.8 更好嗎?
答:視「更好」的定義。Opus 4.8 在 SWE-Bench Pro 準確率領先(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率與每任務成本上領先,差距可達 4 倍。Agent 工作流完成率上,Grok 4.5 在 AutomationBench-AA 亦略勝 Opus 4.8。

問:Grok 4.5 可以免費使用嗎?
答:SpaceXAI 在 Grok Build 與 Cursor 提供限時免費額度。之後 API 為 $2/M 輸入、$6/M 輸出;Cursor 訂閱方案已納入模型池,首週使用量加倍。

問:如何在 Cursor 中使用 Grok 4.5?
答:所有 Cursor 方案自動可用。開啟 Cursor,在模型選擇器選 Grok 4.5 即可;無需額外安裝外掛。

問:Grok 4.5 的上下文視窗多大?
答:500,000 Tokens(500K),足以涵蓋多數大型程式碼庫任務。請注意超過 200K 有較高計費層級。

問:為何 CursorBench 從發布材料中撤除?
答:Cursor 程式碼庫快照意外混入 Grok 4.5 訓練資料,造成資料污染與不公平優勢。SpaceXAI 已撤除相關分數,訓練資料已剔除,後續將獨立重測。

問:Grok 4.5 可透過 OpenRouter 使用嗎?
答:可以。亦可透過 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方閘道存取。

問:歐盟使用者何時能用?
答:目前所有 SpaceXAI 產品與 API Console 在歐盟地區 geo-blocked,預計 2026 年 7 月中旬開放。

問:應該全面切換到 Grok 4.5 嗎?
答:不建議。多數企業團隊採混合路由:高頻、成本敏感任務交 Grok 4.5;高精度架構決策與安全關鍵程式碼保留 Claude Fable 5。先在自有 repo 跑評測再決定預設模型。

最後更新:2026-07-11 | 模型能力與定價可能隨時變更,請以官方文件為準。