若您是使用 Cursor 或 Claude Code 的開發者、或負責評估 AI Agent 成本的技術決策者,2026 年 7 月 8 日 SpaceXAI 正式發布的 Grok 4.5 很可能已進入您的採購清單。馬斯克稱其為「Opus 級智慧、速度更快、Token 效率更高、成本更低」——本文不帶濾鏡,完整梳理官方與第三方 benchmark、$2/$6 定價表、真實任務成本($2.49 vs $11.80)、Cursor 聯合訓練背景、API 接入步驟與適合/謹慎場景決策矩陣,協助您判斷是否值得切換。
01 Grok 4.5 是什麼?SpaceXAI 發布背景與痛點拆解
2026 年 7 月 8 日,SpaceXAI 正式推出 Grok 4.5——上市後首款旗艦模型。馬斯克在 X 上稱其為「Opus 級別模型,但速度更快、Token 效率更高、成本更低」。這不是普通版本迭代:模型與 AI 程式設計工具 Cursor 聯合訓練,注入數兆 Token 的真實開發者互動資料(程式碼審查、除錯流程、Agent 與程式碼庫互動紀錄)。SpaceX 於 2026 年 6 月宣布以約 600 億美元全股票交易收購 Cursor 母公司 Anysphere,Grok 4.5 是此合作的首批可見成果。
許多團隊在發布稿後仍卡在以下痛點:
- 標榜 Opus 級、benchmark 卻非第一: SWE-Bench Pro 落後 Claude Fable 5 約 16 個百分點,難以判斷「性價比」是否足以彌補準確率差距。
- 定價低但 Token 消耗不透明: $2/$6 單價看似便宜,若輸出 Token 是競品的 4 倍,實際帳單可能反超。
- CursorBench 資料污染: Cursor 程式碼庫快照意外混入訓練資料,相關分數已撤除,可信度存疑。
- 歐盟地區尚未開放: API 僅 us-east-1 / us-west-2,EU 預計 7 月中旬才可用。
- 幻覺率上升: 獨立評測顯示 AA-Omniscience Index 幻覺率達 54%,生產環境需加強輸出驗證。
- 垂直整合鎖定風險: 同一集團掌控算力(Colossus)、模型(Grok)、工具(Cursor)與分發(Grok Build),長期議價空間可能縮小。
| 參數 | 數值 | 備註 |
|---|---|---|
| 架構 | Mixture of Experts(MoE) | 混合專家,參數量未公開 |
| 上下文視窗 | 500,000 Tokens | 超過 200K 有較高計費層級 |
| 推理模式 | 低 / 中 / 高(預設:高) | reasoning_effort 參數可調 |
| 推理速度 | 官方 80 TPS,實測約 90 TPS | TryAI 測得首 Token <0.5 秒、約 110 tokens/秒 |
| 訓練硬體 | 數萬塊 NVIDIA GB300 GPU | 孟菲斯(Memphis)資料中心 |
| 模型 ID | grok-4.5 |
別名 grok-4.5-latest、grok-build-latest |
| 優化場景 | 程式設計 / Agent / 知識密集型工作 | 法律、醫療、教育、資料分析等專業情境 |
Grok 4.5 不是「最強的程式設計模型」,而是 SpaceXAI 迄今針對高頻 Agent 工作流性價比最激進的產品定位。
02 API 定價與真實任務成本:真的比競品便宜 4 倍嗎?
定價是 Grok 4.5 最核心的賣點。單看每百萬 Token 單價不夠——必須結合 Token 效率 與 每任務實際成本 才能做出採購決策。
| 模型 | 輸入 | 輸出 | 快取輸入 |
|---|---|---|---|
| Grok 4.5(標準) | $2.00 | $6.00 | $0.50 |
| Grok 4.5 Fast(Cursor 優先) | $4.00 | $18.00 | — |
| Claude Opus 4.8(標準) | $5.00 | $25.00 | $0.50 |
| Claude Fable 5 | $10.00 | $50.00 | — |
| GPT-5.6 Sol(旗艦) | $5.00 | $30.00 | — |
| GPT-5.6 Luna(經濟) | $1.00 | $6.00 | — |
| 上下文視窗 | Grok 4.5:500K;Claude Opus/Fable:1M | ||
| 模型 / 平台 | 每任務平均 Token 消耗 | 每任務實際成本 |
|---|---|---|
| Grok 4.5 / Grok Build | 約 1.9M tokens | $2.49 |
| GPT-5.5 / Codex | 約 6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | 約 7.2M tokens | $11.80 |
| Token 效率(SWE-Bench Pro) | Grok 4.5 平均 15,954 輸出 Token/任務 | Opus 4.8 為 67,020——差距 4.2 倍 |
以開發團隊每日 500 次 Agent 任務估算:Grok 4.5 約 $1,245/日,Claude Code 約 $5,900/日。在高頻呼叫場景下,Token 效率優勢會被指數級放大。SpaceXAI 官方亦稱 Grok 4.5 達到約 2 倍 Token 效率,以不到一半的步驟完成同類任務。
03 Benchmark 全解析:編程、Agent 與 CursorBench 污染爭議
SpaceXAI 官方公布 4 項程式設計評測;我們同步整理第三方獨立測試與 Agent 任務 benchmark,並標註資料可信度風險。
3.1 程式設計 Benchmark
| 評測項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(各廠商 harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立 harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro(解決率) | 64.7% | 80.4% | 69.2% | 58.6% |
解讀: DeepSWE 1.0 用各廠商自有 harness 時 Grok 4.5 排第三;換成中立 harness(DeepSWE 1.1)後跌至第四,Fable 5 領先 17 個百分點。Terminal Bench 2.1 四款頂級模型差距在 5.4 個百分點以內,幾乎平局。SWE-Bench Pro 是最嚴苛測試,Grok 4.5 排第三,落後 Fable 5 約 16 個百分點——對高精度多檔案重構任務,差距真實存在。
3.2 Agent 任務 Benchmark(Grok 4.5 高光舞台)
| 評測項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657 個企業工作流) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(專業工作場景) | 29% | — | 21% |
| Snorkel 法律場景 | 40% | — | 27–28% |
| Snorkel 教育場景 | 58% | — | 35–42% |
| Snorkel 醫療場景 | 35% | — | 23–25% |
AutomationBench-AA 涵蓋 Gmail、Slack、Salesforce、HubSpot 等 40 個模擬企業應用程式。Grok 4.5 是首個在不違反業務約束下完成超過一半工作流目標的模型,且每任務成本約為 Fable 5 的四分之一。
3.3 綜合智慧指數與 CursorBench 污染
- Artificial Analysis Intelligence Index: Grok 4.5 得分 54(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之後;較上一代 Grok 大幅提升 16 分。
- CursorBench 撤除: Cursor 官方承認 Grok 4.5 訓練資料中意外包含 Cursor 程式碼庫早期快照,在 CursorBench 上造成不公平優勢。相關分數已從發布材料撤除,訓練資料已剔除,CursorBench 本身亦將大幅改版。這是本次發布的明顯瑕疵,但主動揭露污染反而比隱瞞更具可信度。
- AA-Omniscience 幻覺率: 獨立評測顯示 Grok 4.5 幻覺率達 54%,明顯高於前代,生產環境須建立輸出驗證管線。
3.4 TryAI 真實程式設計對比
獨立測評機構 TryAI 讓 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 以相同提示詞從零建構相同互動應用程式:
| 測試維度 | Grok 4.5 | Claude Opus / Fable 5 | GPT-5.5 |
|---|---|---|---|
| 3D 立方體渲染(最難) | 第一次失敗,重試成功 | 一次成功 | 失敗 |
| 首 Token 延遲 | <0.5 秒 | 較慢 | 短回答最快 |
| 串流速度 | 約 110 tokens/秒(約 2 倍) | Fable 5 最慢、最貴 | 中等 |
| 每次測試成本 | 最低 | 最高 | 中等 |
結論: 高頻重複性程式設計任務,Grok 4.5 的速度與成本優勢壓倒性;需一次搞定複雜狀態管理的高精度任務,Claude 系列仍更可靠。
04 可用平台、API 接入與 6 步實操指南
Grok 4.5 已在以下平台上線(歐盟地區預計 7 月中旬開放):
| 平台 | 說明 | 備註 |
|---|---|---|
| Grok Build | SpaceXAI 自家 Coding Agent 平台 | Grok 4.5 為預設模型;限時免費 |
| Cursor | 所有訂閱方案可用 | 桌面、Web、iOS、CLI、SDK;首週用量加倍 |
| SpaceXAI Console API | 直接 API 呼叫 | 支援 Chat Completions 與 Responses API |
| Office 外掛 | Word、PowerPoint、Excel | 預設模型;可組裝試算表、簡報、文件 |
| 第三方閘道 | OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic | API 區域:us-east-1、us-west-2;限速 150 req/s、50M tokens/min |
# SpaceXAI Responses API 快速接入
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "幫我找出這段程式碼的 bug 並修復:function median(a){a.sort();return a[a.length/2]}"
}'
最佳實踐(成本優化):
- Responses API 設定
prompt_cache_key,或 Chat Completions 使用x-grok-conv-idHeader,確保對話路由至同一伺服器——快取命中後輸入價格降至 $0.50/M tokens。 - 長 Agent 迴圈建議開啟 Context Compaction,減少 Token 累積成本。
- 高吞吐量任務用標準版($2/$6);需優先排程時再選 Cursor Fast 版($4/$18)。
首次接入建議按以下 6 步實操指南 進行:
- 取得 API 金鑰: 登入 SpaceXAI Console(console.x.ai),建立專案並產生 API Key;確認帳戶區域為 us-east-1 或 us-west-2。
- 驗證基礎連通: 以上方 curl 範例發送單輪請求,確認
grok-4.5模型 ID 回應正常。 - 在 Cursor 啟用模型: 開啟 Cursor → 模型選擇器 → 選 Grok 4.5;首週加倍額度可用於壓力測試。
- 設定快取路由: 為長對話設定
prompt_cache_key或x-grok-conv-id,觀察快取命中率與帳單變化。 - 跑自有評測: 選 3–5 個團隊真實 repo 任務(修 bug、重構、測試生成),對比 Grok 4.5 與現用模型(如 Fable 5)的每任務成本與一次成功率。
- 建立混合路由策略: 將高頻、成本敏感子任務路由至 Grok 4.5;最複雜的架構決策保留 Claude Fable 5——記錄路由規則供團隊共用。
05 適合/謹慎場景決策矩陣、可引用數據與參考來源
| 場景 | 建議 | 理由 |
|---|---|---|
| 高頻 Agent 任務(每日數百至數千次) | 適合 Grok 4.5 | 每任務 $2.49 vs $11.80,成本節省立竿見影 |
| 終端機與工具呼叫密集型工作流 | 適合 Grok 4.5 | Terminal Bench 2.1 與 AutomationBench 頂級表現 |
| 已深度整合 Cursor 的團隊 | 適合 Grok 4.5 | 原生支援、無縫切換;聯合訓練針對 IDE 工作流優化 |
| 混合模型策略(路由分層) | 適合 Grok 4.5 作為二線 | 常規子任務交 Grok,架構決策留 Fable 5 |
| SWE-Bench Pro 級高精度程式設計 | 謹慎,優先 Fable 5 | Fable 5 領先約 16 個百分點,多檔案重構差距真實 |
| 幻覺率敏感生產系統(金融、安全關鍵) | 謹慎,加強驗證 | AA-Omniscience 幻覺率 54%,須建立輸出驗證管線 |
| 歐盟地區團隊 | 暫緩至 7 月中旬 | 目前 API 與產品均 geo-blocked,僅 us-east-1 / us-west-2 |
| CursorBench 相關效能宣稱 | 暫不採信 | 訓練資料污染已確認,等待獨立重測 |
可引用技術數據(EEAT)
- 每任務成本: Grok 4.5 約 $2.49/任務,Claude Code 約 $11.80/任務(SWE-Bench Pro 實測折算)。
- Token 效率: SWE-Bench Pro 平均輸出 Token Grok 4.5 為 15,954,Opus 4.8 為 67,020——4.2 倍差距。
- 推理速度: 官方 80 TPS,TryAI 實測約 110 tokens/秒,首 Token <0.5 秒。
- 綜合智慧指數: Artificial Analysis 54 分(第四名),較上一代 +16 分。
- Agent 工作流: AutomationBench-AA 51.4%——首個超過 50% 且不違反業務約束的模型。
- API 限速: 預設 150 requests/秒、50M tokens/分鐘。
以下為主要參考來源;發版後請以官方頁面為準:
官方發布與技術文件:
SpaceXAI 官方發布:Introducing Grok 4.5
Cursor 聯合發布聲明:Introducing Grok 4.5
SpaceXAI API 文件:Grok 4.5 Model Reference
第三方報導與獨立評測:
TechCrunch:SpaceXAI Releases Grok 4.5
Awesome Agents 獨立評測:Grok 4.5 Review
APIdog:Grok 4.5 Benchmark 深度解讀
Artificial Analysis Intelligence Index
Grok 4.5 的真正價值不在 benchmark 第一,而在於:把 Token 效率與 API 定價折算成實際任務成本時,它能在主流 Agent 工作流上以七八折甚至更低價格完成與 Opus 4.8 相近品質的工作。但長時間 Agent 任務對執行環境穩定性要求極高——本機 Mac 休眠中斷、共用雲端桌面爭奪頻寬與算力、虛擬化 Hypervisor 損耗都會拖慢 Cursor CLI 與多倉庫開發吞吐。純 SaaS Agent 也無法取代需要獨佔 Apple Silicon、原生 macOS 工具鏈的情境(Xcode 建置、Claude Code / Codex 持久化開發機、本地模型推論)。相較之下,對需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 7×24 自動化的生產環境,ZUKCLOUD 裸金屬 Mac mini 雲端節點通常是更優解:獨佔實體機、無 Hypervisor 損耗、7×24 在線、按天/週/月彈性下單。延伸閱讀:裸金屬架構宣言 · Mac Mini M4 租用 vs 購買 2026 · OpenRouter 2026 年 6 月模型流量榜。
06 常見問題 FAQ
問:Grok 4.5 比 Claude Opus 4.8 更好嗎?
答:視「更好」的定義。Opus 4.8 在 SWE-Bench Pro 準確率領先(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率與每任務成本上領先,差距可達 4 倍。Agent 工作流完成率上,Grok 4.5 在 AutomationBench-AA 亦略勝 Opus 4.8。
問:Grok 4.5 可以免費使用嗎?
答:SpaceXAI 在 Grok Build 與 Cursor 提供限時免費額度。之後 API 為 $2/M 輸入、$6/M 輸出;Cursor 訂閱方案已納入模型池,首週使用量加倍。
問:如何在 Cursor 中使用 Grok 4.5?
答:所有 Cursor 方案自動可用。開啟 Cursor,在模型選擇器選 Grok 4.5 即可;無需額外安裝外掛。
問:Grok 4.5 的上下文視窗多大?
答:500,000 Tokens(500K),足以涵蓋多數大型程式碼庫任務。請注意超過 200K 有較高計費層級。
問:為何 CursorBench 從發布材料中撤除?
答:Cursor 程式碼庫快照意外混入 Grok 4.5 訓練資料,造成資料污染與不公平優勢。SpaceXAI 已撤除相關分數,訓練資料已剔除,後續將獨立重測。
問:Grok 4.5 可透過 OpenRouter 使用嗎?
答:可以。亦可透過 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方閘道存取。
問:歐盟使用者何時能用?
答:目前所有 SpaceXAI 產品與 API Console 在歐盟地區 geo-blocked,預計 2026 年 7 月中旬開放。
問:應該全面切換到 Grok 4.5 嗎?
答:不建議。多數企業團隊採混合路由:高頻、成本敏感任務交 Grok 4.5;高精度架構決策與安全關鍵程式碼保留 Claude Fable 5。先在自有 repo 跑評測再決定預設模型。
最後更新:2026-07-11 | 模型能力與定價可能隨時變更,請以官方文件為準。