首页 / 博客 / Grok 4.5
ENGINEERING BLOG · 2026.07.11

Grok 4.5 深度评测:
SpaceXAI「Opus 级智能 + 四分之一价格」是噱头还是实力?

2026 年 7 月 8 日,马斯克旗下 SpaceXAI 正式发布上市后首款旗舰模型 Grok 4.5。马斯克在 X 上喊话:「这是一款 Opus 级别的模型,但速度更快、Token 效率更高、成本更低。」若你正用 Cursor 或 Claude Code 跑 Agent 工作流、且 7 月账单又创新高,本文将帮你判断:这话有几分可信?我们梳理了全部公开 benchmark、独立测评与定价细节,给出 API 单价表、编程/Agent 评测解读、6 步接入指南与生产环境决策矩阵——不带滤镜,只看数字。

01

Grok 4.5 是 SpaceXAI 迄今为止最强的模型,专为以下场景深度优化:

  • 编程与代码 Agent:修 bug、大型代码库重构、端到端应用开发
  • 自主工作流(Agentic Tasks):跨工具、跨应用的多步骤自动化任务
  • 知识密集型工作:法律、医疗、教育、数据分析等专业场景

与以往不同,这款模型不是单打独斗研发出来的——它与 AI 编程工具 Cursor 联合训练,注入了数万亿 Token 的真实开发者交互数据(代码审查、调试流程、Agent 与代码库的互动记录)。SpaceX 在 2026 年 6 月已完成对 Cursor 母公司 Anysphere 的收购,此次联合训练是收购后的首批成果之一。

团队在评估 Grok 4.5 时普遍卡在以下痛点:

  • 宣传话术 vs 实测准确率:「Opus 级」在 Artificial Analysis 综合指数上方向正确,但 SWE-Bench Pro 仍落后 Claude Fable 5 约 16 个百分点。
  • 标价便宜 vs 任务总成本:输入 $2/M 看似诱人,真正拉开差距的是 SWE-Bench Pro 上 4.2 倍 的输出 Token 效率优势。
  • Benchmark 可信度缺口:CursorBench 因训练数据污染被临时撤除,是本次发布的明显瑕疵。
  • 平台绑定焦虑:深度 Cursor 集成对 Cursor 用户是利好,对标准化 Claude Code 专用 Mac 开发机 的团队则是迁移成本。
  • 区域可用性:API 目前仅在 us-east-1us-west-2 开放,欧盟预计 7 月中旬上线。
  • 幻觉率回归:独立评测显示 AA-Omniscience Index 幻觉率达 54%,生产环境须加强输出验证。
Grok 4.5 核心规格一览
参数 数值
架构 Mixture of Experts(MoE,混合专家);参数量未公开
上下文窗口 500,000 Tokens(50 万)
推理模式 低 / 中 / 高(默认:高)
推理速度 官方 80 TPS,实测约 90 TPS
训练硬件 数万块 NVIDIA GB300 GPU(孟菲斯数据中心)
核心优化方向 编程 Agent、自主工作流、知识密集型专业场景

Grok 4.5 不是 2026 年中期「最强的编程模型」,但可能是高频 Agent 流水线上性价比最高的 Opus 级选择——前提是你做好输出校验,并把最难的架构决策留给更强的模型。

02

定价是 Grok 4.5 最核心的卖点。标价只是一半故事,另一半是真实 Agent 任务的 Token 消耗。只有把单价和效率乘在一起,才能看清「四分之一价格」是不是算术而非营销。

API 单价对比(每 100 万 Tokens)
模型 输入 输出
Grok 4.5 $2.00 $6.00
Grok 4.5(缓存命中) $0.50
Grok 4.5 Fast 版 $4.00 $18.00
Claude Opus 4.7 $5.00 $25.00
Claude Fable 5 更高 更高
GPT-5.6 Sol(旗舰) $5.00 $30.00
GPT-5.6 Luna(经济档) $1.00 $6.00
真实编程 Agent 任务每次成本对比
模型 / 平台 每任务平均 Token 消耗 每任务实际成本
Grok 4.5 / Grok Build ~1.9M tokens $2.49
GPT-5.5 / Codex ~6.2M tokens $5.07
Claude Fable 5 / Claude Code ~7.2M tokens $11.80

在 SWE-Bench Pro 编程任务上,Grok 4.5 平均每次只消耗 15,954 个输出 Token,而 Claude Opus 4.8 同任务消耗 67,020 个——差距 4.2 倍。按每天 500 次任务估算,成本约为 $1,245/天 vs $5,900/天。若你同时在跟踪 2026 年 6 月 Claude Sonnet 5 与 GPT-5.6 泄露信号,Grok 4.5 会立刻改变成本曲线,而不必等下一波发版。

03

SpaceXAI 官方公布了 4 项编程评测。我们汇总了官方数据与第三方独立测试,并补充 Agent 任务与专业场景评测。

3.1 编程 Benchmark

编程 Benchmark 四款顶级模型对比
评测项目 Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0(官方 harness) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1(中立 harness) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro(解决率) 64.7% 80.4% 69.2% 58.6%

解读: DeepSWE 1.0(各厂商自己的 harness)Grok 4.5 排第三,差距不大;DeepSWE 1.1(中立 harness)差距被放大,Grok 4.5 跌到第四,Fable 5 领先 17 个百分点;Terminal Bench 2.1 四款模型差距在 5.4 个百分点以内,几乎是平局;SWE-Bench Pro 是最严苛测试,Grok 4.5 排第三,落后 Fable 5 约 16 个点。

⚠️ CursorBench 重要说明: Cursor 自有评测集在发布时被临时撤除,原因是发现 Cursor 自身代码库的部分快照意外混入了 Grok 4.5 的训练数据,存在数据污染风险。在独立重测落地前,请将所有 Cursor 专属性能宣称视为暂定。

3.2 Agent 任务 Benchmark(Grok 4.5 的高光舞台)

Agent 与企业工作流 Benchmark
评测项目 Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA(657 个企业工作流) 51.4% 48.6% 48.5%
Snorkel GDPVal+(专业工作场景) 29% 21%

AutomationBench-AA 涵盖 Gmail、Slack、Salesforce、HubSpot 等 40 个模拟企业应用,Grok 4.5 是首个在不违反业务约束的前提下完成超过一半工作流目标的模型。Snorkel 专业场景评测中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、医疗(35% vs 23–25%)等领域大幅领先。

Artificial Analysis 综合智能指数:54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之后,但比上一代 Grok 大幅提升 16 分

3.3 真实编程对比:TryAI 同台 PK

独立测评机构 TryAI 让 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示词从零构建相同的交互应用:

  • 3D 立方体渲染(最难): Opus 4.8 和 Fable 5 一次成功;Grok 4.5 第一次只渲染了标题和按钮、无立方体,第二次重试成功;GPT-5.5 失败。
  • 速度: Grok 4.5 第一个 Token 出现时间 <0.5 秒,流速约 110 tokens/秒(约是竞品的 2 倍)。
  • 成本: 每次测试运行中 Grok 4.5 均为最便宜选项,即使有时产出更多原始 Token。

结论: 对于高频重复性编程任务(大量循环调用),Grok 4.5 的速度和成本优势是碾压性的;但在需要一次搞定复杂状态管理的高精度任务上,Claude 系列仍然更可靠。

04

Grok 4.5 已在以下平台上线(欧盟地区预计 7 月中旬开放):Grok Build(默认模型)、Cursor(所有订阅计划,首周使用量加倍)、SpaceXAI Console API、Office 插件(Word/PowerPoint/Excel 默认模型),以及 OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic 等第三方网关。

  1. 选择入口: Cursor 用户直接在 IDE 模型选择器中选 Grok 4.5;API 优先团队走 SpaceXAI Console 或 OpenRouter;Agent 构建者评估 Grok Build 原生 Coding Agent 平台。
  2. 确认区域与限流: API 区域为 us-east-1us-west-2,限流 150 请求/秒5000 万 Tokens/分钟。欧盟团队须准备备用模型至 7 月中旬。
  3. 配置凭证: 在 SpaceXAI Console 生成 XAI_API_KEY,或确认 Cursor 订阅已包含 Grok 4.5(全档位可用,发布后首周额度加倍)。
  4. 运行 API 冒烟测试: 用 Responses API 验证连通性,再接入生产流量。
  5. 开启缓存路由: Responses API 设置 prompt_cache_key,或 Chat Completions 使用 x-grok-conv-id Header,命中缓存后输入价格从 $2.00/M 降至 $0.50/M
  6. 长 Agent 循环开启 Context Compaction: 多步骤 Agent 会快速累积 Token;Compaction + 缓存键组合,才能把单次任务成本稳定在 $2.49 附近,而非漂向 GPT-5.5 或 Fable 5 区间。
grok-4.5-api.sh
# SpaceXAI Responses API — Grok 4.5 冒烟测试
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "帮我找出这段代码的 bug 并修复:function median(a){a.sort();return a[a.length/2]}"
  }'

最佳实践提醒: 强烈建议设置稳定的对话标识以命中缓存;简单代码生成用低/中推理模式,多文件重构保留高推理(默认);金融、安全关键代码无论 benchmark 分数多高,都必须人工复核。

05

✅ 适合 Grok 4.5 的 5 类场景
场景 原因
高频 Agent 任务 每天数百到数千次编程任务,4.2 倍 Token 效率带来立竿见影的成本节省
终端类任务和工具调用 Terminal Bench 2.1 和 AutomationBench 均有顶级表现
已深度集成 Cursor 的团队 桌面端、Web、iOS、CLI、SDK 原生支持,无缝切换
初创公司和预算敏感团队 相近智能水平下,每任务成本不到竞品的四分之一
混合模型策略 常规子任务路由给 Grok 4.5,最复杂架构决策留给 Claude Fable 5
⚠️ 需要谨慎的 4 类场景
场景 风险 缓解措施
SWE-Bench Pro 类高精度代码任务 Claude Fable 5 领先约 16 个百分点,差距真实 复杂多文件重构保留 Fable 5 / Opus 4.8;Grok 4.5 负责高频子任务
幻觉率敏感场景 AA-Omniscience Index 幻觉率 54%,明显高于前代 自动化输出验证、测试门禁、上线前人工复核
欧盟用户(截至 7 月 11 日) API 仅在美区可用,EU 尚未开放 推迟生产切换,或通过合规网关做区域审查
CursorBench 可信度 训练数据污染使 Cursor 专属 benchmark 失效 等待独立重测后再采信 IDE 专属性能数据

06

  • 单次任务经济学: Grok 4.5 约 1.9M Tokens / $2.49 vs GPT-5.5 约 6.2M / $5.07 vs Claude Fable 5 约 7.2M / $11.80。
  • Token 效率: SWE-Bench Pro 输出 Token — Grok 4.5:15,954;Claude Opus 4.8:67,020(4.2 倍差距)。
  • Agent 里程碑: AutomationBench-AA 51.4% — 首个在 657 个企业工作流任务上突破 50% 的前沿模型。
  • 综合智能指数: Artificial Analysis 54 分(第四名),较上一代 Grok +16 分。
  • 推理吞吐: 官方 80 TPS,实测约 90 TPS;TryAI 首 Token <500ms,流式约 110 tokens/秒。

以下为主要参考来源;模型能力与定价可能随时更新,发版后请以官方文档为准:

SpaceXAI 官方发布博客:Grok 4.5

Cursor 联合发布声明:Grok 4.5

SpaceXAI 官方文档:Grok 4.5 API

TechCrunch:SpaceXAI 发布 Grok 4.5 报道

Awesome Agents 独立评测:Grok 4.5

APIdog Benchmark 解读:Grok 4.5

Snorkel AI 专业场景测试:Grok 4.5

Grok 4.5 不是「最强的编程模型」,但它是性价比最高的 Opus 级编程 Agent。真正价值在于:把 Token 效率和 API 定价折算成实际任务成本时,能在主流 Agent 工作流上以七八折甚至更低的价格完成与 Opus 4.8 相近质量的工作。但 Agent 规模化仍需要稳定宿主机:笔记本休眠即中断、共享 VM 有 Hypervisor 损耗、云端虚拟 Mac 对 Xcode/Metal 原生工具链兼容性差。对于需要零损耗 Apple Silicon、7×24 在线、Cursor / Grok Build 持久化开发环境的团队,ZUKCLOUD 裸金属 Mac mini 云端节点是更可控的生产级选择——独占物理机、无虚拟化损耗、按天/周/月弹性下单。查看定价下单,或阅读裸金属架构宣言了解 Agent 级托管的工程逻辑。

07

Q:Grok 4.5 比 Claude Opus 4.8 更好吗?
A:取决于评价维度。Claude Opus 4.8 在原始编程准确率上胜出(SWE-Bench Pro:69.2% vs 64.7%)。Grok 4.5 在速度、Token 效率和单次任务成本上领先,差距可达 4 倍。在 Agent 工作流完成率上,Grok 4.5 在独立 benchmark 中略胜 Opus 4.8。

Q:Grok 4.5 可以免费使用吗?
A:SpaceXAI 在 Grok Build 和 Cursor 中提供限时免费额度。之后 API 定价为输入 $2/M、输出 $6/M tokens。Cursor 订阅计划已将其纳入模型池。

Q:如何在 Cursor 中使用 Grok 4.5?
A:Grok 4.5 已自动上线所有 Cursor 订阅计划。打开 Cursor,进入模型选择器,选择 Grok 4.5 即可。发布后首周使用量加倍。

Q:Grok 4.5 上下文窗口多大?
A:500,000 tokens(50 万),足以覆盖绝大多数大型代码库任务。

Q:为什么发布时撤除了 CursorBench?
A:Cursor 自身代码库的部分快照意外混入了 Grok 4.5 训练数据,造成 benchmark 污染。SpaceXAI 已撤回相关结果,等待独立重测。

Q:Grok 4.5 可以通过 OpenRouter 使用吗?
A:可以。Grok 4.5 已上线 OpenRouter、Vercel AI Gateway、Cloudflare、Snowflake 和 Databricks Mosaic 等第三方网关。