2026 年 7 月 8 日,马斯克旗下 SpaceXAI 正式发布上市后首款旗舰模型 Grok 4.5。马斯克在 X 上喊话:「这是一款 Opus 级别的模型,但速度更快、Token 效率更高、成本更低。」若你正用 Cursor 或 Claude Code 跑 Agent 工作流、且 7 月账单又创新高,本文将帮你判断:这话有几分可信?我们梳理了全部公开 benchmark、独立测评与定价细节,给出 API 单价表、编程/Agent 评测解读、6 步接入指南与生产环境决策矩阵——不带滤镜,只看数字。
01 Grok 4.5 是什么?Cursor 联合训练与核心规格
Grok 4.5 是 SpaceXAI 迄今为止最强的模型,专为以下场景深度优化:
- 编程与代码 Agent:修 bug、大型代码库重构、端到端应用开发
- 自主工作流(Agentic Tasks):跨工具、跨应用的多步骤自动化任务
- 知识密集型工作:法律、医疗、教育、数据分析等专业场景
与以往不同,这款模型不是单打独斗研发出来的——它与 AI 编程工具 Cursor 联合训练,注入了数万亿 Token 的真实开发者交互数据(代码审查、调试流程、Agent 与代码库的互动记录)。SpaceX 在 2026 年 6 月已完成对 Cursor 母公司 Anysphere 的收购,此次联合训练是收购后的首批成果之一。
团队在评估 Grok 4.5 时普遍卡在以下痛点:
- 宣传话术 vs 实测准确率:「Opus 级」在 Artificial Analysis 综合指数上方向正确,但 SWE-Bench Pro 仍落后 Claude Fable 5 约 16 个百分点。
- 标价便宜 vs 任务总成本:输入 $2/M 看似诱人,真正拉开差距的是 SWE-Bench Pro 上 4.2 倍 的输出 Token 效率优势。
- Benchmark 可信度缺口:CursorBench 因训练数据污染被临时撤除,是本次发布的明显瑕疵。
- 平台绑定焦虑:深度 Cursor 集成对 Cursor 用户是利好,对标准化 Claude Code 专用 Mac 开发机 的团队则是迁移成本。
- 区域可用性:API 目前仅在
us-east-1、us-west-2开放,欧盟预计 7 月中旬上线。 - 幻觉率回归:独立评测显示 AA-Omniscience Index 幻觉率达 54%,生产环境须加强输出验证。
| 参数 | 数值 |
|---|---|
| 架构 | Mixture of Experts(MoE,混合专家);参数量未公开 |
| 上下文窗口 | 500,000 Tokens(50 万) |
| 推理模式 | 低 / 中 / 高(默认:高) |
| 推理速度 | 官方 80 TPS,实测约 90 TPS |
| 训练硬件 | 数万块 NVIDIA GB300 GPU(孟菲斯数据中心) |
| 核心优化方向 | 编程 Agent、自主工作流、知识密集型专业场景 |
Grok 4.5 不是 2026 年中期「最强的编程模型」,但可能是高频 Agent 流水线上性价比最高的 Opus 级选择——前提是你做好输出校验,并把最难的架构决策留给更强的模型。
02 Grok 4.5 定价多少?真的比 Claude Opus 便宜 4 倍吗?
定价是 Grok 4.5 最核心的卖点。标价只是一半故事,另一半是真实 Agent 任务的 Token 消耗。只有把单价和效率乘在一起,才能看清「四分之一价格」是不是算术而非营销。
| 模型 | 输入 | 输出 |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5(缓存命中) | $0.50 | — |
| Grok 4.5 Fast 版 | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | 更高 | 更高 |
| GPT-5.6 Sol(旗舰) | $5.00 | $30.00 |
| GPT-5.6 Luna(经济档) | $1.00 | $6.00 |
| 模型 / 平台 | 每任务平均 Token 消耗 | 每任务实际成本 |
|---|---|---|
| Grok 4.5 / Grok Build | ~1.9M tokens | $2.49 |
| GPT-5.5 / Codex | ~6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | ~7.2M tokens | $11.80 |
在 SWE-Bench Pro 编程任务上,Grok 4.5 平均每次只消耗 15,954 个输出 Token,而 Claude Opus 4.8 同任务消耗 67,020 个——差距 4.2 倍。按每天 500 次任务估算,成本约为 $1,245/天 vs $5,900/天。若你同时在跟踪 2026 年 6 月 Claude Sonnet 5 与 GPT-5.6 泄露信号,Grok 4.5 会立刻改变成本曲线,而不必等下一波发版。
03 Benchmark 全解析:编程、Agent 与综合智能指数
SpaceXAI 官方公布了 4 项编程评测。我们汇总了官方数据与第三方独立测试,并补充 Agent 任务与专业场景评测。
3.1 编程 Benchmark
| 评测项目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(官方 harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立 harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro(解决率) | 64.7% | 80.4% | 69.2% | 58.6% |
解读: DeepSWE 1.0(各厂商自己的 harness)Grok 4.5 排第三,差距不大;DeepSWE 1.1(中立 harness)差距被放大,Grok 4.5 跌到第四,Fable 5 领先 17 个百分点;Terminal Bench 2.1 四款模型差距在 5.4 个百分点以内,几乎是平局;SWE-Bench Pro 是最严苛测试,Grok 4.5 排第三,落后 Fable 5 约 16 个点。
⚠️ CursorBench 重要说明: Cursor 自有评测集在发布时被临时撤除,原因是发现 Cursor 自身代码库的部分快照意外混入了 Grok 4.5 的训练数据,存在数据污染风险。在独立重测落地前,请将所有 Cursor 专属性能宣称视为暂定。
3.2 Agent 任务 Benchmark(Grok 4.5 的高光舞台)
| 评测项目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657 个企业工作流) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(专业工作场景) | 29% | — | 21% |
AutomationBench-AA 涵盖 Gmail、Slack、Salesforce、HubSpot 等 40 个模拟企业应用,Grok 4.5 是首个在不违反业务约束的前提下完成超过一半工作流目标的模型。Snorkel 专业场景评测中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、医疗(35% vs 23–25%)等领域大幅领先。
Artificial Analysis 综合智能指数:54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之后,但比上一代 Grok 大幅提升 16 分。
3.3 真实编程对比:TryAI 同台 PK
独立测评机构 TryAI 让 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示词从零构建相同的交互应用:
- 3D 立方体渲染(最难): Opus 4.8 和 Fable 5 一次成功;Grok 4.5 第一次只渲染了标题和按钮、无立方体,第二次重试成功;GPT-5.5 失败。
- 速度: Grok 4.5 第一个 Token 出现时间 <0.5 秒,流速约 110 tokens/秒(约是竞品的 2 倍)。
- 成本: 每次测试运行中 Grok 4.5 均为最便宜选项,即使有时产出更多原始 Token。
结论: 对于高频重复性编程任务(大量循环调用),Grok 4.5 的速度和成本优势是碾压性的;但在需要一次搞定复杂状态管理的高精度任务上,Claude 系列仍然更可靠。
04 Grok 4.5 怎么用?6 步接入实操指南
Grok 4.5 已在以下平台上线(欧盟地区预计 7 月中旬开放):Grok Build(默认模型)、Cursor(所有订阅计划,首周使用量加倍)、SpaceXAI Console API、Office 插件(Word/PowerPoint/Excel 默认模型),以及 OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic 等第三方网关。
- 选择入口: Cursor 用户直接在 IDE 模型选择器中选 Grok 4.5;API 优先团队走 SpaceXAI Console 或 OpenRouter;Agent 构建者评估 Grok Build 原生 Coding Agent 平台。
- 确认区域与限流: API 区域为
us-east-1、us-west-2,限流 150 请求/秒、5000 万 Tokens/分钟。欧盟团队须准备备用模型至 7 月中旬。 - 配置凭证: 在 SpaceXAI Console 生成
XAI_API_KEY,或确认 Cursor 订阅已包含 Grok 4.5(全档位可用,发布后首周额度加倍)。 - 运行 API 冒烟测试: 用 Responses API 验证连通性,再接入生产流量。
- 开启缓存路由: Responses API 设置
prompt_cache_key,或 Chat Completions 使用x-grok-conv-idHeader,命中缓存后输入价格从 $2.00/M 降至 $0.50/M。 - 长 Agent 循环开启 Context Compaction: 多步骤 Agent 会快速累积 Token;Compaction + 缓存键组合,才能把单次任务成本稳定在 $2.49 附近,而非漂向 GPT-5.5 或 Fable 5 区间。
# SpaceXAI Responses API — Grok 4.5 冒烟测试
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "帮我找出这段代码的 bug 并修复:function median(a){a.sort();return a[a.length/2]}"
}'
最佳实践提醒: 强烈建议设置稳定的对话标识以命中缓存;简单代码生成用低/中推理模式,多文件重构保留高推理(默认);金融、安全关键代码无论 benchmark 分数多高,都必须人工复核。
05 Grok 4.5 值得切换吗?适合与谨慎场景决策矩阵
| 场景 | 原因 |
|---|---|
| 高频 Agent 任务 | 每天数百到数千次编程任务,4.2 倍 Token 效率带来立竿见影的成本节省 |
| 终端类任务和工具调用 | Terminal Bench 2.1 和 AutomationBench 均有顶级表现 |
| 已深度集成 Cursor 的团队 | 桌面端、Web、iOS、CLI、SDK 原生支持,无缝切换 |
| 初创公司和预算敏感团队 | 相近智能水平下,每任务成本不到竞品的四分之一 |
| 混合模型策略 | 常规子任务路由给 Grok 4.5,最复杂架构决策留给 Claude Fable 5 |
| 场景 | 风险 | 缓解措施 |
|---|---|---|
| SWE-Bench Pro 类高精度代码任务 | Claude Fable 5 领先约 16 个百分点,差距真实 | 复杂多文件重构保留 Fable 5 / Opus 4.8;Grok 4.5 负责高频子任务 |
| 幻觉率敏感场景 | AA-Omniscience Index 幻觉率 54%,明显高于前代 | 自动化输出验证、测试门禁、上线前人工复核 |
| 欧盟用户(截至 7 月 11 日) | API 仅在美区可用,EU 尚未开放 | 推迟生产切换,或通过合规网关做区域审查 |
| CursorBench 可信度 | 训练数据污染使 Cursor 专属 benchmark 失效 | 等待独立重测后再采信 IDE 专属性能数据 |
06 可引用技术数据、参考来源与生产基础设施
- 单次任务经济学: Grok 4.5 约 1.9M Tokens / $2.49 vs GPT-5.5 约 6.2M / $5.07 vs Claude Fable 5 约 7.2M / $11.80。
- Token 效率: SWE-Bench Pro 输出 Token — Grok 4.5:15,954;Claude Opus 4.8:67,020(4.2 倍差距)。
- Agent 里程碑: AutomationBench-AA 51.4% — 首个在 657 个企业工作流任务上突破 50% 的前沿模型。
- 综合智能指数: Artificial Analysis 54 分(第四名),较上一代 Grok +16 分。
- 推理吞吐: 官方 80 TPS,实测约 90 TPS;TryAI 首 Token <500ms,流式约 110 tokens/秒。
以下为主要参考来源;模型能力与定价可能随时更新,发版后请以官方文档为准:
TechCrunch:SpaceXAI 发布 Grok 4.5 报道
Grok 4.5 不是「最强的编程模型」,但它是性价比最高的 Opus 级编程 Agent。真正价值在于:把 Token 效率和 API 定价折算成实际任务成本时,能在主流 Agent 工作流上以七八折甚至更低的价格完成与 Opus 4.8 相近质量的工作。但 Agent 规模化仍需要稳定宿主机:笔记本休眠即中断、共享 VM 有 Hypervisor 损耗、云端虚拟 Mac 对 Xcode/Metal 原生工具链兼容性差。对于需要零损耗 Apple Silicon、7×24 在线、Cursor / Grok Build 持久化开发环境的团队,ZUKCLOUD 裸金属 Mac mini 云端节点是更可控的生产级选择——独占物理机、无虚拟化损耗、按天/周/月弹性下单。查看定价与下单,或阅读裸金属架构宣言了解 Agent 级托管的工程逻辑。
07 常见问题 FAQ
Q:Grok 4.5 比 Claude Opus 4.8 更好吗?
A:取决于评价维度。Claude Opus 4.8 在原始编程准确率上胜出(SWE-Bench Pro:69.2% vs 64.7%)。Grok 4.5 在速度、Token 效率和单次任务成本上领先,差距可达 4 倍。在 Agent 工作流完成率上,Grok 4.5 在独立 benchmark 中略胜 Opus 4.8。
Q:Grok 4.5 可以免费使用吗?
A:SpaceXAI 在 Grok Build 和 Cursor 中提供限时免费额度。之后 API 定价为输入 $2/M、输出 $6/M tokens。Cursor 订阅计划已将其纳入模型池。
Q:如何在 Cursor 中使用 Grok 4.5?
A:Grok 4.5 已自动上线所有 Cursor 订阅计划。打开 Cursor,进入模型选择器,选择 Grok 4.5 即可。发布后首周使用量加倍。
Q:Grok 4.5 上下文窗口多大?
A:500,000 tokens(50 万),足以覆盖绝大多数大型代码库任务。
Q:为什么发布时撤除了 CursorBench?
A:Cursor 自身代码库的部分快照意外混入了 Grok 4.5 训练数据,造成 benchmark 污染。SpaceXAI 已撤回相关结果,等待独立重测。
Q:Grok 4.5 可以通过 OpenRouter 使用吗?
A:可以。Grok 4.5 已上线 OpenRouter、Vercel AI Gateway、Cloudflare、Snowflake 和 Databricks Mosaic 等第三方网关。