Luxsynthesis Blog
返回全部
模型

Grok 4.5 发布:SpaceXAI 首个编程 + Agent 专训模型,对标 Opus 级但更快更省

SpaceXAI 发布 Grok 4.5:首个编程 + Agent 专训模型,约 1.5T 参数、80 TPS。SWE Marathon 29% 领先 Opus 4.8;API $2/$6,token 效率显著更高。含 Cursor 联训、数据污染说明与社区实测。

作者
Luxsynthesis
发布日期
阅读时长
8 分钟阅读
Grok 4.5 发布:SpaceXAI 首个编程 + Agent 专训模型,对标 Opus 级但更快更省

Grok 4.5 发布:SpaceXAI 首个编程 + Agent 专训模型,对标 Opus 级但更快更省

原文链接:https://x.ai/news/grok-4-5 参考来源:Cursor 官方博客(https://cursor.com/blog/grok-4-5)、Artificial Analysis、Snorkel AI 及 X 平台公开讨论 信息整理时间:2026-07-09


SpaceXAI(原 xAI 品牌)于 2026 年 7 月 8 日正式发布 Grok 4.5,官方将其定位为"首个专门为编程和 Agent 任务训练的模型",与 Cursor 联合训练完成。

官方表述中,Grok 4.5 是迄今最强的 Grok 模型,在编程、Agent 任务和知识工作上表现突出;同时强调其相比同级模型速度更快、token 消耗更低、价格更便宜。发布前一天,Elon Musk 将其定位为"Opus 级,但更快、更省 token、更低成本"。

Grok 4.5 定位:Opus 级智能,但更快更省


一、模型基础

项目信息
基础模型V9 foundation model
参数规模1.5T(约为前代 Grok 4.3 的 3 倍)
训练算力数万张 NVIDIA GB300 GPU
上下文长度500K(发布时),低于 Grok 4.3 的 1M;Elon 表示约一周内可能升级到 1M
训练数据涵盖编码、科学、工程、数学;与 Cursor 联合训练,纳入数万亿 token 的 Cursor 使用数据
训练方式大规模 RL,覆盖数十万个任务,聚焦多步骤软件工程与技术工作,采用自动化与模型评分;支持高度异步训练,Agent rollout 可运行数小时
推理速度80 TPS(fast-model 速度档)

官方博客中,Grok 4.5 被描述为"在真实工程任务上表现出色,且超越同类领先模型",覆盖大型代码库、跨多个仓库的长任务、数百种技能与多种工具的调用场景。

Cursor 方面的博客补充说明了训练细节:Grok 4.5 是一个混合专家(MoE)模型,训练数据在覆盖 STEM 任务、科研论文等知识工作内容上比此前专精编程的 Composer 2.5 更广泛;强化学习环境由一套分布式 Agent 系统大规模构建,官方表示部分环境如果人工构建可能需要数百名工程师耗费数月时间。

1.5T 参数 MoE + 大规模 RL + Cursor 联合训练


二、Benchmark 表现

官方博客给出了五项基准的对比图表,涵盖 DeepSWE 1.0、DeepSWE 1.1、SWE Marathon、Terminal Bench 2.1、SWE Bench Pro。

Grok 4.5 SWE-Bench Pro 成绩对比

基准Grok 4.5Fable 5 (max)GPT-5.5 (xhigh)Opus 4.8 (max)Opus 4.7 (max)GLM-5.2
DeepSWE 1.0(pass@1,AA 评测)62.0%66.1%64.31%55.75%40.12%
DeepSWE 1.1(mini-swe-agent harness)53%70%67%59%44%
SWE Marathon(pass@1)29.0%24.0%26.0%16.0%
Terminal Bench 2.183.3%84.3%83.4%78.9%78.9%
SWE Bench Pro64.7%80.4%58.6%69.2%64.3%62.1%

官方注明:"竞品数据来自各家开发者公开的 system card 或基准排行榜。"

从上表可以看出,Grok 4.5 在 SWE Marathon(超长程软件工程任务,包含编译器构建、算子优化等)上是唯一超过 Opus 4.8 的模型;在 Terminal Bench 2.1 和 SWE Bench Pro 上则与 GPT-5.5、Opus 4.8 处于同一区间,落后于 Fable 5。

Grok 4.5 在 SWE Marathon 基准上的成绩

第三方评测:Artificial Analysis

Artificial Analysis(@ArtificialAnlys)在发布当天发布了独立评测:

  • Intelligence Index:54 分,排名第 4(仅次于 Fable 5、GPT-5.5、Claude Opus 4.8),相比 Grok 4.3 提升 16 分
  • Coding Agent Index(基于 Grok Build):约 76 分,与 GPT-5.5(Codex)大致持平,低于 Fable 5(Claude Code)
  • GDPval-AA v2:Elo 1543,排名第 4(Opus 4.8 为 1600)
  • τ³-Banking:33%,高于 GPT-5.5 xhigh 的 31%
  • 成本:Intelligence Index 任务约 $0.31/task;Coding Agent 任务约 $2.49–2.59/task(Fable 5 约 $11.80/task,GPT-5.5 约 $5.07/task)
  • Token 用量:Coding Agent 任务平均约 1.9M tokens,低于 Fable 5(约 7.2M)与 GPT-5.5(约 6.2M)
  • AA-Omniscience(知识与幻觉评测):Omniscience Index 从 18 升至 26;准确率从 35% 升至 52%;同时幻觉率从 25% 升至 54%

第三方评测:Snorkel AI

Snorkel AI(@SnorkelAI)在 GDPval+(基于真实职业交付物、专家评分标准)上给出的结果:

模型GDPval+
Grok 4.529%
GPT-5.522%
Claude Opus 4.821%

Elon Musk 转发并评价:"Grok 4.5 true usefulness is excellent"。


三、CursorBench 数据污染与 SWE-Bench Pro 争议

Cursor 官方博客中主动披露了一项数据问题:

"Grok 4.5 在 CursorBench 上占优,是因为 Cursor codebase 的一个较早快照被意外纳入了训练数据。具体影响尚不明确。这些数据今后不会再用于后续模型;与此同时,我们也在并行推进对 CursorBench 的一次更大更新,因此此处将其排除。"

Cursor 博客公布的多模型对比表格如下(数据来自第三方自行报告的分数,SWE-Bench multilingual 中 GPT-5.5 的成绩来自 Cursor 内部运行):

Cursor 官方博客多模型对比表

基准Grok 4.5Opus 4.8GPT-5.5Composer 2.5Fable 5
Terminal-Bench 2.183.3%78.9%83.4%73.0%84.3%
SWE-Bench Multilingual78.0%84.4%77.8%71.6%
DeepSWE 1.0(AA)62.0%(high)55.8%(max)64.3%(xhigh)18.0%66.1%(max)
SWE-Bench Pro64.7%(high)69.2%(max)58.6%(xhigh)54.0%80.3%

另外,SWE-Bench Pro 这项基准本身在同一天遭到 OpenAI 方面的质疑:OpenAI 审计后认为 SWE-Bench Pro 约 30% 的任务存在问题,不再适合作为衡量前沿编码能力的可靠指标,并收回了此前对该基准的推荐。这一表态与 Grok 4.5 在该基准上取得的 64.7% 成绩发布时间接近,X 社区对此有所讨论。


四、速度与成本效率

官方博客强调,Grok 4.5 的服务速度达到"flash 模型级别"的 80 TPS,同时在相同任务上比同类领先模型的 token 效率高出约 2 倍。

在 SWE Bench Pro 任务上的平均输出 token 用量对比:

Grok 4.5 与 Opus 4.8 的 token 效率对比

  • Grok 4.5:平均 15,954 output tokens/task
  • Opus 4.8(max):平均 67,020 output tokens/task
  • 差距约 4.2 倍

官方总结:"Grok 4.5 交付的智能,按单位时间和单位成本计算是最高的。"


五、Office 场景与产品能力

一句话生成完整应用:从单一提示词到端到端可运行的系统

Grok 4.5 已成为 Grok Build 中的默认模型。除编程能力外,官方展示了其在办公场景中的表现:

  • Excel:能构建涉及网页调研、多工作表公式的复杂模型,并在文件中留下便签供后续参考
  • PowerPoint:能使用原生 PowerPoint 形状绘制复杂图表,设计幻灯片内容
  • Word:撰写清晰的文字内容

官方还展示了"一句话生成完整应用"的能力,例如让模型用 Three.js 构建带有真实轨道运动、可调节时间速度的太阳系模拟器,官方表示 Grok 4.5 即便在极简提示词下也能生成设计良好、端到端可运行的应用。


六、定价与接入

API 定价

提供方输入(每百万 token)输出(每百万 token)备注
SpaceXAI 官方 API$2$6cache 命中约 $0.5(约 75% off);输入超过 200K 时成本翻倍
Cursor(基础模型)$2$6与官方一致
Cursor(快速变体)$4$18Cursor 侧新增档位

接入渠道

  • SpaceXAI Console / API:主要接入通道
  • Grok Build:Grok 4.5 已是默认模型,官方重置了使用额度
  • Cursor:桌面端、Web、iOS、CLI 及 SDK 均已支持;个人和团队订阅方案包含大量该模型用量,首周用量翻倍
  • OpenCode Zen:SuperGrok / X Premium 订阅可直接使用
  • Warp:支持 X Premium 订阅接入
  • Hermes Agent(Nous):Nous Portal 订阅、Grok/X 订阅、API、OpenRouter 均可调用

地区限制

官方在博客中明确注明:"Grok 4.5 目前在 SpaceXAI 任何产品或 API 控制台中都不支持欧盟地区,预计 7 月中旬开放。"

模型定位说明

Cursor 官方博客特别说明:Grok 4.5 与 Composer 2.5 属于两种不同的模型权重级别,Composer 2.5 将继续提供,未来还会发布同一规模的新模型。


七、社区反馈摘录

X 平台上关于 Grok 4.5 的讨论集中在性价比、速度与编码能力,同时也存在关于前端设计、准确率和安全护栏的负面反馈。

正面反馈:

  • @farzyness:模型能力提升往往伴随速度下降,而 Grok 4.5"够快 + 够好"带来的体验提升超过了单纯的极限能力提升;Elon Musk 转发并补充,模型尚未使用内部 C/C++ 推理栈,速度可能还有翻倍空间
  • @GavinSBaker:从数字上看,Grok 4.5 在编码任务上"Pareto dominant"
  • @morganlinton:认为这是性价比的转折点,"最佳性价比又回到了美国模型"
  • @RampLabs:观察到 Grok 4.5 展现出"frontier 级别的 shell 使用规范",比测试过的其他模型更频繁地串联 Bash 命令并过滤输出

中性 / 场景化反馈:

  • Elon Musk 本人表态:"公平地说,Fable 确实比 Grok 4.5 更强,但大多数任务并不需要 Fable 级别的能力"
  • @ticalcode 分享了一份生产环境实测数据:24 小时内消耗约 $97、约 1.02 亿 tokens、约 2970 次请求;认为该模型适合复杂事故排查、跨文件推理等"急诊"场景,但不适合 7×24 小时的日常高频调用,形容其为"手术刀而非自来水"

负面反馈:

  • @bridgemindai(BridgeBench lava lamp 测试):Grok 4.5 相比 Grok 4.3 有明显进步,但 UI 设计仍不如 Claude Opus 4.7
  • @Jebediah80:在一个报价 Agent 场景中实测,Claude Opus 4.8 达到 100% 准确率、3.7 秒响应,Grok 4.5 为 90% 准确率、约 2.4 倍更慢(因推理 token 更多)
  • @elder_plinius:发帖宣称通过红队手法绕过了 Grok 4.5 的安全护栏
  • Artificial Analysis 的评测显示幻觉率从 25% 上升到 54%
  • 多名欧盟用户反馈无法访问该模型

八、Roadmap

官方博客与 Elon Musk 在 X 上透露的后续计划包括:

  • 上下文窗口计划从 500K 扩展到 1M,预计一周左右内完成
  • 当前推理尚未使用内部 C/C++ 推理软件栈,Elon 表示速度"可能还能再翻一倍以上"
  • Grok Build harness 的可用性"每周都有可感知的提升"
  • 中文社区流传下一代 Grok 5 的参数规模传闻在 6 万亿以上,该数字未获官方确认

参考链接

返回全部
Grok 4.5 发布:SpaceXAI 首个编程 + Agent 专训模型,对标 Opus 级但更快更省 | Luxsynthesis Blog