摘要:SpaceXAI 发布 Grok 4.7,换用更大基础模型并延长强化学习周期,强化长任务、自我检查与长上下文管理,速度为可比模型两倍;CursorBench 4.0 得 46.3%,每百万输入输出 token 定价 2 与 6 美元。

SpaceXAI 今天放出 Grok 4.7,主要卖点是"长任务"。官方说法是换用了更大的基础模型并延长了强化学习周期,重点强化长时间任务执行、自我检查与长上下文管理,速度达到可比模型的两倍。评测数字一并给到:CursorBench 4.0 得分 46.3%,比上代提升 5.9 个百分点;Terminal-Bench 4.0 从 20.3% 升到 38.0%;GDPval 以及法律、医疗等专业评测也同步上涨。定价维持不变,标准版每百万输入、输出 token 分别为 2 美元和 6 美元,并已上线 Cursor 与 Grok Build。

07-SpaceXAI-Grok4.7长任务.jpg

争议恰恰出在这些数字上。Terminal-Bench 从 20.3% 到 38.0% 是接近翻倍的提升,幅度大得足以让人本能地多想一层:是模型真的更强,还是评测集与训练数据发生了重叠?技术社区里已经出现"对跑分表现并不认可"的声音,而官方并未同步放出可复现的评测脚本与数据划分说明。在这种时候,单看榜单是危险的。

这里还有一个容易被忽略的产品逻辑:Grok 4.7 选择在 Cursor 与 Grok Build 里首发上线,而不是先发博客再等第三方接入。这个顺序说明 xAI 更在意"真实开发者会不会留下来用",而不是榜单上的名次。对编程智能体来说,最有说服力的评测从来不是 Terminal-Bench,而是"用它改一个真实仓库,提交能不能一次通过评审"。

另外,定价维持 2 美元输入、6 美元输出不变,在 OpenAI 把 Luna 打到 0.1 美元的当天显得并不便宜。这其实是 xAI 的一贯策略:不参与价格战,而用"长任务 + 编程生态"去换取愿意为效果付费的开发团队。它赌的是那部分用户对单价的敏感度低于对"一次把活干完"的敏感度。

放到更大的坐标系里,Grok 4.7 的处境折射出整个编程智能体赛道的焦虑:当 Cursor、Claude Code、Codex、Gemini CLI 同时把"长任务"当作主战场,差异化越来越难靠一句"我更强"讲清楚,于是评测数字成了唯一的通用语言——但也正因如此,数字的可信度才被放在放大镜下。对普通开发者,最理性的态度是把榜单当线索、把真实仓库当考场:你团队里那个拖了三周的遗留模块,就是最好的评测集。

我的判断:Grok 4.7 最值得试的不是它宣称的跑分,而是它真正解决的问题——长任务里的"自我检查"和"上下文管理"。这两点是 Agent 落地的命门:任务一长就发散、一长就忘记前提,是几乎所有编程智能体共同的病。如果 4.7 在这方面确实进步,38.0% 的绝对值低不低就没那么重要了。实操建议:拿你团队真实的多步重构或遗留代码任务去测,观察它在第 20 步之后是否还在遵守最初的约束——那才是"长任务能力"的真考场。榜单会骗人,跑不完的活不会。