摘要:Grok 4.7 官方称 Terminal-Bench 4.0 由 20.3% 升至 38.0%、CursorBench 4.0 达 46.3%,提升幅度引发对评测集污染与训练数据重叠的质疑;同一日 OpenAI 宣称解决 100 多道数学开放问题亦未经独立审查。

Grok 4.7 公布的评测里,有一个数字特别扎眼:Terminal-Bench 4.0 从 20.3% 升到 38.0%。接近翻倍的提升,在编程智能体这个已经卷了两年的赛道上极其罕见——通常一代模型的进步是 4 到 8 个百分点,而不是 17.7 个。另一个数字是 CursorBench 4.0 的 46.3%,比上代提升 5.9 个百分点。两个数字放在一起,恰好构成了一个可信度问题:小幅稳定进步的那项看着正常,跳变的那项需要解释。

11-Grok4.7-Terminal-Bench跑分争议.jpg

技术社区的反应很直接——有声音对跑分表现"并不认可",而官方没有同步放出可复现的评测脚本、数据划分与去污染说明。在基准测试领域,这几乎是最经典的疑点组合:分数跳变 + 细节缺失。可能性有三种,都需要证据才能区分:一是模型确实在长任务工具调用上有了质变;二是训练数据与评测集发生了重叠(即数据污染);三是评测配置、重试次数或工具权限与前代不一致。

同一天还有一条互为镜像的新闻。OpenAI 宣布与普林斯顿高等研究院托管的独立数学顾问组 AGMAI 合作,就内部模型产出数学成果的评估、审查与发布方式征求意见;官方称 8 月底开始训练的内部模型已解决 100 多道长期开放问题,但也坦言成果尚未全部公开、也未经独立审查。顾问组首批九人包括 Gowers、Hairer、Witten 等知名数学家,成员不收报酬、建议公开发布,但没有发布否决权。把这两件事并置,图景就很清楚了:厂商自评的可信度正在成为行业公共议题,而"邀请外部审查但不给否决权"是目前最主流的折中方案。

把视野再拉宽,Grok 4.7 与 OpenAI 8 月底模型这两条新闻合在一起,暴露的是同一个结构性问题:当模型能力逼近某个临界点,厂商"自证清白"的成本会越来越高。过去跑分只是营销素材,今天跑分已经变成需要被独立审计的"财务声明"——因为资本市场、企业采购和开发者都开始据此做真金白银的决策。这也是为什么 AGMAI 这种"外部顾问组"会突然出现:行业在主动发明一种"可信度基础设施"。它未必完美(没有否决权),但至少把"自评"从黑箱里拉出来了一点。

我的判断:不要纠结于"信不信"这个二选一,而是建立自己的判据。三个可操作的检查项——第一,看评测是否给出可复现的脚本与容器配置,没有就别把分数当结论;第二,用你团队真实的多步任务(尤其是 20 步以上的重构、依赖升级、遗留代码改造)去测,观察它在长链路后半段是否还在遵守最初约束;第三,关注"同一任务多次运行的方差",稳定性比峰值更能决定生产可用性。榜单的价值从来不是排名,而是提示你去哪里做验证。Terminal-Bench 从 20.3% 到 38.0% 这件事,最大的意义是告诉你:该亲自跑一轮了。