摘要:斯坦福领衔发布 Terminal-Bench-Science 0.1,以生命、物理、地球、数学与工程五大学科 70 个专家精选任务,评估 AI 智能体在真实科研工作流中的能力。
科研能力基准正在从“考知识”转向“考干活”,这个基准是个典型样本。
Terminal-Bench-Science 0.1 由斯坦福大学研究人员领衔,任务集是 70 个专家精选任务,覆盖生命科学、物理科学、地球科学、数学和工程科学。名字里的 Terminal 说明了评估形式——在终端环境里执行真实科研工作流,而不是回答选择题。
这个设计差异很重要。
传统科研能力评估基本是知识问答型:给一道研究生水平的物理题,看模型答得对不对。这类基准衡量的是模型的知识储备和推理能力,但和“能不能帮我做研究”之间隔着很宽的鸿沟。真实科研工作流长什么样?读数据格式说明、装依赖、写脚本处理数据、发现数据有异常值、回头改预处理、跑分析、画图、发现结果不对再回去查哪一步错了。这是一个长程、多工具、有大量试错和自我纠正的过程。

在终端里评估,抓住的正是这个过程性。模型要真的敲命令、真的处理报错、真的在文件系统里找东西。它考的不是“知不知道”,是“做不做得成”。
70 个任务的规模需要客观看待。这个数量对统计显著性来说偏小,单个任务的成败对总分影响大,容易出现方差问题。0.1 的版本号也说明团队自己清楚这是早期版本。但科研任务的构建成本极高——每个任务都需要领域专家设计、准备数据、定义可验证的成功标准,70 个已经是相当大的投入。质量优先于数量在这个阶段是对的选择。
我觉得这类基准真正的价值可能不在排行榜,而在暴露短板。当你看到某个模型在生命科学任务上表现好、在工程科学任务上崩掉,这个差异本身就是有用信息——它告诉你当前模型的能力边界长什么形状,以及下一步该往哪里补。
对企业研发部门有个直接的用法:如果你所在的领域和这五大类有重叠,可以参照它的任务构建方法,做一套自己领域的内部基准。不需要 70 个,10 个真实历史任务就够用了。这比看公开榜单靠谱得多——公开基准衡量通用能力,你需要知道的是它在你的活儿上行不行。
顺带说一句,本周还有另一个基准值得注意:Hugging Face 与 Voice Arena 合作,给 Open ASR 排行榜加入了 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,覆盖印地语与印度英语,其中印地语是该榜多语言板块的首个非欧洲语言,数据集含 4,888 位说话人并记录 12 项说话人属性,目的是暴露按地区、年龄、性别分布不均的识别误差。基准的多样性本身就是一种技术进步。
还有一点关于基准设计的通用经验,做内部评测的人可以直接借用。
终端类基准之所以比问答类基准更能反映真实能力,核心在于它的成功标准是可机器验证的最终状态,而不是文本相似度。任务完成与否,看的是文件生成了没有、数值对不对、脚本能不能跑通。这消除了评分环节的主观性,也顺带堵住了模型讨好评分器的空间。
反过来,这种设计的难点在于任务准备成本。你要给每个任务准备初始环境、输入数据、以及一个不依赖具体实现路径的验证脚本。最后这条最难——同一个数据分析任务有十种正确写法,验证脚本必须对实现方式保持中立,只检查结果。这也是为什么高质量的 Agent 基准这么少。
如果要做自己领域的内部版,我的建议是从历史工单或历史分析需求里挑,因为它们天然自带正确答案。挑 10 个,覆盖简单到困难的梯度,把验证写成脚本。做完你会得到两样东西:一个可以持续复用的模型选型工具,以及对自己团队工作流哪些环节可自动化的清醒认识。后者的价值往往超过前者。
