评测编码智能体,过去总在几块割裂的场子里打转。修 bug 的看 SWE-bench,做前端的看 Design2Code,生产环境的基准又多半关着门不让外人审计。单科状元遍地走,全能选手找不到。
7月23日,腾讯在 arXiv 上扔出了一颗“炸弹”——WorkBuddy Bench,一套把代码、网页、办公、安全四个领域全部装进来的编码智能体评测套件。论文署名单位包括腾讯优图实验室、科恩安全实验室、WorkBuddy 团队与云鼎安全实验室。
260道题,四个考场
WorkBuddy Bench 的规模不算大——总共260道任务,但覆盖的广度堪称前所未有。
四个子集分别是:
代码(Code):80道题,仓库级软件工程。 智能体被丢进一个真实项目的某个 commit 节点,需要在多个模块间定位并修改代码,最终通过隐藏测试。涵盖开发者、算法工程师、产品经理、QA、运维五种角色。
网页(Web):70道题,前端开发。 要求智能体生成、修改、分析前端页面,涉及交互、数据可视化、视觉设计等。
办公(Office):50道题,多文件业务流程。 智能体需要操作 xlsx、csv、pdf、docx 等混合格式文件,产出精确的制品。
安全(Security):60道题,红蓝队攻防。 智能体要发现并安全复现真实漏洞、分析恶意软件、探测自身攻击面。红队38题、蓝队22题,白盒审计锚定 binutils、curl、nginx 等真实 CVE。
每个子集共享同一套任务目录格式,但各有独立的验证方式,分数不能在子集之间直接比较——腾讯干脆不报套件平均分。
最硬核的设计:从根上防“背答案”
WorkBuddy Bench 真正让人眼前一亮的地方,不在于题多,而在于这些题从根上就防着“背答案”。
每个任务都不是从公开题库里改来的,而是从真实的代码提交、拉取请求或业务场景中“逆向工程”出来,再改写成简短、口语化、带角色扮演味道的请求。提示词没法靠上网搜到对应的 PR 或提交线索——搜不到,自然就背不了。数据集公开发布(任务目录、环境镜像、评估工具、测试用例、参考方案全给),抗污染靠的是这种构造方式加版本管理,而不是把题捂着。
安全子集还布了五层反作弊:禁字面量扫描、重命名输入、覆盖篡改测试、编码依赖、低权重诱饵。
评测在隔离容器里跑,模型和沙箱分离,框架用 CodeBuddy Code 和 Claude Code 两种,推理调高、上下文给到200k,并禁用 WebSearch 与 AskUserQuestion。关掉联网搜索,本就是为验证抗污染是不是真管用。
谁在榜单上领跑?
排行榜把多家模型族摆上了台面(分数0–100,三次平均)。Claude Opus 4.8 在代码、网页、办公、安全多数榜首通吃,拿下五个第一;GLM-5.2 在 security 两榜登顶,GPT-5.5 则摘下 office cc 第一。
框架的敏感性也不小——安全子集重排最狠,平均绝对变动达 8.6 个点。效率上,GPT-5.5 输出 token 最少却分数不低,而 DeepSeek-V4-Pro 在代码上跑了44轮、出入 token 都高,显得更“费劲”。
为什么 WorkBuddy Bench 值得关注?
2026年,AI编码智能体早已不是实验室里的玩具。从 Claude Code 到 GPT-5.5,从 DeepSeek 到 GLM,各家模型都在争相展示自己的“写代码”能力。但一个尴尬的问题始终悬而未决:我们到底该怎么公平地评测这些智能体?
过去的方式一直很割裂。修 bug 的看 SWE-bench,做前端的看 Design2Code,生产环境的基准又多半关着门不让外人审计。每一块都像一座孤岛,各测各的,谁也说不清一个智能体在真实工作中到底能打几分。更麻烦的是数据污染——公开的基准测试题往往会被爬虫抓取、被模型记住。
WorkBuddy Bench 的价值在于三件事:跨领域——四个真实工作场景一次性覆盖;抗污染——从构造方式上防止模型“背答案”;全开源——数据集、评估工具、环境镜像全部公开可复现。
团队也坦承局限:代码子集以 Python 为主、跨语言偏少;开源发布本身带来被爬取污染的风险,得靠版本管理缓解;评判器偏差尚未量化;办公类偏文本,暂无 OCR 与 GUI。近期计划是校准网页评分、扩充公开榜单。
WorkBuddy Bench 的论文和代码均已开源。GitHub 仓库提供了完整的评测框架,支持智能体驱动端到端评测流程。当编码智能体从“能写代码”走向“能干活”,一场真正全面的考试,才刚刚开始。

