过去一年,搜索智能体的强弱几乎全由BrowseComp说了算。但这个标尺正在失灵——短短十个月,模型成绩就从30%一路飙到了90%。基准测试本身的意义,正在被快速刷没。
7月17日,美团LongCat团队抛出了一块更硬的试金石——LoHoSearch。结果相当刺眼:11个前沿模型集体“翻车”,最佳成绩仅有34.74%,其余模型集中在15%到16%左右。同一批模型在BrowseComp上能拿约90%。从90%到34%,这道题把搜索智能体真正逼回了爬坡区。
一、BrowseComp为什么失灵了?
BrowseComp由OpenAI于2025年4月发布,包含1266个问题,用于评估AI代理在开放互联网上检索难以找到的事实信息的能力。问世不到一年,就成了搜索智能体评测的“事实标准”。
问题在于:模型进步太快,基准迭代太慢。2025年BrowseComp刚推出时,模型成绩仅30%出头。到2026年5月,OpenAI的GPT-5.5 Pro以90.1%登顶,GPT-5.6 Sol又刷新到90.4%。2026年7月,超过80%已成为前沿模型的及格线。
基准测试一旦被“刷穿”,就失去了区分度——大家分数都差不多,谁强谁弱根本看不出来。评测的意义变成了“谁更会刷题”,而不是“谁真的更会搜索”。
二、LoHoSearch:把出题权交给知识图谱
美团LongCat团队的解法是:不再靠人脑出题。
LoHoSearch基于一个覆盖762万个实体、2.65亿条有向边的维基百科知识图谱自动生成题目。机器生成的题目在搜索空间和结构复杂度上,抵达了人类标注者根本无法稳定设计的难度上限。过去的基准靠人脑出题,再难也有天花板;LoHoSearch把出题权交给图谱,难度天花板被彻底掀开。
基准包含544道经人工核验的题目,覆盖音乐、地理、影视、体育等11个主题领域。题目采用树状与图结构两种组织方式。树结构通过放大搜索空间制造难度;图结构在巨大搜索空间之上引入环形依赖和交叉约束,叠加结构复杂度。
三、11个前沿模型的“翻车现场”
评测结果用一句话概括:集体不及格。
最强模型GPT-5.5准确率仅34.74%。DeepSeek-V4-Pro、Claude-Opus-4.6和Kimi-K2.6集中在15.53%至15.99%。其余模型均低于14%。作为对比,DeepSeek-V4-Flash在BrowseComp上准确率为58.84%,到了LoHoSearch仅剩10.02%。
更残酷的是:解一道LoHoSearch题目,平均工具调用从35次增至61次,增幅达74%。图结构题目准确率仅8.01%,远低于树结构的11.89%,印证了结构复杂度是独立于搜索空间之外的额外难度来源。
四、上下文策略也失灵了
过去靠提示工程和上下文策略“补分”的老办法,在LoHoSearch上几乎失效。
表现最佳的组合(Discard-all + Verify)将DeepSeek-V4-Flash的成绩从10.02%提升至16.82%,绝对提升仅6.8个百分点。同样的策略在BrowseComp上能带来14个百分点的增益。
收益收窄的原因在于:LoHoSearch需要更长的推理链,简单的轨迹压缩或重启无法解决长程搜索中的信息丢失问题。靠“小聪明”补能力,已经行不通了。
五、LoHoSearch意味着什么?
对AI搜索评测:从“刷分”回到“真考”
BrowseComp被刷穿说明一个道理:基准测试也有保质期。当所有模型都能考90分,这张卷子就废了。LoHoSearch的出现,把搜索智能体重新逼回了爬坡区——想做对一道题,模型必须真正具备长程推理、复杂信息检索和多步规划能力。
对模型厂商:告别“应试教育”
靠刷榜证明实力的时代正在过去。LoHoSearch的34.74%最高分说明:当前最先进模型距离真正的“搜索智能”还有巨大差距。模型厂商不能只盯着几个基准刷分,得回到真实场景里去打磨能力。
对行业:基准开源,人人可测
LoHoSearch已全面开源。论文地址:arxiv.org/abs/2606.12837,数据集:huggingface.co/datasets/meituan-longcat/LoHoSearch。任何团队都可以用自己的模型上去跑一跑,看看是真功夫还是纸老虎。
六、结语
BrowseComp从30%到90%用了十个月。LoHoSearch的34.74%,是新的起点,也是新的天花板。
当老基准被刷到顶,搜索Agent的真正挑战才刚刚开始。LoHoSearch很可能成为下一个绕不开的必测项——不是因为题目更难,而是因为它让“刷分”这件事,变得不再有意义。
