摘要:8月6日,Neon与Castform联合训练了一个40亿参数的文档搜索模型,经强化学习后训练后,准确率超过GPT-5.6 Sol,单次推理成本仅0.000929美元,相差约94倍。这项合作展示了小参数模型在特定工作流中逼近甚至超越前沿闭源模型的可行性。

8月6日,云数据库服务商Neon发布博文,宣布与AI模型训练平台Castform合作,通过强化学习后训练了一个40亿参数的开源模型。在文档搜索任务中,该模型的准确率不仅不低于OpenAI的GPT-5.6 Sol,甚至更高,而单次推理成本仅为后者的约百分之一。

智能体式搜索:从“一次性查找”到“多轮决策”

这项成果的背后,是对搜索范式的一次重新理解。

目前文档检索的主流做法是“嵌入式搜索”——把文档转换成向量数据,再查找相似内容。但随着AI智能体的普及,搜索流程正在转向“智能体式搜索”。在这类系统中,AI模型会把一个复杂问题拆解成多个小问题,自主决定搜索什么、查看结果、再发起下一轮搜索,循环往复直到收集到所需信息。

这套思路能处理更复杂的问题,代价是每次搜索都要调用一次高性能模型,耗时和成本都不低。按Neon给出的口径,用GPT-5.6 Sol完成一次搜索请求,耗时超过10秒,端到端成本约为0.03美元。

强化学习后训练:让4B模型学会“该搜什么”

Neon和Castform的解法是:不依赖更大的模型,而是训练一个更聪明的模型。

两家公司各司其职:Neon提供文档存储位置和搜索能力,Castform负责训练模型判断“该搜什么”。训练用的是强化学习——模型先尝试完成任务,系统给结果打分,评分直接反馈进下一轮试验。评估维度不只看最终答案对错,还会看是否找到了正确文档、是否引用了合适段落。

最终,经Castform后训练的4B模型在Neon的验证中拿到了平均评估分1.447,超过GPT-5.6 Sol的1.369,也高于GPT-5.4的1.377,刷新了该验证的最高纪录。

成本差距才是真正的杀手锏

性能超过只是故事的一半。真正让这个模型值得被记住的,是它的成本结构。

这个4B小模型的单次推理成本为0.000929美元(约0.0063元人民币),而GPT-5.6 Sol是0.087338美元(约0.59元人民币)。两者相差约94倍——用4B参数吃掉了GPT-5.6 Sol级别的搜索精度,同时把推理开销压到了几乎可以忽略不计。

对于高度依赖反复调用模型做多轮检索的智能体应用来说,这意味着单位成本结构被彻底改写。过去因为成本太高不敢做的多轮搜索,现在可以成为默认流程的一部分。

小模型路线的行业信号

当然,这项对比目前来自Neon和Castform自家的案例研究,尚未公开模型名称、完整评测语料、测试查询数量或置信区间等细节。它的适用范围也仅限于文档检索这一特定工作流。

但这项成果本身释放了一个清晰的信号:在特定任务上,经过强化学习后训练的小参数开源模型,完全有能力以极低的成本逼近甚至超越闭源前沿模型。当“4B vs 万亿参数”的差距被缩小到评估分数可以反超的程度,大模型不一定总是正确答案——至少在文档搜索这件事上,小模型已经给出了一个让人无法忽视的选项。