摘要:研究者指出递归自我改进(RSI)的技术实现并不困难,难在验证迭代是否真的有效——模型执行力强但难以自定评估标准;Gemini 3.8 Flash 的后训练核心流程已由模型自主探索得出,公开榜单常被刷榜。

"模型能不能自己训练自己"这个话题,今年从科幻走进了工程讨论。研究者姚顺宇、施天麟在访谈里给出了一个颇有反直觉的判断:用自生成数据训练自己,只是 RSI(递归自我改进)的初级阶段;真正的分水岭在于"能不能自主设计整套训练流程",而那已经超出了强化学习的范畴——终极形态是会做调度、上下文管理与硬件优化的系统工程。更狠的一句是:实现自我迭代并不难,难在验证迭代有效。

这句话值得停下来咀嚼。模型在执行层面的能力已经很强——它能写训练脚本、跑实验、调参;但它很难"自定评估标准"。也就是说,它需要一个外部判据来告诉它"这次比上次好",而这个判据恰恰是最容易出错、也最容易被自欺的环节。访谈中提到的 Gemini 3.8 Flash 是个有意思的实例:其核心后训练流程已由模型自主探索得出,说明"设计流程"这一层正在被打通;但流程设计得出来,不代表能判断哪个流程真的更优。

13-RSI递归自我改进验证难点.jpg

同一话题下,另一条来自 TypeSafe 创始人、前 OpenAI 研究员 Diogo Almeida 的观点提供了对照。他认为行业过度训练模型"像人一样聊天",而 AI 真正的消费者是代码;正确的方向是让模型输出带概率与置信度的"决策判断",把一个大 prompt 拆成上百个可度量、可调试的微小判定,用置信度阈值与模型级联来替代盲目微调。他给出的团队目标是五年内推动全要素生产率增长 3%。这套主张与"验证困难"是同一个问题的两面——要让机器可靠,输入和输出都必须变成可度量的量。

顺着这个思路往下想,RSI 最让人不安的不是"模型会不会失控",而是"我们能不能及时发现它没变好"。一个直观的类比是编译器优化:你可以让编译器自动尝试一百种优化组合,但你必须有一个独立的测试套件来判定"哪种更快且没引入 bug"——否则自我改进只是在制造看似更优、实则更脆的产物。这正是访谈反复强调"私有评测集"的原因:当模型开始参与改造自身,唯一可靠的锚点,是你手里那套它没见过、也不会被悄悄刷过的题目。

我的判断:RSI 这条路上,被严重低估的是"评测"这一环。访谈里提到的一个细节很说明问题:公开 benchmark 常被刷榜,一个榜单能存活三五个月已属不易。这意味着当模型开始参与改进自身时,我们连"它有没有变好"都很难回答——自我迭代会放大评估误差,而不是收敛它。对从业者的实际含义有两点:第一,企业内部一定要建私有评测集,它比任何公开榜单都更接近你的真实需求;第二,在研究方向上,"可验证性"会取代"规模"成为下一代方法的核心竞争点。谁能造出更难被刷的评估,谁就掌握了自我改进的闸门。