摘要:Cognition 工程师驱动多个 Devin 智能体构建 GPU 格子筛,完成 260 位 RSA-260 因式分解,刷新此前 RSA-250 公开纪录。

Cognition 的工程师 samyok 带队,驱动多个 Devin 智能体搭出高性能 GPU 格子筛(lattice sieve),把 260 位的 RSA-260 完成因式分解,刷新了此前 RSA-250(2020 年 2 月)保持的公开 RSA 挑战纪录。作者亲历了用 Devin 在约三周内分解 RSA-260 的全过程,还给出了成本明细和人类介入的具体环节——这让它不像"AI 又破纪录"的标题党,而是一份可信的实测报告。读完整篇,你得到的不是一句结论,而是一张"智能体到底干了什么、人干了什么"的清单。

为什么这件事值得作为"深度测评"来看?因为它回答了从业者的真实疑问:智能体到底能承担多大尺度的科研计算?RSA 因式分解是计算数论里的硬骨头,过去靠人类专家手调算法、调参、排查数值稳定性。Cognition 的做法是让 Devin 们分工协作——有的写筛法实现,有的做性能优化,有的管数值校验——人类在关键节点兜底。这种"人机分工的颗粒度"比单纯跑分更有参考价值。它不是"机器全自动搞定"的神话,而是"机器扛重复、人扛判断"的实景。

09-workflow1111.jpg

报告的诚实之处在于没把人摘掉。它明确列出了哪些环节仍要人类拍板、成本花在哪、踩了哪些坑。对想用 Agent 做严肃科研的团队,这比任何营销都实在:智能体不是全自动黑箱,而是把"重复且可见的子任务"交给机器、把"判断与定题"留给人,整体效率因此上一个台阶。一个细节是,人类介入多发生在"算法选型"和"数值异常排查",而这些恰恰是模型目前最不可靠的地方。

横向看,这和本期 OpenAI 自动化研究实习生、Cursor 协调者智能体的主线一脉相承:Agent 正在接管"执行密度高、但可被验证"的工作。RSA-260 的价值,正是给"智能体能跑多深"画了一道新的、可核验的刻度线。它的可验证性很强——分解对不对,乘回去验一下就知道,这恰恰是智能体最适合接手的那类任务:结果有明确对错,过程可以被拆分。

对安全领域,这也提醒一句:当因式分解这类密码学相关任务被智能体显著加速,长周期密钥的前置风险值得提前纳入考量。公玥体系的设计通常假设"人类做这件事要几十年",但如果智能体把周期压到几周,安全余量就得重新算。一项科研能力的提速,往往先是惊喜,后是警醒。