让AI从零重写一个数据库,不给源码、不给测试用例、不给网络,只给一本835页的手册——这个任务如果交给一个AI智能体,大概率会跑偏甚至崩溃。但Cursor的新一代多智能体集群做到了。

7月20日,Cursor公布了升级版AI智能体集群的最新测试结果。在仅提供SQLite官方文档、禁止访问源代码和互联网的苛刻条件下,新一代集群使用Rust完成了SQLite的重建。更关键的是,所有模型配置最终均在测试套件中实现了100%通过率。

一、从77%到100%:新一代集群如何碾压旧版?

同一个任务,同样的模型,同样的时间预算,新老两代系统的成绩却天差地别。

旧版集群在执行过程中因大量合并冲突导致效率明显下降,最高只跑到了77%的测试通过率。用Grok 4.5跑的时候,旧版系统还没撑到两小时就直接崩溃了。

而新版集群用同样的模型,四小时内就做到了80%的测试通过率——最终在完整的预留测试集上跑出了100%。这个测试集是sqllogictest,来自SQLite项目本身的一套包含数百万条SQL查询的测试工具。关键是,智能体集群事先并不知道这套测试集的存在,这意味着100%的通过率不是“针对测试优化”的结果。

二、成本悬殊:$1,339 vs $10,565,差了87%

比100%通过率更令人震撼的是成本差距。

Cursor团队测试了不同的模型分工方式,有的让一个模型包办规划和执行,有的让强模型负责拆解任务、弱模型负责干活。几种方式做出来的质量差不多,但花的钱天差地别。

最贵的方案——全部使用前沿模型、让昂贵模型承担所有工作——花费了10,565美元。而最便宜的方案——用Opus 4.8做规划、Composer 2.5负责执行——只花了1,339美元。

差了将近8倍,省了87%的API费用。

这个差距揭示了一个比省钱更重要的趋势:在复杂工程任务中,智能体如何编排,可能比选用哪一个具体模型更重要。

三、秘密武器:Planner + Worker 的分层架构

新一代集群的核心突破,不是用了更强的模型,而是重新设计了智能体的协作方式。

新架构将智能体拆成两种角色:

Planner(规划智能体) :由Opus 4.8等前沿模型担任,负责理解需求、拆解步骤、分配子任务。规划者不写一行实现代码,输出是一份任务分解图和每个子任务的规范说明。

Worker(执行智能体) :由Composer 2.5等更快更便宜的模型担任,从规划者那里拿到分解后的任务逐一实现。每个Worker只关心自己的一小块,不携带全局上下文,token消耗大幅降低。

实验数据显示,Worker消耗了总token的69%以上,在大部分运行中甚至超过90%。这意味着绝大部分的计算成本都用在了“干活”上,而不是“思考该干什么”上。

这套设计的核心逻辑是:在大任务中,真正需要前沿智能的时刻只有少数几个——最初的分解、设计决策以及某些关键权衡。一旦前沿规划者将模糊性转化为明确指令,更便宜的模型只需遵循即可。

四、不止于跑分:智能体集群已从研究升级为核心产品

随着Cursor 3的发布,这套智能体集群已经从研究项目升级为核心产品。开发者可以并行运行多个AI智能体协同完成复杂开发任务。

Cursor表示,这种分工不仅减少了智能体长期执行任务时的偏移问题——单个智能体独自扛下整个任务时,容易在长期运行中跑偏,要么盯着眼前的活把大局丢了,要么死死抓住大局导致眼前的活做得稀烂——也有效降低了代码冲突和重复开发。

值得一提的是,Cursor背后的公司Anysphere近期已被SpaceX以600亿美元收购,进一步凸显了AI编程工具在产业中的战略价值。

五、结语

用835页文档、1339美元、一群协作的AI智能体,从零造出一个通过全部测试的数据库——这件事如果放在两年前,听起来像科幻小说。

但Cursor的实验证明了一个正在发生的趋势:AI编程正在从“单一模型辅助”演进为“高度自动化的智能体集群协同模式”。而决定这场变革成败的,可能不再是“哪个模型参数最多”,而是“你如何组织这群模型一起干活”。