不是更大的模型,而是更会调度模型的模型——日本Sakana AI正在用“多智能体协作”重新定义AI能力的上限。
7月20日,Sakana AI正式发布Fugu Cyber,一个专为现代网络防御打造的编排模型(Orchestration Model)。在CyberGym和CTI-REALM两大行业权威安全基准测试中,Fugu Cyber分别取得86.9%和72.1%的成功率,表现超越OpenAI的GPT-5.5-Cyber和Anthropic的Claude Mythos-Preview。
一、一个模型,一个API,背后是一支“AI特种部队”
Fugu Cyber并非传统意义上的单体大模型。它的本质是一个多智能体系统(Multi-Agent System) ,但对外封装成了一个单一API。
用户只需向一个端点发送请求,Fugu Cyber就会在后台动态编排一支由专业智能体组成的“队伍”——有的负责分析代码库验证漏洞(CyberGym),有的负责将原始威胁情报转化为可用的检测规则(CTI-REALM),有的负责验证和审查结果。
其底层架构遵循Sakana Fugu家族的核心设计:一个轻量级的协调器模型(Coordinator Model)接收用户请求后,会自动拆解任务、分派给池化(Pooling)的专家模型池(包括GPT、Claude、Gemini等),最后由验证节点合并输出。用户感知到的,只是一个稳定、高质量的API响应。
二、为什么Fugu能打赢“单兵作战”的GPT-5.5-Cyber?
Fugu Cyber能击败同领域的顶尖专用模型,核心逻辑是“集体智能”(Collective Intelligence)。
在真实的企业安全场景中,一个模型很难同时擅长漏洞挖掘、威胁情报翻译和规则生成。Fugu Cyber通过TRINITY进化算法和Conductor强化学习路由,将任务拆解后分配给最擅长该子任务的专家模型。多个模型的互补优势叠加,最终效果超过了任何单一专用模型。
但这不等于Fugu在所有维度都无敌。 多智能体协作的成本是Token消耗放大和延迟增加。在需要毫秒级响应的场景中,Fugu并非最优解。它的“甜区”是高价值、长周期、离线执行的安全研究与深度分析任务。
三、企业安全的现实:有模型不等于能实战
Sakana AI在发布Fugu Cyber的同时,特意给行业泼了一盆冷水。
“达到高分的评测成绩只是故事的开始,”Sakana AI在官方公告中写道。近期行业内充斥着关于前沿模型网络能力的恐慌言论,暗示只要给企业一个具备网络能力的模型,就能瞬间解决安全问题。
现实并非如此。正如《日经数字治理》报告指出,包括大型金融机构在内的组织,往往难以将这些工具投入实际运用。没有专业内部人才和深度系统集成,即使是最先进的模型也很难真正挖出漏洞。Fugu-Cyber在大型企业的成功部署需要同时具备AI能力和深厚本地化网络安全专业知识。
四、行业意义:AI能力竞争进入“系统战”时代
Fugu Cyber的发布,标志着AI竞争从“训练一个更大的模型”演进到了“设计一套更聪明的协作系统”。Sakana AI CEO David Ha在X平台上写道:“编排模型是下一个前沿,超越更大的模型”。
它的价值不止于技术层面。在美国出口管制收紧的背景下,Fugu通过一个可随时抽换的模型池,提供了一种规避单点依赖和出口管制风险的路径。这正是Sakana AI所强调的“AI主权”——用算法软件定义AI基础设施,而非垄断算力。
Fugu Cyber用86.9%和72.1%的实测成绩证明了多智能体协作的有效性,也揭示了AI能力演进的一个明确方向:把GPT-5.5-Cyber和Claude挑落马下的,不一定是GPT-6,而可能是一群模型组成的“战队”。
