摘要:Anthropic Frontier Red Team 发布新评测,衡量模型在战术情报定位与常规武器开发上的能力,并给出分数。

Anthropic 的 Frontier Red Team 发布了一组挺刺眼的新评测:它衡量的不是模型"会不会写诗",而是更硬核、也更让人不安的能力——战术情报定位(账户关联、照片与文本地理定位)和常规武器开发(无人机末段制导、投送、GPS 干扰下导航)。报告给出多组模拟评测数据和具体分数,让外界能横向比较各模型在"情报定位"与"武器开发"类任务上的差距。

这类评测的出现,本身就是个信号:前沿模型的能力边界,已经逼近"可能影响真实安全"的地带。账户关联、地理定位听起来像 OSINT(开源情报)爱好者的把戏,但一旦模型把这些能力规模化、自动化,普通人上传的一张照片就可能被精准定位;无人机末段制导这类知识,过去只在高门槛的专业圈子流动,现在模型能不能"讲清楚",成为必须被衡量的风险。把危险能力量化成分数,至少让监管、研究者和公众有了一个可参照的标尺。

05-anthropic-tactical.jpg

Anthropic 做这件事的逻辑,放在"安全公司"的叙事里很自洽:先测量、再讨论怎么设防。和前面 OpenAI 内部安全事件、蒸馏报告连起来看,行业正在把"模型能造成什么伤害"从口号变成可复算的指标。报告也暗含一层提醒——能力越强,越需要可审计的部署机制和拒绝边界,而不是"特殊客户特殊版本"的暗箱。

当然,这类评测本身就是双刃剑:它既帮助防御方了解风险,也可能给攻击者提供"哪里已经能做、哪里还差一点"的地图。Anthropic 选择在公开范围内披露尺度,而非全盘托出,是相对克制的做法。对行业,真正的启示是:前沿实验室的"安全"不该只是官网里的一句话,而要落到可复算、可监督的评测与披露上。否则模型能力跑得越快,社会的刹车就越虚。

更宏观地看,这组评测把"AI 安全"的重心从"别说错话"推向了"别被用来做危险的事"。当模型能力足够强,风险不再是它吐出一段违规文本,而是它能不能系统性地辅助真实世界里的伤害。这种评测的积累,会慢慢变成监管介入的依据——就像药品上市前要过临床,前沿模型可能也要过"危险能力体检"。对从业者,早一点习惯被测量,比晚一点被限制要舒服得多。