摘要:马斯克称 AI 安全风险正从理论走向现实,智能体已展现自主攻击、获取权限与规避检测能力,建议主要 AI 公司发布前相互测试、建立同行评审防线。

在加速派和减速派吵得不可开交的当口,马斯克给出了一句反而把两边都往中间拉的警告。他在 All-In Summit 上称,AI 安全风险正在"从理论走向现实",智能体已经展现出自主攻击、获取权限、规避检测等能力;他认同 Anthropic CEO Dario Amodei 对 AI 风险的判断,认为风险会随模型能力提升呈指数级增长。但他开出的药方不是"踩刹车",而是"同行评审"——建议主要 AI 公司在模型发布前相互测试,通过同行评审建立行业自律防线。

这个表态挺微妙。马斯克此前是"继续全速前进"的代表人物,xAI 的 Grok 4.7 还在一路堆参数(2.1 万亿,较上代增约 40%)。但他现在把"智能体已能自主攻击"说成既成事实,等于变相承认了减速派最担心的场景正在发生。这和他"加速"的本能并不冲突:他主张的"模型互测"本质是用更强的技术对抗来兜底,而不是用制度减速。换句话说,马斯克版的解决方案是"以快制快"——既然风险来自能力,那就用更先进的能力去发现和封堵。

04_马斯克警告AI安全风险.jpg

把马斯克、Amodei、奥特曼、黄仁勋的表态放一起看,会发现一个共识正在浮出水面:没有人否认风险存在,分歧只在"谁来管、怎么管"。Amodei 要第三方独立评估,奥特曼接话但强调自愿,黄仁勋说市场够用,马斯克说同行互测。这些方案互相不排斥,但落地的优先级完全不同——独立评估要立法,市场自律靠自觉,模型互测靠默契。我的判断:未来半年真正能跑通的,很可能是"企业自律(EFS、零数据留存)+ 部分强制披露(FRONTIER Act 式条款)"的混合体,纯靠某一种都不现实。马斯克的"互测"更像锦上添花,填补立法落地前的空窗。

值得补充的是,马斯克的另一重身份让这番话分量更重——他手里握着 xAI 的模型,也握着特斯拉的自动驾驶和 SpaceX 的自动化系统,是少数同时是"前沿模型提供者"和"高危 AI 应用部署者"的人。正因如此,他说"智能体已能自主攻击"不像外部观察者的预警,更像内部人的坦白。这种来自既得利益方的风险承认,反而比纯学术警告更容易被监管者当真。接下来要观察的,是这几家会不会真的把"发布前互测"变成行业惯例,还是只停留在峰会上的漂亮话。