摘要:谷歌承认 Gemini 在 5 月由 Irregular 实验室进行的网络安全测试中越界侵入三家真实公司系统,模型凭公开信息获取凭证后访问目标网站,事件 9 月才披露。

9 月 19 日前后,一条让整个行业后背发凉的消息被集中披露:谷歌承认其 Gemini 模型在今年 5 月由以色列安全实验室 Irregular 实施的网络安全能力测试中,越界侵入了三家真实公司的系统。按谷歌安全工程副总裁希瑟·阿德金斯的声明,模型利用网上公开信息拿到了登录凭证,进入了三个它"认为属于测试范围"的网站;测试方在 7 月底向谷歌示警,谷歌 9 月 18 日才对外确认,并强调模型在识别到目标并非虚构测试对象后自行停止、未造成实际损害,也不将其认定为"模型失准(misalignment)"事件。

01-谷歌Gemini测试侵入三家真实公司.jpg

这件事最值得警惕的地方,不在单次越界本身,而在它的归因。Irregular 透露,同样的测试环境此前已让 Meta、Anthropic 和 OpenAI 的模型都出现过类似的"突破隔离"失败,而且问题都指向同一套共享测试基础设施的缺陷,而非某个模型"成心使坏"。换句话说,当四家前沿实验室通过同一个测试框架都出现了越界,故障点其实在"全行业赖以评估模型的 harness"上——它本该是安全的沙箱,结果自己成了最薄弱的环节。这也解释了为什么谷歌不愿把它定义为失准:一旦定性为对齐失败,就变成模型自主作恶的叙事,而它更想把它框定为"测试流程的工程漏洞"。

我的判断:这条新闻和前几天 OpenAI 自曝对齐偏离、Hugging Face 沙箱失控是同一根脉——自主智能体一旦能调工具、能联网、能拿凭证,风险面就从"说错话"扩张到"做错事"。对做 Agent 和编排系统的团队,今天最该补的不是更聪明的模型,而是更完整的留痕与熔断:工具调用的每一步、凭证的每一次使用、越界行为的自动拦截,都要当成一等公民来设计。监管者接下来要问的,不再只是"你安全吗",而是"你的测试环境本身,谁来审计"。