摘要:蚂蚁在网安周开源大模型内生式安全护栏 SingProbe,复用基座模型推理隐藏状态,逐 token 实时输出风险信号,额外开销不足 0.5%,已适配 29 个主流开源模型。
主流的内容审核大多是"外挂式"——模型生成完,再丢给一个分类器去查有没有违规。蚂蚁这次开源的 SingProbe 走了一条不同的路:内生式安全护栏。它复用基座模型本身的推理隐藏状态(hidden states),通过轻量探针在生成过程中逐 token 实时输出内容安全与幻觉风险信号,额外计算开销不足 0.5%,能在风险内容完整输出前就拦截。同期还发布了流式安全评测基准 SingStreamBench 与医疗场景版 SingProbe-Med。

"内生"二字是关键区别。外挂式审核的痛点在于滞后——内容已经生成、甚至已经发出去了,才被拦下来,对直播、对话、Agent 连续执行这类场景几乎无效。SingProbe 的思路是把安全判断"前置"到生成的那一刻,借着模型自己推理时产生的内部信号来判断风险,相当于在模型的思考过程里装了个报警器。官方称已适配 Ling-3.0 系列、GLM-5.2/5.3、Qwen、DeepSeek V4 等 29 个主流开源模型,并接入 SGLang、vLLM 推理框架,代码、模型与评测基准同步开源。开源策略降低了企业把安全嵌进推理链的成本,也让社区能一起打磨探针的准确率。
这件事的意义不只是在安全圈。当 Agent 开始调用工具、操作业务系统,"生成了什么"和"该不该生成"之间的时间差,就是风险敞口。SingProbe 把护栏做成"可插拔、低开销、与模型同生"的组件,意味着安全从"体外戴套"走向"体内免疫"。当然,0.5% 的开销声明是在特定测试下给出的,真实长上下文、高并发场景会不会回升,还需要社区用脚投票。但方向上,安全内生化是大模型规模化落地的必然——尤其在金融、医疗这类错一次就出大事的场景,事后审核远不如事前拦截。蚂蚁把它开源,也顺手在"AI 安全基础设施"这条新赛道上抢了个位。
把 SingProbe 和前面提到的西班牙 AI 代理泄露、Anthropic 企业前沿安全防护(EFS)放到一张图里,能看出一个清晰的行业走向:安全正在从"模型发布后的补丁"前移到"推理过程里的原生能力"。EFS 管的是"数据留在谁手里",SingProbe 管的是"生成时有没有风险信号",二者叠加才构成企业敢把 Agent 接进核心系统的底气。对做推理引擎和 MLOps 的团队,这是个值得跟进的方向——未来"安全护栏"很可能像"向量数据库"一样,成为大模型服务栈里一个标准且可替换的组件,而开源会让这个组件的选型更早走向成熟。







