摘要:蒸馏攻击利用公开 API 的高频调用,用模型输出批量训练自家模型,以极低成本复刻前沿能力,本质是知识提取的规模化和工业化。
Anthropic 那份报告把"蒸馏攻击"推到了台前。技术上看,它的机制并不玄乎:前沿模型通过 API 开放,攻击者就用海量 prompt 高频调用,把模型的输出(回答、推理链、风格)当成"教材"批量收集,再用这些语料训练自己的模型。等于用极低成本,复刻了别人花几年、烧几亿美金才训出来的能力。这本质上是"知识提取"的规模化和工业化——把别人模型的"知识密度"通过接口一次性抽走。
为什么 API 成了突破口?因为公开接口是对外暴露的、可被程序化的。一个小规模研究性蒸馏,圈内默认睁只眼闭只眼;但一旦调用量上去、形成稳定流水线、产出可商用的替代模型,原创方的护城河就被掏空了。Anthropic 给出"近 2 亿次交互、五个活动"的量级,正是要把这件事从"偶尔蹭用"定性为"有组织的攻击"。从工程角度,蒸馏攻击难防之处在于它和"正常高频调用"在外表上几乎无异,差异只在意图和规模。

防御上,前沿实验室不是没招:输出加噪、对可疑流量限流、对高频相似 prompt 做指纹识别、在服务条款里明确禁止训练用途,都是常见手段。但根本难点在于——API 的本意就是让人调用,要在"正常使用和恶意蒸馏"之间划清线,本身是个猫鼠游戏。这也是为什么本期另一篇里,Anthropic 把"模型能力的合法性"和"训练链路可审计"绑在一起谈。安全不是一道门,而是一整套可观测、可追责的机制。
对国内厂商,这则技术拆解的提醒是双重的:一方面别把"调别人 API 做蒸馏"当捷径,窗口正在关闭、合规风险在累积;另一方面,自研底座、原生数据和可审计训练链路,会从"加分项"变成"生存项"。谁的训练链路经得起查,谁才走得远。一个常被忽视的视角是:当蒸馏规模化,被攻击者也会反过来用"诱导式输出"投喂错误知识,形成反制——这场博弈的复杂度,远超"谁抄了谁"的表层叙事。
把训练数据来源与授权链路留好凭证,既是合规要求,也是未来谈判的筹码。
