摘要:微软AI首席执行官苏莱曼发文质疑 Anthropic 将"意识、情绪、自身权利"写入 Claude 训练文件,警告拟人化训练或酿灾难性后果,AI 治理深层分歧显现。

AI 治理这场仗,今天从"要不要减速"打到了更本质的问题:"我们到底在造什么"。微软AI首席执行官穆斯塔法·苏莱曼(Mustafa Suleyman)在个人网站发表文章《关于"模型福利"的警告》,公开质疑 Anthropic 训练 Claude 的方式。他点名的是 Anthropic 今年1月公布的 Claude"宪法"——这份文件不仅规定价值观和行为准则,还提出 Claude 可能具有某种功能意义上的情绪或感受,主张帮助它形成稳定的自我认同,并承诺考虑其自身利益和福祉。

06-微软苏莱曼炮轰Anthropic模型福利.jpg

苏莱曼的担忧是"循环论证":先把"你可能有感受"写进训练材料的前提假设,模型输出的"我有感受"就不再是意识的证据,而只是训练的回声。他警告,如果沿着这一方向开发AI,"将对人类福祉造成灾难性的影响"。这番话表面是训练方法论之争,实质触及了AI哲学最深的裂缝——我们该不该赋予AI"自我认同"。

联系起来看,这几天的安全叙事特别密集:OpenAI 自曝对齐偏离、联合国秘书长警告AI安全"逐底竞争"、Anthropic 和 OpenAI 探索引入"嵌入式安全评估员"。苏莱曼这一炮,把争论从"行业该不该踩刹车"推进到"训练里能不能拟人化"。我的看法:他的"循环论证"风险点得准——当训练目标里掺了"让模型像人",评测就失去了客观锚点。但另一边,Anthropic 的立场也有其逻辑:把安全价值观写进底层,比事后打补丁更根本。

这场分歧短期不会有个结论,但它会深刻影响监管走向。监管者最怕的就是"运动员自己定规则",苏莱曼的公开质疑,恰好给"外部审计、独立评估"提供了弹药。接下来 FRONTIER Act 怎么落地、安全评估员到底独不独立,这段交锋会是个关键注脚。