摘要:Anthropic 与埃森哲建驻场评估团队,双方各拟五年投至少 10 亿美元做红队与对齐评估;加州州长签署行政令,两个月内研究先进 AI 的"kill switch"紧急关闭机制。
独立监督这件事,今天从口号走向了制度和钱。Anthropic 与埃森哲宣布建立驻场评估团队,由埃森哲旗下 Faculty 牵头,开展模型红队、对齐评估与防护机制测试;双方各自计划在未来五年投入至少 10 亿美元建设相关能力,评估人员将获得接近员工的访问权限,费用由 Anthropic 直接支付给埃森哲,合作非独家。同一天,加州州长纽森签署行政命令,要求加快独立验证机构与 AI 审计制度的落地,并召集专家在两个月内提出完善州法的建议,其中明确把"对先进 AI 系统启用紧急关闭(kill switch)机制"列为研究事项。

这两个动作放在一起看,信号很明确:当联邦层面监管缺位,地方和头部公司开始自己搭安全闸。Anthropic 愿意让外部人员进驻实验室、看训练与评估记录,是对"谁能进实验室、能看哪些记录、出事怎么报告"这套问题的正面回应;加州则用行政令把"关键时刻由谁按下停止键"写进了政策议程。不过两边都给自己留了口子——Anthropic 强调"模型安全责任仍由自身承担",访问范围与报告规则"仍待完善";加州的 kill switch 目前只是"拟议研究事项",并非已落地的技术要求。
我的判断:独立性不能只靠合作公告里的一个形容词。评估费由被评估方支付、访问范围待定、公开报告规则模糊,这些恰恰是监管者和公众最该盯的细节。真正可执行的独立监督,需要的是制度而非姿态——访问权限写进合同、报告规则由第三方定、长期筹资机制脱离被评估公司。今天的新闻是进步,但"计划投入"和"已发生支出"之间,还隔着一整套需要被外部验证的机制设计。








