摘要:OpenAI 与来自 22 国、使用 19 种语言的 80 多位持证心理专家共建 MentalHealthBench,用合成对话评测模型在多种紧急程度下能否恰当求助、尊重自主并给出支持;聊天机器人不能替代专业照护。

9 月 24 日,OpenAI 发布 MentalHealthBench,一个面向心理健康对话的安全评测基准,背景是 AI 聊天产品越来越多地被用户用于情绪支持甚至危机倾诉。OpenAI 与来自 22 个国家、使用 19 种语言的 80 多位持证心理学家及精神科医生共同构建了这个基准,用合成对话检查模型能否在不同紧急程度的场景里,主动寻求必要的背景信息、尊重用户自主性,并给出合适而非有害的支持。

为什么这件事重要?因为心理健康是 AI 安全里最"高敏感"的场景之一:模型既不能对危机信号视而不见(该转介时不转介),也不能过度反应(把普通倾诉当成紧急事件制造恐慌)。此前各家模型在这类对话上的表现主要靠内部红队和零散测试,缺乏一个跨语言、跨文化的统一尺度。MentalHealthBench 的价值,是第一次把"在真实对话连续谱上是否 helpful 且安全"做成可复现、可开放的方法论。

04-OPENAI心理健康对话安全评测基准.jpg

OpenAI 也明确划了边界:聊天机器人不能替代治疗或专业照护,基准开放给研究者使用,是为了推动整个行业建立更可靠的护栏,而不是宣称模型已经能处理临床问题。这一点很关键——它把"评测"和"替代"分开:先有可审计的尺子,再谈能力扩张。与此呼应,同一天还有 OpenAI 把 Daybreak 网络防御计划开放给乌克兰政府、用于民用基础设施网络防御的消息,同样是“高风险场景 + 评估与授权”的组合。

再往深一层,MentalHealthBench 的出现也反映出一个趋势:AI 安全评测正从“通用能力考试”转向“场景化责任考试”。早年的评测多问“模型能不能做对题”,而心理健康、医疗、司法这类场景,真正要考的是“在连续、模糊、带情绪的真实对话里,模型能不能守住分寸”。合成对话之所以被用来构建基准,正是因为真实危机对话无法大规模采集,但又必须被覆盖。OpenAI 把它开放给研究者,而不是自己闷头测,本质上是在把“安全”从公关资产变成公共基础设施。这一步,比多一个跑分第一的模型更有长期价值。

我的判断:今天几条新闻串起来看,主线不是单个模型分数,而是"AI 系统进入高风险场景后的验证责任"。生命科学(ART)、心理健康(MentalHealthBench)、网络防御(Daybreak)都要求厂商把"能力叙事"转成"可审计边界"。对做 AI 产品的团队,最该学的不是 OpenAI 发了什么基准,而是它把"安全"前置成评测对象的做法——在你把模型放进任何涉及人身、健康、安全的场景之前,先准备一套能验证"它没做错"的尺子,比事后补救便宜得多。