7月31日,中文医疗大模型评测基准MedBench正式迎来5.0版本的全面升级。这套由钟南山、葛均波等多位院士团队联合攻关的评测体系,首次将“医疗安全性”和“复杂推理能力”置于核心地位,给医疗大模型立了一把“尺子”。
MedBench自2023年首发以来,已从1.0迭代至5.0版本。此次升级由上海人工智能实验室科研团队联合广州实验室、广州医科大学附属第一医院钟南山院士团队、复旦大学附属中山医院葛均波院士团队等顶尖力量共同构建。作为国内首个原生医疗垂直评测体系,MedBench同时也是上海市委网信办和上海市卫健委指定的前置医疗AI应用技术评测载体。
MedBench 5.0此次升级的核心突破在于两大创新:专科化评测体系和医疗原子技能评测范式。
专科化评测体系意味着评测不再笼统地考察一个医疗大模型的“综合能力”,而是深入到具体临床专科场景——心血管、呼吸、肿瘤等不同专科的AI辅助诊断能力,将被独立、精细化地考核。这得益于钟南山院士团队在呼吸系统疾病领域和葛均波院士团队在心血管疾病领域的深度参与。
更值得关注的是“医疗原子技能评测范式”——这是MedBench 5.0首创的全新评测方法论。所谓“原子技能”,就是把医疗AI在临床中需要完成的任务拆解到最基础的技能单元。一个医疗AI模型在面对患者时,需要经历症状识别、病史追问、鉴别诊断、检查建议、治疗方案推荐等多个环节——每个环节都是一项“原子技能”。MedBench 5.0将医疗智能体拆解为临床任务规划与推理、医疗工具调用与执行、医疗场景感知与交互、记忆与上下文保持、医疗多智能体协作五大能力维度,并自主构建了11个专业评测集。评测从“这个模型能得多少分”变成了“这个模型在哪个具体环节出了问题、为什么出错”。
这一范式直接指向医疗AI最致命的问题——AI模型幻觉。在通用场景中,AI“编造”一段信息或许只是不够准确;但在医疗场景中,一次幻觉可能就是一次误诊。MedBench 5.0通过原子技能拆解,将幻觉的检测从“整体判断”下沉到“环节定位”——模型是在病史采集环节产生了偏差,还是在治疗方案推荐环节出现了错误归因,都能被精准定位。
从行业影响来看,MedBench 5.0的发布标志着中文医疗大模型正在从“能不能回答问题”走向“能不能安全地辅助临床决策”。京东健康已与上海人工智能实验室联合共建MedBench v5.0,将自主研发的医疗AI评测体系纳入国家级权威评测榜单。在2026年7月的评测中,云知声U2-Med以逼近满分的99.2分在智能体评测榜单强势登顶,U2-RadiMed在全模态大模型赛道以综合得分57.2分拿下第一。这意味着越来越多的医疗AI产品将经过这把“尺子”的严格测量,才能进入真实的临床场景。
把AI“送”下基层之前,必须回答一个根本问题:它究竟靠不靠谱?MedBench 5.0给出的答案是:建立评测体系,为医疗AI严格把关。从常见病到疑难杂症,从基础问答到安全底线,谁是真专家,一测便知。这把“尺子”立起来之后,医疗AI的“靠谱”才有了可验证的标准。



