摘要:《临床影像学》最新调查显示,FDA批准的乳腺癌AI诊断工具在临床实际中远未达到放射科医生预期。本文拆解预期与现实之间的巨大落差、FDA审批的“低门槛”问题,以及AI在乳腺癌筛查中的真实定位。

8月11日,《临床影像学》发表了一项调查。

加州大学圣地亚哥分校健康中心的研究团队问了215名乳腺影像学会的放射科医生。问题很简单:你们用的那些FDA批准的乳腺癌AI诊断工具,到底怎么样?

答案不怎么好看。

预期和现实,差了一个量级

47%的受访医生已经在日常工作中使用FDA批准的AI诊断工具,11.2%计划引入,41.8%还没用。

但真正有意思的数据,是把“没用的人怎么想”和“用了的人怎么说”放在一起看。

没用AI的医生里,59.3%预期AI能降低召回率。实际用了的人里,只有34.7%报告确实降了。

没用的人里,36.4%预期AI能减少不必要的活检。实际用了的人里,只有9.1%说做到了。

没用的人里,56%预期AI能减轻职业倦怠。实际用了的人里,只有29.4%感到负担减轻了。

每一组差距都在20个百分点以上。活检那项差了27个百分点。

这不是“效果不如预期”的问题。这是预期和现实之间,隔着一道鸿沟。

医生拿AI当什么用

调查还发现了一件事:绝大多数医生把AI定位成“第二读者”——相当于多一个人帮你复核,但不是决策者。只有极少数人把它当成决定性因素。

这个定位本身就是一种信号。如果AI真的足够可靠,医生不会只拿它当参考。医生们心里清楚这东西的边界在哪里。

FDA审批的标准,跟你想的不一样

为什么会出现这么大的落差?问题不全在AI本身,也在FDA的审批逻辑上。

华盛顿大学放射科教授Christoph Lee说过一句话:“FDA的审批流程对AI软件来说门槛非常低。他们根本没设计来确保人口层面的有效性。”

FDA批一个AI诊断工具,看的主要是它在特定数据集上的表现——敏感度够不够、特异度高不高。但这跟“放进真实的影像科日常流程里能不能帮上忙”是两回事。

真实世界里有不同的患者人群、不同的设备、不同的操作习惯、不同的阅片流程。一个在实验室数据上跑得很漂亮的算法,进了真实诊室可能就哑火了。

单读片和双读片的差距

另一个被忽略的因素是阅片模式。

欧洲很多国家采用双读片制——两张片子两个人看,意见不一致再讨论。在这种模式下,AI辅助的优势更容易显现。MASAI试验就显示AI辅助乳腺X线摄影能找到更多间期癌、减少放射科医生工作量。

但美国主流是单读片——一个放射科医生自己看完就出报告。

约翰霍普金斯大学的一项研究专门验证了这个问题。他们用FDA批准的AI判读工具Transpara(ScreenPoint Medical生产)分析了24520份筛查乳腺X线摄影,对比实施AI前的21630份。结果呢?召回率从12.3%变成12.8%,癌症检出率从每千人中6.7例变成7.0例——统计上都没有显著差异。

在双读片系统里AI能帮上忙,在单读片系统里几乎没变化。你拿欧洲试验的数据去预期美国临床的效果,落差是注定的。

真正拦住AI的是什么

调查还问了医生们为什么不用AI。排第一的原因是实施成本——53.3%的人提到了这一点。其次是准确性和可靠性担忧、缺乏足够证据支持、以及可能的工作流程中断。

成本问题不只是买软件的钱。影像科要接入AI,需要IT改造、员工培训、流程重构。对于已经超负荷运转的科室来说,为一个效果不确定的工具投入这么多,算不过账。

AI不该被神化,也不该被否定

这篇调查的结论写得很克制:“这些初步观察表明,需要对乳腺癌检测AI工具进行持续优化和进一步验证,才能对临床实践产生有意义的影响。”

翻译一下:这东西有点用,但远没到取代医生的程度。

十多年前就有人预测放射科医生会被AI取代。黄仁勋批评过这种论调,管它叫“上帝情结”。这次调查用数据证明了——在医疗这种高度专业的领域,AI落地从来不是一蹴而就的事。

FDA批了不等于临床好用。实验室数据漂亮不等于真实世界有效。放射科医生对AI的预期,需要从“它能做什么”拉回到“它在现有流程里到底能帮多少”。

这不是AI不行。这是我们对AI的期待,跑得比技术本身快了一点。