JAMA 刊文直接怼监管层:别再硬塞医生进 AI 诊断回路了
作者组不是外行,第一作者是斯坦福医学院的 Jonathan H. Chen,长期混迹临床信息学和大模型评测一线。他们列举的证实链条大概是:过去两年 NEJM AI、Lancet Digital Health、Nature Medicine 接连刊出的对比实验里,无论是罕见病鉴别诊断、ICU 脓毒症早期预警,还是放射影像分级,纯模型推理的准确率、召回率、F1 值,统计学显著优于「模型给建议→医生复核→医生决策」的串联流程。哪怕把医生换成资深专家、把模型换成 GPT-4o / Claude 3.5 Sonnet / Med-Gemini 这类顶配,结论也不变。
为啥?文章给了三个机制解释,我琢磨着挺在理:
一、认知卸载悖论。医生一旦知道「AI 已经跑完初筛」,注意力会下意识收缩到 AI 标红的区域,反而容易漏掉模型没关注但临床关键的负向信息——也就是 automation bias 的变种。纯 AI 没有「信任校准」这个心理负担,全量注意力机制天然覆盖全特征空间。
二、延迟放大效应。人机串联必然引入「读报告→思考→下单」的分钟级甚至小时级延迟,急危重症场景下这段 latency 直接换算成死亡率。全自主模式下,模型输出即医嘱草案,电子病历系统可直连执行层,端到端可压到秒级。
三、责任归属模糊导致的防御性决策。只要法规规定「最终签字必须是人」,医生就会倾向于把边界模糊案例往「再观察」「再会诊」推,反而降低了干预及时性。纯 AI 只要把置信度阈值、回溯审计、责任保险三件套配齐,反而能跑出更激进也更准的临床路径。
但——这是个巨大的但——作者自己在 Discussion 里诚实招了:以上结论 95% 来自回顾性模拟 / 影子模式 / 合成病例,真实前瞻性 RCT 几乎为零。最接近实战的,是去年 Duke Health 做的急诊分诊影子试验:模型跑了三个月,只输出建议不落地,AUC 确实比护士分诊高 0.07,但一旦切到「模型直接下分诊等级」的准实验阶段,IRB 直接卡住了,根本没法收真实结局数据。
这就卡在监管的死结里:FDA 目前对「临床决策支持软件」的豁免条款(21 CFR 820.30)明确要求「不替代临床判断」,EU AI Act 把医疗诊断 AI 定为 High-risk,强制要求 human-in-the-loop;中国 NMPA《医疗器械分类目录》里,辅助诊断软件若涉及「自动给出诊断结论」直接按三类器械管,临床试验样本量动辄上千例。没人敢先跑那个「纯 AI 真实接诊」的首例 RCT,证据链就永远补不全,法规也就永远不敢松绑。
我倒觉得有个折中路径值得试:把「医生必须拍板」改成「医生可随时介入 + 完整审计追溯 + 事后责任兜底」。把人从「必经节点」降级为「熔断开关」,把合规重心从「流程强制」转到「事后可查、损害可赔」。毕竟自动驾驶 L3/L4 早就跑通了这套逻辑——Waymo 在凤凰城跑了 700 万英里无人驾驶,安全员坐后排甚至不在车上,出了事故保险公司按算法责任比例赔,没听说非要规定「方向盘必须随时有人握着」。
医疗比自动驾驶复杂?肯定。但复杂不等于不能借鉴监管范式。JAMA 这篇文的价值不在「给答案」,而在把「人必须在回路」这句咒语拆解成可量化、可测试、可替代的工程指标。下一步,得有人敢拿真金白银、真实病床、真实 IRB 批件,把那个 RCT 做起来。否则再漂亮的模拟曲线,也只是 PPT 里的乌托邦。
