JAMA 文章指监管设人工瓶颈,建议让 AI 自主诊断并设医生为熔断开关

PromptCube 中级 2026/8/19 712 浏览 8 点赞 约 2 分钟

在 JAMA(美国医学会杂志)刊出的一篇观点文章中,作者直接将矛头对准监管层:既然在医学推理任务上,全自主 AI 系统的上限大概率高于“医生+AI”的人机组合,那么把“必须由医生拍板”写入法规,是否只是在系统中添加了一个不必要的人工瓶颈?

JAMA 文章指监管设人工瓶颈,建议让 AI 自主诊断并设医生为熔断开关

第一作者 Jonathan H. Chen 来自斯坦福医学院,专攻临床信息学与大模型评测。文章引用的证据链主要源自过去两年 NEJM AI、Lancet Digital Health 和 Nature Medicine 发表的对比实验:无论是罕见病鉴别诊断、ICU 脓毒症早期预警,还是放射影像分级,纯模型推理在准确率、召回率和 F1 值上,均统计学显著优于“模型建议→医生复核→医生决策”的串联流程。即便使用 GPT-4o、Claude 3.5 Sonnet 或 Med-Gemini 等顶配模型与资深专家对比,结论依然成立。

作者指出三种导致人机协作降低准确率的机制。首先是认知卸载悖论,医生得知 AI 完成初筛后,注意力会收缩至 AI 标注区域,忽略未关注的负向关键信息,这是 automation bias 的一种变体;而纯 AI 无需承担信任校准负担,全量注意力机制能天然覆盖全特征空间。其次是延迟放大效应,人机串联带来的“读取-思考-下单”分钟级甚至小时级延迟,在急危重症中直接转化为死亡率,全自主模式则将端到端延迟压缩至秒级。第三是责任归属模糊引发的防御性决策,因法规要求最终签字,医生倾向将模糊案例推向再观察或会诊,而纯 AI 可通过置信度阈值、回溯审计和责任保险配置更激进且准确的路径。

尽管证据有力,作者承认结论中 95% 源于回顾性模拟、影子模式和合成病例,真实前瞻性 RCT 近乎空白。最接近实战的是去年 Duke Health 的急诊分诊影子试验,模型运行三个月仅输出建议,AUC 较护士分诊高出 0.07。但在进入模型直接给出分诊等级的准实验阶段时,IRB 叫停试验,导致无法获取真实结局数据。

监管因此陷入死结。FDA 对“临床决策支持软件”的豁免条款(21 CFR 820.30)要求不能替代临床判断;EU AI Act 将医疗诊断 AI 列为 High-risk 并强制 human-in-the-loop;中国 NMPA《医疗器械分类目录》规定涉及“自动给出诊断结论”的软件按三类器械管理,需上千例临床试验。缺乏机构率先开展“纯 AI 真实接诊”首例 RCT,证据链难以闭环,法规也无法松绑。

文章建议将医生从必经节点转为“熔断开关”:医生随时介入并配合完整审计追溯,由事后责任兜底,合规重点从“流程强制”转向“事后可查、损害可赔”。参照自动驾驶 L3/L4 逻辑,Waymo 在凤凰城运行 700 万英里无人驾驶时,安全员甚至不在车内,事故后由保险公司按算法责任比例赔偿。医疗虽更复杂,但可借鉴此范式。该文章旨在将“人必须在回路”拆解为可量化、可测试、可替代的工程指标,呼吁投入资源与 IRB 批件完成 RCT,避免模拟曲线沦为 PPT 乌托邦。

JAMA医疗AIFDA监管自主诊断临床试验

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

脚
脚本小子阿强 初级 2026/8/19

如果幻觉率降不 below 0.1%,医生在回路里就是 AI 擦屁股的工具。折中的做法是把“医生必须拍板”改为“医生可以随时介入,配合完整审计追溯,并由事后责任兜底”,让医生变成熔断开关,合规重点从流程强制转为事后可查、损害可赔。

0 回复
摸
摸鱼攻城狮 初级 2026/8/19

要是全自主AI误诊了,医院得赔多少钱?这才是监管层死磕医生的关键。就像 JAMA 发表的那篇观点文章指出的,既然在医学推理任务上,全自主 AI 系统的上限大概率高于“医生+AI”的人机组合,那么把“必须由医生拍板”写进法规,是否只是给系统增加了一个没有必要的人工瓶颈?要知道,即便把医生换成资深专家,把模型换成 GPT-4o、Claude 3.5 Sonnet 或 Med-Gemini 这类顶配,结论也没有改变。所以说,监管层死磕医生,还不如学习自动驪驾 L3/L4 的逻辑,把医生从必经节点变为“熔断开关”,配合完整审计追溯,由事后责任兜底——这样才是真正的前进方向。

0 回复
程
程序员Tom 高级 2026/8/19

去年用 AI 读片居然比我眼尖,明明标出来了但我复核时居然给漏了,后怕——这让我想起 JAMA 最近发的一篇观点文章,直接把问题指向监管层:既然在医学推理任务上,全自主 AI 系统的上限大概率高于“医生+AI”的人机组合,那么把“必须由医生拍板”写进法规,是否只是给系统增加了一个没有必要的人工瓶颈?

文章里提到一个机制特别戳人:认知卸载悖论。医生一旦知道“AI 已经完成初筛”,注意力往往会收缩到 AI 标出的区域,从而忽略模型没有关注、但临床上同样关键的负向信息。这可以看作 automation bias 的一种变体。纯 AI 不需要承担“信任校准”的心理负担,其全量注意力机制能够天然覆盖全特征空间。

说起来也类似,当时我就觉得自己标的干净利落,结果复核的时候大意了,正好中了这个圈——知道 AI 看过了,反而放松了警惕,那些 AI 没圈出来的区域,我也没再仔细看。

不过,作者也承认,目前 95% 的证据来自回顾性模拟和影子模式,真实前瞻性 RCT 几乎为零。比如去年 Duke Health 的急诊分诊影子试验,模型比护士分诊高出 0.07 AUC,结果准备进入“由模型直接给出分诊等级”时,IRB 立马叫停,没法收集真实结局数据。

所以监管现在真是进退维谋:FDA 要求“不能替代临床判断”,EU AI Act 强制 human-in-the-loop,国内 NMPA 也把“自动给出诊断结论”的软件归为三类器械……没机构敢开首例 RCT,证据链就断了,法规也不敢松。

不过作者倒是提出个折中方案:把“医生必须拍板”改为“医生可以随时介入,配合完整审计追溯,并由事后责任兜底”,就像自动驾驶的熔断开关一样,医生不作为必经节点,而是随时可以插手的开关。

我想,要不是因为法规卡住,说不定哪天连复核这一步都可以省了——直接信 AI,省得自己又中认知卸载的圈了。

0 回复

发表回复

支持 Markdown 格式
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。