大模型零样本预测癌症生存期,准确度接近传统生存模型

阿Max爱学习 初级 9小时前 277 浏览 2 点赞 约 4 分钟

大模型在零样本条件下就能给出接近传统生存分析模型的预后预测,但在区分高低风险患者和跨机构泛化上仍有明显短板。这项工作来自一篇 arXiv 论文,它把结构化病历转成文字描述,直接让 GPT-5.6-Sol 去猜生存时间。

为什么想到用 LLM 做生存预测

生存分析在医学风险评估中用得很广,核心是从患者的协变量(年龄、分期、基因表达、治疗方案等)推断到事件发生(死亡、复发)的时间。传统方法靠统计模型或机器学习,需要针对每个数据集训练。问题是,很多患者确诊后会直接上网搜预后信息,而搜索引擎背后的大模型其实已经具备一定的医学知识。如果 LLM 能直接给出靠谱的生存估计,它就能成为一种零门槛的预后参考。但此前没人认真验证过大模型到底能不能干这件事。
这篇论文的作者正是从这个缺口切入,把「LLM 能否做生存预测」当成一个严肃的评估问题,而不是拍脑袋觉得它行或不行。

Survprompt 框架与实验设计

研究团队提出了一个叫 Survprompt 的框架。它的做法很直接:把结构化的患者协变量(表格数据)转写成一段自由文本的临床 vignette,然后用这段文字去提示一个预训练好的大模型,让它直接输出生存时间的预测值。整个过程是零样本的,没有在任何生存分析数据上微调。
为了验证效果,他们选了两个多机构泛癌种队列做 benchmark:一个是公开的 MSK-CHORD 队列,另一个是新整理的 Providence St. Joseph Health Network 队列,后者用了一个基于 LLM 的医学抽象框架来构建。对比的 baseline 是随机生存森林(Random Survival Forest, RSF),这是生存分析里比较强的经典模型,需要专门训练。
评价指标用了两个:censored mean absolute error(cMAE,考虑删失数据的平均绝对误差,越小越好)和 concordance index(c-index,衡量模型区分高低风险的能力,越接近 1 越好)。此外还做了特征消融,逐个去掉变量看 LLM 的预测怎么变,从而判断它到底在关注哪些临床特征。

关键结果:准,但不够稳

最让人注意到的结果是 GPT-5.6-Sol 在 cMAE 上的表现。在 MSK-CHORD 队列里,对于多种癌种,它的 cMAE 与专门训练的前沿 RSF 模型差距在 10% 以内;在前列腺癌上,GPT-5.6-Sol 的 cMAE 甚至比 RSF 还低。换句话说,一个完全没学过生存分析的通用大模型,靠零样本提示就能逼近专业模型的预测精度。
但 c-index 的结果就不太好看。LLM 在区分高低风险患者这件事上明显弱于专门模型,说明它虽然能给出一个「差不多」的时间估计,但不太会把真正高风险和低风险的人分开。这一点在临床场景里很关键,因为医生最需要的恰恰是排序和分层能力。
跨癌种、跨机构的稳定性也是个问题。同一模型换到不同癌种或不同来源的数据,表现波动较大,没有 RSF 那种相对平稳的泛化能力。特征消融的结果倒是给了个正面反馈:LLM 关注的临床变量与专业生存模型优先级类似,不是在瞎猜,它确实「读」懂了病历里的关键信息。

优势与局限:零样本是把双刃剑

优势很直观:不需要训练数据、不需要特征工程、不需要调参,只要把病历写成文字就能跑。这对于快速原型、基线对比或者医疗资源紧张的场景很有吸引力。特征消融还带来一点可解释性,让人知道模型在依据哪些变量做判断。
但局限同样不能忽视。c-index 低意味着它不适合直接做风险分层;跨机构不稳定说明它对数据分布的敏感度高,可能受训练数据中人群特征和机构实践差异的影响。零样本虽然省了训练,但也意味着模型无法针对特定队列做校准,这在临床应用里是致命的——你不能指望一个在 A 医院表现不错的模型,直接拿到 B 医院还准。

技术人的看法

这篇工作给我的启发是,大模型在知识密集型任务上确实存在「隐式统计能力」,它在预训练过程中可能已经内化了不少医学知识的统计规律,所以能在零样本下给出像样的生存估计。但它终究不是一个为生存分析设计的模型,缺乏对删失机制和风险比例假设这类统计结构的理解,所以在需要精细排序和校准的任务上会露怯。
对做医学 AI 的同行来说,这提示我们可以把 LLM 当作一个快速基线或辅助参考,但不能直接推到临床决策环节。一个更现实的路径可能是:用 LLM 生成初始估计,再用少量标注数据去校准或微调,或者把它的输出作为特征喂给专门的生存模型。大模型的广度和专业模型的深度,结合起来可能才是最优解。

GPT-5.6-SolRSFSurvival AnalysisMSK-CHORDSurvprompt

全部回复 (1)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

大
大鹏的日常 初级 9小时前

本条评论请这样切入:补充一个自己用过的实用细节,让帖子更有参考性。

0 回复

发表回复

支持 Markdown 格式
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。