AI大模型进临床,距离真正落地还有多远?——《自然·医学》最新系统综述深度解读

LLM-assisted systematic review of large language models in clinical medicine
摘要
本文系统梳理了2022年1月至2025年9月间发表的4,609篇关于大语言模型(LLM)在临床医学中应用的同行评审研究,每天约有3.2篇相关论文发表。研究发现:仅有1,048项研究使用了真实患者数据,其中仅19项为前瞻性随机对照试验;ChatGPT系列模型占所有评估模型的65.7%;在1,046次人机对比中,LLM仅在33%的对比中超越人类专家。证据表明,在临床医学正式大规模采纳LLM之前,亟需开展更大规模、以患者为中心的前瞻性临床试验。
原文PDF可通过 https://t.zsxq.com/oUpUa 或者文末阅读原文获取
一、背景:一场医疗AI的范式革命
2022年11月,ChatGPT横空出世,大语言模型(Large Language Model,LLM)在医学人工智能领域掀起了一场深刻的范式变革。
与以往需要大量标注数据和针对性训练的传统AI模型不同,LLM展现出三种革命性能力:
涌现推理(Emergent Reasoning):LLM能够自发呈现出复杂的问题求解和抽象推断能力,这些能力并非被明确编程进去的。
上下文学习(In-context Learning):模型能够通过提示词中提供的示例或信息来适应全新任务,无需重新训练。
指令遵循(Instruction Following):模型具备按用户意图准确解读和执行自然语言命令的能力。
这三大能力的组合,使LLM在临床医学领域的应用前景极为广阔——从回答患者医疗问题、总结临床笔记和文献,到辅助复杂病例的临床决策;从简化医疗文档到支持医学教育,乃至直接执行医疗操作性任务。
早期研究已证明,GPT-3.5、GPT-4和PaLM-2等通用LLM能够在美国医师执照考试(USMLE)等标准化医学考试中达到或接近通过水平。此后的研究将评测范围扩展到越来越多的独特任务和专科领域,将LLM与临床医生或患者生成的数据进行基准对比。
然而,随着出版量和出版速度的不断攀升,LLM在真实世界临床场景中的影响至今仍难以准确评估。许多备受关注的研究基于模拟情境,属于回顾性或窄范围的研究。过去虽有系统综述评估LLM在临床医学中的安全性、公平性和透明度,但这些综述受限于研究范围,且通常以人工方式开展,存在可扩展性和可重复性方面的缺陷。

二、研究方法:以LLM之矛,攻LLM之盾
本研究最大的方法论创新在于:用LLM来筛查、分类和分析关于LLM的文献——以子之矛,攻子之盾。
2.1 文献检索
研究团队检索了PubMed、Embase和Scopus三大数据库,检索关键词包括"大语言模型"、"GPT"、"ChatGPT"及其他常见语言模型名称,最终获得:
-
Embase:8,666条记录
-
PubMed:5,633条记录
-
Scopus:9,315条记录
-
去重后共计:12,894项独立研究
2.2 AI辅助筛查
面对如此庞大的文献量,人工逐一筛查几乎不可能完成。研究团队采用GPT-5(推理模式设置为"高")构建了基于LLM的自动化筛查流水线,并通过与人工筛查结果对比进行验证。
人工验证结果:
-
两组独立人工审核团队之间的一致性(Cohen's κ)为0.741(95%置信区间:0.685–0.796)
-
GPT-5与人工裁定结果的一致性(Cohen's κ)高达0.820(95%置信区间:0.765–0.870),甚至优于两组人工审核之间的一致性
筛查准确性:
-
纳入灵敏度:0.911(95%CI:0.866–0.952)
-
排除特异性:0.921(95%CI:0.892–0.949)
最终,LLM筛查纳入了4,609项研究。
2.3 证据分级体系
研究团队创建了一套LLM医学研究的证据分级框架,共分四级:
|
等级 |
定义 |
代表性描述 |
|---|---|---|
|
Tier S(金标准) |
在真实临床环境中对已部署系统进行前瞻性随机对照评估 |
RCT,实时临床数据,随机盲法 |
|
Tier I(强证据) |
对真实临床数据进行回顾性或前瞻性分析 |
真实电子病历,无需现场部署 |
|
Tier II(中等证据) |
模拟临床情境、开放性问答或主观患者评分 |
患者对话模拟、常见问题解答、开放性临床小品 |
|
Tier III(低证据) |
执照考试、多项选择题、具有明确答案的案例小品 |
"这是什么诊断?"、知识检索 |
LLM分级任务的整体宏平均灵敏度为0.822(95%CI:0.772–0.869),特异性为0.896(95%CI:0.868–0.923)。值得注意的是,LLM所犯的错误中,84.8%为"相差一级"的错误,且略微偏向于将研究分配到更高级别(53.9%的错误为高估一级)。
三、核心发现:数量爆发,质量参差
3.1 发表趋势:每天3.2篇,增速惊人
在2022年1月至2025年9月期间,临床医学LLM相关研究以每天约3.2篇的速度持续发表。ChatGPT发布后,月发表量呈线性增长(R²=0.84),增速约为每月7.04篇。
然而,从研究类型来看,高质量研究的增速远不及总体增速:
-
Tier II(模拟数据)研究增速(每月3.03篇)显著高于Tier I(真实数据)研究增速(每月2.03篇,P=0.02)
-
Tier S(随机对照试验)研究的增速由于样本太少,统计上难以评估
第一项Tier S研究发表于2024年7月23日,是一项关于LLM戒烟干预(QuitBot)的随机对照试验,结果显示QuitBot显著优于对照组(比值比OR=2.58,95%CI:1.34–4.99,P=0.005)。据研究者所知,这不仅是首个涉及LLM的随机对照试验,也是首个LLM随机对照试验证明其优于现有成熟对照方法的研究。

[图2 — 各分级研究随时间的发表趋势图,包括各Tier的累积发表曲线和月度发表量折线图]
3.2 研究对象分布:OpenAI一家独大
在已评估的模型中,ChatGPT及OpenAI相关模型占据压倒性主导地位:
-
OpenAI系列模型(含ChatGPT、GPT-4等):65.7%
-
Google Gemini/Bard:13.1%
-
Inflection的"Pi"聊天机器人:仅4项研究
-
Google Assistant:仅4项研究
-
Amazon Alexa:仅3项研究
后两个模型在家庭和移动设备中极为普及,却极少受到研究关注。研究者指出,完全可以想象这样的场景:用户自发向家庭设备寻求医疗建议(例如"Hey Alexa,我切洋葱时手指割得很深,我该怎么办?"),但这类真实使用场景至今缺乏系统研究。
此外,闭源模型被研究的频率远高于开源模型,占所有被评估模型的87.7%,且这一比例在各证据分级间无显著差异。

[图3b — 各LLM被研究次数的横向柱状图]
3.3 任务类型分布:知识问答霸榜,真实应用偏少
每项研究平均评估1.93项任务,最常见的评估任务为:
- 患者沟通与教育
:1,545项研究(占所有任务的17.4%)
- 知识检索与临床问答
:1,128项研究(12.7%),包括多选题、临床小品、患者问答等
- 教育、评估与模拟
:1,064项研究(12.0%)
- 诊断推理与疾病检测
:979项研究(11.0%)
- 临床管理与工作流程指导
:833项研究(9.36%)
3.4 数据集类型:考试题目泛滥,真实病历稀缺
约四分之一的摘要(23.7%)未提及所评估的数据集类型。在明确提及数据集的研究中:
-
临床执照考试与自我评估题目:22.7%(最常见)
-
患者问答和常见问题解答:15.0%
-
临床小品和案例报告:14.2%
-
临床指南和共识声明:12.6%
-
影像数据和报告:10.2%
-
真实电子健康记录:仅9.18%
更值得关注的是,在可判断数据集开放获取性的研究中,仅**42.6%**使用了开放获取数据集,大多数研究的数据集无法被外界访问,极大地限制了研究的可重复性。

[图3a — 各数据集类型研究数量柱状图]
3.5 专科分布:高竞争专科扎堆,冷门领域严重匮乏
每项研究平均涉及1.63个专科或亚专科,最常研究的专科为:
- 内科
:1,500项研究(32.5%)
-
介入与诊断放射学:743项研究(16.1%)
-
预防医学:657项研究(14.2%)
-
骨科手术:447项研究(9.69%)
-
家庭医学:422项研究(9.16%)
在外科研究中,骨科手术(33.0%)、耳鼻喉科(23.7%)、泌尿外科(22.0%)最为集中。在内科亚专科中,肿瘤科(28.3%)、心脏病科(15.2%)、睡眠医学(12.9%)位居前三。
研究团队分析认为,这些专科大多竞争激烈,可能存在更大的发表压力。然而,这同时也意味着许多其他医学和外科专科存在严重的研究空白,亟待探索。

[图3c — 各专科研究占比饼图或柱状图]
四、关键争议:LLM到底有多厉害?

4.1 人机对比:LLM仅在1/3的比较中胜出
在检测到人类比较者的研究中(2,249项,占48.8%),共识别出2,983次比较。其中:
-
对比对象为医生:1,914次(64.2%),其中主治医师占78.0%、住院医师13.7%
-
对比对象为患者或公众:257次(8.6%)
在明确报告比较结果的1,046项研究中:
-
LLM优于人类比较者:345项(33.0%)
-
LLM劣于人类比较者:675项(64.5%)
-
结果混合:26项(2.49%)
4.2 任务难度与证据等级的影响
LLM的超越率与任务的真实性高度相关:
-
在Tier III(知识考试)研究中,LLM超越人类的比率(38.4%)显著高于Tier I(真实临床数据,25.9%,P<0.001)
这一发现深刻揭示了一个重要结论:LLM在知识考试中的优秀表现,并不能预测其在真实临床实践中的表现。换言之,通过执照考试不等于具备临床实战能力。
4.3 专家等级的关键影响
LLM与不同级别临床医生的对比结果呈现出明显规律:
-
LLM超越主治医师的频率显著低于超越未指明级别的医生(P<0.004)
-
LLM超越非医师临床工作者的频率也低于超越未指明级别的医生(P<0.022)
-
住院医师被LLM超越的频率比主治医师高30%(P=0.053,多重比较校正后不显著)
-
LLM超越医学生的频率高于超越主治医师(P<0.03)
核心结论:人机对比的结果高度依赖于人类比较者的训练水平——对手越强,LLM赢的可能性越低。
4.4 样本量的警示
在71.4%的研究中,摘要提及了样本量。其中:
-
样本量低于20的研究占四分之一
-
样本量低于30的研究占35%(1,151项)
因此,可以保守估计,所有纳入研究中至少25%的样本量低于30。这意味着大量研究的统计效能严重不足,相关结论需极为谨慎地解读。
五、讨论:繁荣背后的隐忧与未来路径
5.1 研究现状的结构性失衡
本综述揭示了当前临床LLM研究领域存在的深层次结构失衡:
- 4,609项研究中,仅1,048项(22.7%)使用了真实临床数据
- 仅19项为真正的随机对照试验
,且RCT出现自2024年才开始,此后增速并不显著
- 77.3%的研究(3,561项)分析的是非真实临床数据
-
22.7%的研究评估的是临床执照考试题目,14.2%评估的是临床小品
5.2 重大研究空白
开源模型研究严重不足
当前文献高度偏向闭源模型(占87.7%)。研究者强调,开源模型对于科学研究至关重要:其实验结果可以被无限期重现,而基于闭源模型的实验随时可能因模型停更而无法复现。
开放获取数据集严重缺乏
虽然临床数据的敏感性有时限制了数据开放,但开放获取数据集对于快速迭代和社区审查不可或缺。研究者同时指出,数据集的设计应以产出有意义的洞见为目标——例如,从一套仅有10道题的模拟执照考试中很难得出有意义的结论,即使作为概念验证也很勉强。
专科覆盖极度不均衡
部分热门专科(骨科、肿瘤、心脏病等)研究扎堆,而大量医学和外科专科的LLM研究几乎空白。这一研究空白不仅令人担忧,也意味着巨大的探索机遇。
人机比较标准不够严格
研究者强调,在涉及人类比较者的任何阶段,应将生成式AI模型与被测任务领域的专家进行比较,而非随意选取其他领域的合格临床医生。例如,一个用于解读皮肤活检的生成式模型,应与经过认证的皮肤病理学家比较,而非与病理科医生、皮肤科医生、住院医师或研究员比较。以训练生为主要对比对象的研究,除非有充分的研究动机或属于概念验证性低证据研究,否则应被明确劝阻。
5.3 研究路线图:从零到临床的四步走
本研究为将生成式AI引入临床实践提出了清晰的研究路线图:
第一步(Tier III):如尚无某临床应用的基础研究,先开展知识与能力评估,测试生成式模型的原始知识和能力。
第二步(Tier II):在安全、资源消耗较低的模拟情境中研究模型行为,既保障安全性,又能以较低成本获得初步洞见。
第三步(Tier I):在充足样本量的前提下,对模型进行真实世界数据的评估,包括回顾性和前瞻性研究,覆盖未来部署所期望的完整范围。
第四步(Tier S):最终在临床环境中通过随机对照试验部署模型,以终点指标衡量其临床价值。
研究者的最终建议是:在完成充分的前瞻性验证(Tier I研究)后,LLM应当也能够进入随机对照试验阶段,以证明其实用性并正式进入临床实践。
六、方法论创新:用AI审AI的可靠性验证
本研究在方法论层面最为突出的创新,是对"LLM辅助文献综述"可靠性的严格验证。
研究团队采用了双层验证设计:
筛查阶段验证:随机抽取500篇文献,由两组各5名独立审核员(医学生、研究生、住院医师)进行评审,GPT-5的一致性(κ=0.820)高于人工组间一致性(κ=0.741)。
分级阶段验证:随机抽取250篇已纳入研究,由两组各4名审核员进行证据分级,GPT-5的一致性(κ=0.695)与人工组间一致性(κ=0.645)相近,且错误分级中84.8%仅偏差一个等级。
贝叶斯建模估算显示,真实纳入研究数约为4,361项(95%CI:3,838–4,906),与LLM实际筛查结果4,609项相差不足1%。
这一严格的方法论验证不仅为本研究结论提供了坚实基础,也为未来利用AI开展大规模文献综述树立了方法论范本。
七、局限性
研究团队坦诚地承认了以下主要局限:
仅分析摘要,未分析全文:出于合规性考虑,自动化分析仅基于文章题目和摘要,而非全文。临床重要的方法论细节、数据质量等信息可能无法从摘要中完整提取。
领域特定LLM评估不足:由于专门针对临床应用进行训练和微调的领域特定LLM所需数据稀缺、训练成本高昂,此类模型的相关研究极少,本综述对其表现无法有效评估。许多"专科模型"实际上是在通用基础模型上叠加提示词工程或检索增强生成(RAG)技术,本研究未对其单独分析。
聚合指标的局限:涵盖广泛领域和任务的汇总统计数据应谨慎解读,因为不同领域和用例在本质上存在根本差异,将其同质化处理会限制结论的深度。
价格下降带来的未来可能性:随着LLM上下文长度的快速增长和API调用成本的持续下降,未来针对数千篇研究的全文自动化分析将成为可能,届时将进一步提升系统综述的深度与精度。
八、结论
这篇发表于《自然·医学》的系统综述以其空前的规模和方法论创新,为我们提供了一幅当前临床LLM研究领域的全景图像。核心发现可以用四句话概括:
-
研究总量惊人,但高质量证据极度稀缺——4,609篇论文中,仅19项为随机对照试验。
-
LLM在考题上表现优异,但在真实临床中仍落后于人类专家——人机对比中,LLM仅在33%的案例中胜出,且随任务真实性和医生专业水平的提升而胜率递减。
-
研究结构严重失衡——闭源模型、知识考试类任务、少数热门专科三者占据了研究版图的绝大部分;开源模型、真实患者数据、冷门专科严重缺乏。
-
路径清晰,前景可期——现有RCT初步成果令人鼓舞(如QuitBot戒烟研究),说明LLM在特定场景下已具备超越传统方法的潜力。
对于企事业单位中的专业决策者和投资人而言,这一综述传递出一个清醒的信号:在将LLM纳入临床决策流程或医疗产品之前,必须要求供应商提供经过严格前瞻性验证的证据,而非仅凭考试成绩或模拟场景下的亮眼表现。热门专科的研究泡沫与冷门领域的研究真空并存,也提示投资者需警惕"伪需求"陷阱,将目光投向真正存在研究空白、临床价值尚待挖掘的应用方向。大模型进临床,路已清晰,但终点仍远。
这不是一场技术的独角戏,而是一次需要临床医学、统计学、伦理学与工程学共同参与的系统工程。从每天3.2篇论文的喧嚣,到19项随机对照试验的沉默,这一鲜明对比本身,便是这个领域最诚实的自画像。真正的落地,始于第一个被患者受益所验证的随机对照试验,而非第一个通过执照考试的聊天机器人。
对于每一位站在这一领域门口的研究者、临床医生或决策者而言,这篇综述既是一面镜子,也是一张地图。镜子照出了繁荣表象下的空洞;地图则标注了前方真正值得跋涉的路径。数字不会说谎:4,609篇论文堆砌出的,不是一座已建成的大厦,而是一片尚待夯实地基的工地。我们所需要的,不是更多的论文,而是更好的论文;不是更快的发表,而是更深的验证。
当第一批真正经过随机对照验证、以患者结局为终点的LLM临床研究相继发表之日,才是这场革命真正意义上的起点。在此之前,所有的热情都应当被审慎所约束,所有的承诺都应当被证据所背书。医学的本质从未改变:无论工具多么智能,治愈与关怀的责任,始终落在经过验证的实践之上,而非未经检验的期许之中。
这是一个需要耐心的时代。大模型的能力边界仍在扩展,临床验证的齿轮也在缓慢咬合。我们无需悲观,亦不必狂热。最稳健的姿态,是以科学家的严谨丈量每一步进展,以临床医生的责任感守护每一位患者,以决策者的远见为真正有价值的研究清除障碍。历史终将证明:在医学与人工智能的交汇处,慢即是快,稳即是远。
而那19项随机对照试验,不是终点的遥远,而是黎明的先兆。每一项严谨的前瞻性研究,都是写在患者身上的承诺;每一个被真实数据验证的模型,都是技术向人性俯首的证明。这条路不会因为论文数量的堆砌而自动抵达,只会因为每一位选择做难事、做正确之事的研究者而一步步延伸。大模型进临床,我们正走在最关键的一段路上。
更多推荐

所有评论(0)