图片

LLM-assisted systematic review of large language models in clinical medicine


摘要

本文系统梳理了2022年1月至2025年9月间发表的4,609篇关于大语言模型(LLM)在临床医学中应用的同行评审研究,每天约有3.2篇相关论文发表。研究发现:仅有1,048项研究使用了真实患者数据,其中仅19项为前瞻性随机对照试验;ChatGPT系列模型占所有评估模型的65.7%;在1,046次人机对比中,LLM仅在33%的对比中超越人类专家。证据表明,在临床医学正式大规模采纳LLM之前,亟需开展更大规模、以患者为中心的前瞻性临床试验。

原文PDF可通过 https://t.zsxq.com/oUpUa 或者文末阅读原文获取

一、背景:一场医疗AI的范式革命

2022年11月,ChatGPT横空出世,大语言模型(Large Language Model,LLM)在医学人工智能领域掀起了一场深刻的范式变革。

与以往需要大量标注数据和针对性训练的传统AI模型不同,LLM展现出三种革命性能力:

涌现推理(Emergent Reasoning):LLM能够自发呈现出复杂的问题求解和抽象推断能力,这些能力并非被明确编程进去的。

上下文学习(In-context Learning):模型能够通过提示词中提供的示例或信息来适应全新任务,无需重新训练。

指令遵循(Instruction Following):模型具备按用户意图准确解读和执行自然语言命令的能力。

这三大能力的组合,使LLM在临床医学领域的应用前景极为广阔——从回答患者医疗问题、总结临床笔记和文献,到辅助复杂病例的临床决策;从简化医疗文档到支持医学教育,乃至直接执行医疗操作性任务。

早期研究已证明,GPT-3.5、GPT-4和PaLM-2等通用LLM能够在美国医师执照考试(USMLE)等标准化医学考试中达到或接近通过水平。此后的研究将评测范围扩展到越来越多的独特任务和专科领域,将LLM与临床医生或患者生成的数据进行基准对比。

然而,随着出版量和出版速度的不断攀升,LLM在真实世界临床场景中的影响至今仍难以准确评估。许多备受关注的研究基于模拟情境,属于回顾性或窄范围的研究。过去虽有系统综述评估LLM在临床医学中的安全性、公平性和透明度,但这些综述受限于研究范围,且通常以人工方式开展,存在可扩展性和可重复性方面的缺陷。

图片


二、研究方法:以LLM之矛,攻LLM之盾

本研究最大的方法论创新在于:用LLM来筛查、分类和分析关于LLM的文献——以子之矛,攻子之盾。

2.1 文献检索

研究团队检索了PubMed、Embase和Scopus三大数据库,检索关键词包括"大语言模型"、"GPT"、"ChatGPT"及其他常见语言模型名称,最终获得:

  • Embase:8,666条记录

  • PubMed:5,633条记录

  • Scopus:9,315条记录

  • 去重后共计:12,894项独立研究

2.2 AI辅助筛查

面对如此庞大的文献量,人工逐一筛查几乎不可能完成。研究团队采用GPT-5(推理模式设置为"高")构建了基于LLM的自动化筛查流水线,并通过与人工筛查结果对比进行验证。

人工验证结果:

  • 两组独立人工审核团队之间的一致性(Cohen's κ)为0.741(95%置信区间:0.685–0.796)

  • GPT-5与人工裁定结果的一致性(Cohen's κ)高达0.820(95%置信区间:0.765–0.870),甚至优于两组人工审核之间的一致性

筛查准确性:

  • 纳入灵敏度:0.911(95%CI:0.866–0.952)

  • 排除特异性:0.921(95%CI:0.892–0.949)

最终,LLM筛查纳入了4,609项研究。

2.3 证据分级体系

研究团队创建了一套LLM医学研究的证据分级框架,共分四级:

等级

定义

代表性描述

Tier S(金标准)

在真实临床环境中对已部署系统进行前瞻性随机对照评估

RCT,实时临床数据,随机盲法

Tier I(强证据)

对真实临床数据进行回顾性或前瞻性分析

真实电子病历,无需现场部署

Tier II(中等证据)

模拟临床情境、开放性问答或主观患者评分

患者对话模拟、常见问题解答、开放性临床小品

Tier III(低证据)

执照考试、多项选择题、具有明确答案的案例小品

"这是什么诊断?"、知识检索

LLM分级任务的整体宏平均灵敏度为0.822(95%CI:0.772–0.869),特异性为0.896(95%CI:0.868–0.923)。值得注意的是,LLM所犯的错误中,84.8%为"相差一级"的错误,且略微偏向于将研究分配到更高级别(53.9%的错误为高估一级)。


三、核心发现:数量爆发,质量参差

3.1 发表趋势:每天3.2篇,增速惊人

在2022年1月至2025年9月期间,临床医学LLM相关研究以每天约3.2篇的速度持续发表。ChatGPT发布后,月发表量呈线性增长(R²=0.84),增速约为每月7.04篇

然而,从研究类型来看,高质量研究的增速远不及总体增速:

  • Tier II(模拟数据)研究增速(每月3.03篇)显著高于Tier I(真实数据)研究增速(每月2.03篇,P=0.02)

  • Tier S(随机对照试验)研究的增速由于样本太少,统计上难以评估

第一项Tier S研究发表于2024年7月23日,是一项关于LLM戒烟干预(QuitBot)的随机对照试验,结果显示QuitBot显著优于对照组(比值比OR=2.58,95%CI:1.34–4.99,P=0.005)。据研究者所知,这不仅是首个涉及LLM的随机对照试验,也是首个LLM随机对照试验证明其优于现有成熟对照方法的研究。

图片

[图2 — 各分级研究随时间的发表趋势图,包括各Tier的累积发表曲线和月度发表量折线图]

3.2 研究对象分布:OpenAI一家独大

在已评估的模型中,ChatGPT及OpenAI相关模型占据压倒性主导地位:

  • OpenAI系列模型(含ChatGPT、GPT-4等):65.7%

  • Google Gemini/Bard:13.1%

  • Inflection的"Pi"聊天机器人:仅4项研究

  • Google Assistant:仅4项研究

  • Amazon Alexa:仅3项研究

后两个模型在家庭和移动设备中极为普及,却极少受到研究关注。研究者指出,完全可以想象这样的场景:用户自发向家庭设备寻求医疗建议(例如"Hey Alexa,我切洋葱时手指割得很深,我该怎么办?"),但这类真实使用场景至今缺乏系统研究。

此外,闭源模型被研究的频率远高于开源模型,占所有被评估模型的87.7%,且这一比例在各证据分级间无显著差异。

图片

[图3b — 各LLM被研究次数的横向柱状图]

3.3 任务类型分布:知识问答霸榜,真实应用偏少

每项研究平均评估1.93项任务,最常见的评估任务为:

  1. 患者沟通与教育

    :1,545项研究(占所有任务的17.4%)

  2. 知识检索与临床问答

    :1,128项研究(12.7%),包括多选题、临床小品、患者问答等

  3. 教育、评估与模拟

    :1,064项研究(12.0%)

  4. 诊断推理与疾病检测

    :979项研究(11.0%)

  5. 临床管理与工作流程指导

    :833项研究(9.36%)

3.4 数据集类型:考试题目泛滥,真实病历稀缺

约四分之一的摘要(23.7%)未提及所评估的数据集类型。在明确提及数据集的研究中:

  • 临床执照考试与自我评估题目:22.7%(最常见)

  • 患者问答和常见问题解答:15.0%

  • 临床小品和案例报告:14.2%

  • 临床指南和共识声明:12.6%

  • 影像数据和报告:10.2%

  • 真实电子健康记录:仅9.18%

更值得关注的是,在可判断数据集开放获取性的研究中,仅**42.6%**使用了开放获取数据集,大多数研究的数据集无法被外界访问,极大地限制了研究的可重复性。

图片

[图3a — 各数据集类型研究数量柱状图]

3.5 专科分布:高竞争专科扎堆,冷门领域严重匮乏

每项研究平均涉及1.63个专科或亚专科,最常研究的专科为:

  • 内科

    :1,500项研究(32.5%)

  • 介入与诊断放射学:743项研究(16.1%)

  • 预防医学:657项研究(14.2%)

  • 骨科手术:447项研究(9.69%)

  • 家庭医学:422项研究(9.16%)

在外科研究中,骨科手术(33.0%)、耳鼻喉科(23.7%)、泌尿外科(22.0%)最为集中。在内科亚专科中,肿瘤科(28.3%)、心脏病科(15.2%)、睡眠医学(12.9%)位居前三。

研究团队分析认为,这些专科大多竞争激烈,可能存在更大的发表压力。然而,这同时也意味着许多其他医学和外科专科存在严重的研究空白,亟待探索。

图片

[图3c — 各专科研究占比饼图或柱状图]


四、关键争议:LLM到底有多厉害?

图片

4.1 人机对比:LLM仅在1/3的比较中胜出

在检测到人类比较者的研究中(2,249项,占48.8%),共识别出2,983次比较。其中:

  • 对比对象为医生:1,914次(64.2%),其中主治医师占78.0%、住院医师13.7%

  • 对比对象为患者或公众:257次(8.6%)

在明确报告比较结果的1,046项研究中:

  • LLM优于人类比较者:345项(33.0%

  • LLM劣于人类比较者:675项(64.5%

  • 结果混合:26项(2.49%)

4.2 任务难度与证据等级的影响

LLM的超越率与任务的真实性高度相关:

  • 在Tier III(知识考试)研究中,LLM超越人类的比率(38.4%)显著高于Tier I(真实临床数据,25.9%,P<0.001)

这一发现深刻揭示了一个重要结论:LLM在知识考试中的优秀表现,并不能预测其在真实临床实践中的表现。换言之,通过执照考试不等于具备临床实战能力。

4.3 专家等级的关键影响

LLM与不同级别临床医生的对比结果呈现出明显规律:

  • LLM超越主治医师的频率显著低于超越未指明级别的医生(P<0.004)

  • LLM超越非医师临床工作者的频率也低于超越未指明级别的医生(P<0.022)

  • 住院医师被LLM超越的频率比主治医师高30%(P=0.053,多重比较校正后不显著)

  • LLM超越医学生的频率高于超越主治医师(P<0.03)

核心结论:人机对比的结果高度依赖于人类比较者的训练水平——对手越强,LLM赢的可能性越低。

4.4 样本量的警示

在71.4%的研究中,摘要提及了样本量。其中:

  • 样本量低于20的研究占四分之一

  • 样本量低于30的研究占35%(1,151项)

因此,可以保守估计,所有纳入研究中至少25%的样本量低于30。这意味着大量研究的统计效能严重不足,相关结论需极为谨慎地解读。


五、讨论:繁荣背后的隐忧与未来路径

5.1 研究现状的结构性失衡

本综述揭示了当前临床LLM研究领域存在的深层次结构失衡:

  • 4,609项研究中,仅1,048项(22.7%)使用了真实临床数据
  • 仅19项为真正的随机对照试验

    ,且RCT出现自2024年才开始,此后增速并不显著

  • 77.3%的研究(3,561项)分析的是非真实临床数据
  • 22.7%的研究评估的是临床执照考试题目,14.2%评估的是临床小品

5.2 重大研究空白

开源模型研究严重不足

当前文献高度偏向闭源模型(占87.7%)。研究者强调,开源模型对于科学研究至关重要:其实验结果可以被无限期重现,而基于闭源模型的实验随时可能因模型停更而无法复现。

开放获取数据集严重缺乏

虽然临床数据的敏感性有时限制了数据开放,但开放获取数据集对于快速迭代和社区审查不可或缺。研究者同时指出,数据集的设计应以产出有意义的洞见为目标——例如,从一套仅有10道题的模拟执照考试中很难得出有意义的结论,即使作为概念验证也很勉强。

专科覆盖极度不均衡

部分热门专科(骨科、肿瘤、心脏病等)研究扎堆,而大量医学和外科专科的LLM研究几乎空白。这一研究空白不仅令人担忧,也意味着巨大的探索机遇。

人机比较标准不够严格

研究者强调,在涉及人类比较者的任何阶段,应将生成式AI模型与被测任务领域的专家进行比较,而非随意选取其他领域的合格临床医生。例如,一个用于解读皮肤活检的生成式模型,应与经过认证的皮肤病理学家比较,而非与病理科医生、皮肤科医生、住院医师或研究员比较。以训练生为主要对比对象的研究,除非有充分的研究动机或属于概念验证性低证据研究,否则应被明确劝阻。

5.3 研究路线图:从零到临床的四步走

本研究为将生成式AI引入临床实践提出了清晰的研究路线图:

第一步(Tier III):如尚无某临床应用的基础研究,先开展知识与能力评估,测试生成式模型的原始知识和能力。

第二步(Tier II):在安全、资源消耗较低的模拟情境中研究模型行为,既保障安全性,又能以较低成本获得初步洞见。

第三步(Tier I):在充足样本量的前提下,对模型进行真实世界数据的评估,包括回顾性和前瞻性研究,覆盖未来部署所期望的完整范围。

第四步(Tier S):最终在临床环境中通过随机对照试验部署模型,以终点指标衡量其临床价值。

研究者的最终建议是:在完成充分的前瞻性验证(Tier I研究)后,LLM应当也能够进入随机对照试验阶段,以证明其实用性并正式进入临床实践。


六、方法论创新:用AI审AI的可靠性验证

本研究在方法论层面最为突出的创新,是对"LLM辅助文献综述"可靠性的严格验证。

研究团队采用了双层验证设计:

筛查阶段验证:随机抽取500篇文献,由两组各5名独立审核员(医学生、研究生、住院医师)进行评审,GPT-5的一致性(κ=0.820)高于人工组间一致性(κ=0.741)。

分级阶段验证:随机抽取250篇已纳入研究,由两组各4名审核员进行证据分级,GPT-5的一致性(κ=0.695)与人工组间一致性(κ=0.645)相近,且错误分级中84.8%仅偏差一个等级。

贝叶斯建模估算显示,真实纳入研究数约为4,361项(95%CI:3,838–4,906),与LLM实际筛查结果4,609项相差不足1%。

这一严格的方法论验证不仅为本研究结论提供了坚实基础,也为未来利用AI开展大规模文献综述树立了方法论范本。


七、局限性

研究团队坦诚地承认了以下主要局限:

仅分析摘要,未分析全文:出于合规性考虑,自动化分析仅基于文章题目和摘要,而非全文。临床重要的方法论细节、数据质量等信息可能无法从摘要中完整提取。

领域特定LLM评估不足:由于专门针对临床应用进行训练和微调的领域特定LLM所需数据稀缺、训练成本高昂,此类模型的相关研究极少,本综述对其表现无法有效评估。许多"专科模型"实际上是在通用基础模型上叠加提示词工程或检索增强生成(RAG)技术,本研究未对其单独分析。

聚合指标的局限:涵盖广泛领域和任务的汇总统计数据应谨慎解读,因为不同领域和用例在本质上存在根本差异,将其同质化处理会限制结论的深度。

价格下降带来的未来可能性:随着LLM上下文长度的快速增长和API调用成本的持续下降,未来针对数千篇研究的全文自动化分析将成为可能,届时将进一步提升系统综述的深度与精度。


八、结论

这篇发表于《自然·医学》的系统综述以其空前的规模和方法论创新,为我们提供了一幅当前临床LLM研究领域的全景图像。核心发现可以用四句话概括:

  1. 研究总量惊人,但高质量证据极度稀缺——4,609篇论文中,仅19项为随机对照试验。

  2. LLM在考题上表现优异,但在真实临床中仍落后于人类专家——人机对比中,LLM仅在33%的案例中胜出,且随任务真实性和医生专业水平的提升而胜率递减。

  3. 研究结构严重失衡——闭源模型、知识考试类任务、少数热门专科三者占据了研究版图的绝大部分;开源模型、真实患者数据、冷门专科严重缺乏。

  4. 路径清晰,前景可期——现有RCT初步成果令人鼓舞(如QuitBot戒烟研究),说明LLM在特定场景下已具备超越传统方法的潜力。

对于企事业单位中的专业决策者和投资人而言,这一综述传递出一个清醒的信号:在将LLM纳入临床决策流程或医疗产品之前,必须要求供应商提供经过严格前瞻性验证的证据,而非仅凭考试成绩或模拟场景下的亮眼表现。热门专科的研究泡沫与冷门领域的研究真空并存,也提示投资者需警惕"伪需求"陷阱,将目光投向真正存在研究空白、临床价值尚待挖掘的应用方向。大模型进临床,路已清晰,但终点仍远。

这不是一场技术的独角戏,而是一次需要临床医学、统计学、伦理学与工程学共同参与的系统工程。从每天3.2篇论文的喧嚣,到19项随机对照试验的沉默,这一鲜明对比本身,便是这个领域最诚实的自画像。真正的落地,始于第一个被患者受益所验证的随机对照试验,而非第一个通过执照考试的聊天机器人。

对于每一位站在这一领域门口的研究者、临床医生或决策者而言,这篇综述既是一面镜子,也是一张地图。镜子照出了繁荣表象下的空洞;地图则标注了前方真正值得跋涉的路径。数字不会说谎:4,609篇论文堆砌出的,不是一座已建成的大厦,而是一片尚待夯实地基的工地。我们所需要的,不是更多的论文,而是更好的论文;不是更快的发表,而是更深的验证。

当第一批真正经过随机对照验证、以患者结局为终点的LLM临床研究相继发表之日,才是这场革命真正意义上的起点。在此之前,所有的热情都应当被审慎所约束,所有的承诺都应当被证据所背书。医学的本质从未改变:无论工具多么智能,治愈与关怀的责任,始终落在经过验证的实践之上,而非未经检验的期许之中。

这是一个需要耐心的时代。大模型的能力边界仍在扩展,临床验证的齿轮也在缓慢咬合。我们无需悲观,亦不必狂热。最稳健的姿态,是以科学家的严谨丈量每一步进展,以临床医生的责任感守护每一位患者,以决策者的远见为真正有价值的研究清除障碍。历史终将证明:在医学与人工智能的交汇处,慢即是快,稳即是远。

而那19项随机对照试验,不是终点的遥远,而是黎明的先兆。每一项严谨的前瞻性研究,都是写在患者身上的承诺;每一个被真实数据验证的模型,都是技术向人性俯首的证明。这条路不会因为论文数量的堆砌而自动抵达,只会因为每一位选择做难事、做正确之事的研究者而一步步延伸。大模型进临床,我们正走在最关键的一段路上。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐