
AI医生开始“看图问诊”

远程问诊里,患者最常发来的不只是文字。
可能是一张皮疹照片。
可能是一张心电图截图。
可能是一份体检报告、化验单、出院记录。
现实中的医生问诊,本来就是多模态的:一边问病史,一边看图片、看检查、看既往资料,再决定下一步怎么追问。可过去很多医疗大模型评估,还停留在“文字问、文字答”。
这篇发表在 Nature Medicine 的研究,正是把这个问题往前推了一步。
Google DeepMind 和 Google Research 团队提出了 multimodal AMIE,也就是多模态版 Articulate Medical Intelligence Explorer。它不仅能和患者对话,还能在问诊过程中请求、读取并整合多模态资料,包括皮肤照片、心电图和临床文件。研究采用随机、盲法、OSCE风格的模拟远程问诊设计,共包含105个多模态临床场景,并由18名专科医生对AI和基层医生的表现进行盲评。
结果很抓人:在这项探索性研究中,multimodal AMIE 在诊断准确性、病史采集、管理建议、沟通质量和共情等方面整体达到或超过基层医生;在32个评价维度中,29项表现更优或相当,其中包括9项多模态推理指标中的7项。
但先说清楚:这不是随机临床试验,也不是证明AI已经可以独立接诊。作者明确强调,这是一项模拟远程问诊场景下的探索性研究。
清璟AI——清北医工交叉团队,擅长AI智能体、大模型、深度学习、机器学习、多模态与多组学等,能够为医学研究者和临床医生提供全方位的支持与创新解决方案。我们拥有顶级科研资源,欢迎咨询!共同探索AI与医学的无限可能,一起发顶刊!

这篇文章为什么值得临床医生看?
因为它不是简单测试“AI会不会回答医学问题”。
它测试的是一个更接近真实远程医疗的问题:
患者发来照片、心电图或报告后,AI能不能继续问对问题?
能不能把图片和病史放在一起推理?
能不能解释图片里看到什么?
能不能提出合理鉴别诊断和处理建议?
还能不能保持基本沟通质量和共情?
这和传统医学考试题完全不同。
考试题往往把关键信息都整理好了,模型只要给答案。真实问诊则不是这样。患者表达可能不完整,图片质量可能不好,医生需要边问边判断,必要时还要让患者补拍一张更清楚的照片,或者上传检查报告。
所以,这篇文章的核心不是“AI比医生强”,而是:医学AI正在从静态答题,走向动态、多轮、多模态临床对话。
研究团队
作者团队主要来自 Google DeepMind 和 Google Research。文章发表于 Nature Medicine,题目为 Advancing conversational diagnostic AI with multimodal reasoning。研究系统基于 Gemini 2.0 Flash 构建,并在原有AMIE对话式诊断系统基础上加入多模态感知和“状态感知”的推理框架。
这里的“状态感知”很关键。它不是让模型随意聊天,而是把问诊拆成几个阶段:先采集病史,再形成鉴别诊断和管理计划,最后回答患者追问。每一轮对话后,系统都会更新患者状态、当前鉴别诊断和还缺哪些信息。
这更像医生的工作方式:不是一上来就下结论,而是边问边修正判断。
研究亮点
从文本问诊升级到多模态问诊。 患者可上传皮肤照片、心电图和临床文件,AI需要结合图像和病史推理。
不是一次性回答,而是动态追问。 AMIE根据诊断不确定性决定是否继续问病史、是否请求更多资料。
采用OSCE式模拟远程问诊。 105个场景、患者演员、基层医生、专科医生盲评,设计更接近临床教学评估。
评价维度很全面。 不只看诊断准确率,还看病史采集、管理方案、沟通、共情、多模态理解和幻觉风险。
结论克制。 作者明确说明这不是临床试验,不能直接外推到真实医疗部署。
研究结果
Figure 1|AMIE整体框架:会看图,也会决定下一步怎么问
图注:
Figure 1展示multimodal AMIE的关键组成和评价流程。系统通过多模态聊天界面接收患者文字和上传资料,在状态感知推理框架下完成病史采集、诊断管理和追问回答。研究还构建了模拟环境,用患者智能体和自动评分器支持系统开发;最终通过随机、盲法、OSCE风格研究,与基层医生进行比较。
图示解读:
这张图其实讲了一个很重要的变化:AMIE不是“患者发图,AI看图,然后给答案”。
它中间有一个状态更新过程。患者说了什么、上传了什么、AI目前怀疑什么、还缺哪些信息,都会进入内部状态。然后系统再决定下一句该问什么、是否需要更多图片、什么时候给出鉴别诊断和管理计划。
图中还显示,研究场景主要围绕三类远程问诊常见资料:皮肤照片、心电图、临床文件。这比单纯文字问诊更接近真实线上医疗。
Figure 2|OSCE结果:诊断准确率和问诊质量,AMIE整体更高
图注:
Figure 2比较multimodal AMIE和基层医生在OSCE模拟问诊中的表现。图A展示top-k鉴别诊断准确率;图B分析图片质量、是否正确使用图像信息、是否出现图像幻觉对诊断准确率的影响;图C展示患者和专科医生对多模态理解、诊断管理、病史采集、沟通和共情等指标的相对评价。
图示解读:
诊断准确率方面,AMIE从top-1到top-10整体高于基层医生,差异达到统计学显著。也就是说,无论只看首位诊断,还是看更完整的鉴别诊断列表,AI更常把真实诊断放进去。
更有意思的是图B。图片质量差时,AI和医生都会掉点,这说明这些场景确实需要视觉资料参与判断;但AMIE受低质量图片影响更小。若专科医生认为问诊者恰当地使用了图像信息,AI和医生诊断准确率都会提高。相反,如果出现“图像幻觉”——也就是描述了图片里并不存在的发现,诊断准确率都会下降。
图C则显示,在多模态问题回应、图像解释、鉴别诊断适当性、管理计划、病史采集、共情、患者是否愿意再次就诊等多个维度,AMIE整体获得更高评价。
这部分结果说明,远程问诊AI真正要做好的不是单点识别,而是图像理解、追问、解释和管理建议连成一条线。
Figure 3|三类资料分开看:临床文件最容易,皮肤和心电图更难
图注:
Figure 3展示不同多模态资料类型下AMIE和基层医生的表现,包括临床文件、皮肤照片和心电图。指标包括top-k诊断准确率、鉴别诊断适当性、管理计划适当性、患者是否愿意复诊,以及图像解释、图像推理和幻觉情况。
图示解读:
三个模态里,临床文件场景表现最好。无论AI还是医生,看到较清楚的化验单、报告或临床文件时,诊断更容易靠近正确答案。
皮肤照片和心电图则更有挑战。皮肤病变照片受到角度、光线、清晰度、肤色和病变阶段影响;心电图则涉及节律、波形、间期和导联信息,对非专科医生也不轻松。
但总体上,AMIE在三类模态中都保持较高表现。专科医生评分显示,AMIE在鉴别诊断适当性、管理计划适当性、患者愿意再次咨询等方面均更高;在图像解释和图像推理方面也优于基层医生,同时没有增加幻觉或误报。
这点对远程医疗很重要。线上问诊里,患者上传的资料质量经常参差不齐。一个可用系统不能只在“标准图片”上表现好,还要能处理现实中的截图、拍屏、模糊照片和信息不完整的报告。
Figure 4|模拟训练环境:先用虚拟患者反复打磨系统
图注:
Figure 4展示multimodal AMIE的模拟对话和自动评价框架。研究先基于真实医学数据集和临床专家案例生成患者资料和场景,再让AMIE与患者智能体进行多轮模拟问诊,最后由自动评分器根据诊断准确性、信息采集、管理计划和幻觉等维度进行评价。
图示解读:
这张图回答了一个实际问题:这么复杂的问诊AI,怎么迭代?
研究没有直接把系统拿去和人做大规模比较,而是先搭建了模拟环境。患者智能体根据预设病例回答问题,医生智能体负责问诊,自动评分器判断诊断是否命中、信息采集是否充分、管理计划是否合理、有没有编造信息。
这种方法很适合医学AI开发。因为真实医生和患者评估成本很高,不可能每改一次系统都重新组织OSCE。自动评价可以先用于快速筛选和消融实验,最后再进入人工盲评。
不过,这也提醒我们:自动评分不能完全替代专家评价。医学问诊的安全性、沟通质量和临床可接受性,最后仍然需要人来审。
Figure 5|状态感知推理和对话本身,都很关键
图注:
Figure 5展示两类消融实验。第一类比较有无状态感知推理框架时的诊断准确率、信息采集、管理计划和非幻觉率;第二类比较“只看图像”与“图像+对话”两种方式的诊断准确率。
图示解读:
结果很清楚:不是有一个多模态大模型就够了,问诊流程本身很重要。
在临床文件、皮肤照片、心电图等数据集中,加入状态感知推理后,AMIE整体优于没有这一框架的vanilla模型。尤其在临床文件任务中,top-1准确率从0.89提升到0.98;在PAD-UFES-20皮肤图像中,从0.75提升到0.84;在PTB-XL心电图中,从0.20提升到0.28。
第二个实验更像给医生看的:只看图,不如边问边看图。
“Images-only”模式表现明显低于“Images + Dialogue”模式。也就是说,图片本身很重要,但病史同样重要。对于皮疹,要问瘙痒、疼痛、持续时间、接触史、药物史;对于心电图,要问胸痛、心悸、晕厥、既往病史和危险因素。
这正是临床诊断的常识:图像不是孤立证据,必须放进病史里解释。
Figure 6|AMIE的“问诊脑回路”:先采集,再诊断,再解释
图注:
Figure 6展示multimodal AMIE的状态感知对话阶段转换框架。系统分为三个阶段:病史采集、诊断与管理、回答随访问题。每个阶段都会基于对话历史和多模态输入更新患者状态、鉴别诊断和信息缺口,并决定是否继续追问或进入下一阶段。
图示解读:
这张图是整篇文章的技术核心。
第一阶段,系统先建立患者画像,包括主诉、现病史、人口学信息、阳性/阴性症状、既往史、家族史、用药史和还缺什么信息。随后形成一个内部鉴别诊断,但暂时不直接告诉患者。
第二阶段,系统在信息足够后,给出排序后的鉴别诊断和管理计划。重要的是,它会把多模态证据说出来,比如“根据你上传的照片,皮损呈环形并有中央变清”或者“心电图显示ST段相关改变”。
第三阶段,系统回答患者后续问题,帮助其理解诊断和处理建议。最后,系统还会生成结构化总结,供临床评审使用。
这个设计比单纯提示词更像一个“问诊流程控制器”。它的目标不是让AI话更多,而是让AI更像医生一样按步骤推进。
这篇文章真正的价值
这项研究最值得借鉴的地方,不是“AI超过医生”这个标题。
更重要的是它把医学大模型研究从三个层面推进了。
第一,从文字问答走向真实问诊过程。
诊断不是一次回答,而是多轮交流、动态补充信息和逐步缩小鉴别诊断。
第二,从单模态走向多模态融合。
远程医疗中,患者上传图片、心电图和报告非常常见。AI如果只能读文字,就缺了一大块临床信息。
第三,从最终答案走向过程评价。
文章不只看诊断对不对,还评价病史采集、图像解释、管理计划、共情、患者体验和幻觉风险。这个评价体系对临床AI研究非常有参考价值。
但这篇文章也不能被过度解读
第一,它不是临床RCT。
作者明确说明,该研究不是有预设主要终点和注册统计方案的随机临床试验,而是探索性系统评价。结果不能直接证明真实医疗环境中AMIE能改善患者结局。
第二,场景是模拟远程问诊。
患者由演员扮演,病例经过设计,不能等同于真实患者。真实患者可能表达更混乱、上传资料更差、合并病更多,也可能出现情绪、隐私和法律问题。
第三,对医生并不完全公平。
研究使用的是同步文字聊天,而现实医生更常用视频或线下面诊。文字聊天限制了非语言线索、动态观察和体格检查,这可能影响医生表现。
第四,部分数据可能存在预训练接触风险。
作者提到,皮肤图像和原始心电信号来自公开数据集,可能被基础模型预训练接触过。虽然研究通过构造新的合成病例场景来降低影响,但未来仍需完全私有或前瞻性数据验证。
所以,更准确的说法是:multimodal AMIE展示了多模态问诊AI的潜力,但还没有到临床独立部署阶段。
给临床团队的课题申报启发
这篇文章非常适合全科医学、皮肤科、心内科、急诊科、互联网医院、医学教育和医工交叉团队参考。
方向一:专病多模态问诊智能体
不要一开始就做“全科AI医生”。可以从皮肤病、胸痛、心悸、头痛、发热、术后随访等具体场景切入,设计“病史+图片/报告+问诊流程”的智能体。
方向二:远程问诊OSCE评价体系
借鉴这篇文章的方法,构建患者演员、标准病例、医生/AI双盲比较、专科医生评分和患者体验评分。相比单纯测试模型答案,这种设计更容易体现临床价值。
方向三:多模态资料处理能力验证
可以针对皮疹照片、伤口照片、心电图、检验报告、出院小结、病理报告等常见上传资料,建立标准化评测集,评估AI是否能正确提取关键临床信息。
方向四:人机协作问诊研究
比较医生单独问诊、AI单独问诊、医生+AI辅助问诊三种模式,看诊断准确率、漏诊率、问诊时间、患者满意度和医生工作负担。
方向五:状态感知临床智能体设计
把临床流程拆成阶段:采集信息、形成鉴别诊断、补充检查、给出处理建议、解释风险、安排随访。每个阶段设定进入和退出条件,比单纯“长提示词问答”更适合医学安全场景。
一个可直接迁移的研究框架
临床团队可以按这个路径设计课题:
第一步,选一个远程医疗高频场景。
例如皮疹复诊、胸痛初筛、心悸咨询、术后伤口随访、糖尿病足照片评估、体检报告解读。
第二步,准备多模态病例包。
每个病例至少包括主诉、基础病史、患者可上传材料、标准诊断、推荐处理方案和危险信号。
第三步,设置OSCE式模拟问诊。
让患者演员分别与医生和AI对话,保持随机顺序和盲法评价。
第四步,建立多维评价指标。
不要只看诊断准确率,还要看追问是否充分、是否识别危险信号、是否正确解释图片或报告、是否给出合适转诊建议、是否出现幻觉。
第五步,强调临床边界。
AI输出建议必须经过医生复核。对于胸痛、卒中、严重感染、过敏反应、心律失常等高风险场景,要设置自动升级和线下就医提醒。
写在最后
医学AI真正进入临床问诊,不能只会回答文字问题。
患者会发照片,会上传报告,会问“这张图严重吗”,也会在描述不清楚时漏掉关键病史。一个有用的问诊AI,必须能看资料、会追问、能解释,还要知道什么时候该建议线下就医。
AMIE这篇 Nature Medicine 文章给了一个很清晰的方向:未来的临床智能体,不只是聊天机器人,而是一个能围绕患者状态不断更新判断的多模态问诊系统。
不过,它离真实临床应用还有距离。模拟问诊结果很好看,但真正上线前,还需要前瞻性临床试验、真实患者验证、安全监管、医生在环审核和医疗责任边界设计。
对临床科研团队来说,这类文章的启发很明确:不要只做“某模型回答某问题准确率多少”。更值得做的是把AI放进一个真实流程里,验证它能否改善问诊质量、提高信息采集完整性、减少漏诊风险,并真正减轻医生和患者之间的信息沟通成本。
如果你的团队正在做互联网医院、专病随访、影像/报告解读或临床智能体课题,可以从“多模态问诊OSCE评价”这个方向切入。病例包、评价量表、医生盲评和人机协作流程,比单纯追模型参数更容易做出临床认可度。
关于我们
清璟AI由国内TOP2高校医工交叉博士联合创立,专注于医疗大模型科研、影像组学、病理组学、深度学习、AI智能体、生信分析、多组学、多模态和各类人工智能算法。致力打造一站式Al+医学科研生态圈,提供专业的AI智能体、高端科研资源及一对一定制化服务。我们的服务涵盖从科研方案设计、数据处理到AI模型训练及系统开发等各个领域,旨在为医学研究者和临床医生提供全方位的支持与创新解决方案。携手清璟AI,让科研更智能,让医学更精准。

科研合作请联系
长按二维码加微信

夜雨聆风