当“医 学 × A I”
一篇《自然》论文给出的诚实答案
——《Large language models encode clinical knowledge》解读(Google Research,2023)
🩺 划重点
◆ 谷歌团队在《自然》上系统检验了大模型的"医学水平";
◆ AI 在美国执业医师考试风格试题上拿到 67.6%,刷新纪录;
◆ 但回答普通人健康问题时,近四成偏离医学共识;
◆ 经过医学"对齐"补课后大幅进步,但离医生仍有差距——AI 可参考,就医不能省。
ChatGPT 引爆大模型热潮之后,一个现实的问题摆在医疗领域面前:
大语言模型到底掌握了多少临床知识?它离真正的医生还有多远?
2023年8月,谷歌研究团队在《自然》(Nature)发表论文,用一套严谨的"考试 + 医生阅卷",给出了一个不吹不黑的答案:AI 既能在医师考试风格的试题上超越以往所有模型,也会在回答普通人健康问题时暴露出不容忽视的缺陷。

这项研究做了什么?
研究团队做了三件事:
① 出了一套"全能考卷"
整合六个已有医学问答数据集,涵盖执业医师考试题、医学研究文献题、普通人健康提问;另新建 HealthSearchQA 数据集,收录 3173条人们真实搜索过的健康问题(如"新生儿黄疸多久能退")。合称 MultiMedQA。
② 让大模型去考试
参考选手是基于 PaLM(5400亿参数大语言模型)的 Flan-PaLM。
③ 请医生来当阅卷人
这是最关键的一步——不止看选择题得分,还让临床医生盲评模型对开放性健康问题的回答:是否符合科学共识、有没有遗漏重点、会不会造成伤害、有没有偏见。
先看考试成绩:确实很能打
在 MedQA 数据集(美国执业医师资格考试 USMLE 风格的选择题)上,Flan-PaLM 拿到了 67.6% 的准确率,比此前最佳纪录高出 17.3 个百分点。其他几份"考卷"同样刷新纪录:
MedQA(美国医师考试题)
67.6%此前最佳 50.3%
MedMCQA(印度医学入学考题)
57.6%此前最佳 52.9%
PubMedQA(医学文献理解)
79.0%此前最佳 78.2%,单人医生评分约 78.0%
📖 名词解释:USMLE 是美国执业医师资格考试,其选择题以临床情境复杂、干扰项迷惑性强著称,是衡量医学知识水平的公认"硬考卷"。
研究还发现:模型越大,成绩越好——参数从80亿扩到5400亿,准确率几乎翻倍。而且团队检查了考题与训练数据的重叠,发现重叠极小,高分并非靠"背题"。
再看医生阅卷:差距暴露了
选择题拿高分,不等于回答真实患者问题时靠谱。研究选取了 140个普通人真实的健康问题,让 Flan-PaLM、经过医学对齐的 Med-PaLM 和临床医生分别作答,由医生盲评。结果耐人寻味:
① 答案符合科学共识吗?(越高越好)
医生 92.9%
Med-PaLM 92.6%
Flan-PaLM 61.9%
→ 通用大模型近四成回答偏离主流医学共识
② 回答可能造成伤害吗?(越低越好)
Flan-PaLM 29.7%
Med-PaLM 5.9%
医生 5.7%
→ 近三成 Flan-PaLM 回答被判定"可能造成伤害"(如错误的用药建议)
③ 还有这三项,同样值得一看
遗漏重要信息(越低越好)
Flan-PaLM 47.6% → Med-PaLM 15.3%(医生 11.1%)
存在人群偏见(越低越好)
Flan-PaLM 7.9% → Med-PaLM 0.8%(医生 1.4%)
普通人觉得"有帮助"(越高越好)
Flan-PaLM 60.6% → Med-PaLM 80.3%(医生 91.1%)
一句话总结:通用大模型距离"能放心回答健康问题"还有明显差距;针对性的医学对齐能补上大部分差距——但还补不全。
Med-PaLM 是怎么"补课"的?
从 Flan-PaLM 到 Med-PaLM 的关键,是论文提出的指令提示微调(instruction prompt tuning)。
大白话解释:不动大模型本体(几千亿参数一个不改),只在"提示层"加一小段可训练的参数,再用少量医生精心打磨的示范问答去训练它——相当于给一个博览群书的人做短期"医学话术培训",教它像医生期望的那样组织答案:引用共识、覆盖要点、语气谨慎。
这是一种数据高效、参数高效的对齐方法,也正是 Med-PaLM 在共识、伤害、偏见等维度大幅进步的原因。
研究者自己泼的冷水
这篇论文的可贵之处,在于作者把局限写得明明白白:
▪选择题不等于真实临床——真实诊疗需要问诊、查体、综合决策,比选 ABCD 难得多;
▪医学共识会过时——模型知识停留在训练数据的时间点,无法自动跟上指南更新;
▪只会英语——评估仅覆盖英语数据集,多语言能力待检验;
▪不会说"我不确定"——而医疗场景恰恰最需要这种坦诚;
▪评估本身有限——每条回答仅由一位医生评定,评估维度也未穷尽。
作者反复强调:在模型真正进入临床之前,安全性、可靠性、公平性的验证还有大量工作要做。
结语:给"AI医生"一个准确的定位
回到开头的问题:大模型掌握了多少临床知识?这篇论文的答案是——
它像一个读过海量医学文献、考试成绩优秀的"实习生":知识储备惊人,答题能力出众,但离独立"接诊",还差着安全、严谨和责任心这几课。
对普通人而言,这个研究也提了个醒:研究者自己在论文里写明,这类模型可能生成看似可信、实则错误的医学信息(即"幻觉")。
给每个人的提醒
AI 健康咨询,可以参考
身体的事,还是交给医生
📎 文献来源
Singhal K, Azizi S, Tu T, et al. Large language models encode clinical knowledge. Nature. 2023;620:172-180.
本文由该论文整理撰写,仅供科普参考,不构成医疗建议。文中数据均引自原文献。
夜雨聆风