乐于分享
好东西不私藏

AI能在医学考试中拿高分,也能"一本正经地胡说"

AI能在医学考试中拿高分,也能"一本正经地胡说"

当“医 学 × A I”

一篇《自然》论文给出的诚实答案

——《Large language models encode clinical knowledge》解读(Google Research,2023)

🩺 划重点

◆ 谷歌团队在《自然》上系统检验了大模型的"医学水平";

◆ AI 在美国执业医师考试风格试题上拿到 67.6%,刷新纪录;

◆ 但回答普通人健康问题时,近四成偏离医学共识;

◆ 经过医学"对齐"补课后大幅进步,但离医生仍有差距——AI 可参考,就医不能省

ChatGPT 引爆大模型热潮之后,一个现实的问题摆在医疗领域面前:

大语言模型到底掌握了多少临床知识?它离真正的医生还有多远?

2023年8月,谷歌研究团队在《自然》(Nature)发表论文,用一套严谨的"考试 + 医生阅卷",给出了一个不吹不黑的答案:AI 既能在医师考试风格的试题上超越以往所有模型,也会在回答普通人健康问题时暴露出不容忽视的缺陷。

1

这项研究做了什么?

研究团队做了三件事:

① 出了一套"全能考卷"

整合六个已有医学问答数据集,涵盖执业医师考试题、医学研究文献题、普通人健康提问;另新建 HealthSearchQA 数据集,收录 3173条人们真实搜索过的健康问题(如"新生儿黄疸多久能退")。合称 MultiMedQA

② 让大模型去考试

参考选手是基于 PaLM(5400亿参数大语言模型)的 Flan-PaLM。

③ 请医生来当阅卷人

这是最关键的一步——不止看选择题得分,还让临床医生盲评模型对开放性健康问题的回答:是否符合科学共识、有没有遗漏重点、会不会造成伤害、有没有偏见。

2

先看考试成绩:确实很能打

在 MedQA 数据集(美国执业医师资格考试 USMLE 风格的选择题)上,Flan-PaLM 拿到了 67.6% 的准确率,比此前最佳纪录高出 17.3 个百分点。其他几份"考卷"同样刷新纪录:

MedQA(美国医师考试题)
67.6%此前最佳 50.3%

MedMCQA(印度医学入学考题)
57.6%此前最佳 52.9%

PubMedQA(医学文献理解)
79.0%此前最佳 78.2%,单人医生评分约 78.0%

📖 名词解释:USMLE 是美国执业医师资格考试,其选择题以临床情境复杂、干扰项迷惑性强著称,是衡量医学知识水平的公认"硬考卷"。

研究还发现:模型越大,成绩越好——参数从80亿扩到5400亿,准确率几乎翻倍。而且团队检查了考题与训练数据的重叠,发现重叠极小,高分并非靠"背题"。

3

再看医生阅卷:差距暴露了

选择题拿高分,不等于回答真实患者问题时靠谱。研究选取了 140个普通人真实的健康问题,让 Flan-PaLM、经过医学对齐的 Med-PaLM 和临床医生分别作答,由医生盲评。结果耐人寻味:

① 答案符合科学共识吗?(越高越好)

医生 92.9%

Med-PaLM 92.6%

Flan-PaLM 61.9%

→ 通用大模型近四成回答偏离主流医学共识

② 回答可能造成伤害吗?(越低越好)

Flan-PaLM 29.7%

Med-PaLM 5.9%

医生 5.7%

→ 近三成 Flan-PaLM 回答被判定"可能造成伤害"(如错误的用药建议)

③ 还有这三项,同样值得一看

遗漏重要信息(越低越好)
Flan-PaLM 47.6% → Med-PaLM 15.3%(医生 11.1%)

存在人群偏见(越低越好)
Flan-PaLM 7.9% → Med-PaLM 0.8%(医生 1.4%)

普通人觉得"有帮助"(越高越好)
Flan-PaLM 60.6% → Med-PaLM 80.3%(医生 91.1%)

一句话总结:通用大模型距离"能放心回答健康问题"还有明显差距;针对性的医学对齐能补上大部分差距——但还补不全。

4

Med-PaLM 是怎么"补课"的?

从 Flan-PaLM 到 Med-PaLM 的关键,是论文提出的指令提示微调(instruction prompt tuning)。

大白话解释:不动大模型本体(几千亿参数一个不改),只在"提示层"加一小段可训练的参数,再用少量医生精心打磨的示范问答去训练它——相当于给一个博览群书的人做短期"医学话术培训",教它像医生期望的那样组织答案:引用共识、覆盖要点、语气谨慎。

这是一种数据高效、参数高效的对齐方法,也正是 Med-PaLM 在共识、伤害、偏见等维度大幅进步的原因。

5

研究者自己泼的冷水

这篇论文的可贵之处,在于作者把局限写得明明白白:

选择题不等于真实临床——真实诊疗需要问诊、查体、综合决策,比选 ABCD 难得多;

医学共识会过时——模型知识停留在训练数据的时间点,无法自动跟上指南更新;

只会英语——评估仅覆盖英语数据集,多语言能力待检验;

不会说"我不确定"——而医疗场景恰恰最需要这种坦诚;

评估本身有限——每条回答仅由一位医生评定,评估维度也未穷尽。

作者反复强调:在模型真正进入临床之前,安全性、可靠性、公平性的验证还有大量工作要做。

6

结语:给"AI医生"一个准确的定位

回到开头的问题:大模型掌握了多少临床知识?这篇论文的答案是——

它像一个读过海量医学文献、考试成绩优秀的"实习生":知识储备惊人,答题能力出众,但离独立"接诊",还差着安全、严谨和责任心这几课。

对普通人而言,这个研究也提了个醒:研究者自己在论文里写明,这类模型可能生成看似可信、实则错误的医学信息(即"幻觉")。

给每个人的提醒

AI 健康咨询,可以参考
身体的事,还是交给医生

— · — · —

📎 文献来源

Singhal K, Azizi S, Tu T, et al. Large language models encode clinical knowledge. Nature. 2023;620:172-180.

本文由该论文整理撰写,仅供科普参考,不构成医疗建议。文中数据均引自原文献。