夜雨聆风学习资料网

ARTICLE · 1069525

99% 的医生要求最终决定权,但 AI 单独跑分更高:这场拉锯战谁让步?

99% 的医生要求最终决定权,但 AI 单独跑分更高:这场拉锯战谁让步?
一、先把结论摊开
2026 年 6 月 17 日,国际顶级学术期刊《自然》同期发表了两篇论文,讲的是两个 AI 系统——德国团队做的 MIRA、谷歌做的 AMIE。它们要做的事情,是传统意义上医生的核心工作:问病史、开检查、读结果、下诊断、定治疗方案。
结果很难看。在一场同条件的头对头比较里,MIRA 的诊断准确率是 87.8%,对面四位经验丰富的跨专科医生组成的专家组是 78.1%,住院医师与专家混合组只有 71.1%
也就是说,AI 赢了医生,而且赢的不是一点点。
但如果因此得出"AI 要取代医生",那就跳得太快了。真正的事实是这样一个组合:
AI 在"看"这件事上已经赢了,但在"担"这件事上还完全没入门。全国超过 300 家三甲医院部署了影像 AI,日常常态化使用的不到三分之一;国家药监局累计批了 127 张 AI 医用软件注册证,而民众最直接的感受是——没感觉。
这不是技术不够,是技术之外的四件事没解决:谁负责、谁付钱、错了谁兜、以及那个"万一"由谁来承受。
这篇文章想把三件事说清楚:AI 医疗今天到底走到了哪一步;它取代不了医生的真正原因是什么;以及如果一定要问"还要多久",那个答案长什么样。
二、它现在能做什么、不能做什么
把"AI 医疗"当成一个整体去讨论是没有意义的。它在不同任务上的完成度差着量级。
已经做到(接近或超过人类)
乳腺 X 线检出比人类读者高 13.8%–21.6%糖尿病视网膜病变筛查准确率 96%脓毒症提前最多 6 小时预测阑尾炎诊断 98.6%、胰腺炎 92.3%
正在做(能力够、门槛未过)
全流程管理推理(AMIE 首诊方案适当性 95%)用药推理(RxQA 基准疑难病例优于医生)病历文书(减少医生记录时间 40%–45%)多就诊追踪的慢病管理
做不到(结构性短板)
体格检查(诊断最基础的临床技能)真实的共情与在场感告知坏消息、终末期对话、哀伤支持为临床决策承担法律责任
图 1 | 数据来源:《自然》2026 年 6 月两篇论文及相关综述。三层划分按"是否已进入常规临床流程"而非"技术是否可行"。
有一个数字最能说明"能力"和"落地"之间的距离:MedQA 这个医学考试基准已经饱和了——头部模型都在 96% 以上,o1 是 96.52%,GPT-5.1 是 96.38%,Gemini 3.1 Pro 是 96.37%。但换到 HealthBench Hard 这个困难切片,几乎所有模型都趋近于零,最好的一个也只有 0.428,平均 0.222。
考试满分,实战零分。这是理解整件事的关键前提。
三、两个系统,两种赢法
MIRA 和 AMIE 虽然同期发表,但走的是两条完全不同的路。
MIRA(德国)—— 在封闭病历里当医生
开发方:德累斯顿工业大学、海德堡大学等。它不是一个聊天机器人,而是在隔离的电子病历系统内部自主运行的智能体,能调用 11 个工具、从 85,000 多个选项中做选择:开化验、开影像、解读结果、生成鉴别诊断、写治疗方案(含处方、手术安排、办理入院)。
测试集:公开 MIMIC-IV 数据集中 500 多例真实急诊病例,由一个"扮演患者"的 AI 智能体提供信息。
88.9%:八个疾病类别、对照病历记录诊断的准确率87.8%:311 例同条件头对头(医生专家组 78.1%)一个没漏:需要住院的病例零遗漏
AMIE(谷歌)—— 管的是"多次复诊"
双智能体结构:一个负责与患者流畅对话,另一个在后台参考临床指南做更审慎的推理。底层用 Gemini,输出对齐英国 NICE 指南与《英国医学杂志》最佳实践,以及经批准的药物目录。
测试集:100 个多次就诊的病例场景、5 个专科,对手是 21 名初级保健医生;患者由演员通过文本扮演。
95% vs 72%:首诊方案被评为"适当"的比例持平:管理推理能力优于医生:治疗与检查的精准度、指南遵循度、疑难病例用药推理
图 2 | MIRA 论文 DOI: 10.1038/s41586-026-10675-5;AMIE 论文 DOI: 10.1038/s41586-026-10764-5。
但两位作者自己都在踩刹车。MIRA 团队承认,它对"比例虽小但并非为零"的一部分患者,给出了偏离最佳实践的照护建议;而且模拟患者的回答比真实急诊问诊"更有结构",测试用数据集还可能已经在模型的训练数据里——如果真是这样,测出的性能更像天花板,而不是现实估计。
AMIE 团队的表述更直接:这项工作是"里程碑",但"尚未准备好用于真实世界转化",还需要解决藏在系统内部推理步骤里的"潜在推理错误"。而且即便在较简单的问题上,双方的最高分都低于 75%。
注意这个细节:两队都不约而同地强调"测试条件比真实临床更理想"。技术团队自己比媒体谨慎得多。
四、同一期《自然》上的那盆冷水
这是全篇最容易被忽略、也最重要的一段。
两篇论文刊出的同一期,哈佛医学院生物医学信息系的 Arjun Manrai 教授发表了一篇评论,标题叫《医疗 AI 存在测量问题》。他提的问题不是"AI 够不够强",而是——我们真的知道该怎么衡量它吗?
他提了三个很难回答的问题。
问题一:能力强,到底是谁的功劳?
两个系统都建立在通用大语言模型之上:MIRA 用 GPT-4o 与 o1-preview,AMIE 用 Gemini。研究团队在底层模型之上加了复杂的"脚手架"——额外的软件和医学知识。但一个意外发现是:新版本"开箱即用"的通用大模型,能力已经追平了旧版 AMIE 经过精心脚手架增强后的效果;而曾经帮到旧版 AMIE 的那套脚手架,换成新版底层模型后几乎起不到作用了。
这就引出了阿尔伯塔大学 Richard Sutton 那个著名的论断——「苦涩的教训」:随着算力增长,通用方法最终会超越为 AI 系统精心构建的专门架构。
问题二:AI 的迭代速度,远远超过评估速度
底层模型每几个月更新一次,每次进步都让上一轮的评估结论变得更难判断。而最现实的一层担忧是:医生们已经在临床实践中使用 AI 工具了,采用速度很可能已经超过了关于其有效性的证据积累速度。
问题三:同一个问题,两项研究得出相反结论
2026 年另有研究试图回答"专门的医学 AI 模型是否比通用模型更好",结果是:研究 A 得出"通用模型更优",研究 B 得出"专门模型更优"。两个团队做的是同一件事,方向完全相反。
Manrai 的结论是:问题不在于哪个研究"对了",而在于评估方法本身的差异,就足以导致截然不同的结论。因为所有这些研究,都依赖医生的判断来评估 AI 输出——
一把尺子上的六个变量,每一个都能翻转结论
1. 谁是评判者?全科医生还是专科医生?人数够不够?评判者之间一致吗?2. 是否盲法?评判者知道哪些输出是 AI 的、哪些是医生的吗?3. 标准统一吗?是否给了评判者正式的评判指引?4. 怎么对比?AI 和医生是同时对比,还是分别评估?5. 题目从哪来?测试问题能否代表真实临床场景?6. 结果怎么定?由研究者选定的评判者点头就算,还是有明确定义的结果指标? 
他打了个很通俗的比喻:你要比较两个厨师的厨艺,但每次请的评委不同、评分标准不同、连比赛菜品都不同——得出的结论能有多可靠?
所以医疗 AI 真正的前沿,也许不是"更聪明"的模型或"更大胆"的智能体——这些每几个月就会被超越。真正的前沿,是"尺子"本身:一套足够耐用、可靠的评估科学,能经受得住被测对象的持续变迁。
他还指了一个方向:过去把 AI 与医生判断做对比是必要的,但更难的挑战在前面——需要在真实临床环境中做前瞻性试验,深入研究人机交互的效果,建立明确定义的结果指标,而不是依赖研究者选定的评判者。
五、最锋利的一个发现:AI 的严重错误,八成是"该做的没做"
2026 年 7 月,斯坦福大学、哈佛医学院等机构的研究者发布了一个专门测"临床危害"的新基准,叫 NOHARM。
它的做法跟传统考试完全不同:不看模型答对多少题,而是问——如果患者真的照着这个建议去做,可能受到多严重的伤害?研究对象包括 20 个通用大语言模型和 4 个在医院里实际使用的临床 AI 工具,覆盖 1,100 个"从初级保健转诊到专科"的真实病例任务、10 个专科,累计 12,747 条专家标注、4,249 个临床管理选项。
潜在严重有害错误率(越低越好)
AMBOSS LiSA
2.9%
Doximity Ask
4.8%
OpenEvidence
5.1%
Glass Health
5.4%
ChatGPT 5.5
8.9%
Gemini 2.5 Pro
12.8%
Gemini 3.1 Pro
15.6%
Grok 4.3
20.9%
Llama 4 Maverick
24.6%
假想对照:永远建议"什么都不做"
37%
图 3 | 条形长度表示潜在严重有害错误率(若建议被直接采纳时的危害概率),基准为 37%。颜色编码:青蓝 = 专用临床 AI 工具(四者差异不显著,但均显著优于所有通用模型);琥珀 = 通用模型;砖红 = 通用模型中错误率最高的两档;灰色 = 假想的"什么都不做"对照模型。数据为 2026 年 7 月 13 日预印本,未经正式同行评审。该指标衡量的是"若建议被直接采纳"的潜在危害,不等于真实世界的不良事件发生比例。
这张图本身已经很有信息量:四个专用的临床 AI 工具(2.9%–5.4%)全部明显好于所有通用大模型(8.9%–24.6%)。但更值得注意的是研究对错误类型的拆解——
超过 80% 的严重错误属于"遗漏"。也就是说,更大的危险往往不是 AI 推荐了一个明显危险的操作,而是它没有推荐某个临床上重要的东西
这一点在临床上格外棘手:错误的药物剂量、明显不合适的干预措施,在医生复核时容易引起警觉;而一项被漏掉的检查、治疗或随访建议,恰恰是复核者最难察觉的——因为医生必须自己本来就知道"少了什么",才可能发现它少了。
研究者还做了另一组实验:101 名持有美国执照的全科医生参与的随机交叉研究。结果是三层递进,每一层都反直觉——
第一层
AI 辅助确实提升了医生的表现
相比使用常规资源,接入 AI 的医生表现更好。
第二层
但 AI 辅助的医生,仍低于许多单独运行的 AI
原因之一:医生有时没有采纳 AI 给出的有用建议。
第三层
如果全部采纳,人机组合会同时超过医生和 AI
也就是说,当前损失主要来自"人没有听 AI 的"。
研究者同时提示了一个悖论:虽然人在环内是安全保障,但这个保障会被临床的认知负荷与时间压力削弱;而系统越强大,"自动化偏见"带来的风险反而越高——因为有害错误变得更难被发现,也更容易真的落到患者身上。
这些话把"人机协同"这个温情口号,变成了一个有数据支撑的真问题:人在环内,究竟是安全阀,还是效率损失?如果是前者,代价多大?如果是后者,谁有权决定把这个阀门关上?
六、AI 出错的三副面孔
如果不看具体怎么错,"AI 会犯错"就只是一句空话。它的错误有三种可测量的形态。
面孔一:顺着错的信息往下编
西奈山的研究团队造了 300 个经医师验证的临床情景,每个里面故意植入一个虚构细节(假化验值、编造的体征、不存在的疾病),跑 6 个模型、5,400 次输出。
默认状态下幻觉率 65.9%,加一句"先核实再作答"的提示降到 44.2%。但最麻烦的数字是:模型重复或扩写那个植入的假事实的比例,最高达 83%。调温度没有帮助。
后续针对 GPT-5 的同协议研究显示:更强的模型在这项测试上反而更差(65% vs GPT-4o 的 53%),加上缓解提示后可降到 7.67%。
面孔二:缺失信息时,直接猜
卡内基梅隆大学的研究者向模型提问时,故意不提供医学图像,看它会不会主动索取。12 个模拟患者画像、覆盖胸片/脑 MRI/皮肤科图像,三个模型共 11,700 次响应。
82% 的情况下模型拒绝作答,但在剩下的 18% 里,它直接编出了一个诊断,而不是索要缺失的图像。
更值得警惕的是偏见:GPT-5 对约 77% 的年轻黑人胸片提问给出"结节病"(一种发病率仅每 10 万人 10–60 例的罕见病);一位 65 岁白人男性询问皮肤痣,几乎每一次回答都是"黑色素瘤",而癌症专家估计不到万分之一的痣会癌变。
面孔三:该做的没做
回到 NOHARM 基准的发现:超过 80% 的严重错误是遗漏
真实临床摘要的独立测量也指向同一处:某生产环境测量显示幻觉率 1.47%、遗漏率 3.45%,但被归类为"重大"的错误里,幻觉占 44%、遗漏只有 16.7%——说明遗漏虽然数量少,单个更严重。而且所有幻觉里有 20% 落在"计划"部分,也就是直接驱动医嘱的那一段。
另一组急诊分诊测试中,AI 对 52% 的真实急症做出了"下调分诊"。
图 4 | 三副面孔对应三类可测错误:事实性幻觉(65.9%/83%)、信息缺失时的编造(18%)与偏见、以及遗漏(占严重错误 80% 以上)。数据分别来自《通讯·医学》2025 年论文、npj Digital Medicine 2026 年后续研究、卡内基梅隆大学研究、NOHARM 预印本及独立生产环境测量。各研究测试条件不同,数字不可直接横向比较。
还有两个数字也值得记住:一份针对 500 多个 AI 生成参考文献的核查发现,只有 32% 是准确的,近一半属于部分编造;而 2026 年一份对 5 个聊天机器人、250 条健康提示的审计显示,49.6% 的回答有问题,19.6% 属于"高度有问题"。美国急救医学会性质的机构 ECRI 更直接把"AI 赋能的健康技术"列为 2025 年第一号健康技术危害,排在网络安全之前。
七、拉锯战:五方各说各话
"AI 能不能取代医生"之所以争不出结果,是因为争论的几方根本不在回答同一个问题。
立场方
核心主张
关键证据
医生方
AI 必须整合进医生主导的团队、在主治医师指导下使用,是"增强"而非"替代"。医疗是"一门艺术",不只是任务集合。
美国医学会 2026 年会决议;其首席执行官公开反问:"你真的愿意胸痛时去急诊被大模型治疗吗?"
技术资本方
生成式 AI 已在收集病史、做出诊断、选择检查、开具治疗、管理慢病五项认知任务上"匹敌或超越"医生;把人类留在环内,可能最终让临床表现更差;而医生的技能正因依赖 AI 而退化。
2026 年《美国医学会杂志》评论文章(作者含知名风投与公共卫生政策人士),明确预言"优越的自主 AI 很可能在 2030 年前"进入部分真实工作流。
患者方摇摆
要准确,也要人。分不出 AI 写的和医生写的,甚至更偏好 AI 写的那份;但仍不愿用 AI 替代医生本人。超过九成要求"必须有人类监督"和"随时能转真人"。
一项百人患者调查中,50% 把"信息准确性"排第一,40% 选"与医生的个人关系",只有 10% 认为"即时获取"最重要;跨国调研显示,患者对嵌入医生门户的 AI 的信任,是公共聊天机器人的 3 倍。
监管方划线
划清"谁能自称医生"。美国多个州立法禁止 AI 使用 doctor / physician / MD 等受保护头衔,加州已立法可对 AI 系统的开发者或使用者执行头衔保护法。中国口径是"人机协同、以人为主"。
特拉华州、俄勒冈州、华盛顿州相关立法;中国《医疗机构人工智能应用与治理专家共识(2026 版)》明确医师拥有最终诊疗决策权。
数据侧戳破
用跑分把前两方的说法都推翻了:医生用 AI 仍不如 AI 单干,但如果医生全部采纳 AI 建议,人机组合又同时超过两者。所以争论"谁更强"是个伪问题。
101 名执业全科医生的随机交叉研究;以及"人在环内会被认知负荷和时间压力削弱"的机制提示。
现实侧投票
医生实际怎么用,比他们怎么说更能说明问题:用得最多的是行政减负,用来辅助诊断的最少。
医生 AI 使用者中 39% 用于检索研究与诊疗标准、30% 用于制定治疗方案、28% 用于记录就诊,仅 17% 用于辅助诊断;另一项调查中 92% 的医生认为 AI 最大的价值是减少行政负担。
图 5 | 五方立场对照。需要说明的是,"现实侧"的使用比例来自美国医学会 2026 年 3 月调查,样本为医生中的 AI 使用者,不代表全部医生。
把这张表读一遍会发现一件很有意思的事:医生在"该不该由 AI 决定"上口径统一(几乎没有人同意),但在"AI 好不好用"上身体很诚实(八成人在用)。而技术方在讲能力,患者在讲关系,监管在讲头衔,数据在讲"你们吵的方向不对"。
八、为什么 AI 必然要上:需求侧正在崩
如果只看技术争议,容易以为这是一场"要不要"的选择。但在中国的现实里,这更像一场"来不及"的补位。
先看存量。国家卫健委主要负责人在 2026 年的公开署名文章中明确表态:我国医务人员总量仍然不足,每千人口执业医师仅 3.25 人。而《国家人权行动计划(2026—2030 年)》提出的目标是每千人口执业医师数达到 3.77 人、注册护士数达到 5.1 人。
更值得注意的是结构。据媒体对历年数据的统计,过去十年全国有 470 万医学生毕业,最终注册执业医师仅新增约 75 万人——每 100 个走进医学院的人,最后坐在诊室里的不到 16 个。而 2026 年 8 月,北京协和医学院团队在《英国医学杂志·开放版》上发表的调研(覆盖全国 31 个省份 136 家三甲医院、两万多名医师)给出了更直接的信号:10.4% 的在职医生明确计划跳槽转行,20.5% 打算彻底离开医疗行业
部分科室的人才缺口(据媒体报道的行业统计口径)
全科
约 50 万
精神科
超 40 万
麻醉科
超 30 万
儿科
近 9 万
参考线
全科医生占全部医生的比例仅 10%–15%,发达国家常规水平为 30%–60%;乡镇卫生院本科以上医师占比不到 30%
图 6 | 条形长度表示各科室缺口规模估算,基准为全科约 50 万。口径说明:上述缺口数字来自媒体转述的行业统计口径,非国家卫健委正式发布文件原文,引用时需标注来源。老年医学人才缺口率高达 95%(同口径)。
横向看也一样。美国的医生就业预测是到 2034 年增长 3%、每年约 23,600 个岗位空缺,而医学院校协会预测到 2036 年将短缺 86,000 名医生。也就是说:AI 在全球范围内首先是被当作"人手不够"的解法来部署的,而不是被当作"替代医生"的兵器。
这解释了为什么政策层面的推进速度,比技术层面的争议快得多。
九、中国走到了哪一步:证件、定价、和那扇门缝
这一节回答的是最实在的问题:在中国,AI 医疗到底能不能用、能不能收钱。
9.1 证件:127 张,且高度集中在两个模态
截至 2026 年年中(6 月 28 日快照),国家药监局累计批准了 127 张 AI 医用软件注册证,其中 126 张是最高等级的三类证,占比 99.2%。第一张是 2020 年批准的冠脉血流储备分数计算软件。
年度获批数量:六年爬坡
2021
6 张
2022
22 张
2023
22 张
2024
28 张
2025
36 张
2026上半年
13 张
图 7 | 条形长度表示当年获批注册证数量。2026 年为截至 6 月 28 日的不完整年度(灰色),不可与完整年度直接比较。累计 127 张中,国产 120 张、进口 7 张。
但证件数量的分布暴露了真实能力边界。肺结节/肺部影像 32 张、心血管/心电 22 张,两项合计就占了四成以上;而超声只有 3 张、病理/细胞 5 张、内镜/消化 6 张。
32
肺结节/肺部
22
心血管/心电
6
内镜/消化
5
病理/细胞
3
超声
这里有个容易忽略的落差:能力最强的影像领域,证件最挤;而病理、超声这些"更依赖经验判断"的领域,反而证件稀少。一种解读是技术不成熟;另一种解读是——这些领域恰恰是 AI 的想象力最大的地方,因为那里的诊断不一致性最高,改进空间也最大。
另一个值得关注的结构特征是:大模型公司在三类证上几乎是空白。某头部大模型公司的医疗大模型仍在申请阶段;一家把自己明确定位为 C 端健康咨询的平台,宣称不碰临床诊断;而一家以基层辅助诊疗和影像云为主业的企业,目前只有 1 张肺结节 CT 三类证。
这说明一件很硬的事:"会做模型"和"能拿证"是两条完全不同的赛道。拿证需要的是多中心临床试验数据、算法泛化能力、全生命周期的质量管理体系——这些都得一件件沉下来做。
监管侧也在跟进。2026 年 9 月,国家药监局医疗器械技术审评中心发布了《人工智能医疗器械注册审查指导原则(2026 年修订版)(征求意见稿)》,相比 2022 版新增了跨模态图像合成功能、多模态产品、多病种产品、大模型四节,并对大模型落地的三条路径——接口调用通用大模型、基于通用大模型开发医疗智能体、采用大模型技术路线自研模型——分别给出明确定性规则。
9.2 定价:一个被大多数人误读的制度设计
网上流传着很多"AI 辅助诊断进医保、自付仅 15%、单项 200 元"的价目表。这些数字大多是拼凑的。真实的制度设计比它克制得多,也比它更有意思。
三份官方文件里的真实口径
江苏(2026 年 6 月):在放射检查、超声检查、康复类立项指南中设立 51 项"人工智能辅助"扩展项;待发布的检验项目立项指南,所有检验项目均设置"人工智能"辅助扩展项。关键一句:AI 辅助执行与主项目相同的价格水平——"同样的价格水平下,医院可以选择培养医务人员进行诊疗,也可以选择使用 AI 参与诊疗行为,但现阶段不宜额外单就 AI 辅助技术再向患者收费。"
苏州(2026 年 4 月):2025 年 10 月与 2026 年 1 月先后落地影像、超声类立项指南,共 34 项人工智能辅助诊断(拓展项)——影像类 22 项(甲类 4 项自付 0、乙类 14 项自付 0.1、丙类 4 项自付 1),B 超类 12 项。例:"X 线摄影成像-人工智能辅助诊断(扩展)40 元/部位或体位",甲类、自付比例为 0,但不得与主项目同时收费
重庆(2026 年 6 月):截至 2026 年 3 月已新增设立 55 个 AI 技术相关医疗服务价格项目,覆盖临床量表、放射检查、超声检查、康复、病理;均为扩展项,明确与主项目不同时收费,AI 技术纳入主项目价格构成。病理方面,"病理诊断费-人工智能辅助诊断(扩展)"三级、二级及一级医疗机构收费标准均为 110 元/次,纳入甲类支付;而"病理诊断费(远程)"110 元/次明确为不支付项目
读懂了就会发现:中国给 AI 医疗开的是"同价不加价"的门。医院用 AI,可以收和原来一样的钱,但不能因为用了 AI 就多收患者的钱。这个设计的意图很清楚——鼓励应用,但绝不增加患者负担。它同时意味着:AI 的价值不需要向患者证明,而需要向医院的成本结构证明。这跟"AI 能提高诊断准确率"是两件完全不同的事。
于是就有了那个最扎心的现实:全国超过 300 家三甲医院部署了影像 AI,日常常态化使用的不到三分之一。而行业人士给出的原因很直白——"制约 AI 诊断大规模临床落地的核心瓶颈,是不成熟且无法闭环的商业模式":一套 AI 系统动辄上百万元,医院难以负担;按次收费又缺乏统一标准。采购靠信息科挤预算,运维靠领导批特款。
所以,"AI 能不能查出癌症"和"医院用不用得起",是两个问题。前者已经解决,后者还没。
十、回到那个问题:还要多久
"取代医生"这个问法本身就不准确。准确的问题是:哪些任务、在哪个层级、什么时候被接管。
四层替代时序
已经在发生 | 约 2024–2026
第一层:模式识别型诊断——影像、心电、筛查眼科
特征:输入边界清晰、输出是分类结论。这恰好是深度学习被造出来就要做的事。乳腺 X 线检出比人类读者高 13.8%–21.6%、糖网筛查 96%、脓毒症提前 6 小时。AI 已经接管的是"首读"这个动作,不是"签发报告"这个责任。
正在逼近 | 约 2027–2030
第二层:模式识别型的"诊断职能"整体质变——病理、皮肤科诊断、全流程管理
支撑它的三个条件正在同时到位:一是《美国医学会杂志》2026 年评论明确预言"优越的自主 AI 很可能在 2030 年前"进入部分真实工作流;二是中国政策给的时间表是 2027 年形成一批临床专病专科垂直大模型、2030 年基层诊疗智能辅助基本全覆盖;三是技术侧出现了"选择性自主"的可操作框架——德国团队 2026 年 9 月的研究显示,在七疾病基准上自主临床 AI 智能体诊断准确率达 90.04%,而通过"行为一致性"这个信号,可以在 49.4% 的病例上以 98.9% 的准确率实现选择性自主,剩下的交给医生复核。
这一层的里程碑不是"AI 能不能诊断",而是"什么时候允许它在没人看着的情况下诊断一部分病例"。
更晚 | 2030 年之后
第三层:方案导向型——心内科、内分泌科、呼吸科、门诊内科
特征是"检验值 + 影像 + 病史,套进循证算法"。技术上比第一层复杂但性质相同,主要变量是责任划分和长期追踪的可靠性。这一层大概率走"AI 主导方案生成 + 医生签字确认"的路径,而不是替代。
不是"更晚",是"另一类"
第四层:具身介入型与人类身份型——外科、急诊、麻醉、产科、介入;精神科、安宁疗护、成瘾医学、心理治疗
前者要在"永远会出意外的活体环境"里做灵巧的物理干预;后者处理的是一个人对自我的认知、文化框架、哀伤、关系与求生意愿。这两类里,AI 的作用是"辅助"而不是"取代",而且这个判断在可预见的时间里不会因为模型更强而改变——因为限制它们的不是模型能力,是责任主体必须是可追溯的人
图 8 | 四层划分依据"认知任务的性质"而非科室地位或薪酬水平。第一、二层顺序参考 2026 年 5 月一位执业二十年的急诊科医生提出的分层框架,并结合中国政策时间表与最新研究结论校准。
所以,如果一定要给一个"还要多久"的答案:
如果问题是"AI 什么时候在诊断能力上全面超过医生"——已经在部分任务上发生了,2027 到 2030 年会在影像与病理这类模式识别领域成为常态。
如果问题是"AI 什么时候取代医生这个人"——这个时间点不会到来,不是因为技术做不到,而是因为责任无法转移给一个没有执照、没有执业主体资格、无法被追偿的实体。
如果问题是"我什么时候能感受到变化"——已经能了,只是感受的方式不是"医生消失",而是"你的片子多了一个不睡觉的复核者"。
十一、三个判断抓手
抓手一:看"尺子",不看"分数"
下次看到某个医疗 AI"准确率 98%",先问四个问题:评判者是谁、几人、是否盲法、测试题从哪来。哈佛那篇评论已经证明,同一件事换个评估方法就能得出相反结论。一个领域的成熟标志不是分数越来越高,而是评估标准开始收敛
抓手二:看"错误类型",不看"错误率"
漏诊和误诊是完全不同的风险。NOHARM 基准给出的最重要提示是:严重错误里八成是"该做的没做",而这种错误恰恰是人工复核最难拦住的。所以评价一个 AI 产品,不要只问"它答错了多少",要问"它会在什么情况下沉默"
抓手三:看"付费结构",不看"技术公告"
证批了多少张、模型又刷新了什么榜,都不如一件事说明问题:这个环节的钱从哪来。中国现在给的是"同价不加价",美国还在争论谁为 AI 错误负责、以及 AI 提供的照护该怎么报销。这两件事没落地之前,技术再强也只是产线上的一个待装零件。
十二、五个必须盯住的风险
1. 责任真空。司法实践采用的是"人为核心、AI 为辅"的归责逻辑:医疗机构与在岗医师承担诊疗首要责任,医务人员必须自主复核算法输出,完全依赖 AI 结论的损害后果由医疗机构先行承担赔偿,赔付后可向技术提供方追偿。但一旦患者脱离医疗机构单独使用面向大众的健康 AI 自诊,就会出现无医师兜底、追责链条断裂的空白地带。而这类轻量化小程序和智能问答,目前恰恰缺乏强制备案要求。2. 举证困难。我国法律未明确 AI 的法律主体资格,AI 只能作为辅助工具参与诊疗,无法独立承担法律责任。但算法"黑箱"导致举证困难:患者难以证明损害与 AI 缺陷之间的因果关系,医疗机构与研发企业容易相互推诿。3. 审批模式跟不上迭代速度。算法迭代快、具备持续学习特性,会出现"上市后性能漂移",而传统的"一次性审批"监管模式难以适配;同时卫生健康、药品监管、网信、数据管理等多部门职责边界不清,容易形成监管空白。此外,AI 自动生成处方、无人监控的全自动诊疗,违反《互联网诊疗监管细则(试行)》的禁止性规定。4. 数据与场景的"最后一公里"。训练需要不同年龄、地区、病情阶段的数据,以及不同设备、参数下的影像,但现实是各家医院数据互不相通,获取成本高、周期长。基层落地更麻烦:在大医院相对规范的数据上训练的模型,进到基层诊所后会遇到设备条件不一、病历记录不完整、诊疗信息碎片化的问题,影响模型稳定性。中医领域尤其困难——术语不标准、诊断结果不统一,同一位患者,不同流派的老中医可能给出截然不同的诊断和处方;而很多经验传承只传自家人,"没有标准答案,如何训练 AI"。5. 技能退化。这是最容易被忽略的长期风险,而且已经被写进了《美国医学会杂志》的评论里:医生的技能正面临"AI 导致的技能退化"。如果一代医生从训练阶段就依赖 AI 给出结论,那么当 AI 出错、或者遇到 AI 训练分布之外的罕见病例时,可能已经没有足够的人有能力发现它错了。这不是"AI 会不会犯错"的问题,而是"人类还剩多少纠错能力"的问题。 
结语
把整件事压缩成一句话:
AI 已经在"读"这件事上赢了医生。真正卡住"取代"的,从来不是技术——是漏掉的那 80% 谁来补、猜错的那 18% 谁来兜,和那个付钱的人是谁。
所以这篇不是"AI 威胁论",也不是"AI 万能论"。它是一个更冷静的判断:医疗 AI 的瓶颈已经从实验室转移到了制度层——评估科学、责任分配、付费机制、人才结构,这四件事的进度条,比模型的版本号更能决定我们什么时候能感受到变化。
至于医生会被取代吗——一位执业二十年的急诊科医生给出的分层判断里,最值得记住的不是哪一科先倒,而是他在文中写下的那句意思:把学科按"认知任务的性质"重新理解一遍,正在变成一种职业义务,而不只是一场智力练习。
你上一次看病的时候,有没有悄悄把症状先问过 AI?你会接受一个"AI 看完、医生签字"的诊断结果吗?欢迎在评论区聊聊你的真实选择——这个问题没有标准答案,但每个人的答案加起来,其实就是这件事最终会怎么落地的样子。

相关学习资料