
文 / AlxNns
你有没有想过这样一个场景:你把一张X光片传给AI,它给你发来一份详细的诊断报告,结论精确到毫米。但实际上,这张片子根本就没上传成功——AI什么都没看到,却依然在正儿八经地推理。
这不是科幻小说。这是李飞飞团队2026年6月发表的研究论文《Mirage: The Illusion of Visual Understanding》(海市蜃楼:视觉理解的幻觉)所验证的现实。
研究团队设计了一个测试,包含医学、生物、艺术等20个类别、共计200道视觉题目——把图片偷偷移除,但不告诉模型。结果发现,主流模型在无图情况下仍能达到原来70%至80%的准确率。平均“幻影率”超过60%,加上标准化提示词后,幻影率甚至能飙升到90%。
更令人细思恐极的是医疗场景下的验证:团队用一个从未见过任何医学影像的纯文本模型(30亿参数)去回答胸片问答测试,结果这个“瞎子AI”的成绩不仅超过了前沿多模态模型,甚至比人类放射科医生还高出10个百分点以上。
换句话说,现在的医疗AI评测体系,可能根本不是在考模型“看懂了多少”,而是在考它“猜对了多少”。
一、古德哈特定律:当指标成为目标
经济学中有一条著名定律——古德哈特定律:“当一个指标变成目标时,它就不再是一个好的指标。”
今天的医疗AI领域,正在完美演绎这条定律。
研究人员和开发者疯狂追逐公开基准测试的高分——MedQA、MedMCQA、PubMedQA……这些排行榜上的数字越漂亮,融资故事就越动听,估值就越高。但正如研究所示,公开的基准测试集很容易成为模型“应试”的目标,而非推动科学进步的催化剂。
开发者可能通过过度拟合甚至“数据污染”的方式来刷高分数。在多模态评测基准中,有高达74%至77%的题目在无图情况下仍然能被答对。
这不是在测试视觉理解能力,这是在测试“文字线索猜答案”的能力。
真正的临床推理,需要的是哲学意义上的“证成知识”——理解事物为什么为真,而不仅仅是“真信念”——偶然猜对或死记硬背。一个正确猜出“溃疡性结肠炎”但基于背景光线或无关文本伪影做出决策的医疗AI,不是医生,只是一个幸运的算法。在高风险的医疗环境中,这种区别关乎生死。
医学不是选择题,而是证明题。 而我们现在用选择题的标准,在给证明题打分。
二、高分低能的现实:AI在临床面前频频露馅
如果只是理论上的担忧,问题或许还没那么严重。但当我们将AI放入真实临床环境测试时,差距触目惊心。
一项发表在《Journal of Medical Internet Research》上的真实世界研究显示:神经科医生的诊断准确率为75% ,而ChatGPT仅为54% ,Gemini仅46%。两个LLM在细致临床推理方面均表现出明显局限,并且在17%-25%的病例中过度开具了诊断检测。
在甲状腺结节超声评估中,ChatGPT-5的准确率仅59.1% ,而经FDA批准的专用AI-CAD系统S-Detect准确率高达91.9% 。研究结论毫不留情:ChatGPT-5“尚不足以应用于医学影像”。
2025年一项涵盖83项研究的荟萃分析发现,生成式AI的准确率仅为52.1% ,与“非专家”水平相当,但显著低于专业医生。
高考试分数和低临床可靠性的巨大落差,正在制造一个危险的信息不对称:投资者以为自己在投一个“准医生”,实际上可能只是在投一个“猜题高手”。
三、“海市蜃楼效应”:AI在假装看懂
李飞飞团队发现的“海市蜃楼效应”,比传统的大模型“幻觉”更可怕。
· 传统幻觉:AI看到了图片,但编错了答案。
· 海市蜃楼:AI压根什么都没看见,却正儿八经地开始推理。
研究团队发现,模型在假装看片子时,给出的诊断一般偏向严重病症——心梗、癌症等。这意味着,在真实医疗场景中,一个“什么都没看到”的AI,可能会自信地告诉医生或患者:“你很可能得了癌症。”
这种“主动自信的海市蜃楼模式”,与“被动保守的猜测模式”是模型内部两套不同的响应机制。当模型以为图片还在时,它会进入“表演模式”——脑补出一张图并在其基础上推演输出。
对于医疗场景,这种“表演”的代价可能是人命。
四、监管与市场:一边狂奔,一边刹车
尽管存在这些深层次的可靠性问题,医疗AI市场仍在以惊人的速度膨胀。
全球医学影像AI市场预计将从2025年的18.7亿美元增长到2026年的25亿美元,CAGR高达34.2%。Global Market Insights预测,到2035年该市场将达到196亿美元。中国医疗AI产业规模预计2026年超400亿元,2030年有望超2000亿元。全球AI医疗健康市场规模预计2026年将达到560亿美元。
监管层面同样在加速。2026年第二季度,FDA授权了86个AI/ML医疗设备。2026年4月,平均每26.7小时就有一款新的AI医疗设备进入美国市场。NHS England宣布三年内投入100亿英镑用于AI发展。
但市场的狂热与技术的缺陷之间的张力正在加剧。
光大证券在研报中指出,AI医疗投资逻辑的核心在于 “数据闭环”与“场景刚需” 。未来的竞争核心在于谁拥有独家的、高质量的私有数据,并能通过业务场景实现数据的持续迭代。
东方证券则观察到,随着AI影像注册证稀缺性边际下降,行业竞争重点正在转向落地能力——医院准入、临床工作流适配、收费闭环及规模化交付能力。投资评价也应由“拿证数量”转向“付费医院数、单院检查量、续约率”。
这些分析指向同一个方向:市场正在从“看谁分数高”转向“看谁真能用”。
五、产业链拆解:谁在真正创造价值?
上游:数据与算法基础设施
这是整个产业链的“底座”,也是最容易被低估的环节。
一脉阳光创始人王世和指出,高质量的临床数据“需要影像中心的重资产投入、专业医生团队的持续治理以及长达数年的合规沉淀”,这种 “时间×规模×标准化”的三重积累,是竞争对手短期内无法复制的硬核护城河。
影禾医脉聚焦于底层基座模型的研发与AI工具链的打造,而一脉阳光则依托近3000万例、5PB的真实世界数据。两者形成“场景哺育技术、技术反哺场景”的双向闭环。
中游:AI软件开发商与平台提供商
联影医疗将AI植入CT、MR等设备的底层信号处理链条中。联影智能已拥有20款AI应用取得NMPA三类证。数坤科技三类证数量达到19张。头部企业产品矩阵正从单病种向全模态、全部位、全流程扩展。
单病种模型的时代正在终结。研发并落地一款肺结节AI产品需耗资5000万至1亿元人民币。若以此逻辑覆盖整个胸部CT的30多个病种,研发资金将高达30亿元。这条路走不通。
下游:医院、影像中心与支付方
截至2026年6月底,全国医保影像云索引已近4.4亿条。济南已有85家定点医疗机构接入医保影像云,累计上传影像检查数据807万份。中国已成为全球首个将AI诊断大规模纳入国家医保体系的国家。
AI影像收入模式正在从免费试用、一次性项目,转向软件授权、年度订阅及按检查量结算。
六、给创业者和投资者的实操建议
对创业者:
第一,不要做“刷榜高手”,要做“临床搭档”。 医疗AI的终局不是排行榜第一,而是医生愿意每天打开使用。与其追逐公开基准的高分,不如深入一家医院、一个科室,理解真实工作流中的痛点。正如影禾医脉所展示的,AI的价值在于将医生从“写报告人”转变为“审报告人”。
第二,重视数据壁垒,而非算法炫技。 在大模型时代,算法的差异化正在快速消失。真正的护城河是独家的、高质量的真实世界临床数据。这需要重资产投入、专业团队治理和长时间的合规沉淀。
第三,从“辅助诊断”走向“全病程管理”。 百川智能基于M4大模型推出的“百小医”,已覆盖全病程管理——从症状问诊、就医准备、病情分析到医嘱解读和主动健康管理。单点工具的估值天花板有限,能嵌入完整诊疗流程的AI才有长期价值。
第四,建立“可解释性”作为核心竞争力。 表现最可靠的系统,不是规模最大的,而是那些设计有结构化推理和显式基础的模型——被迫一步步展示工作过程,并将答案直接与医学影像中的特定视觉证据联系起来。在医疗领域,“为什么”比“是什么”重要一万倍。
对投资者:
短期(0-12个月):关注商业化落地能力的验证。 随着注册证数量不再是稀缺资源,投资逻辑应从“拿证数量”转向“付费医院数、单院检查量、续约率”。重点关注那些已经打通医院准入、临床使用和收费闭环三环节的企业。
中期(12-24个月):押注“数据+平台”型公司。 影禾医脉与一脉阳光的“基座模型+线下影像网络”模式,代表了医疗AI从单点工具向平台化演进的方向。拥有真实世界数据闭环的公司,将在下一阶段获得显著的先发优势。
长期(24-36个月):布局“AI原生”医疗场景。 当AI从“辅助工具”进化为“医疗基础设施”,整个诊疗流程将被重构。智能分诊、自动化报告生成、个性化治疗方案推荐——这些场景将催生全新的商业模式和估值体系。
风险提示: 医疗AI面临“海市蜃楼效应”等深层次的可靠性问题;监管政策(FDA、NMPA)仍在快速演变;医院信息化投入和回款周期存在不确定性;AI辅助诊断的医保支付政策落地进度可能不及预期。
医疗AI正站在一个十字路口
一边是狂奔的市场——数百亿美元的资金涌入,数千家企业竞逐,数以万计的AI模型在实验室里诞生。另一边是冰冷的现实——一个连图都没看到的AI,可以在考试中击败人类放射科医生;一个在基准测试中名列前茅的模型,在真实临床场景中可能一败涂地。
古德哈特定律告诉我们:当考试分数成为目标,考试就失去了测量真实能力的意义。
医疗AI需要的不是更多的排行榜冠军,而是更严谨的评估框架、更透明的推理过程、更扎实的临床验证。李飞飞团队给出了三个清晰的启示:
第一,必须增加无图对照的消融测试,让每一次评估都看清楚“加了图到底能多加分,不加图差距又在哪里”。
第二,测评要避免只依靠公开基准或过于静态的标准题库,以免被训练数据或文本线索提前“作弊”。
第三,医疗等高风险场景必须严格校验有图与无图输出的差异,防止模型在没有视觉输入的情况下作出危险推理。
归根结底,如果我们想让AI真正进入临床,必须从将这些系统视为“神奇且无需负责的预言者”,转变为将其视为“严谨、透明的医疗合作伙伴” 。真正的信任不是在排行榜上赢得的,而是在解释中获得的。
医疗AI的终局,不是AI替代医生,而是AI成为医生值得信赖的“第二双眼睛”。但要走到那一天,我们首先需要承认:现在的考试,可能正在考错的东西。

(本文基于Alx.Nns神经网络长记忆智能体对公开信息及产业链调研整理分析,不构成任何投资建议。投资有风险,决策需谨慎。)
往期精选
正在催生AI自诞生以来最大的一次范式转移:从“数字AI”走向“物理AI”
Anthropic的“权力游戏”:当AI模型可以随时被关停,世界会发生什么?
DeepSeek 510亿融资背后的“资本棋局”:梁文锋为何拒绝阿里,选择了腾讯、京东和宁德时代?
夜雨聆风