ARTICLE · 1049324
医疗AI估值按软件走,责任按器械算
医疗AI估值按软件走,责任按器械算让资本掏钱的是模型的分数,让医生签字的却是模型的失败。这两笔账,行业至今没有放在同一张表上算过。 2026年8月,澳大利亚患者Rebecca Green收到泌尿科医生的一封信。信里引用她的病历:她曾"微量服用致幻蘑菇"。她没说过,也没做过。唯一解释是,那次问诊她同意用AI语音记录,系统在转写或生成的某个环节,把一句凭空冒出的话写进了她的永久病历。医生道歉并更正,但没人说得清它是怎么进去的。Green当时正在申请工伤赔偿——病历上出现"违禁药物",对一个索赔中的人意味着什么,不需要解释。 这不是"AI偶尔犯错"的故事,而是关于谁承担后果的故事。 钱正以软件的速度涌入。截至2026年6月底,FDA累计授权AI医疗器械1,614件,放射科占1,230件;中国NMPA截至2026年中累计发放AI医用软件注册证127张,其中126张是三类证——凡是碰诊断、碰决策的,一律按最高风险等级收口。资本端更热:Abridge估值53亿美元,覆盖250多家医疗集团;OpenEvidence从10亿美元估值走到120亿美元,只用了大约一年。 但同一时间,ECRI把"医疗场景中AI聊天机器人的误用"列为2026年十大医疗技术危害第一位,这是该报告19年来首次由AI相关问题登顶。批准在加速,警告也在加码。两件事同时发生,说明这个行业缺的不是模型和钱,是一套能把二者对齐的验收标准。 预测式AI的错误多半来自训练数据本身。皮肤病图像分类里,医生标注不一致,模型学到的是标注习惯而非病灶;电子病历中的诊断和结局常由收费编码或记录事件代替,模型学到的可能是"这家医院怎么写病历",不是"这个人得了什么病"。共同点是:临床数据不是被采集出来的,是被诊疗流程、收费激励和机构习惯生产出来的,缺失与错误因此是结构性的,不是随机的。 生成式AI更隐蔽。西奈山医学院团队2026年发表在《Lancet Digital Health》的研究,把虚假建议塞进真实出院小结,让九个主流模型处理超过一百万次提示——植入的错误被复述或发挥的比例最高达83%。卡内基梅隆大学同年测试更直接:故意把医学影像从提问中拿掉,11,700条回复里82%的模型选择拒绝,剩下18%直接编了一个诊断。接近五分之一的情况下,它宁可编,也不肯说"我缺一张图"。 安大略省审计长2026年5月的报告更硬:20款政府批准的环境AI记录员中,60%生成过不准确记录,45%凭空生成没发生过的治疗计划或体格检查,85%遗漏心理健康关键信息。另一项356份AI生成病历的医师评估显示,18%有意外遗漏,11.5%是纯粹幻觉,5.3%被判定"可能带来严重或紧迫风险"。 病历上的一句话会跟着患者走一辈子。这是医疗AI与普通软件最根本的差别。 第二种失败更难被承认,因为它不只是"错",而是"不平等"。 同一份临床表现,只把种族信息写进提示词,治疗建议就可能降级。有研究用十个精神科病例测试Claude、ChatGPT、Gemini和一个医疗版LLaMA,一旦种族被点明,治疗建议质量明显下降——诊断环节受影响小,治疗规划环节受影响大。卡内基梅隆的测试中,胸片问题配上"年轻黑人患者",GPT-5约77%的回答提到结节病,一种发病率在十万分之十到六十的罕见病。 影像侧同样:视觉-语言基础模型系统性低估边缘群体病情;病理分类中部分亚组假阴性、假阳性率持续偏高,而整体AUROC一切正常。整体漂亮、亚组糟糕,是医疗AI最常见的"体检正常,病灶在深处"。 商业上的杀伤力在于它不可自证。厂商能公布灵敏度、特异度、AUC,却公布不了"我们不知道自己在哪些人群上失效"——要回答这个问题,得先有完整准确的人口学数据,而电子病历里这类字段最残缺。 第三种失败最有欺骗性,因为它总在交付之后出现。 单中心训练的模型跨机构使用性能大幅下滑,这在急性肾损伤预测、影像分类上被反复验证。更细微的变化也会击穿模型:编码体系从ICD-9切到ICD-10,用历史数据训练的模型就突然失准。一个环境AI记录员的真实世界试验里,仅仅因为病历模板调整,ICD-10文档准确率从79%掉到35%——生成的病历依旧通顺,只有系统化监测把它抓了出来。 生成式系统同样衰减。Hager等人的研究中,模型从"被动接收打包好的信息"变成"自己采集信息",诊断准确率从约68%降到55%;Johri等人让模型从结构化考题切换到真实医患对话,跨12个专科明显下滑。基准分数和诊室表现,是两回事。 更长远的隐患在数据里。AI大规模写病历、写报告,这些文本会进入下一代训练集。新加坡国立大学联合哈佛、斯坦福、耶鲁、谷歌、梅奥的团队分析了80多万条合成数据:没有强制人工核验时,多代自训练循环会让罕见但关键的病理信息快速消失,诊断可靠性在群体层面持续下降。用AI生成的数据训练AI,最后得到一个越来越自信、越来越单调的系统。 行业不是没试过修。数据清洗、缺失填补、异常检测、抗噪训练、集成学习、RAG、重加权、领域对抗训练、RLHF——工具箱很满。MIT与UCSD团队在2026年9月《Cell》的综述里逐条拆了这些方法的共同前提,结论不客气:它们大多假设错误随机、缺失机制已知、亚组预先识别、部署分布可观测、模型权重可修改。真实临床里,这五条几乎条条不成立。 举两个例子就够。集成学习把多个在同一批有偏数据上训出的模型放在一起,只降方差不降偏差——像让五个只读过同一份错误病历的医生投票。RAG被寄予厚望,但检索可能返回过期、残缺或上下文不匹配的材料,模型照样能生成一段与检索内容矛盾、读起来却很顺的话。至于需要访问权重的去偏方法,对闭源模型直接失效。 不是这些技术没用,而是它们的生效条件,恰恰是临床最不具备的条件。 既然错误修不掉,能不能靠测试拦住?答案比想象悲观。 MedQA已经饱和:o1、GPT-5.1、Gemini 3.1 Pro都在96%以上,这个数字再也不能区分谁更安全。OpenAI在2026年4月推出的HealthBench Hard上,多数模型接近0分,最好的Muse Spark也只有42.8分。同一批模型的落差恰好说明,前者考"背得出教科书",后者考"扛得住真实场景"。 更麻烦的是安全与准确不同步。加拿大Cortico的MedSafe-Dx测试11个前沿模型、250个模拟病例:安全表现最好的GPT-5.2,在71%的常规病例上过度升级;诊断召回最高的Gemini 3 Pro Preview,安全通过率最低;最差的模型漏掉156个急症中的26个。没有一个同时做到"该紧张的紧张、该放心的放心"。 厂商拿给采购方的往往是前一种分数,医院真正需要的是后一种。两者之间的空档,就是医疗AI目前最大的估值泡沫。 所以2026年真正的变化发生在监管和责任分配上,而不是模型能力上。 FDA在2026年8月18日发布首份生成式AI医疗器械讨论文件(Docket FDA-2026-N-7874,征求意见截止10月19日),提出用"活动类型×错误后果严重度"两轴定位风险,把上市前评估从性能对比转向"胜任力评估"——先做非临床基准,再做临床确认,参照物可以是合格医师的共识,也可以是执业医师的中位水平。它还讨论了基础模型版本变更、智能体AI自主行为这些此前没有答案的问题。截至发布时,FDA尚未授权过任何一款生成式AI医疗器械。 中国的形态不同、方向一致:NMPA用三类证把门槛立起来,2025年批出36张创历史新高,AI辅助诊断开始进入医保付费目录。欧盟则通过2026年7月生效的AI法案数字综合修正案,把医疗器械类高风险AI的合规截止日推到2028年8月2日,多给产业一年,但透明度义务照旧执行。 共同点是:监管正把"可靠性"从技术指标变成组织义务。FDA要求厂商预先定义变更控制计划、上市后持续监测性能漂移;WHO强调人在回路与问责可追溯。医疗AI公司的成本结构要变——训练算力之外,会多出一整套验证、监测、审计、文档的长期成本。 这对企业是结构性的。IBM在Watson Health上投入约40亿美元,2022年以约10亿美元卖出;Babylon估值峰值42亿美元,2023年破产,英国业务被eMed以约50万英镑收购。它们都不是算法失败——Google Health在泰国11家诊所部署糖网模型时算法本身有效,失败在工作流、图像采集条件和当地激励。反过来看Abridge,它值53亿美元不是因为转写更准,而是因为它嵌进Epic、拿下Kaiser的40家医院,并开始证明自己在真实工作流里的产出。 真正被定价的从来不是模型,而是"你能不能在出事之前证明自己没出事"。 Cell那篇综述最后给了一份清单,落点不在技术而在流程:上线前在留出环境做前瞻性压力测试,提前写好监测指标与干预阈值,先影子部署再全面铺开;上线后把"弃权"当可靠性机制而非缺陷,把部署策略的迭代看得和模型迭代一样重。 翻译成商业语言:这个行业下一次估值重估,不会发生在模型发布会上,而会发生在第一份经得起审计的真实世界性能报告里。谁先把"可靠性"做成可交付、可审计、可定价的产品,谁才真正拥有护城河。 把医疗AI当软件看,你会高估它的增速;把它当器械看,你会低估它的成本。它两者都不是——它是一门卖软件的价格、担器械的责任的生意,而这个错配,正是未来几年最大的风险来源,也是最大的机会所在。