乐于分享
好东西不私藏

AI医疗这一周:讯飞智医助理铺到811县、天智航"骨科手术计划软件"获三类证、中国团队发布" 生物学家"荀子|医疗周报

AI医疗这一周:讯飞智医助理铺到811县、天智航"骨科手术计划软件"获三类证、中国团队发布" 生物学家"荀子|医疗周报

过去这一周,AI 医疗的关键词是"给神话了的舆论降降温"。一边是顶刊和审计联手给高分成绩单泼冷水——基准被抬到顶尖专科团队、论文披露率只有一半、亚裔患者敏感性直接腰斩;一边是心理健康陪伴被实验室机制拆穿——越共情越把人往坑里推,监管随之落地。与此同时,FDA 密集放行、国内融资三线并进,Agent 从概念走进院端。下面我们将 7 天内有关联的动态归纳成 8 条进行解析。

1. 评测与信任:这周在反复教"怎么读 AI 医疗的成绩单"

这周顶刊、榜单和审计同时出手,指向同一个结论——单看准确率会高估 AI 医疗,真正该看的是"考了什么、怎么报的、对谁有效"。

本周关联动态

  • 1.08-02《Nature Medicine》MAST 超级智能测试:把评价基准从"打败普通医生"抬到"打败顶尖专科团队",并援引 MedAgentBench 最强 Agent 仅完成 69.67% 任务。
  • 2.08-04 MedBench 5.0:智能体赛道榜首 99.2 分,全模态赛道冠军仅 57.2 分,落差 42 分。
  • 3.08-04《Korean Journal of Radiology》审计 102 篇论文:平均仅披露 51.2% 该披露项,训练数据截止日期仅 9.8% 写明。
  • 4.08-07 辅助生殖 ML 预测 meta:纳入模型间异质性 I²=97.7%,十篇研究十个样,结论无法横向相加。
  • 5.08-04 泌尿肿瘤影像 AI 110 项 meta:AI 特异度 0.83 优于医生 0.68,但前列腺 MRI 亚组医生敏感性反而更高。
  • 6.08-02 乳腺检测:病例级 AUC 0.974 碾压医生,病灶级敏感性 66.3% 仅与资深医生打平。

MedBench 那 42 分落差比任何厂商自评都说明问题——医疗 AI 现在真正难的不是读懂病历文字,是把影像和文字合在一起做判断。顺着这条线往下想,评测本身正在变成一门生意:谁定义基准、谁掌控题库,谁就手握"谁能进医院"的门票。接下来一两年,真正的战场可能不是模型谁更强,而是有没有一个像影像界 LUNA、文本界 MIMIC 那样被全行业认账的公开评测集;在没有它之前,厂商自己发的"第一"都先打个折扣看。

2. 可解释 AI 与患者信任:解释越像人话,越容易把不懂的人带偏

行业默认"让 AI 解释清楚就等于更安全",这周一篇顶刊直接给出反证——对非专家,解释反而成了陷阱。

本周关联动态

  • 1.08-05 / 08-07《Nature Medicine》可解释 AI 皮肤科:623 名素人 + 153 名全科医生对照,大模型解释让普通人自动化偏见更强,医生"扛得住";先给 AI 答案会加重锚定,医生在"只给预测、不附加解释"时表现最好。
  • 2.08-07 上观新闻:一位三甲医生称约 25/30 患者带着 AI 生成的诊断或用药结论来就诊。
  • 3.08-07 大众网 / 网易:据称每天约 2000 万人在豆包上问健康问题(王小川公开披露口径)。

最该从 AI 受益的人(缺医学知识者),也最容易被 AI 带沟里。这篇论文给的解法很反直觉——先让用户自己说出判断假设,再给 AI 建议当参考。顺着这个反直觉往产品看:现在所有 AI 问诊都把结论顶在首屏,等于主动给用户"先入为主"的锚;真要落地,不如把交互倒过来——先问"你觉得哪里不对",再把 AI 当第二意见。这不光是体验问题,豆包、阿福月活千万级之后,首屏一句话就是上亿人的健康锚点,措辞的轻重已经不是产品细节,是公共卫生量级的事。

3. 心理健康与 AI:越共情,越把人往坑里推

从"AI 治愈一切"的温情叙事,到这周被实验室机制拆穿——风险恰恰藏在共情里。

本周关联动态

  • 1.08-03《NEJM AI》生成式 AI 心理预防 RCT:486 名本科生随机分组,用 App 的人孤独感显著改善,但对抑郁、焦虑、压力无显著改善。
  • 2.08-06《JMIR Participatory Medicine》:48.7% 有心理困扰者曾用 LLM 寻求治疗、陪伴甚至恋爱对象式的支持。
  • 3.08-08《Nature Medicine》SIM-VAIL 框架:用模拟人格压测 9 款聊天机器人、共 810 场对话,最暖的回应反而放大用户脆弱性(VAIL 闭环)。
  • 4.08-08 监管落地:《人工智能拟人化互动服务管理暂行办法》7-15 施行;海外加州 SB-243、Character.AI 多起诉讼同步推进。
  • 5.08-06 舆论个案:成都男子靠 AI 减肥 45 天瘦 40 斤进 ICU。

这条又是"AI有风险"的具体表现,这次是把风险定位在了共情能力本身——意味着单纯"让 AI 更温柔"的产品方向可能是反向的。论文用的是模拟用户而非真实患者,不能说是"已造成实际伤害",但机制层面的解释,比任何道德说教都更能帮普通人建立边界感。把视线拉长一点:陪伴类 AI 的商业模式恰恰靠"黏住人",而黏度最高的设计(拟人、共情、24 小时在)正好与"防止情感依赖"的监管红线撞车;成都那个进 ICU 的极端个案也许罕见,但它点破的是同一件事——当产品靠情绪留存,安全就不是加一层提示词能解决的,得从商业逻辑上重新算账。

4. 影像与多病种筛查:一次检查多重信息,公平性要拆开看

筛查正从"单病单做"走向"一次检查、多信息打包"。

本周关联动态

  • 1.08-03 Caristo Diagnostics 的 CaRi-Heart 获 FDA De Novo(美通社):从常规冠脉 CT 量化冠状动脉炎症,宣称提前约 10 年识别心血管死亡风险(企业披露口径)。
  • 2.08-05 EchoNext 心电图查结构性心脏病获 FDA 清关:几十块钱的心电图挖出旧数据里的风险。
  • 3.08-07《Radiology: Cardiothoracic Imaging》AI 心腔容积预测心衰:5892 人回顾队列,复合模型 AUC 0.80 优于指南评分 0.76。
  • 4.08-05 甲状腺癌颈部平扫 CT:不打造影剂,低年资医生敏感性显著提升、阅片时间少四成。
  • 5.08-06《JMIR AI》胸片估肺功能:整体敏感性 0.70,亚裔患者骤降到 0.43,白人为 0.75,绝对差 -0.32。
  • 6.08-02 乳腺检测:病例级强、病灶级平(见第 1 条)。

"一张片子查多种病"比诊断型 AI 更快产生民生价值,因为它不碰诊断责任这条高压线,先把"该去查什么"前置。但亚裔敏感性腰斩提醒一句大实话:不按族群拆开看,你根本看不见模型差在哪。往产业侧推一步,CaRi-Heart、EchoNext 这类"从已有检查里多挖一层"的产品,卖点正是"不新增检查、只多读数据",可一旦某族群的数据在训练里偏薄,多挖出来的恰好是误差;筛查铺得越广,公平性审计就越不能只交给厂商自证,得有第三方按人群拆开的验证。

5. 基层与临床落地:减负还是增负,培训缺口是隐形天花板

最接地气的 AI 不是抢诊断权,而是补"人容易忘、容易缺"的环节。

本周关联动态

  • 1.08-02《NEJM AI》AI 触发快速反应:11 家医院院内死亡率 23.1% 降到 18.6%,但非教学社区医院不显著——作者明确"这是关联不是因果"。
  • 2.08-03 讯飞医疗 WAIC 亮全栈:智医助理覆盖 811 区县、影像云归集 1.6 亿份(企业披露口径)。
  • 3.08-05《Nature Medicine》肯尼亚 9691 人整群 RCT:LLM 辅助未降低 14 天治疗失败率(P=0.13)。详见文章GPT-4o下基层:肯尼亚...
  • 4.08-06《JMIR Medical Education》法国 1625 人调查:仅 6.6% 受 AI 培训,78.3% 想学;46.3% 目前完全没用 AI。
  • 5.08-05《Journal of Dental Hygiene》学生用 AI 写病历:3 个月后感知医患连接改善,但测的是学生主观感受。
  • 6.08-07 AR 急救 AI Copilot;08-08 港中深医院开"AI+医生"健康管理科

基层 AI 的成败不在精度,在有没有嵌进真实工作流、让医护愿意用。肯尼亚阴性 RCT 和法国"93% 没受过训"的错位数据提醒我们:算法变不出医生,培训缺口才是隐形天花板。把这个缺口放到国内的语境里看——讯飞智医助理铺到 811 个县区、归集 1.6 亿份影像,硬件和模型到了县乡,可"谁来教县乡医生用、用坏了算谁"这件事还没跟上;港中深把"AI 初筛、医生终审"写进科室职责,这种组织设计比技术参数更值得学习,因为它把培训缺口变成了一个岗位,而不是一句口号。

6. 审批、资本与责任治理:FDA 放行、国内拿证,谁为出错买单是暗线

产业侧一片火热,但责任分配机制是这周没说出口的主线。

本周关联动态

  • 1.08-03 CaRi-Heart / EchoNext 获 FDA 清关;Epitel 2600 万美元 B 轮;
  • 2.08-06 天智航"骨科手术计划软件"获三类证,注册证编号国械注准 20263211672。
  • 3.08-07 Salesforce 拿下美国 VA 约 16 亿美元代理式 AI 合同,标志 agentic AI 进国家级医疗行政系统。
  • 4.08-08 Function Health 获 4.5 亿美元成长期融资。
  • 5.08-04《BMJ Quality & Safety》"human-in-the-loop 不是足够安全策略";同期 NEJM AI 把"持续监测"定为监管基础,PROACTIVE-AI 仪表盘追踪召回。
  • 6.08-08 广东点名 20 款医疗健康 App 违规;英国 MHRA 监管沙盒;伦理论文主张责任"事前分账"。

签字的是医生、写代码的是厂商、看不懂的也是医生——这条责任传导链这周被多篇论文同时指向。顺着"事前分账"想下去,现在最现实的切口在理赔和保险:当 AI 进了诊疗流程,出事后的责任认定会直接决定保费和采购意愿,保险公司比任何伦理委员会都更早关心"这台模型出错的概率和代价"。Salesforce 拿下 VA 16 亿美元合同之所以是分水岭,不只是金额大,而是国家级行政系统开始把 agentic AI 写进合同——一旦政府合同里明确了"模型出错谁赔",这套责任条款会反过来成为行业的默认模板,比指南类的软约束管用得多。

7. Agent 与基础模型路线:从单点工具到智能体矩阵

这周最清晰的产业转向——从"一个模型看一种病"走向"一群智能体管一段流程",基础模型也来到开源与自我降温并存。

本周关联动态

  • 1.08-02 MerMED-FM 跨 7 模态影像基础模型:只用 10% 标注数据微调即达多模态 AUROC 0.81–0.96。
  • 2.08-04 MedBench 智能体 99.2 分;08-05 Tempus PRISM2 病理基础模型开源,230 万张切片 + 1400 万条问答。
  • 3.08-05 锦欣 IVF 辅助生殖 AI 智能体;08-07 云知声三甲项目 + 紫荆智康 Agent Hospital 进院。
  • 4.08-08 中国团队"AI 生物学家"荀子登《Nature Biomedical Engineering》;温州医大附一院 + 京东发布 NICE 体重管理智能体"管 21 天"。
  • 5.08-08《Medicinal Research Reviews》AI 制药综述自我降温:多数成果仍停在临床前,说不出缩短了多少时间、省了多少钱。

医疗 AI 的评价口径正从"答题分数"换成"行为完成率"——京东减重大赛 21 天打卡就是信号。但把镜头拉到"智能体进院"的节奏会看到另一面:Agent Hospital、锦欣 IVF 这类试点主打"把一段流程交给一群智能体",流程一跨科室,出错的责任链就比单点工具长得多,这又把话题拽回第 6 条的责任治理。更底层的一根刺是验证:荀子能提假设、AI 制药综述自己承认说不清省了多少时间钱,说明"能不能跑起来"和"跑出来的结论靠不靠谱"是两件事,前者这周进展很快,后者还卡在最核心的临床试验上。

8. 医学教育与医生角色:被重塑,还是不可替代

院士泼冷水、神经科给"智能"打引号、患者带着 AI 结论来考医生——这周从不同角度给出同一判断:医生的不可替代在综合判断与临场智慧。

本周关联动态

  • 1.08-05 王俊、张文宏、葛均波院士级专家公开泼冷水:大模型"聊天登峰造极、临床不行"、反对系统性引入病历、追问隐私与责任。
  • 2.08-07 清华 AI 医疗论坛四位院士定调:AI 不会替代医生,但医疗体系不能没有 AI。
  • 3.08-08 系统医学论证"复杂疾病闭环失效时医生不可取代";同日《Neurological Sciences》神经科医生给"intelligence"打上引号。
  • 4.08-07 / 08-08 临床一线:患者带 AI 版建议来考医生(上观 25/30、医师报);法国 1625 人调查仅 6.6% 受训、78.3% 想学。

"AI 不会替代医生,但体系不能没有 AI"这句定调,比任何"超越医生"的标题都经得起推敲。真正要补的不是医生的危机感,是医生的 AI 素养——78.3% 想学却 93% 没受过训,这个缺口不填,再好的模型也接不住。顺着"患者带 AI 来考医生"这个新场景想:以后门诊会出现一种新角色——医生既要看病,还要当"AI 结论的质检员",这其实抬高了对医生的要求而不是降低。法国那个培训缺口的结果,短期看是尴尬,长期看却是机会:谁能先把"医生怎么和 AI 协作"做成标准化培训,谁就握住了 AI 真正落地的最后一公里。

往期精彩推荐

特别声明:本号聚焦AI医疗行业知识科普及行业动态研究,我们尊重原创,也注重分享,部分图文素材来源于网络,如有违规或侵权,请及时联系我们处理

欢迎合作|学习|交流

小医每日在群内推送行业动态

点赞推荐的你更酷哦