

上一篇聊了医院 AI 效果衡量的三层框架,这一篇把它落到具体品类。
医院里的 AI 品类太多,病历质控、影像辅助、CDSS、智能问诊,每个品类的效果指标都不一样,一套表打不了天下。这篇先讲最近推得最多、争议也最大的:门诊医生站的诊疗智能体——就是嵌在医生工作站里,帮医生做鉴别诊断、给治疗建议、辅助决策的那种 AI 助手。
为什么先讲它?因为它介入的是医生最核心的诊疗决策,最难衡量,也最容易"看起来很美,用起来很鸡肋"。
下面的三层指标,每条都按 「指标 + 怎么算 + 经验值 + 怎么用」 写。你可以直接拿去填,也可以根据自己医院的情况删改。




如果这一层的数不好看,后面两层就不用看了。医生都不用的 AI,效果再好也是纸上谈兵。
| 指标 | 怎么算 | 经验值 | 怎么用 |
| 门诊接诊 AI 使用率 | 调用了 AI 的门诊病例数 ÷ 总门诊病例数 | 低于 30%,说明 AI 还没真正融入诊疗流程 | 对外汇报的主指标,但别只看这一个数。自动弹窗会把它虚高,跟"主动调用占比"配对看 |
| 人均日调用次数 | 当日 AI 总调用次数 ÷ 当日活跃医生数 | <2 次是摆设;>15 次要警惕,可能是 AI 不准 | 跟使用率配对。高使用率+低人均=少数人在用;低使用率+高人均=有核心粉丝但没扩散 |
| 7 日留存率 | 本周活跃医生中,下周仍活跃的比例 | 最诚实的指标。留存低=新鲜感过了就不用了 | 每周看一次,持续跌的科室要找医生深聊,别自己猜原因 |
| AI 建议忽略率 | 未采纳且直接关闭的 AI 建议数 ÷ AI 总建议数 | 高了说明 AI 要么打扰人,要么说的都是废话 | 按场景分类统计(初诊/开检查/下诊断/开处方),发现某些场景特别废的,关掉 |
| 主动调用占比 | 医生主动点击触发的 AI 调用 ÷ 总调用次数 | 区分"医生真的想用"和"系统自动弹出来被迫看" | 比例低于 50%,自动弹窗该关就关,别让 AI 变成医生的工作负担 |
| 诊疗阶段分布 | 初诊/开检查/下诊断/开处方 各阶段调用占比 | 能看出医生把 AI 当什么用 | 不同科室不要拿一个数比。内科高、外科低很正常,外科主要靠手术 |



这一层是核心,也是最容易被糊弄的。供应商给你看"准确率 95%",那是测试集数字,不是真实门诊里的效果。
我把效果指标分成三类,从易到难。建议按顺序来,先把 A 类跑通,再冲 B+C 类。




指标 | 怎么算 | 怎么用 |
诊断完整率 | 列出≥2 个鉴别诊断的病例 ÷ 总病例数 | 衡量诊断思维的规范性。AI 辅助后,医生会不会考虑得更周全。HIS/EMR 直接拉数 |
处方合格率 | 合格处方数 ÷ 总处方数 | 用药规范性。必须跟上线前基线比,没基线这个数毫无意义 |
指南符合率 | 诊断+治疗方案符合临床指南的病例 ÷ 抽审病例数 | 诊疗规范性。每月人工抽审 100–200 份。抽审不能只抽 AI 推过的,也要抽没推过的,才能看出 AI 的边际价值 |
检查合理率 | AI 建议的检查中,最终有阳性发现的比例 | 避免过度检查。反向也能看,AI 建议补充的检查有没有真的帮上忙 |
A 类指标数据好拿,HIS/EMR 里直接拉。但它还是"过程",不是"结果"。处方合格 ≠ 病人治好。



这是医生最在意的部分,也是医院信息科最难拿到的部分,因为大部分医院根本没建过基线。
指标 | 怎么算 | 怎么用 |
漏诊率变化 | (AI 辅助后漏诊率 − 基线漏诊率) ÷ 基线漏诊率 | 最重要的安全指标。漏诊比误诊可怕得多,误诊了医生还能纠正,漏诊就是直接放过了 |
误诊率变化 | (AI 辅助后误诊率 − 基线误诊率) ÷ 基线误诊率 | 诊断准确性。但误诊率下降的价值远不如漏诊率下降 |
30 天再就诊率 | AI 辅助诊疗的患者 30 天内因同一疾病再就诊的比例 | 首诊质量的间接反映。再就诊率下降,说明首诊更准了 |
转诊准确率 | 基层向上转诊中确需转诊的比例 ÷ 总转诊数 | 适合医联体/社区场景。AI 提升基层能力,转诊更精准 |
不良事件发生率 | 与 AI 辅助诊疗相关的药物不良反应/治疗延误等 | 安全性底线。这个数不能升,升了就要停 |
怎么测才靠谱?
一定要有对照组。找一个情况相近的科室不用 AI,同期对比。不然你说不清变化是 AI 带来的,还是医生水平自然提高了。
漏诊率怎么定义? 建议用"后续就诊 / 住院确诊推翻初诊"作为代理指标。谁来推翻(谁来审)、推翻争议怎么处理,这两个问题必须在项目启动前定好,不然数据出来没人认。
基线要回溯至少 6 个月。事后用"近 3 个月没用 AI 的病例"做对照,样本量不够、季节因素干扰大,数据基本不能用。
急不得,至少攒 3 个月数据再下结论。第一个月的波动很正常。



指标 | 怎么算 | 怎么用 |
平均接诊时长变化 | (AI 辅助后平均接诊时长 − 基线) ÷ 基线 | 变长不一定是坏事。可能是医生在看 AI 建议、思考更充分了。别单纯按"变长=不好"汇报 |
病历书写时长变化 | AI 辅助后病历书写耗时变化 | 如果 AI 能自动生成病历初稿,这个指标会明显改善。是 ROI 计算里最容易量化的部分 |
医生日接诊量变化 | 医生日均门诊量变化 | 受号源限制,通常变化不大。别把它当主线 |
医生工作负荷评分 | 问卷量表(如 NASA-TLX) | 客观数据 + 主观感受结合才全面。建议每季度做一次 |
正确姿势
质量指标和效率指标放一起看:
质量升、效率也升 → 真的好
质量升、效率略降 → 可以接受,医生多花的思考时间换来了诊疗质量
质量没变化、效率升 → 要警惕,可能只是省了时间,没省脑子
质量降、效率升 → 赶紧停,这种"快"是用病人安全换的




到了这一层,就是给院领导算总账。别指望算得特别精确,医疗 AI 的价值很多是间接的、长期的。但你得有个说法。
| 档位 | 指标 | 怎么算 / 关键动作 |
| 第一档 能直接算的钱(院领导最认) | 人力时间节约 | 每例节约时间 × 年门诊量 × 医生时薪 − AI 年服务费。别只算净节约,运维、培训成本都算进去,不然领导会觉得你在藏成本 |
| 第一档 能直接算的钱(院领导最认) | 医保拒付减少 | AI 辅助后医保拒付减少金额。信息科通常拿不到,要找医保办或病案室。拿不到就别硬凑 |
| 第二档 能讲清楚的间接价值 | 医疗纠纷损失规避 | 漏诊率下降 × 年门诊量 × 单例平均赔偿。给领导最有效的一条,漏诊率哪怕只降 1%,乘以年门诊量就是几百万潜在赔偿节省 |
| 第二档 能讲清楚的间接价值 | 基层收入留存(医联体/社区) | 转诊率下降 × 年门诊量 × 单例平均收入。对县医院、乡镇卫生院特别有效 |
| 第二档 能讲清楚的间接价值 | 科研产出 | 论文数 + 课题申报数。汇报时把这块放前面,信息科主任爱听,医生也爱听 |
| 第三档 软价值(能讲但难量化) | 智慧医院评级加分 | 等级医院评审、智慧医院评级、互联互通成熟度测评都是加分项。提前搞清楚今年要冲哪个评审,针对性准备材料 |
| 第三档 软价值(能讲但难量化) | 患者满意度 | 满意度问卷评分变化。容易做,但真实度有疑问,作为辅助证据,别当主线 |
一个避坑提醒
第一年 ROI 大概率是负的,别硬撑。重点讲"第二年、第三年的边际成本趋近于零"。AI 系统搭好了,多用一个科室、多处理一万份病历,成本增加很少。这是 AI 跟传统 IT 项目最大的区别,也是最值得反复讲的。




不用等所有指标都建起来再动。
- 第 1 个月:挑一个试点科室,跑使用率 + 指南符合率 + 医生主观满意度,目标——确认"有人用,不反感"。
- 第 3 个月:加一个临床质量指标(漏诊率变化或 30 天再就诊率),找个对照组开始对比,目标——拿出"真的有效果"的初步证据。
- 第 6 个月:算一笔粗账——人力节约 + 医保拒付减少 + 漏诊率下降 × 单例赔偿,目标——回答"值不值",能跟院领导、采购、供应商三方都聊得动。
三步走完,手里的全是硬数据,不是靠感觉。
下一篇我打算聊另一个热门品类:AI 病历质控的效果怎么衡量。这个品类有个特别有意思的矛盾——AI 质控越严,医生越反感;AI 质控越松,又没效果。这个平衡点怎么找,我们下篇聊。


夜雨聆风