乐于分享
好东西不私藏

门诊医生站 AI 怎么评估?一张三层指标表,直接拿走用

门诊医生站 AI 怎么评估?一张三层指标表,直接拿走用

上一篇聊了医院 AI 效果衡量的三层框架,这一篇把它落到具体品类。

医院里的 AI 品类太多,病历质控、影像辅助、CDSS、智能问诊,每个品类的效果指标都不一样,一套表打不了天下。这篇先讲最近推得最多、争议也最大的:门诊医生站的诊疗智能体——就是嵌在医生工作站里,帮医生做鉴别诊断、给治疗建议、辅助决策的那种 AI 助手。

为什么先讲它?因为它介入的是医生最核心的诊疗决策,最难衡量,也最容易"看起来很美,用起来很鸡肋"。

下面的三层指标,每条都按 「指标 + 怎么算 + 经验值 + 怎么用」 写。你可以直接拿去填,也可以根据自己医院的情况删改。

1
第一层 使用指标:医生愿不愿意用

如果这一层的数不好看,后面两层就不用看了。医生都不用的 AI,效果再好也是纸上谈兵。

指标怎么算经验值怎么用
门诊接诊 AI 使用率调用了 AI 的门诊病例数 ÷ 总门诊病例数低于 30%,说明 AI 还没真正融入诊疗流程对外汇报的主指标,但别只看这一个数。自动弹窗会把它虚高,跟"主动调用占比"配对看
人均日调用次数当日 AI 总调用次数 ÷ 当日活跃医生数<2 次是摆设;>15 次要警惕,可能是 AI 不准跟使用率配对。高使用率+低人均=少数人在用;低使用率+高人均=有核心粉丝但没扩散
7 日留存率本周活跃医生中,下周仍活跃的比例最诚实的指标。留存低=新鲜感过了就不用了每周看一次,持续跌的科室要找医生深聊,别自己猜原因
AI 建议忽略率未采纳且直接关闭的 AI 建议数 ÷ AI 总建议数高了说明 AI 要么打扰人,要么说的都是废话按场景分类统计(初诊/开检查/下诊断/开处方),发现某些场景特别废的,关掉
主动调用占比医生主动点击触发的 AI 调用 ÷ 总调用次数区分"医生真的想用"和"系统自动弹出来被迫看"比例低于 50%,自动弹窗该关就关,别让 AI 变成医生的工作负担
诊疗阶段分布初诊/开检查/下诊断/开处方 各阶段调用占比能看出医生把 AI 当什么用不同科室不要拿一个数比。内科高、外科低很正常,外科主要靠手术
2
第二层 效果指标:用了之后,诊疗质量有没有提升

这一层是核心,也是最容易被糊弄的。供应商给你看"准确率 95%",那是测试集数字,不是真实门诊里的效果。

我把效果指标分成三类,从易到难。建议按顺序来,先把 A 类跑通,再冲 B+C 类。

3
A 类 过程质量指标(易测,上线 1 个月就能出)

指标

怎么算

怎么用

诊断完整率

列出≥2 个鉴别诊断的病例 ÷ 总病例数

衡量诊断思维的规范性。AI 辅助后,医生会不会考虑得更周全。HIS/EMR 直接拉数

处方合格率

合格处方数 ÷ 总处方数

用药规范性。必须跟上线前基线比,没基线这个数毫无意义

指南符合率

诊断+治疗方案符合临床指南的病例 ÷ 抽审病例数

诊疗规范性。每月人工抽审 100–200 份。抽审不能只抽 AI 推过的,也要抽没推过的,才能看出 AI 的边际价值

检查合理率

AI 建议的检查中,最终有阳性发现的比例

避免过度检查。反向也能看,AI 建议补充的检查有没有真的帮上忙

A 类指标数据好拿,HIS/EMR 里直接拉。但它还是"过程",不是"结果"。处方合格 ≠ 病人治好。

4
B 类 临床质量指标(中等难度,需要 3–6 个月随访)

这是医生最在意的部分,也是医院信息科最难拿到的部分,因为大部分医院根本没建过基线。

指标

怎么算

怎么用

漏诊率变化

(AI 辅助后漏诊率 − 基线漏诊率) ÷ 基线漏诊率

最重要的安全指标。漏诊比误诊可怕得多,误诊了医生还能纠正,漏诊就是直接放过了

误诊率变化

(AI 辅助后误诊率 − 基线误诊率) ÷ 基线误诊率

诊断准确性。但误诊率下降的价值远不如漏诊率下降

30 天再就诊率

AI 辅助诊疗的患者 30 天内因同一疾病再就诊的比例

首诊质量的间接反映。再就诊率下降,说明首诊更准了

转诊准确率

基层向上转诊中确需转诊的比例 ÷ 总转诊数

适合医联体/社区场景。AI 提升基层能力,转诊更精准

不良事件发生率

与 AI 辅助诊疗相关的药物不良反应/治疗延误等

安全性底线。这个数不能升,升了就要停

怎么测才靠谱?

  • 一定要有对照组。找一个情况相近的科室不用 AI,同期对比。不然你说不清变化是 AI 带来的,还是医生水平自然提高了。

  • 漏诊率怎么定义? 建议用"后续就诊 / 住院确诊推翻初诊"作为代理指标。谁来推翻(谁来审)、推翻争议怎么处理,这两个问题必须在项目启动前定好,不然数据出来没人认。

  • 基线要回溯至少 6 个月。事后用"近 3 个月没用 AI 的病例"做对照,样本量不够、季节因素干扰大,数据基本不能用。

  • 急不得,至少攒 3 个月数据再下结论。第一个月的波动很正常。

5
C 类 效率指标(易测,但容易误读)

指标

怎么算

怎么用

平均接诊时长变化

(AI 辅助后平均接诊时长 − 基线) ÷ 基线

变长不一定是坏事。可能是医生在看 AI 建议、思考更充分了。别单纯按"变长=不好"汇报

病历书写时长变化

AI 辅助后病历书写耗时变化

如果 AI 能自动生成病历初稿,这个指标会明显改善。是 ROI 计算里最容易量化的部分

医生日接诊量变化

医生日均门诊量变化

受号源限制,通常变化不大。别把它当主线

医生工作负荷评分

问卷量表(如 NASA-TLX)

客观数据 + 主观感受结合才全面。建议每季度做一次

正确姿势

质量指标和效率指标放一起看:

  • 质量升、效率也升 → 真的好

  • 质量升、效率略降 → 可以接受,医生多花的思考时间换来了诊疗质量

  • 质量没变化、效率升 → 要警惕,可能只是省了时间,没省脑子

  • 质量降、效率升 → 赶紧停,这种"快"是用病人安全换的

6
第三层 价值指标:投入值不值

到了这一层,就是给院领导算总账。别指望算得特别精确,医疗 AI 的价值很多是间接的、长期的。但你得有个说法。

档位指标怎么算 / 关键动作
第一档 能直接算的钱(院领导最认)人力时间节约每例节约时间 × 年门诊量 × 医生时薪 − AI 年服务费。别只算净节约,运维、培训成本都算进去,不然领导会觉得你在藏成本
第一档 能直接算的钱(院领导最认)医保拒付减少AI 辅助后医保拒付减少金额。信息科通常拿不到,要找医保办或病案室。拿不到就别硬凑
第二档 能讲清楚的间接价值医疗纠纷损失规避漏诊率下降 × 年门诊量 × 单例平均赔偿。给领导最有效的一条,漏诊率哪怕只降 1%,乘以年门诊量就是几百万潜在赔偿节省
第二档 能讲清楚的间接价值基层收入留存(医联体/社区)转诊率下降 × 年门诊量 × 单例平均收入。对县医院、乡镇卫生院特别有效
第二档 能讲清楚的间接价值科研产出论文数 + 课题申报数。汇报时把这块放前面,信息科主任爱听,医生也爱听
第三档 软价值(能讲但难量化)智慧医院评级加分等级医院评审、智慧医院评级、互联互通成熟度测评都是加分项。提前搞清楚今年要冲哪个评审,针对性准备材料
第三档 软价值(能讲但难量化)患者满意度满意度问卷评分变化。容易做,但真实度有疑问,作为辅助证据,别当主线

一个避坑提醒

第一年 ROI 大概率是负的,别硬撑。重点讲"第二年、第三年的边际成本趋近于零"。AI 系统搭好了,多用一个科室、多处理一万份病历,成本增加很少。这是 AI 跟传统 IT 项目最大的区别,也是最值得反复讲的。

7
三个可以立刻动手的小步骤

不用等所有指标都建起来再动。

  • 第 1 个月:挑一个试点科室,跑使用率 + 指南符合率 + 医生主观满意度,目标——确认"有人用,不反感"。
  • 第 3 个月:加一个临床质量指标(漏诊率变化或 30 天再就诊率),找个对照组开始对比,目标——拿出"真的有效果"的初步证据。
  • 第 6 个月:算一笔粗账——人力节约 + 医保拒付减少 + 漏诊率下降 × 单例赔偿,目标——回答"值不值",能跟院领导、采购、供应商三方都聊得动。

三步走完,手里的全是硬数据,不是靠感觉。

下一篇我打算聊另一个热门品类:AI 病历质控的效果怎么衡量。这个品类有个特别有意思的矛盾——AI 质控越严,医生越反感;AI 质控越松,又没效果。这个平衡点怎么找,我们下篇聊。