AI如何落地临床实践?从工具到队友

题目:From tool to teammate in a randomized controlled trial of clinician-AI collaborative workflows for diagnosis
期刊:《npj digital medicine》,影响因子15.1
1.研究背景:早期AI研究显示,医师在使用基础LLM时性能反而不佳,凸显人机交互设计的重要性。本研究旨在解决此问题,开发了协作工作流系统,以促进医师与AI的独立分析→整合→批判式对话。研究评估两种工作流:AI优先意见(医师先看AI诊断)和AI第二意见(医师先诊断后看AI反馈)。
2.方法设计:研究对象70名美国内科医师(39名住院医师,31名主治医师),随机分配到AI优先组(n=27)或AI第二意见组(n=43)。
不进行模型微调,仅通过多部分定制化系统提示词实现功能改造,让 GPT-4 具备三大核心能力:独立的临床诊断分析、整合医生与 AI 的推理观点、与医生的开放式对话。
AI 会生成 5 个鉴别诊断(按可能性排序)、7 个诊疗下一步建议,匹配医生的临床推理逻辑,且会生成整合视图,清晰展示双方对每个诊断的支持 / 反对证据。
使用6个临床病案(clinical vignettes),通过19分制评分(2名医师盲评)衡量准确性,包括证据支持度、最终诊断和推荐行动。
3.主要结果:
诊断性能显著提升:AI辅助组整体准确性显著高于仅常规资源组。AI独立准确率达90%,但协作组与之无显著差异。AI第二意见组中36%病例在临床可行动决策上有所提升;但在8%病例中,AI错误导致性能下降。
工作流程顺序的影响:AI优先组在可行动决策方面优于AI第二意见组(,且病例处理更快。AI第二意见下,AI易“锚定”医师输入(48%病例中AI与人类诊断完全重叠),而AI优先组仅3%。
交互方式与人机关系差异:AI第二意见组参与者更频繁使用拟人化语言(如“Great thought!”)和表达感谢,显示出更“对话式”关系。
4结论与启示:
协作设计提高了诊断“底线”,而非整体均分提升,证明AI可通过互补能力优化临床决策。
工作流程顺序锚定偏差需针对性设计策略;AI第二意见模式下AI易出现“谄媚效应”(sycophancy)。
医师接受度高(≥95%开放未来临床整合),但研究局限性包括:依赖病案模拟(非真实临床)、AI输出不确定性、采样偏差。
此篇文献是AI如何落地临床的一个很好示范,落地临床的和兴不是提升模型性能,而是如何更好的人机交互,该研究中并未采用专用模型,而是在通用大模型的基础进行适配,成本更低。对于基层医院来说,AI协作能够让医疗资源下沉,让普通医生更接近专家水平。未来如何在真实医疗场景中使用AI,如何评估AI的诊断,仍然是重点需要关注的问题
夜雨聆风