AFP助手:一个为低资源语言社区提供检索增强生成和大型语言模型支持的多语言脊髓灰质炎聊天机器人
基于MRI的瘤内异质性量化预测ER+/HER2−乳腺癌复发风险
文献讨论:上尿路尿路上皮癌围手术期多模态融合与深度学习预后系统:一项多中心研究
AI语音助手Sofiya在术前患者准备中的应用:
一项前瞻性两阶段评估研究
Implementation of an AI Voice Assistant for Preprocedural Patient Calls
论文基本信息
标题:Prospective Two-Phase Evaluation of Implementation of an AI Voice Assistant for Preprocedural Patient Calls(AI语音助手在术前患者电话沟通中的前瞻性两阶段实施评估)
期刊:Journal of Vascular and Interventional Radiology (JVIR),Elsevier出版
作者:Jafar B. Kani、Soroush Hooshmand、Daniel J. Kim、Timothy M. Kahan、Amit Gupta、Ari Wachs、Gustavo Oderich、Jeffrey W. Olin、David J. Finlay、Sabine B. Doniger、Jason A. Botta、Jason C. Kovacic、Sham J. Meraney
通讯机构:Mount Sinai Health System(西奈山医疗系统),纽约
通讯邮箱:Sham.Meraney@mountsinai.org
一、研究背景与目的
1.1 研究背景
术前患者准备电话是介入放射学等手术前的关键临床沟通环节。传统模式下,注册护士(RN)需手动拨打电话,向患者提供手术相关信息(时间、地点、停车指引、禁食要求、出院注意事项等),同时采集临床数据(过敏史、用药情况、糖尿病、透析等),并解答患者的各类问题。这一过程耗时耗力,护士面临大量重复性工作。以西奈山Health System为例,约15,000至18,000名患者在介入手术前需要护士电话沟通,涵盖9个介入放射科、9个手术室、5个杂交手术室以及12名介入放射科医生的团队,工作负荷极其沉重。
近年来,大型语言模型(LLM)和AI语音技术的快速发展为医疗领域带来了变革机遇。尽管AI语音助手在患者预约提醒、手术前教育和远程患者监测等方面已有探索,但在真实的介入放射科临床环境中进行前瞻性评估的研究仍然有限。
1.2 研究目的
本研究旨在评估一种名为Sofiya的AI语音助手在术前患者电话沟通中的有效性。Sofiya能够自主联系患者,提供手术前说明,采集临床变量,回答患者问题,并生成结构化报告供注册护士审核。研究通过前瞻性两阶段设计,评估该系统在真实临床环境中的表现,重点关注通话完成率、患者满意度以及AI系统的优化改进效果。
二、研究方法
2.1 系统架构与工作流程
Sofiya是一款由AI驱动的数字语音助手,专门设计用于介入手术前的患者电话沟通。整个工作流程包括五个核心步骤:首先,Sofiya按照管理员预先输入的时间表联系预约手术的患者,提供手术时间、地点、停车指引、禁食要求、出院注意事项等信息,并在身份验证后采集临床数据(过敏史、用药情况、糖尿病、透析、发热等),同时回答患者的各类问题;第二步,通话记录、摘要和临床变量通过在线门户提供给注册护士审核;第三步,注册护士在门户上审查通话记录,并根据既定方案决定是否需要回拨患者;第四步,注册护士做出必要的修改或评论,验证AI生成报告中信息的准确性;第五步,经审核确认的报告被扫描录入患者的电子健康记录(EHR)系统。
在护士决定回拨患者的情况下,回拨触发条件分为后勤类和临床类两类。后勤类触发条件包括:患者拒绝AI沟通、要求与护士直接通话、需要调整预约或取消手术、需要交通安排等。临床类触发条件包括:患者正在使用抗凝药物、糖尿病患者正在使用胰岛素、使用相关药物输液泵、碘造影剂/静脉造影/贝类过敏等。
2.2 两阶段评估设计
研究采用前瞻性两阶段设计。第一阶段(Phase I)为期90天,为系统优化期,Sofiya团队在此期间持续对系统进行主动优化和迭代改进,包括功能更新和流程调整。第二阶段(Phase II)同样为期90天,为常规运营期,系统在注册护士监督下进行常规运营,不再进行主动的系统优化,旨在评估优化后的系统在稳定状态下的表现。
2.3 评估指标
主要评估指标包括:每周通话完成率(完成通话占总通话的比例)、通话完成的分类构成(患者自助解决无需回访、需要方案驱动回访的各类原因、适当的人工通话转化原因等)、通话未完成的分类构成(患者相关问题、AI系统可靠性问题等)。次要评估指标为患者满意度,通过10项问卷进行评估,涵盖指示清晰度、准备充分性、易理解性、预期一致性、通话与手术体验匹配度、通话舒适度、信息详细程度、问题回答有效性、不明确或缺失领域、通话在术前准备中的整体有效性等维度。
三、研究结果
3.1 通话完成率
在第一阶段(优化期),共拨打806通电话,通话完成率为86.4%(696通)。其中,36.6%的患者通过自助服务解决且无需回访,37.6%需要方案驱动的回访(包括临床问卷21.1%、临床澄清8.1%、患者要求回电1.5%、后勤/取消/重新安排7.0%),12.2%适当转化为人工通话。在第二阶段(常规运营期),共拨打800通电话,通话完成率提升至87.9%(703通),其中42.6%的患者通过自助服务解决且无需回访,较第一阶段有显著提升。
值得注意的是,患者自助解决无需回访的比例从第一阶段的36.6%上升至第二阶段的42.6%,表明系统优化后患者对AI助手的接受度和自助解决问题的能力有所增强。与此同时,需要方案驱动回访的比例从37.6%下降至33.5%,AI拒绝的比例从4.3%下降至2.8%,患者验证失败率从1.7%大幅下降至0.1%,AI幻觉发生率从0.7%降至0%。
3.2 通话未完成原因分析
通话未完成率从第一阶段的13.7%(110通)下降至第二阶段的12.1%(97通)。未完成原因中,患者相关问题从7.7%上升至9.1%(主要因未接听电话和中途挂断略有增加),而AI系统可靠性问题从6.0%大幅下降至3.0%。其中,技术错误从2.9%降至2.6%,患者验证失败从1.7%降至0.1%,AI幻觉从0.7%降至0%,干扰环境(电视噪音等)从0.6%降至0.3%。这表明经过第一阶段的系统优化,AI系统的可靠性得到了显著提升。
3.3 患者满意度
患者满意度调查覆盖542名患者(第一阶段)和571名患者(第二阶段)。10项问卷的平均满意度从第一阶段的94.7%提升至第二阶段的98.1%。具体来看,指示清晰度从97.2%提升至99.1%,准备充分性从94.5%提升至97.4%,易理解性从94.1%提升至97.4%,通话舒适度从93.9%提升至98.3%,信息详细程度从95.2%提升至98.3%,问题回答有效性从95.7%提升至99.1%,不明确或缺失领域从89.1%大幅提升至96.5%,整体通话有效性从92.1%提升至97.4%。所有维度的满意度均呈现正向改善趋势。
3.4 临床工作流程对比
研究详细对比了AI实施前后的工作流程变化。在呼叫发起环节,AI实施前由护士手动拨打患者电话,无人接听是主要挑战;AI实施后Sofiya按管理员输入的时间表自动拨打,并在无人接听时自动重拨。在提供基本信息环节,AI实施前护士需花费大量时间提供手术基本信息;AI实施后Sofiya在通话中直接提供信息,仅在患者身份验证后进行。在采集临床数据环节,AI实施前护士手动采集并录入EHR;AI实施后Sofiya自动采集数据并生成报告,护士仅需验证并在必要时回拨患者。在回答患者问题环节,AI实施前护士需回答简单重复及复杂问题;AI实施后Sofiya基于训练数据回答问题或将患者转接至护士。在报告环节,AI实施前护士手动录入报告至EHR;AI实施后管理员直接扫描Sofiya的报告至EHR。
四、讨论
4.1 主要发现
本研究的核心发现表明,AI语音助手Sofiya在介入放射科的术前患者电话沟通中具有良好的可行性和有效性。经过90天的系统优化期后,通话完成率稳定在87.9%,患者满意度达到98.1%的高水平。更为重要的是,系统优化带来了显著的性能改善:患者自助解决率从36.6%提升至42.6%,AI系统可靠性问题从6.0%大幅下降至3.0%,AI幻觉完全消除(从0.7%降至0%),患者验证失败率从1.7%降至0.1%。
4.2 系统优化的价值
研究充分证明了主动系统优化阶段的重要价值。通过第一阶段90天的持续迭代改进,系统在多个关键指标上实现了显著提升。团队在此期间进行了功能更新和流程调整,包括优化患者身份验证流程、改进临床问卷的逻辑判断、增强AI对复杂临床场景的理解能力等。这些优化措施的效果在第二阶段得到了充分验证,系统在无主动优化的情况下仍能维持高质量表现。
4.3 临床意义
从临床工作流程的角度来看,Sofiya的引入显著减轻了注册护士的重复性工作负担。在传统模式下,护士需要手动拨打大量电话,提供标准化的术前信息,采集结构化的临床数据,回答患者的各种问题,并手动录入报告。这些工作占据了护士大量的时间和精力,影响了其处理更复杂临床任务的能力。Sofiya通过自动化处理这些标准化任务,使护士能够将更多精力投入到需要专业判断的临床决策中,实现了人机协作的最优配置。
4.4 研究局限性
本研究存在若干局限性。首先,这是一项单中心研究,仅在西奈山Health System的一个院区进行,结果的外推性需要在多中心环境中进一步验证。其次,研究仅涵盖介入放射科的术前电话场景,Sofiya在其他临床科室和场景中的适用性尚不明确。第三,研究未设置随机对照组,无法直接量化AI助手相对于传统人工模式的效率提升幅度。第四,患者满意度调查可能受到选择偏倚的影响,参与调查的患者可能更倾向于对新技术持积极态度。
五、结论
本研究证明了AI语音助手Sofiya在介入放射科术前患者电话沟通中的可行性和有效性。经过90天的系统优化,系统实现了87.9%的通话完成率和98.1%的患者满意度,AI系统可靠性问题显著减少,AI幻觉完全消除。研究结果表明,在经过适当的系统优化和临床验证后,AI语音助手可以有效地替代或辅助护士完成标准化的术前电话沟通任务,减轻临床工作负担,同时保持高质量的患者体验。未来需要在更多临床场景和更大规模的研究中进一步验证该系统的普适性和长期效益。
附录:图表与图注
表1:前瞻性两阶段评估中AI语音助手Sofiya的通话完成率

表1. 前瞻性两阶段评估中AI语音助手Sofiya的通话完成率。展示了Sofiya在90天优化期(第一阶段)和随后90天护士监督下的常规运营期(第二阶段)的性能表现。第一阶段(N=806)通话完成率为86.4%(696通),第二阶段(N=800)提升至87.9%(703通)。患者自助解决无需回访的比例从36.6%提升至42.6%,AI系统可靠性问题从6.0%下降至3.0%,AI幻觉从0.7%降至0%。
表2:患者满意度评分

表2. 患者满意度评分。通过10项问卷评估患者对AI语音助手的满意度,第一阶段(n=542)平均满意度为94.7%,第二阶段(n=571)提升至98.1%。所有维度均呈现正向改善,其中"不明确或缺失领域"提升最为显著(从89.1%至96.5%)。
表3:AI语音助手Sofiya实施前后临床工作流程对比

表3. AI语音助手Sofiya实施前后的临床工作流程对比。展示了呼叫发起、提供基本信息、采集临床数据、回答患者问题和报告录入五个环节中,护士旧工作流程、护士新工作流程和Sofiya工作流程的差异。
图1:通话完成率的时间趋势

图1. 通话完成率的时间趋势。蓝线表示前瞻性两阶段评估中AI语音助手Sofiya术前患者准备通话的每周成功完成率。(a) 第一阶段(优化期)中通话完成率随Sofiya主要更新(红色虚线)和新功能实施(橙色虚线)的时间变化趋势(橙色线表示根据系统更新划分的阶段性均值);(b) 第二阶段(常规运营期)在无显著系统变更情况下的通话完成率。两个阶段中绿色虚线分别表示各自的平均完成率。AI,人工智能;DOB,出生日期;Txt,文本;LLM,大型语言模型。
图2:Sofiya工作流程图

图2. Sofiya工作流程图。(1) Sofiya联系预约手术的患者,提供说明、采集临床变量并回答问题;(2) 通话记录、摘要和临床变量通过在线门户提供审核;(3) 注册护士在门户上审查通话记录,并根据方案驱动的原因在必要时回拨患者;(4) 注册护士做出必要的评论或修改,并验证AI生成报告的信息准确性;(5) 报告被扫描录入患者的电子健康记录(EHR)。AI,人工智能;IV,静脉注射。
图3:Sofiya门户监控仪表板

图3. Sofiya门户监控仪表板显示每次通话的状态。门户上为每次AI辅助通话创建新记录,反映通话状态,使护士能够按紧急程度优先处理审核任务。AI,人工智能。
图4:成功完成的AI通话报告

图4. 成功完成的AI通话报告。(a) 全自动通话的AI生成报告,无需护士回访;(b) 带有评论(红色方框标注)的AI生成通话报告,因用药原因需要护士回访,患者正在服用Eliquis抗凝药物。AI,人工智能。
图5:未完成AI通话的报告

图5. 未完成AI通话的报告。该通话被归类为未完成,原因是患者在收到手术说明后挂断电话,未完成病史问卷(红色方框标注)。AI,人工智能;DOB,出生日期;NPO,禁食。

夜雨聆风