点击蓝字 ·关注我们
每天一篇顶刊解读
相信每一位临床护士都有这样的经历。
夜班结束。
病人终于稳定了。
可真正的“第二场战斗”才刚刚开始。
打开HIS。
护理记录。
护理评估。
交班记录……
等全部写完,至少半个小时过去了。
如果以后护士不用敲键盘,而是像和同事聊天一样,把护理过程说出来,AI自动生成标准护理记录,会发生什么?
台湾中国医药大学医院研究团队发表在 JMIR Nursing(2026) 的一项研究结果表明:AI不仅能写,而且写得几乎和护士一样。

文章信息
英文标题:Voice-Based Structured Nursing Documentation Using Automatic Speech Recognition and Large Language Models: Development and Evaluation Study
中文译名:使用自动语音识别和大语言模型生成基于语音的结构化护理记录:一项开发与评估研究
文章类型:横断面比较研究 + 前瞻性观察研究
发表期刊:JMIR Nursing
影响因子:5
分区:JCR Q1区
文章速览
为缓解临床护士手动录入病历耗时且易遗漏的负担,本研究开发并评估了一套集成自动语音识别(ASR)与大语言模型(LLM)的结构化护理文书系统。
团队利用来自急诊和病房真实的中英夹杂护理语音,对 Whisper 模型进行了微调,随后通过 GPT-4o 模型及模式约束提示,将护士的语音输入自动生成为标准化的 DART(数据、行动、反应、卫教)记录,在经过护士人工核对确认后上传至医院信息系统(HIS)。
研究结果证实,定制优化的语音识别结合大语言模型,能高准确度且极低“幻觉”地自动生成结构化护理记录,在真实临床部署中获得了显著的使用增长。多数护士反馈该系统有效减轻了手工录入负担并提升了文书完整性,表明在保留人工把关的前提下,该智能工作流能切实优化临床效率。
这项研究怎么做的?
定制专属AI听力:团队利用525名护士真实的“中英夹杂”临床语音及合成数据,微调了 Whisper 语音识别模型,使其能够精准识别各类护理专业术语和缩写。
大模型智能排版:语音转录后,系统利用 GPT-4o 大模型及“模式约束提示”技术,将口语化文本严格转化为标准的 DART(数据、行动、反应、卫教)结构化格式。
DART字段 | 写什么 | 例子 |
D - Data (数据) | 客观观察、评估数据 | SpO2 92%,呼吸稍促 |
A - Action (措施) | 你做了什么 | 给予氧气2L/min,鼻导管给氧 |
R - Response (反应) | 病人有什么变化 | SpO2回升至96%,呼吸平稳 |
T - Teaching (宣教) | 你给病人/家属说了什么 | 指导深呼吸技巧,家属表示理解 |
人机协作安全防线:确立了严谨的临床工作流,护士在床旁通过移动端完成语音输入,AI 生成记录后,必须由护士进行人工审核确认,方可最终上传至医院信息系统。
多维度评估:团队不仅通过混合错误率 (MER) 评估听写精度、用 F1-score 及非劣效性检验评估分类准确度,还严格测试了 AI 的“幻觉率”以防其瞎编乱造。此外,研究还连续半年追踪了病房的实际使用量及120名护士的主观反馈,以验证真实可行性。
这个系统怎么工作?
第1步:对着手机说观察到的情况和护理措施
第2步:AI帮你整理成DART格式
第3步:检查确认,一键上传HIS

核心结果
结果一:专属语音识别准确率大幅提升
混合错误率(MER)从零样本条件下的44.79%大幅下降至6.67%,相对错误降低85.11%。
这说明经过护理专业语料训练后的语音识别模型,无需重新训练大模型,已经能够较好地适应临床护理环境中的中英文混合表达和专业医学术语。只需通过少量科室真实语音数据,就能低成本解决临床语音识别核心短板,是基层医院可复制的改造方案。
结果二:结构化记录生成媲美人工且幻觉率极低
结果显示系统自动生成的 DART 结构化记录在分类准确度上完全达到了相对于人工撰写的非劣效性标准。针对大语言模型最令人担心的幻觉问题。本研究显示,AI生成护理记录的幻觉率仅为2.51%,远低于未经护理场景优化模型的8.98%。
这主要得益于两项设计:一是采用了严格限制输出格式的Schema-constrained Prompt(结构化提示词),避免模型自由发挥;二是系统始终坚持Human-in-the-loop(人工审核)模式,所有护理记录均需护士确认后才能上传HIS,因此既保证了记录质量,又兼顾了临床安全性。
结果三:临床部署应用量显著翻倍
研究团队还观察了系统在真实病区中的应用情况。系统正式部署后,仅6个月时间,每月生成并上传至HIS的护理记录数量由32,724份增加至65,417份,实现近2倍增长。
研究者分析认为,这一增长并非由于患者数量增加,而是因为系统属于自愿使用,能够持续获得越来越多护士的主动采用,说明该系统具有较高的临床接受度和实际应用价值。同时,系统支持护士在床旁直接语音记录护理过程,减少了返回护士站后依赖记忆补录护理记录的情况,有助于降低遗漏和延迟记录带来的风险。
结果四:切实减轻文书负担并优化工作流
在120名参与反馈的护士中,75.8%(91名)表示系统减轻了工作量并提升了记录完整性。积极反馈集中在手动转录负担减少和文档效率提升上。也有24.2%的护士提出建议,主要集中在个别专业术语偶尔识别不准确,以及生成内容仍需人工审核。
研究者认为,该ASR+LLM集成系统在真实临床环境中可行且高效,不仅技术性能强劲,更获得了护士的良好接受度。它直接缓解了护理人员长期面临的文书压力,为结构化护理记录工作流提供了创新解决方案。尽管存在数据集单一等局限性,但整体为未来智慧护理文档的发展指明了方向:让AI成为护士的得力助手,而非替代者。
小结
这项研究最大的价值,并不只是证明AI可以写护理记录,而是证明了AI能够真正融入临床护理工作流。 从“护士说、AI写、护士审”的闭环模式来看,未来护理文书工作有望从传统键盘录入,逐步转向智能语音记录。
对于临床而言,这意味着AI不是取代护理,而是帮助护士减少机械劳动,把更多时间真正还给患者。这样的应用模式,也代表了护理人工智能未来发展的重要方向。
选题启示
该研究局限于单体医疗中心(CMUH),推荐选题:基于大语言模型的语音护理病历系统在多中心医院环境下的泛化能力与应用评估。探究该系统在面对不同方言口音、不同医院特有缩写习惯时,其识别准确率是否会衰减。
或者直接跳出准确率评估,将目光转向临床结局,推荐选题:AI 辅助智能语音录入对降低临床护士职业倦怠及减少护理不良事件的长期影响分析。
此外,纯语音输入依然有局限性,可以设计一项研究将护士佩戴的智能设备以及直接从床旁监护仪读取的生命体征数据实时融合,利用多模态大模型自动生成图文并茂、数据精准的全方位护理评估记录,推荐选题:融合视觉、语音与实时监护数据的多模态大模型(Multimodal LLM)在智能护理文书生成中的应用研究。
原文:Su MH, et al. Voice-Based Structured Nursing Documentation Using Automatic Speech Recognition and Large Language Models: Development and Evaluation Study. JMIR Nursing, 2026, 9:e88567
本文为学术解读,仅供交流参考。
如需论文原文
公众号后台回复0701领取
整理不易
您的点赞就是对小编最大的鼓励!
期待你的
分享
点赞
在看
夜雨聆风