乐于分享
好东西不私藏

AI开始“审查”医生报告了?npj Digital Medicine最新研究探索大模型医疗质控新模式

AI开始“审查”医生报告了?npj Digital Medicine最新研究探索大模型医疗质控新模式

一份超声报告,看似简单,背后却关系患者诊疗决策

在医院里,一份超声检查报告通常包含:
检查描述;
影像表现;
临床结论。
对于医生而言,这是一份日常工作中非常熟悉的文本。
但你可能不知道:
报告中的一个小错误,有时可能影响后续诊疗。
例如:
描述部分写“右侧乳腺结节”,结论却写成“左侧乳腺结节”;
检查描述提示异常,但最终结论写“未见异常”;
漏掉关键检查项目;
专业术语或文字错误导致理解偏差。
这些问题并不一定来自医生能力不足,而可能与现实临床环境有关:

检查数量不断增加、医生工作压力增大、长时间阅读导致注意力下降。

因此,一个重要的问题出现:
能不能让AI帮助医生进行报告质量检查?
近日,发表于npj Digital Medicine的一项研究,对这个问题进行了探索。
研究团队发现:

大语言模型(Large Language Models, LLMs)具备辅助发现超声报告错误的潜力,但目前仍应作为医生的辅助工具,而不是替代医生。


一、这项研究做了什么?

研究团队收集了来自中国3家医院的超声报告数据:
包括:
浙江省肿瘤医院;
东阳市人民医院;
台州肿瘤医院。
共纳入:
400份超声报告
其中:
300份经过质量控制的无错误报告;
100份包含错误的报告。
这些错误覆盖6类:
检查项目遗漏;
结论逻辑矛盾;
描述错误;
内容重复;
拼写错误;
其他错误。
研究测试了多个主流大模型:
GPT-3.5
GPT-4
GPT-4o
Claude 3.5 Sonnet
并与不同经验水平的超声医生进行比较。

二、大模型真的能发现报告错误吗?

答案:
有一定能力,但不同模型差异明显。
在“不提供示例”的情况下(zero-shot):
Claude 3.5 Sonnet表现最佳:
发现错误:
52.3%
即:
127个错误中发现了约一半。
GPT-4o:
41.2%
GPT-4:
26.7%
GPT-3.5:
4.9%
这说明:
随着模型能力提升,大语言模型对于医学文本逻辑检查能力也在增强。

三、大模型最擅长发现什么?

研究进一步分析:
大模型并不是所有错误都擅长。
其中表现较好的包括:
1. 前后逻辑矛盾
例如:
描述中写:
“发现肝囊肿”
但结论写:
“未见异常”。
这类问题本质是:
文本内部信息不一致。
Claude 3.5 Sonnet能够较好识别此类错误。

2. 项目遗漏
例如:
应该描述某项检查内容,但报告中缺失。
GPT-4o在此类错误检测中表现较好。

3. 拼写和文字错误
这也是目前大模型比较明显的优势。
GPT-4o在拼写错误检测方面表现突出。

四、如果给AI几个示例,它会变得更好吗?

研究进一步测试了:Few-shot learning(少样本学习)
简单理解:
先告诉AI:
“这些是典型错误案例,你按照这个标准检查。”
然后再让它检查新的报告。
结果:
Claude 3.5 Sonnet性能进一步提升。
错误检测率:
从44.9%
提高到:
50.4%
同时:
阳性预测值(PPV)
从75.0%
提高到:
91.4%。
这提示:
未来医学大模型应用中,
高质量医学案例库和提示设计(prompt engineering)非常重要。

五、AI比医生更可靠吗?

这是大家最关心的问题。
研究确实发现:
在部分任务中,大模型表现接近甚至超过部分医生。
例如:
Claude 3.5 Sonnet少样本模式:
错误检测率:
50.4%
最高的一名医生:
54.3%
两者非常接近。
但是:
这并不意味着:
“AI已经超过医生”。
原因很重要:
医生拥有:
临床经验;
疾病背景理解;
对患者整体情况的判断能力。
而大模型目前主要分析:
文本中的逻辑和格式问题。
研究发现:
某些涉及复杂医学语义和临床背景的问题,大模型仍可能失败。

六、AI最大的优势:速度和稳定性

医学报告审核是一项重复性工作。
在速度方面:
Claude 3.5 Sonnet:
平均每份报告:
13.2秒
GPT-4o:
15.0秒
最快医生:
42.0秒。
这意味着:
未来AI更适合承担:
初筛;
质量控制;
提醒风险点。
而医生负责:
最终审核;
临床判断;
患者管理。

七、但不要忽视:医学大模型仍有局限

这项研究也提醒我们:
AI不是万能检查员。
目前主要局限包括:
1. 可能产生假阳性
AI可能把正常描述误认为错误。
这会增加医生额外审核负担。
2. 缺少真正影像理解能力
本研究主要分析:
超声文字报告
而不是直接分析超声图像。
对于:
漏诊;
图像判断错误;
病灶识别错误;
目前模型能力仍有限。
3. 中文医学场景仍需进一步优化
研究指出:
大模型在非英语环境中的表现仍面临挑战,需要针对中文医学场景持续优化。

八、从“大模型”到“临床应用”,下一步在哪里?

这项研究展示了一种非常现实的医学AI路径:
不是让AI直接诊断疾病。
而是:
AI作为医疗流程中的智能质量控制助手。
未来可能形成这样的模式:
医生完成报告
大模型自动检查:
是否存在逻辑矛盾?
是否遗漏关键内容?
是否存在术语问题?
AI提示风险
医生确认修改
生成更规范、更安全的医疗报告

结语

医学大模型真正的价值,
可能不是替代医生完成所有工作。
而是在大量重复、容易疲劳、规则明确的任务中:

帮助医生减少错误,提高医疗质量。

这项发表于npj Digital Medicine的研究告诉我们:
大语言模型已经开始进入医疗质量控制领域,但距离真正临床应用,还需要更多:
多中心验证;
医学专业优化;
安全评价;
与影像AI融合。
未来的医学AI,不只是“会看图”。
它还需要:
理解医学语言、理解临床流程,并成为医生可信赖的智能助手。

论文信息

Yan, Yuqi, Kai Wang, Bojian Feng, Jincao Yao, Tian Jiang, Zhiyan Jin, Yin Zheng et al. "The use of large language models in detecting Chinese ultrasound report errors."NPJ Digital Medicine8, no. 1 (2025): 66.

声明:本文内容仅为人工智能与医学交叉领域的学术交流与科研分享,不作任何直接或间接的商业用途。如本文内容无意中侵犯了您的合法权益,或存在引用不当之处,请通过公众号后台联系我们,我们将第一时间进行核实、修改或删除处理。