一份超声报告,看似简单,背后却关系患者诊疗决策
描述部分写“右侧乳腺结节”,结论却写成“左侧乳腺结节”;这些问题并不一定来自医生能力不足,而可能与现实临床环境有关:检查数量不断增加、医生工作压力增大、长时间阅读导致注意力下降。
近日,发表于npj Digital Medicine的一项研究,对这个问题进行了探索。大语言模型(Large Language Models, LLMs)具备辅助发现超声报告错误的潜力,但目前仍应作为医生的辅助工具,而不是替代医生。
一、这项研究做了什么?
二、大模型真的能发现报告错误吗?
随着模型能力提升,大语言模型对于医学文本逻辑检查能力也在增强。
三、大模型最擅长发现什么?
Claude 3.5 Sonnet能够较好识别此类错误。
四、如果给AI几个示例,它会变得更好吗?
研究进一步测试了:Few-shot learning(少样本学习)Claude 3.5 Sonnet性能进一步提升。高质量医学案例库和提示设计(prompt engineering)非常重要。
五、AI比医生更可靠吗?
某些涉及复杂医学语义和临床背景的问题,大模型仍可能失败。
六、AI最大的优势:速度和稳定性
七、但不要忽视:医学大模型仍有局限
大模型在非英语环境中的表现仍面临挑战,需要针对中文医学场景持续优化。
八、从“大模型”到“临床应用”,下一步在哪里?
结语
帮助医生减少错误,提高医疗质量。
这项发表于npj Digital Medicine的研究告诉我们:大语言模型已经开始进入医疗质量控制领域,但距离真正临床应用,还需要更多:理解医学语言、理解临床流程,并成为医生可信赖的智能助手。
论文信息
Yan, Yuqi, Kai Wang, Bojian Feng, Jincao Yao, Tian Jiang, Zhiyan Jin, Yin Zheng et al. "The use of large language models in detecting Chinese ultrasound report errors."NPJ Digital Medicine8, no. 1 (2025): 66.
声明:本文内容仅为人工智能与医学交叉领域的学术交流与科研分享,不作任何直接或间接的商业用途。如本文内容无意中侵犯了您的合法权益,或存在引用不当之处,请通过公众号后台联系我们,我们将第一时间进行核实、修改或删除处理。