ARTICLE · 1155238
AI工具判断家用血压计是否通过临床验证的结果并不可靠

美国心脏协会研究显示,AI搜索工具判断家用血压计是否通过临床验证的结果并不可靠,识别的准确性因所使用的AI驱动工具不同而差异显著,三款准确率仅为63%至83%,可能误导患者的治疗和用药选择等。关注详情。
阅读文摘
美国心脏协会将在2026年高血压科学会议发布的一项初步研究提醒:用AI搜索工具查询家用血压计是否通过临床验证标准,结果并不可靠。四款领先的AI搜索工具中有三款在准确识别符合已验证临床标准的家用血压监测仪时准确性各不相同。
《2025年美国心脏协会成人高血压预防、检测、评估和管理指南》建议人们使用已通过准确性验证的家用血压监测设备。人们可以与自己的临床医生交谈,并访问专业网站获取更多信息。
既然AI驱动的搜索工具已整合到所有在线平台,人们也越来越多地向AI工具寻求健康问题的快速答案,包括血压监测仪等家用健康设备是否已经过验证并符合临床标准。
当独立第三方测试证明家用血压监测仪能持续给出准确的血压读数时,该监测仪就被认为已通过验证;有三个主要注册登记处会列出这些设备。在这项分析中,研究人员发现AI驱动的聊天机器人无法可靠地做出这一判断。
研究发现大多数AI工具的表现差强人意,即便是表现最好的谷歌Gemini,也经常出错,找不到很容易找到的信息。人们可能不知不觉地根据AI工具不准确的回答而认为某设备已经过验证。值得关注的是使用该设备可能导致不准确的血压读数,进而可能导致不恰当的诊断或治疗决定。
研究还发现,识别家用血压监测仪是否符合临床标准的准确性,因所使用的AI驱动工具不同而差异显著。谷歌Gemini得分最高,根据问题措辞不同正确回答率为86%至91%,ChatGPT、Copilot和Perplexity的正确回答率仅为约63%至83%。
所有四种AI工具在识别已通过临床验证血压监测仪方面,都不如识别未验证监测仪准确。当研究人员对准确性结果不一致的设备重新测试AI工具的回答时,即在不同的日子或不同的电脑上向同一AI工具询问相同问题,AI工具常常给出不同答案。
研究人员还测试了多种设备,包括不太知名的家用血压监测仪,尽管研究人员指出,这些设备与更知名的设备出现在相同的官方注册登记处。因此无法确定为什么AI工具难以识别已经通过验证测试的设备。
更令人惊讶甚至几乎反直觉的是,AI工具在专门识别已验证设备方面竟如此困难,因为这些设备正是在官方注册登记处有明确列表的设备。
在许多情况下,AI工具发现该血压监测仪列在某个官方网站内;然而,AI似乎无法将出现在注册登记处解释为验证证明。这项研究结果所显示的AI潜在缺陷应提醒临床医生和公众,将AI用于临床决策需要谨慎。
这项研究存在的局限性是,随着AI技术随时间不断改进,这些结果很可能发生变化。此外,为限制每种工具从先前的测试搜索中学习的能力,科学家使用了私密互联网浏览会话;然而,这一方法无法完全阻止AI工具的语言模型训练。

关注长寿医学及科技国际资讯,扫码加入微信群(实名+机构名称)
扫码加入专业交流群

(群规: 实名+机构)
加入【亚太长寿医学会】微信联系
GlobalMD2026或APACLONGEVITYSOCIETY

关注我们,获取生物医学前沿最新资讯