ARTICLE · 1133477
《在线症状检查工具格式对健康素养与AI信任的影响:一项随机对照试验》

一、背景与问题
在线症状检查工具作为循证健康信息工具,已由英国国家健康服务体系(NHS)、澳大利亚healthdirect等主流机构向公众提供逾十年。在强调减少不必要低价值医疗、提供可及且可信健康建议的政策背景下,这类工具的重要性日益凸显,尤其是在ChatGPT等通用人工智能工具普及的当下。然而,研究显示症状检查工具面临两大挑战:一是使用率与依从性不足,即便人们使用了工具,也未必遵循其分诊建议;二是现有设计可能加剧健康不平等与数字鸿沟,使用者更多集中于女性、高学历、白人和数字素养较高的人群,而医学术语的滥用可能妨碍低健康素养人群的使用。信任是影响工具使用的关键因素,除数据隐私、权威背书等共性问题外,用户还常感到工具未能充分理解其症状。
在此背景下,作者开展了一项在线随机对照试验,评估不同症状检查工具格式对症状管理知识、信任度、可接受性及行为意图的影响,尤其关注人工智能增强格式的作用。该研究由悉尼大学健康素养实验室与澳大利亚healthdirect合作完成。

二、研究方法
研究采用两个5臂平行组在线随机对照试验设计,于2025年6月通过在线研究面板招募2062名澳大利亚成年人。参与者中男性占49%,女性占51%,中位年龄49岁(IQR=28)。参与者首先阅读一个假设的健康场景(发热和呕吐),随后查看来自healthdirect的症状检查工具截图。
参与者被随机分配至两种症状严重程度之一:低严重度(建议居家自我照护)或中等严重度(建议24小时内就诊全科医生),并进一步随机分配至五种工具格式之一。标准格式展示healthdirect现有症状检查工具的建议;其余四种为“AI增强”版本,均包含针对特定症状的定制化建议、相关信息链接、AI生成内容声明,以及低严重度情况下的安抚性语气,并明确解释症状与分诊级别的关系。四种AI增强格式的区别在于附加特征:编号步骤、多介质(发热管理视频和图片)、更详细的AI使用信息,以及基础AI增强版。
主要结局指标为遵循自我照护建议和24小时内就诊全科医生的意图;次要结局包括对建议的信任度、症状管理知识及工具可接受性。所有结局在干预后立即评估,知识还在2周后随访评估。信任度采用单项10点李克特量表及认知信任(4项)和情感信任(3项)量表评估;知识采用基于干预内容的自编多选题,分别评估当前症状管理和变化症状管理两个维度;可接受性采用5点李克特量表评估未来使用、推荐意愿和期望满足程度。分析采用意向性治疗原则,使用Kruskal-Wallis检验和单因素方差分析,事后比较采用Dunn检验并作Bonferroni校正。

三、主要发现
行为意图方面:当建议居家自我照护时,AI增强组报告24小时内就诊全科医生的意图显著低于标准组(中位数3.00 vs 4.00,校正p=0.003)。在其他情况下,格式对意图无显著影响。值得注意的是,在中等严重度建议就诊的情况下,各格式间未见差异。
知识方面:干预后立即评估显示,无论症状严重程度如何,查看AI增强格式的参与者对当前症状和变化症状的管理知识均显著优于标准格式组(校正p<0.001)。具体而言,与标准组相比,详细AI信息组的平均差异为-8.0%(95%CI:-11.1%至-4.9%,p=0.023),多介质组为-9.4%(95%CI:-12.3%至-6.6%,p=0.003)。然而,这些知识增益在2周随访时未能持续。
信任与可接受性方面:各格式间信任度和可接受性均较高,且无显著差异。明确披露AI使用信息并未对信任或可接受性产生负面影响。
探索性分析:在低严重度情况下,分层分析显示AI格式降低就诊意图的效果在以下人群中更为明显:大学学历者(p=0.012)、过去6个月未使用ChatGPT者(p=0.012)、无慢性病者(p=0.007)和60岁及以下者(p=0.008)。而在无大学学历、有ChatGPT使用经验、有慢性病或60岁以上人群中未观察到这一模式。性别间无差异。敏感性分析排除注意力不集中参与者后结果稳健,多重插补分析结果一致。

四、讨论与意义
该研究具有多重意义。首先,它首次定量比较了不同症状检查工具格式的效果,发现针对低严重度症状,更个性化的信息可能减少不必要的医疗服务使用。两个关键设计特征可能促成这一效果:使用可操作的简明语言建议管理当前和变化症状,以及更清晰地描述居家管理的理由。这些特征恰好针对了症状检查工具长期存在的问题。
其次,该研究是首批探索公众对在线症状检查工具中使用生成式AI反应的研究之一。明确披露AI使用并未显著影响信任或可接受性,这与更广泛的文献一致——人们日益转向ChatGPT等通用AI工具获取健康建议,随着对生成式AI工具的熟悉和胜任度提高,信任度也可能增加。本研究中AI被整合进可识别的国家健康服务机构(healthdirect),配以政府标识、网址和临床医生审核声明等视觉线索,这些特征可能增强了感知可靠性。
然而,研究也存在若干局限。所有组别均观察到高意图水平,可能限制了检测格式差异效应的能力。主要结局(意图)和知识采用自编条目,虽与研究生境高度相关,但未经验证,可能无法可靠准确地反映潜在构念。此外,症状检查工具以截图形式呈现,参与者对交互式版本(尤其是强调视觉设计的多媒体格式)的反应可能不同。研究采用假设场景,允许参与者回应真实关切将提供更具普适性的发现。

五、结论与展望
该研究表明,提供更定制化建议的在线症状检查工具格式能更好地帮助人们掌握症状管理知识,并有证据显示这些格式可能有助于减少可安全居家管理的症状对初级保健服务的不必要使用。明确使用AI并未对在线症状检查工具的信任或可接受性产生显著影响。未来研究应使用交互式原型,在更广泛的健康情境中调查这些格式,以增强外部效度和普适性。对于政策制定者和工具开发者而言,这些发现提示:利用AI增强症状检查工具的建议可能不会对信任和可接受性产生负面影响,反而可能改善适当的症状管理,但需进一步研究验证其在真实世界中的效果。
文章还提示,面向普通民众的AI 症状自查工具,不必过度堆砌复杂附加信息,核心应当聚焦输出贴合具体症状的定制化建议、清晰易懂的分诊逻辑解释,能够即时提升使用者的症状管理认知,在轻症场景下减少过度就医。不必担心披露 AI 身份会破坏用户信任。本研究对公共卫生领域 AI 科普工具、数字分诊产品的界面设计、信息呈现策略具备重要参考价值。



Some talk to you in their free time and some free their time to talk to you. Learn the difference. 有人是在空闲时分才想起与你寒暄,有人是特意腾出整段时光只为和你深谈,要读懂这其中的分量差。早上好!
