ARTICLE · 1112474
当AI走进HIV诊室:10款大模型谁更靠谱?
你有没有想过,有一天你走进诊室,对面坐着的不再是穿白大褂的医生,而是一个聊天机器人?它快速阅读你的病历,几秒钟内给出诊疗建议,你拿着它开的处方去取药——这听起来像是科幻电影里的情节,但大型语言模型在医疗领域的应用,正在让这个场景离我们越来越近。
尤其在HIV管理这个领域,情况更是复杂到让人头疼。感染者需要终身服药,治疗方案不断更新,还要应对各种机会性感染、药物耐药、合并症……光是听上去就够让人焦虑了。而在偏远地区或者医疗资源匮乏的地方,想找个HIV专家当面咨询,简直难上加难。这时候,如果AI能充当“线上专家”,给一线医生提供即时参考,那该多好?
想法很美好,现实却让人捏把汗。这些AI模型,到底靠不靠谱?
最近,一篇发表在 Communications Medicine 上的研究,给这个问题交了一份沉甸甸的答卷。研究人员搞了一个叫 HIVMedQA 的测试题库,专门拿来考考市面上主流的10款大模型。题库里的题目可不是简单的选择题,而是开放式问答题,覆盖了从最基础的知识问答,到需要综合分析的复杂临床病例,甚至还包括刻意“使绊子”的认知偏见测试。
结果怎么样?一句话:有惊喜,但远没到能放心交给它们看病的程度。
研究人员挑选了10个模型,既有我们熟悉的通用型“学霸”,比如谷歌的Gemini 2.5 Pro、Anthropic的Claude 3.5 Sonnet,也有专门在医学数据上“开过小灶”的“专科生”,比如MedGemma-27B、Meditron 3-70B这些。
考试成绩一出来,Gemini 2.5 Pro稳稳拿下最高分,Claude 3.5 Sonnet和MedGemma-27B紧随其后,属于第一梯队。但有趣的是,“专科生”并没有像我们预想的那样碾压“学霸”。比如同样是70亿参数级别的模型,专门学过医的Med42 v2-70B和Meditron 3-70B,综合成绩反而被通用型的Llama 3.3-70B-Instruct给比下去了。这说明模型体积大不大、有没有专门用医学数据训练,并不直接决定它看病厉不厉害,背后的训练方法和架构设计,可能发挥着更关键的作用。
如果把考试成绩拆开细看,你会发现一个有意思的现象:这些AI在知识 recall这一项上,得分普遍不错。毕竟它们肚子里装的都是海量医学教材、指南和论文,你问“HIV是怎么诊断的”“传播途径有哪些”,它们答得八九不离十。
可一旦切换到需要逻辑推理和深度理解的复杂病例,不少模型就露怯了。比如,给出一位病人的症状、检查结果、影像学发现,让AI判断最可能的病原体是什么,或者计算一个筛查试验的阴性预测值——这时候,有的模型就开始一本正经地胡说八道了。Gemini 2.5 Pro和Claude 3.5 Sonnet在这个环节表现还算稳健,但即便最高分,离“完美”也还有相当一段距离。这感觉就像,学生能把教科书倒背如流,可一遇到需要动脑子的应用题,就卡壳了。
AI在医疗场景下最危险的地方,不是它直接说“我不知道”,而是它用极其自信、专业的口吻,给出一个完全错误的建议。这在医学上有个专门的词,叫做“虚构”。换句话说,它编造了一个听起来像那么回事儿的答案。
研究中就有一个让人后背发凉的例子。当被问到“抗逆转录病毒治疗应该多久吃一次”时,小体量的Llama 3.2-1B-Instruct模型居然回答:“病毒载量越高,吃药频率就可以越低。”这种错误如果被一线医生信以为真,后果简直不堪设想。研究数据也证实了这一点:当题目从简单的基础知识过渡到复杂的临床场景时,几乎所有模型的“潜在危害”评分都出现了下滑。越复杂的情况,AI越可能给出有风险的答案。
更让人担忧的是,AI和人类一样,也会被语境中的无关信息带偏。研究人员特意设计了一个“挖坑”环节:在原本标准的病例描述里,额外塞进一句误导性的话,比如“最近刚有个类似症状的病人,你诊断他得了肺癌”。这种手法模拟的是临床中常见的“近因偏差”——也就是人更容易被最近发生的事情影响判断。
结果,好几个模型都中招了。受影响最严重的NVLM-D-72B模型,平均分直接从5分暴跌到2.6分。这说明,AI并没有真正“理解”患者的病情,它更像是在根据文字概率来猜答案,很容易被上下文里的“烟雾弹”干扰,从而偏离正确的诊断方向。
还有一个问题值得琢磨:我们怎么判断AI给出的回答到底好不好?
研究采用了一种叫“用AI来给AI打分”的方法,并把这套评分结果和4位真正的HIV专科医生的评分做了比对。结果发现,AI评分和医生评分在“知识 recall”这项上一致性还不错,但在“推理能力”和“理解深度”上,两者差距就比较明显了。
更值得注意的是,当不给AI提供“标准答案”、让它直接凭感觉打分时,它给出的分数会普遍偏高——相当于一个手松的阅卷老师,看谁都顺眼。这意味着,AI对自己答案的评估并不可靠,尤其是在没有参考答案的情况下,它很容易高估自己的表现。
这项研究像一面镜子,照出了AI在医疗领域落地时最真实的样子:潜力巨大,但距离真正靠谱的临床应用,还有不短的路要走。
目前来看,AI最适合的角色,还是一个随时在线的“超级参考书”或“检索助手”——帮医生快速查查资料、提供一些背景信息。但想让它在独立承担诊断和治疗建议的重任,远未到时候。
未来的改进方向也很明确:不能只往AI脑子里塞医学知识,更要下功夫训练它的临床推理能力、抗干扰能力,以及面对信息不完整时主动询问、承认不确定的能力。评估方式也不能只看它答没答对,更要关注它得出结论的过程是否可靠、给出的建议是否安全。
说到底,医学不只是科学,更是人学。它关乎信任、沟通,关乎一个医生在倾听病史时眼神里的温度,关乎面对患者恐惧时那句耐心的安慰。至少在目前,坐在你对面的那位医生,他的经验和共情能力,依然是任何AI都无法替代的。而AI最好的角色,或许是成为医生身边一个得力的“超级助手”,帮他们分担一些重复性的案头工作,而不是取而代之。
毕竟,我们想要的,从来不是一个会看病的机器,而是一个让医生能看得更好、更从容的未来。