乐于分享
好东西不私藏

体检AI解读|npj Digit Med(IF=18.0)韩国蔚山大学医学院等:1万例国家体检数据验证,解读体检结果准确率达0.98–0.99,但血压仍是难点

体检AI解读|npj Digit Med(IF=18.0)韩国蔚山大学医学院等:1万例国家体检数据验证,解读体检结果准确率达0.98–0.99,但血压仍是难点

体检报告,AI能看懂吗?

很多人拿到体检报告,第一反应不是去找医生,而是先上网搜。

“低密度脂蛋白偏高怎么办?”
“尿蛋白一个加号严重吗?”
“γ-GTP升高是不是肝出问题?”
“血压这一栏到底算不算高血压?”

体检报告看起来是结构化数据:数字、单位、参考范围、异常箭头。但对普通人来说,它并不友好。尤其是多个指标同时异常时,患者很容易把单个数值放大,或者被网上信息带偏。

这篇 npj Digital Medicine 文章做了一个很实际的测试:大语言模型到底能不能稳定解读体检结果?

研究团队使用韩国国家健康保险服务系统的健康体检数据,评估了4个大模型:Claude Sonnet 4、Gemini 2.5 Pro、GPT-4o和LLaMA 3.1-70B。他们没有对模型做医学微调,而是通过不同提示词策略,让模型对体检项目进行分类解读。结果很清楚:提示词写得好,准确率可以明显提升;但并不是所有体检项目都一样容易,血压最容易出问题。

清璟AI——清北医工交叉团队,擅长AI智能体、大模型、深度学习、机器学习、多模态与多组学等,能够为医学研究者和临床医生提供全方位的支持与创新解决方案。我们拥有顶级科研资源,欢迎咨询!共同探索AI与医学的无限可能,一起发顶刊!

核心结论

最简单地说,有三点。

第一,大模型“裸读”体检单不够稳。
Zero-shot情况下,也就是只给简单指令、不提供明确规则,4个模型平均准确率只有0.69

第二,提示词工程非常重要。
当研究加入角色设定、少样本示例、参考范围约束和Chain-of-Thought后,平均准确率提升到0.95。Claude Sonnet 4和Gemini 2.5 Pro达到0.99,GPT-4o达到0.98

第三,血糖、血脂、肝酶这类指标很好判断,血压却很难。
多数生化指标准确率接近0.99–1.00,但血压准确率明显低一些,不同模型大约在0.61–0.91之间。原因并不神秘:血压不是一个单值判断,要同时看收缩压、舒张压,还涉及正常、升高、1级、2级、单纯收缩期高血压等多分类边界。

这也是这篇文章最值得医生关注的地方:大模型不是不会看体检单,而是不能让它凭感觉看。

研究团队和数据来源

这项研究来自韩国蔚山大学医学院、首尔峨山医学中心医学信息与统计学相关团队。研究使用韩国国家健康保险服务系统的健康体检数据。韩国每年约有2200万人具备健康体检资格,其中超过75%实际参加体检;作者指出,虽然现有体检报告会标记异常值并给出基础解释,但患者理解报告仍然存在困难。

研究中,作者从健康体检数据中筛选无缺失记录,经过处理后得到约32万条记录,再分层抽样选择10,000例用于模型评估。涉及项目包括BMI、血压、空腹血糖、总胆固醇、甘油三酯、HDL-C、LDL-C、血红蛋白、尿蛋白、肌酐、AST、ALT和γ-GTP等。

这不是让AI“诊断疾病”,而是让AI根据既定参考范围,对体检结果做分类解释。这个任务比真正临床诊断简单,但更贴近体检中心和患者教育场景。

研究亮点

  1. 不是问AI医学考试题,而是让AI处理真实体检结构化数据。

  2. 比较了4个大模型,包含闭源模型和开源模型。

  3. 系统测试提示词策略,从zero-shot到CoT逐步增强。

  4. 样本量达到10,000例,并重复运行3次评估稳定性。

  5. 专门分析了年龄、性别相关偏倚,提醒临床部署不能只看平均准确率。


Figure 1|研究流程:体检数据进入大模型前,必须先定义规则

图注:
Figure 1展示研究总体流程。研究首先收集韩国国家健康保险服务系统的健康体检数据,随后根据各体检项目的正常/异常参考范围进行标签化,再将结构化体检结果输入4个大语言模型,比较不同提示词策略下的解释准确率和重复稳定性。

图示解读:
这张图的重点不是“用了几个模型”,而是模型前面那一步:先把参考范围和分类规则讲清楚。

比如空腹血糖要区分正常、糖尿病、空腹血糖受损;HDL-C要区分正常、低、高、很高;γ-GTP还要按性别分别设置参考范围。

这和临床实际很像。医生解读体检单时,并不是看到一个数字就凭印象判断,而是会结合参考范围、性别、年龄和项目本身的医学含义。大模型要做这件事,也必须把规则喂给它。

所以,体检报告AI解读的关键不只是“选哪个大模型”,还包括:参考范围从哪里来、分类标签怎么定义、提示词有没有把规则写清楚、输出格式能不能稳定。

Table 1|提示词越清楚,大模型越靠谱

图注:
Table 1比较5种提示词策略下4个大模型的平均准确率,包括zero-shot、角色设定、少样本示例、约束条件和Chain-of-Thought组合提示。

图示解读:
这张表很适合所有做医学大模型应用的人看。

只给简单指令时,平均准确率是0.69。加上角色设定后提升到0.74;加入少样本示例后达到0.80;再加入明确参考范围和约束条件后,直接升到0.92。最后加上Chain-of-Thought,平均准确率达到0.95

这说明,在结构化体检解读这种任务里,提示词不是装饰,而是决定模型能不能按医学规则工作的关键。

临床上不能简单说“让AI解释一下体检报告”。更稳妥的做法应该是:告诉模型它是什么角色、按哪个指南或参考范围判断、如何一步步比较数值、最后用什么格式输出。


Figure 2|模型对比:Claude、Gemini、GPT-4o接近满分,LLaMA掉队明显

图注:
Figure 2展示4个大模型在不同体检项目上的平均准确率。图A展示多分类项目表现,图B展示二分类项目表现,图C比较各模型整体平均准确率和标准差。

图示解读:
整体表现上,Claude Sonnet 4和Gemini 2.5 Pro平均准确率均为0.99,GPT-4o为0.98,LLaMA 3.1-70B为0.85左右。

多数常规生化项目非常稳定。空腹血糖、总胆固醇、甘油三酯、HDL-C、尿蛋白、AST、ALT等,在前三个模型中几乎都能达到0.99–1.00。

但血压是明显短板。Claude Sonnet 4血压准确率为0.91,Gemini 2.5 Pro为0.89,GPT-4o为0.88,LLaMA 3.1-70B只有0.61

这说明一个很现实的问题:越是简单阈值判断,AI越稳;越是多分类、需要整合多个数值的指标,越容易出错。

血压恰好就是这样的项目。它不只看收缩压,也不只看舒张压,还要处理两者不一致时的分类逻辑。对医生来说这是常规判断,对大模型来说却很容易在边界条件上失误。

Table 2|别只看准确率:敏感性和F1也暴露问题

图注:
Table 2展示4个模型在10,000例体检数据中的准确率、敏感性、特异性和F1-score,并重复测试3次评估稳定性。

图示解读:
如果只看准确率,很多指标看起来都很漂亮。但Table 2提醒我们:体检AI不能只看accuracy。

以血压为例,Claude Sonnet 4准确率达到0.91,但F1-score只有0.66;GPT-4o血压准确率0.88,F1-score为0.54;LLaMA血压F1-score只有0.46

为什么会这样?因为体检数据里正常样本往往占比较高,模型把大部分正常人判断对,accuracy就会好看;但真正需要识别的异常类别、多分类边界,可能表现并没有那么稳。

这对临床部署非常重要。体检中心真正关心的不是AI能不能把大多数正常结果判断对,而是能不能别漏掉需要随访、复查、就诊的人。

Table 3|速度、成本和部署:GPT-4o最快,LLaMA免费但不一定省心

图注:
Table 3比较4个大模型的关键特征,包括开发者、版本、平均token使用量、推理时间、参数设置和调用成本。

图示解读:
这张表把“模型选型”讲得更现实。

Claude Sonnet 4、Gemini 2.5 Pro、GPT-4o都是商业闭源模型,LLaMA 3.1-70B是开源模型。推理时间上,GPT-4o约3.75秒,Claude约13.33秒,Gemini约24秒,LLaMA约18秒

这意味着,如果做大规模体检报告自动解释,不能只看准确率。还要看调用成本、推理速度、隐私合规、医院能否私有化部署,以及模型对本地参考范围的适配能力。

开源模型看起来成本低,但在这项研究里,LLaMA 3.1-70B整体准确率明显低于其他模型,尤其BMI、血压、LDL-C等项目表现不够理想。

所以,医院真正落地时可能会遇到一个取舍:闭源模型效果好但涉及数据安全和成本;开源模型可控性强但需要更多本地调优和验证。

还有一个细节:年龄和性别偏倚不能忽视

这篇文章没有只停在“哪个模型最强”,还做了亚组分析。

按性别看,Claude Sonnet 4在BMI判断上对男性准确率更高;LLaMA 3.1-70B在尿蛋白、肌酐和γ-GTP上出现不同方向的性别差异。Gemini 2.5 Pro和GPT-4o没有显示明显性别相关偏倚。

按年龄看,Claude Sonnet 4和Gemini 2.5 Pro在血压评估中,随着年龄增加准确率下降;LLaMA 3.1-70B在LDL-C和血红蛋白方面出现年龄相关差异。GPT-4o在年龄亚组中表现相对稳定。

这个结果很有临床意义。体检解释不是给“平均人群”看的。老年人、不同性别、不同参考范围、不同国家和地区,都可能影响判断规则。大模型如果要进入体检报告系统,必须做本地化验证,不能只拿总体准确率说事。

这篇文章怎么读,才不跑偏?

第一,它不是证明大模型可以替代医生解释体检报告。
研究任务主要是结构化数值分类,不包括病史、用药、症状、既往疾病和综合诊断。作者也明确指出,研究结果应被视为探索性,不能替代医生判断或完整诊断。

第二,它也不是证明规则系统没用了。
对于确定性阈值分类,传统规则系统本来就可以做到非常稳定,甚至可以达到100%。大模型的价值不在于替代规则判断,而在于后续能生成患者能看懂的解释、生活方式建议和随访提醒。

第三,它真正提醒我们:医学大模型应用不能裸奔。
没有参考范围、没有约束、没有步骤、没有输出格式,模型表现会明显下降。把规则写进提示词后,表现才明显提升。

第四,血压、BMI这类看似简单的项目,反而最需要小心。
因为它们涉及多分类、年龄/性别背景、生理差异和边界值判断。体检AI最容易出问题的地方,往往不是最复杂的医学术语,而是这些“医生觉得很基础”的常规项目。

给临床团队的选题启发

这篇文章很适合体检中心、全科医学、健康管理中心、检验科、心内科、内分泌科和医学信息团队参考。

方向一:本土体检报告AI解读系统
基于中国体检中心数据,建立适合本地参考范围的体检结果自动解释系统,重点验证血压、血脂、血糖、肝肾功能、尿检等项目。

方向二:规则系统+大模型双层架构
第一层用规则系统完成确定性分类,第二层用大模型生成患者友好的解释和建议。这样比让大模型直接判断更安全。

方向三:体检异常结果分层随访
不仅告诉患者“异常”,还根据异常组合识别需要复查、门诊、专科转诊或生活方式干预的人群。

方向四:大模型体检报告可读性研究
比较传统体检报告、医生人工解释、大模型解释、规则增强大模型解释,在患者理解度、焦虑程度和复查依从性上的差异。

方向五:公平性与本地化验证
重点评估不同年龄、性别、民族、地区和慢病人群中模型表现是否一致。特别是血压、肌酐、γ-GTP、BMI这类容易受人口学因素影响的项目。

写在最后

体检报告解读,是医学大模型最容易落地、也最容易被低估的场景之一。

它不像复杂诊断那样需要完整病史和推理链,但又比简单异常标记更需要解释能力。患者真正需要的不是一个红色箭头,而是明白:这个指标为什么异常、严重不严重、需不需要复查、该找哪个科、生活方式要改什么。

这篇研究给出的答案很务实:大模型可以做,但不能裸用。规则、提示词、参考范围、输出格式、亚组验证,一个都不能少。

如果你的团队有体检数据、检验报告、健康管理随访或患者咨询记录,可以从“体检报告智能解读”切入。相比一上来就做复杂诊断,这类课题更容易拿到数据,也更容易形成真实应用闭环:自动分类、患者解释、医生审核、复查提醒、随访管理。

关于我们

清璟AI由国内TOP2高校医工交叉博士联合创立,专注于医疗大模型科研、影像组学、病理组学、深度学习、AI智能体、生信分析、多组学、多模态和各类人工智能算法。致力打造一站式Al+医学科研生态圈,提供专业的AI智能体、高端科研资源及一对一定制化服务。我们的服务涵盖从科研方案设计、数据处理到AI模型训练及系统开发等各个领域,旨在为医学研究者和临床医生提供全方位的支持与创新解决方案。携手清璟AI,让科研更智能,让医学更精准。

科研合作请联系

长按二维码加微信