乐于分享
好东西不私藏

AI科研助手新高度:DeepEvidence打通生物医学知识图谱,从靶点发现到临床试验全程“深度研究”

AI科研助手新高度:DeepEvidence打通生物医学知识图谱,从靶点发现到临床试验全程“深度研究”

点击蓝字 关注我们

如果你做过生物医学研究,一定熟悉这个场景:想搞清楚某个基因跟某种疾病的关系,打开PubMed搜出几千篇论文;去KEGG查通路,信息分散在不同页面;去OpenTargets看基因-疾病关联,再去ClinicalTrials.gov查有无相关临床试验……每个数据库都有自己的查询语言、数据格式和更新节奏。你花在“拼图”上的时间,远超“理解”的时间。

通用AI助手(如OpenAI DeepResearch)确实能帮你搜索和总结,但它们在生物医学领域有一个致命问题:它们主要处理非结构化的网页文本,而生物医学的关键证据——基因-疾病关联、药物-靶点相互作用、临床试验设计、通路注释——大部分藏在结构化或半结构化的知识图谱和数据库中。通用AI助手要么找不到这些数据,要么找到了也无法理解其内部逻辑。

2026年7月2日,Nature Machine Intelligence在线发表了UIUC Jimeng Sun团队的工作——DeepEvidence。这是一个专为生物医学知识探索和证据合成设计的“深度研究”AI系统。它通过多智能体协同,结合广度优先(BFRS)和深度优先(DFRS)两种互补的研究策略,在PubMed、KEGG、ChEMBL、ClinicalTrials.gov、OpenTargets等17个生物医学知识库之间自由穿行,将分散的证据整合成一个可追溯、透明的“证据图”。在四个公开生物医学基准上,DeepEvidence的准确率较通用AI助手提升幅度达100%-1100%。他们在药物发现、临床前实验、临床试验设计和循证医学四个关键阶段构建了7个新基准任务,DeepEvidence全面领先

生物医学知识太多太散

想为一个疾病(比如特发性肺纤维化)寻找新的治疗靶点,你需要同时查询PubMed、KEGG、OpenTargets、ChEMBL……光是理解每个数据库的查询方式就需要半天。

通用DeepResearch系统依赖“搜网页+总结”的模式。对于结构化的生物医学知识图谱(如KEGG代谢通路),网页搜索根本抓不到节点和边的拓扑关系。用网页搜索去“爬”知识图谱,就像用渔网去捞分子——什么都捞不着。

DeepEvidence的设计从根本上解决了这个问题。它内置了针对17个生物医学知识库的统一查询接口——Agent不用关心每个数据库的API格式,只需说“查一下这个基因在KEGG和OpenTargets里的信息”,系统自动并行查询、合并结果。更关键的是,它把研究策略拆成两种互补模式:广度优先(BFRS)快速调查第一跳邻居(如“这个疾病关联了哪些药物和基因”);深度优先(DFRS)沿着引用链和实体关系深入挖掘(如“从一篇论文追溯到它引用的所有论文”)。这两种模式由AI Agent自主决定何时切换、如何协同。

证据图:不是RAG,是“研究过程的透明日志”

DeepEvidence与普通RAG最大的区别在于——它不仅返回答案,还返回一个完整的、可审查的证据图。

这个证据图记录了研究过程中发现的所有关键实体(基因、疾病、药物、通路、论文)以及它们之间的关系(激活、抑制、治疗、关联、引用等)。每条边都标明了来源——具体来自哪篇论文、哪个数据库的哪个条目。在证据图质量的人工审计中,节点和关系的来源有效性达到100%,归一化准确率99.7%,声称与源内容的一致性达93.3%这意味着研究者可以像检查自己的工作笔记一样,逐条验证AI的推理过程——哪些结论有坚实的证据支持,哪些是推断,哪里可能存在争议。对于需要严格证据审查的领域(如系统综述、临床试验设计),这点至关重要。

团队在四个公开生物医学基准上测试了DeepEvidence,对比基线包括GPT-5、Sonnet-4.5(配备文献搜索),以及Biomni、ToolUniverse两个通用生物医学Agent。所有Agent使用相同底层LLM(GPT-5)。

HLE-Medicine(专家级医学问题)上,DeepEvidence准确率40.0%,Biomni 20.0%,ToolUniverse 10.0%,GPT-5和Sonnet-4.5仅3.3%

LabBench-LitQA2(文献检索+证据合成)上,DeepEvidence 64.7%,Biomni 48.9%,ToolUniverse 25.0%。

SuperGPQA-Medicine-Hard(困难机制推理)上,DeepEvidence 47.1%,Biomni 40.7%,Sonnet-4.5 43.6%。

TrialPanorama-EvidenceQA(临床试验证据推理)上,DeepEvidence 96.0%,Biomni 84.0%,Sonnet-4.5 88.0%。

为什么差距这么大?通用生物医学Agent虽有大量API可用,但只做浅层探索——几次搜索就给出答案。大型工具集还导致“工具混淆”——选错工具或走上错误推理路径。DeepEvidence通过结构化的BFRS-DFRS探索+持续更新的证据图,实现了更深、更聚焦的调查。

从候选列表到优先排序,全部自动化

靶点识别任务中,Agent接收研究问题与约束,必须迭代搜索、聚合和评估证据以收敛到有充分依据的靶点。DeepEvidence准确率68%,Biomni 56%,ToolUniverse 40%,通用LLM 42%。人工评估人员在8个维度上对开放性靶点优先排序任务评分,DeepEvidence综合得分1.40,Biomni为1.15(p<0.001)

在更具挑战性的靶点验证中——候选靶点存在相互矛盾的文献证据(证据层级冲突、证据噪声、上下文适用性冲突)——Agent必须检索、协调并推理冲突证据后才能做出最终判断。DeepEvidence再次表现最佳,说明其结构化推理过程更好地支持了跨来源异质证据的聚合与解释。

临床前研究:机制推理与代谢通量预测

在临床前阶段,DeepEvidence需要回答两类问题:机制推理(解释信号通路串扰、药物机制和生物标志物)和体内代谢通量预测(识别哪些肿瘤队列在酶抑制后最可能表现出强靶向代谢抑制)。

在机制推理上,DeepEvidence准确率72%,Biomni和ToolUniverse为44%,通用LLM为52%。在体内代谢通量预测上,DeepEvidence达80%,Biomni 68%,通用LLM 60%,ToolUniverse 52%。在开放性转化验证的人工评估中,DeepEvidence在8个维度中的6个上优于Biomni,综合得分1.64 vs 1.46(p<0.05)

临床试验设计

DeepEvidence还能支持临床试验的设计决策——这是目前大多数AI Agent完全触及不到的领域。团队构建了三个任务:样本量估算、药物方案设计和替代终点发现。

样本量估算:DeepEvidence准确率68%,Biomni仅20%,ToolUniverse 32%,通用LLM 24%。DeepEvidence能全面回顾相关研究中的样本量估算策略,从类似临床试验中形成整体视图。

药物方案设计(起始剂量、爬坡方法、DLT定义等):DeepEvidence准确率52%,Biomni 36%,ToolUniverse 28%,通用LLM 20%。DeepEvidence能持续从FDA批准的药物参考文献中检索信息,形成历史剂量和毒性模式的全面视图。

替代终点发现:DeepEvidence的F1为73.3%,Biomni 60.9%,ToolUniverse 61.9%,通用LLM 58.7%。DeepEvidence能更全面地检索证据,并正确区分药物靶点、通路和生物标志物之间的上下游关系。

循证医学:发现证据空白

一篇系统综述发表时是“最新证据”,但几个月后可能就有新的RCT改变治疗认知。谁去发现这些“证据空白”?

证据空白发现任务中,Agent拿到系统综述的研究问题、目标和纳入标准,需要识别未被原始综述纳入但应被纳入的最新试验。DeepEvidence在top-30候选中的“空白发现率”达90.0%,Biomni 50.0%,ToolUniverse 15.0%,通用LLM 10.0%。召回率方面DeepEvidence为44.14%,Biomni 30.17%,ToolUniverse 5.06%,通用LLM 2.67%。

消融实验揭示了几个关键设计决策:直接暴露大量工具会导致“工具混淆”;加入代码执行能力能大幅缓解;多Agent分解本身不保证性能提升;只有引入结构化的BFRS或DFRS策略后性能才有实质性提升;而两者结合——完整的DeepEvidence——效果最佳。

参考资料

Wang, Z., Chen, Z., Yang, Z. et al. Empowering biomedical evidence exploration and synthesis with deep knowledge graph research. Nat Mach Intell 8, 1142–1156 (2026). https://doi.org/10.1038/s42256-026-01266-0

BIOINFOMATICS

微信号|计算生物前沿