如何判断 AI 是否具备开展科学研究的智能?|深度报道

图片来源:摄图网
多年来,人工智能(AI)研究者梦想开发能通过提出新问题、设计实验乃至执行实验来加速科学进程的工具。近期,大语言模型(large language models,LLM)已取得若干发现,部分AI开发者宣称这使我们更接近该未来。但尚不知道如何测试AI模型是否真能开展科学研究?
为寻求答案,研究者转向基准测试:用于评估AI能力并与其他模型比较的标准化问题或任务集。但科学的复杂性使评判其科研能力尤为困难。美国伊利诺伊大学厄巴纳-香槟分校计算机科学家Hao Peng表示:“模型拥有海量知识,但它们懂得如何运用吗?”
过去1年涌现数10项面向科学的新基准测试以回答该问题,但科学家尚未就最佳方法达成共识。其中最受欢迎者之一是2026年1月28日发表于Nature的“人类终极考试”(Humanity’s Last Exam,HLE)。该测试采用2500道源自“人类知识前沿”的问题考验LLM。例如其中一题询问蜂鸟籽骨支撑多少对肌腱。HLE开发者、非营利组织人工智能安全中心研究工程师Long Phan表示:“我们希望构建仅长期深耕该领域的专家才能回答的多样化数据集。”
HLE自2025年1月24日首次以预印本形式发布以来,已成为LLM的重要试金石——HLE得分现已成为AI公司彰显产品能力的常见谈资。HLE发布时,知名开发者OpenAI的o1模型以仅8.3%的得分位居榜首。2026年3月早些时候,Google宣称其最新科学推理模型Gemini 3 Deep Think创下48.4%的HLE新纪录。
但部分科学家指出,HLE诸多问题测试的是晦涩乃至琐碎的知识,而非开展有意义研究的能力。AI for Science公司Deep Principle创始人段辰儒质疑:“知晓世界上磷同素异形体有多少种颜色,如何助人实现科学发现?”
OpenAI研究者表示,他们开发了朝此方向迈进的新基准测试。2025年12月16日发布的FrontierScience借助700道化学、生物学与物理学问题,旨在识别“专家级科学推理”能力。部分问题类似数学与科学奥林匹克竞赛题目:通常基于简短场景、答案明确,OpenAI研究科学家Miles Wang称之为“纯推理努力的合理代理”。例如识别系列化学反应的产物。其他问题则基于博士科学家在实际工作中处理的复杂开放式研究问题,如推理修饰特定分子可能影响其性质的多种途径。
Wang表示,该基准测试的关键优势在于可验证性——这是公平测试的最重要特征之一。奥林匹克题目易于评分,而对于开放式研究问题,LLM因识别中间推理步骤而获分。截至目前,OpenAI自家产品GPT-5.2取得最佳FrontierScience成绩:奥林匹克题目正确率77%,研究挑战得分25%。
其他研究者认为这一巨大分差颇具启示性。他们主张基准测试应聚焦直接衡量AI开展现实世界研究的能力。这正是段辰儒及其合作者与FrontierScience同期发布的“科学发现评估”(Scientific Discovery Evaluation,SDE)基准测试的指导原则。该测试不提困难但孤立的问题,而是向AI呈现源自8项进行中、数据尚未发表的真实研究项目的1125项任务,关联43种研究场景。例如要求LLM推导如何将目标分子分解为更简单、市售可得的组分。模型评估不仅基于单个答案,更基于其整合完整项目的能力——在多步骤中提出、检验并完善假设。段辰儒表示:“我们确保回答每个问题都关联真实科学发现的微小片段。”
SDE得分显示,LLM正确回答单个问题的能力并不总能转化为完整项目的稳健表现,反之亦然。段辰儒表示:“知晓宏观前进方向往往比知晓特定分子的精确性质更重要。”该基准测试还发现,来自OpenAI、Anthropic、xAI和DeepSeek等不同供应商的顶尖模型常在同一最难问题上受阻。这一模式暗示它们可能遭遇相同局限,很可能因其在相似科学数据池上训练所致。
然而SDE方法仍仅捕捉科学工作流的片段。AI for Science初创公司FutureHouse推出的生物学导向新基准测试LABBench2,旨在测试面向科学的AI能否将项目从初始构想推进至完成论文。2月发布的该测试采用近1900项任务,评估所谓“代理型www.kjdb.orgAI模型”(能独立完成多步骤任务的系统)执行文献检索、数据获取与基因序列构建等工作的能力。
目前结果喜忧参半。多数领先LLM在全文专利与实验室试验论文检索方面表现良好,但在LABBench2更复杂的任务上常遇困难,例如交叉引用多个数据库,或在密集论文中定位并解读特定图表或数据。FutureHouse商业衍生公司Edison Scientific 的Jon Laurent表示,这表明迈向真正AI科学家的进展,部分也取决于改进模型检索与导航信息的方式。
研究者强调,基准测试不仅用于记录当前赢家。更严格的基准测试还可通过为LLM及其他AI工具提供新目标来驱动创新。Laurent表示:“基准测试的目的之一是领先时代,衡量潜在能力,并推动其发展。”
在诸多领域,或不存在衡量AI是否“擅长”科学的单一标准。美国佐治亚理工学院认知神经科学与AI研究者Anna Ivanova表示:“这正是我们看到所用基准测试高度异质的原因。系统绘制数据的能力与其分析化学事实知识截然不同——尽管科学家可能两者都需要。”
鉴于科学所需技能的广泛性,AI专家认为研究界或宜依赖测试组合,每项测试针对并催化科学工作流不同环节的改进。Wang表示:“我们正迈向需要更多元化评估体系的世界。”
无论采用何种方法,被衡量的内容很可能引导改进方向。Peng表示:“要取得进展,你必须能够衡量它。
阅读最新前沿科技趋势报告,请访问21世纪关键技术研究院的“未来知识库”


截止到2月28日 ”未来知识库”精选的百部前沿科技趋势报告
(加入未来知识库,全部资料免费阅读和下载)
-
牛津未来研究院 《将人工智能安全视为全球公共产品的影响、挑战与研究重点》 -
麦肯锡:超级智能机构:赋能人们释放人工智能的全部潜力 -
AAAI 2025 关于人工智能研究未来研究报告 -
斯坦福:2025 斯坦福新兴技术评论:十项关键技术及其政策影响分析报告(191 页) -
壳牌:2025 能源安全远景报告:能源与人工智能(57 页) -
盖洛普 & 牛津幸福研究中心:2025 年世界幸福报告(260 页) -
Schwab :2025 未来共生:以集体社会创新破解重大社会挑战研究报告(36 页) -
IMD:2024 年全球数字竞争力排名报告:跨越数字鸿沟人才培养与数字法治是关键(214 页) -
DS 系列专题:DeepSeek 技术溯源及前沿探索,50 页 ppt -
联合国人居署:2024 全球城市负责任人工智能评估报告:利用 AI 构建以人为本的智慧城市(86 页) -
TechUK:2025 全球复杂多变背景下的英国科技产业:战略韧性与增长路径研究报告(52 页) -
NAVEX Global:2024 年十大风险与合规趋势报告(42 页) -
《具身物理交互在机器人 – 机器人及机器人 – 人协作中的应用》122 页 -
2025 – 2035 年人形机器人发展趋势报告 53 页 -
Evaluate Pharma:2024 年全球生物制药行业展望报告:增长驱动力分析(29 页) -
【AAAI2025 教程】基础模型与具身智能体的交汇,350 页 ppt -
Tracxn:2025 全球飞行汽车行业市场研究报告(45 页) -
谷歌:2024 人工智能短跑选手(AI Sprinters):捕捉新兴市场 AI 经济机遇报告(39 页) -
【斯坦福博士论文】构建类人化具身智能体:从人类行为中学习 -
《基于传感器的机器学习车辆分类》最新 170 页 -
美国安全与新兴技术中心:2025 CSET 对美国人工智能行动计划的建议(18 页) -
罗兰贝格:2024 人形机器人的崛起:从科幻到现实:如何参与潜在变革研究报告(11 页) -
兰德公司:2025 从研究到现实:NHS 的研究和创新是实现十年计划的关键报告(209 页) -
康桥汇世(Cambridge Associates):2025 年全球经济展望报告(44 页) -
国际能源署:2025 迈向核能新时代 -
麦肯锡:人工智能现状,组织如何重塑自身以获取价值 -
威立(Wiley):2025 全球科研人员人工智能研究报告(38 页) -
牛津经济研究院:2025 TikTok 对美国就业的量化影响研究报告:470 万岗位(14 页) -
国际能源署(IEA):能效 2024 研究报告(127 页) -
Workday :2025 发挥人类潜能:人工智能(AI)技能革命研究报告(20 页) -
CertiK:Hack3D:2024 年 Web3.0 安全报告(28 页) -
世界经济论坛:工业制造中的前沿技术:人工智能代理的崛起》报告 -
迈向推理时代:大型语言模型的长链推理研究综述 -
波士顿咨询:2025 亚太地区生成式 AI 的崛起研究报告:从技术追赶者到全球领导者的跨越(15 页) -
安联(Allianz):2025 新势力崛起:全球芯片战争与半导体产业格局重构研究报告(33 页) -
IMT:2025 具身智能(Embodied AI)概念、核心要素及未来进展:趋势与挑战研究报告(25 页) -
IEEE:2025 具身智能(Embodied AI)综述:从模拟器到研究任务的调查分析报告(15 页) -
CCAV:2025 当 AI 接管方向盘:自动驾驶场景下的人机交互认知重构、变革及对策研究报告(124 页) -
《强化学习自我博弈方法在兵棋推演分析与开发中的应用》最新 132 页 -
《面向科学发现的智能体人工智能:进展、挑战与未来方向综述》 -
全国机器人标准化技术委员会:人形机器人标准化白皮书(2024 版)(96 页) -
美国国家科学委员会(NSB):2024 年研究与发展 – 美国趋势及国际比较(51 页) -
艾昆纬(IQVIA):2025 骨科手术机器人技术的崛起白皮书:创新及未来方向(17 页) -
NPL&Beauhurst:2025 英国量子产业洞察报告:私人和公共投资的作用(25 页) -
IEA PVPS:2024 光伏系统经济与技术关键绩效指标(KPI)使用最佳实践指南(65 页) -
AGI 智能时代:2025 让 DeepSeek 更有趣更有深度的思考研究分析报告(24 页) -
2025 军事领域人工智能应用场景、国内外军事人工智能发展现状及未来趋势分析报告(37 页) -
华为:2025 鸿蒙生态应用开发白皮书(133 页 -
《超级智能战略研究报告》 -
中美技术差距分析报告 2025 -
欧洲量子产业联盟(QuIC):2024 年全球量子技术专利态势分析白皮书(34 页) -
美国能源部:2021 超级高铁技术(Hyperloop)对电网和交通能源的影响研究报告(60 页) -
罗马大学:2025 超级高铁(Hyperloop):第五种新型交通方式 – 技术研发进展、优势及局限性研究报告(72 页) -
兰德公司:2025 灾难性网络风险保险研究报告:市场趋势与政策选择(93 页) -
GTI:2024 先进感知技术白皮书(36 页) -
AAAI:2025 人工智能研究的未来报告:17 大关键议题(88 页) -
安联 Allianz2025 新势力崛起全球芯片战争与半导体产业格局重构研究报告 -
威达信:2025 全球洪水风险研究报告:现状、趋势及应对措施(22 页) -
兰德公司:迈向人工智能治理研究报告:2024EqualAI 峰会洞察及建议(19 页) -
哈佛商业评论:2025 人工智能时代下的现代软件开发实践报告(12 页) -
德安华:全球航空航天、国防及政府服务研究报告:2024 年回顾及 2025 年展望(27 页) -
奥雅纳:2024 塑造超级高铁(Hyperloop)的未来:监管如何推动发展与创新研究报告(28 页) -
HSOAC:2025 美国新兴技术与风险评估报告:太空领域和关键基础设施(24 页) -
Dealroom:2025 欧洲经济与科技创新发展态势、挑战及策略研究报告(76 页) -
《无人机辅助的天空地一体化网络:学习算法技术综述》 -
谷歌云(Google Cloud):2025 年 AI 商业趋势白皮书(49 页) -
《新兴技术与风险分析:太空领域与关键基础设施》最新报告 -
150 页!《DeepSeek 大模型生态报告》 -
军事人工智能行业研究报告:技术奇点驱动应用加速智能化重塑现代战争形态 – 250309(40 页) -
真格基金:2024 美国独角兽观察报告(56 页) -
璞跃(Plug and Play):2025 未来商业研究报告:六大趋势分析(67 页) -
国际电工委员会(IEC):2025 智能水电技术与市场展望报告(90 页) -
RWS:2025 智驭 AI 冲击波:人机协作的未来研究报告(39 页) -
国际电工委员会(IEC):2025 智能水电技术与市场展望报告(90 页) -
RWS:2025 智驭 AI 冲击波:人机协作的未来研究报告(39 页) -
未来今日研究所 2025 年科技趋势报告第 18 版 1000 页 -
模拟真实世界:多模态生成模型的统一综述 -
中国信息协会低空经济分会:低空经济发展报告(2024 – 2025)(117 页) -
浙江大学:2025 语言解码双生花:人类经验与 AI 算法的镜像之旅(42 页) -
人形机器人行业:由 “外” 到 “内” 智能革命 – 250306(51 页) -
大成:2025 年全球人工智能趋势报告:关键法律问题(28 页) -
北京大学:2025 年 DeepSeek 原理和落地应用报告(57 页) -
欧盟委员会 人工智能与未来工作研究报告 -
加州大学伯克利分校:面向科学发现的多模态基础模型:在化学、材料和生物学中的应用 -
电子行业:从柔性传感到人形机器人触觉革命 – 250226(35 页) -
RT 轨道交通:2024 年中国城市轨道交通市场数据报告(188 页) -
FastMoss:2024 年度 TikTok 生态发展白皮书(122 页) -
Check Point:2025 年网络安全报告 – 主要威胁、新兴趋势和 CISO 建议(57 页) -
【AAAI2025 教程】评估大型语言模型:挑战与方法,199 页 ppt -
《21 世纪美国的主导地位:核聚变》最新报告 -
沃尔特基金会(Volta Foundation):2024 年全球电池行业年度报告(518 页) -
斯坦福:2025 斯坦福新兴技术评论:十项关键技术及其政策影响分析报告(191 页) -
国际科学理事会:2025 为人工智能做好国家研究生态系统的准备 – 2025 年战略与进展报告(英文版)(118 页) -
光子盒:2025 全球量子计算产业发展展望报告(184 页) -
奥纬论坛:2025 塑造未来的城市研究报告:全球 1500 个城市的商业吸引力指数排名(124 页) -
Future Matters:2024 新兴技术与经济韧性:日本未来发展路径前瞻报告(17 页) -
《人类与人工智能协作的科学与艺术》284 页博士论文 -
《论多智能体决策的复杂性:从博弈学习到部分监控》115 页 -
《2025 年技术展望》56 页 slides -
大语言模型在多智能体自动驾驶系统中的应用:近期进展综述 -
【牛津大学博士论文】不确定性量化与因果考量在非策略决策制定中的应用 -
皮尤研究中心:2024 美国民众对气候变化及应对政策的态度调研报告:气候政策对美国经济影响的多元观点审视(28 页) -
空间计算行业深度:发展趋势、关键技术、行业应用及相关公司深度梳理 – 250224(33 页) -
Gartner:2025 网络安全中的 AI:明确战略方向研究报告(16 页) -
北京大学:2025 年 DeepSeek 系列报告 – 提示词工程和落地场景(86 页) -
北京大学:2025 年 DeepSeek 系列报告 – DeepSeek 与 AIGC 应用(99 页) -
CIC 工信安全:2024 全球人工智能立法的主要模式、各国实践及发展趋势研究报告(42 页) -
中科闻歌:2025 年人工智能技术发展与应用探索报告(61 页) -
AGI 智能时代:2025 年 Grok – 3 大模型:技术突破与未来展望报告(28 页)
上下滑动查看更多
夜雨聆风