夜雨聆风学习资料网

ARTICLE · 1029790

AI 模型亟需更多生物学数据,OpenAI 斥资自建数据集

AI 模型亟需更多生物学数据,OpenAI 斥资自建数据集

人工智能已经在语言、图像识别等领域掀起变革,但进军生物学领域时却遭遇一个根本性难题:高质量生物学数据严重不足。网络上可以海量抓取文本与图片,但生物学实验数据获取成本高昂、碎片化严重,还受到隐私法规约束。2026 年,数据缺口依旧是 AI 应用于药物研发、疾病诊断、精准医疗的最大瓶颈之一。

OpenAI 的非营利母体 ——OpenAI 基金会,推出名为“公共健康数据(Data for Public Health)”全新项目,出资生成、开放生物学数据集,用于训练性能更强、可靠性更高的生命科学 AI 模型。该计划意在填平阻碍生物 AI 发展的数据鸿沟,加速新药研发、快速诊断技术落地,推动更加公平的医疗成果落地。

这一计划部分采纳了临床试验政策分析师鲁克桑德拉・特斯洛去年提出的构想:从宣告破产的生物技术企业手中抢救科研档案。 她提出,可以参与破产企业资产竞拍,获取原本属于商业机密的监管申报卷宗、生产工艺方案、安全性试验数据。特斯洛将这批资料称作“生物技术失落档案”。这些资料可以训练 AI,让 AI 成为药物审批流程的强大辅助工具,帮助科研人员看懂这套长期不够透明、错综复杂的监管体系。

“业内已经形成共识:数据是 AI 落地生物学领域的最大瓶颈。” —— 摩根・莱文,长寿研究企业 Altos Labs 前计算平台负责人

生物学和数学领域不同:AI 做数学可以在不新增实测数据的前提下产出新知识;而想要打造有效的生物 AI,必须依赖真实、完备的实测生物数据。很多有价值的生物数据真实存在,但被商业保密、法律壁垒牢牢锁在各个孤岛中。OpenAI 不再仅仅搜集现有公开资料,转而直接出资生产、收购过去无法获取的数据集,代表 AI 企业战略发生转变。

该项目首轮拨款包括:向北卡罗来纳大学教堂山分校拨款 400 万美元,用于收集新型癌症疫苗相关数据;同时支持 OpenAdmet 平台,举办科研竞赛,推动研究人员分享药物代谢与毒性数据集。

目前该计划完整细节尚未对外披露。这也折射出 2026 年整个行业趋势:通用文本数据源逐渐枯竭,头部 AI 实验室纷纷把专业领域专属数据当作核心战略资产。对于生物技术行业而言,该项目也将引发新讨论:企业倒闭之后,那些曾经被视作无价值副产品的科研数据,该如何评估价值、界定所有权。

https://www.technologyreview.com/2026/09/15/1144129/ai-models-need-more-data-about-biology-and-openai-is-paying-to-create-it/

相关学习资料

返回首页浏览学习资料