
🧬 DeepMind 再放大招:AI 一口气读懂了基因组的"暗物质"
《Nature》最新研究 AlphaGenome,单碱基精度预测数千条功能图谱,98% 非编码区的秘密藏不住了
你体内有 30 亿 个碱基对,但真正编码蛋白质的,不到 2%。剩下 98% 曾被称作基因组的"暗物质"——看不见、读不懂、却掌控着你是健康还是生病。而现在,DeepMind 给这团"暗物质"装上了解码器。
1990 年,人类基因组计划启动,我们像拿到一本用未知文字写成的天书。20 多年后,测序成本从 30 亿美元降到几百元,我们能把整本书复印无数遍。但书里写的什么,99% 依然是个谜——尤其是那 98% 不编码蛋白质的非编码区:它调控着基因何时开、何时关,一旦出错,就是遗传病、癌症、罕见病的根源。
💡 一句话记住:编码蛋白的那 2%,决定了"造什么";而 98% 的非编码区,决定了"什么时候造、造多少、怎么配合"。后者,才是大多数疾病的真凶。
2026 年 1 月,Google DeepMind 在《Nature》发表论文,发布全新 AI 模型 AlphaGenome。它的任务非常纯粹:
给它一段长达 100 万个碱基对(1 Mb) 的 DNA 序列,它能在 单碱基分辨率 上,同时预测出上千条"这本书到底在干什么"的功能图谱。
四个数字,看懂它的实力:
1 Mb
超长 DNA 序列输入,一口气读完整章
单碱基
分辨率级预测,改一个字母都看得见
数千条
功能轨迹:表达、调控、结构、互作全覆盖
25 / 26
变异效应预测任务中,25 项超越此前最优
长 · 准 · 全。
长:一次读 100 万个碱基,相当于一口气看完一整章,而不是支离破碎的段落,上下文关系不丢失。
准:单碱基分辨率——你改一个字母(A→G),它能立刻告诉你这会不会影响功能。
全:不只要一个答案,而是把表达、调控、结构、互作……所有维度一起算出来,像给基因组做"全身 CT"。
这不是实验室里炫技,而是会落进临床和药企的真东西:
🔬 遗传病 / 罕见病:很多家族遗传病就藏在非编码区一个碱基的变化里。以往要大海捞针,现在 AlphaGenome 能直接给这个变异"打分",判断它有多危险。
💊 药物靶点:更快找到调控疾病基因的关键开关,少走十年弯路。
🧫 合成生物学:像写代码一样"设计"一段 DNA,让它按你想要的方式工作。
过去我们像拿着一本没有目录、没有标点的天书,只能读懂其中两句"正文"(编码蛋白的 2%)。AlphaGenome 相当于同时给了你一本完整的翻译、一本用法说明、和一台能预测"改一个字会怎样"的模拟器。
⚠️ 它基于已有数据训练,对没见过的极端情况仍会出错;预测的"效应"还需要实验验证;目前主要覆盖人和小鼠。科学的严谨在于:工具越强,越要清楚它的边界。
但毫无疑问,这类"基础模型 + 多组学"的范式,正在重写生物信息学的玩法。从单细胞、空间转录组,到变异效应预测——研究的瓶颈,早已不是"测不到",而是"读得懂、算得动"。
🚀 我们能为您做什么
如果你手上有单细胞 / 空间转录组 / 基因组变异数据,却卡在"怎么分析、怎么讲故事、怎么发出高分文章"——我们提供从 数据清洗、定制分析,到 可视化与论文级图表 的全程支持。让前沿算法,真正变成你论文里的图。
AlphaFold 解开了蛋白质的折叠之谜,拿了诺奖。现在,AlphaGenome 把目光投向了更庞大、更神秘的基因组"暗物质"。读懂它,或许就是读懂"我们为什么会生病"的下一把钥匙。
📄 文献信息
· 论文:Advancing regulatory variant effect prediction with AlphaGenome
· 期刊:Nature(2026 年 1 月)
· DOI:10.1038/s41586-025-10014-0
· 团队:Google DeepMind



夜雨聆风