ARTICLE · 1085536
张锋点赞!AI科学家独立发现“类CRISPR”新系统!整个过程仅用21小时

撰文丨王聪
编辑丨王多鱼
排版丨水成文

同时,国际顶尖学术期刊 Nature 以:Anthropic’s AI biolab finds ‘CRISPR-like’ DNA in viruses. What’s next? 为题,报道了这项新突破。

值得一提的是,在审阅了该预印本论文后,CRISPR 基因编辑技术先驱张锋表示:This is an exciting example of how AI agents can contribute to biological discovery. The identification of RNA-repeat arrays associated with reverse transcriptases is genuinely intriguing and merits further investigation. I hope this work encourages more scientists to explore how AI can support their research(这是一个令人振奋的案例,展示了 AI 智能体如何推动生物学发现。识别出与逆转录酶相关的 RNA 重复序列阵列确实引人入胜,值得进一步研究。我希望这项工作能鼓励更多科学家探索人工智能如何支持他们的科研工作)。
从“找茬”开始的科学发现
很多生物学上的重大突破,都源于科学家在某天突然注意到了一些“不对劲”的东西——比如某个微生物的基因序列看起来有点奇怪。
问题是,如今公开的基因数据库中存储着数十亿个蛋白质序列,而且每四年就会翻一番。让人类科学家逐条查看这些海量数据,无异于大海捞针。
Anthropic 的研究人员想到了一个新办法:既然大语言模型(LLM)擅长在海量文本中发现规律,那为什么不试试让它们去读“DNA 的语言”呢?
于是,他们启动了一场前所未有的实验。
950 个 AI 智能体的“科研马拉松”
Anthropic 的研究团队部署了大约 950 个 AI 智能体,给它们下达了一个目标:寻找新型的逆转录酶系统。
这些 AI 智能体分工协作,有的负责搜索数据库,有的负责分析结果,还有的担任“监督员”检查同伴的工作,它们可以互相讨论初步发现,共同决定下一步研究方向。
整个研究持续了 21.5 小时,AI 智能体们自主执行了 7578 次命令行操作、696 次数据库查询、131 次文献检索和 61 次网络请求。在这个过程中,它们完成了 119 项任务,消耗了 2.156 亿个 token。
最令人惊讶的是,在整个过程中,没有人类参与任何决策。
“我看到了一串重复的DNA!”
真正的突破发生在一个 AI 智能体读取一段病毒基因序列的时候。
当时,这个 AI 正在检查一个巨型病毒基因组中的 DNA 序列。突然,它在自己的推理日志中写下了一段令人兴奋的文字——我肉眼可见一串串联重复阵列:CATGTGTATCGCATGTT/CATGTGTTTCGCATGT,这个模式不断重复,间隔大约 100-180 个碱基——这不就是类似 CRISPR 或 msDNA 的重复阵列吗?!

这段文字表明,AI 智能体能够像人类科学家一样,“亲眼”注意到了数据中的异常模式,并立即意识到这可能是一个重要发现。
随后,这个 AI 智能体还自行编写了一个脚本,精确统计了重复序列的数量和间距,并通过文献检索确认这确实是一种此前未被描述过的全新结构。
研究团队将这种新发现的系统命名为——阵列相关逆转录酶(Array-Associated Reverse Transcriptase,简称为 ART)。
ART 是什么?它和 CRISPR 有什么不同?
为了理解这个发现的重要性,我们首先需要简单了解一下 CRISPR。
CRISPR(Clustered Regularly Interspaced Short Palindromic Repeat)系统是细菌和古菌的一种“免疫系统”,它通过记录入侵病毒的 DNA 片段来建立“黑名单”,下次遇到相同病毒时就能精准切割并消灭对方。科学家们已经将 CRISPR 改造成了革命性的基因编辑工具。
而新发现的 ART 系统在某些方面看起来很像 CRISPR:它的基因组中也有一系列重复的 DNA 序列,中间夹杂着不同的间隔序列。但与 CRISPR 不同的是——
1. 间隔更长:CRISPR 的间隔通常只有约 30 个碱基,而 ART 的间隔长达 120-220 个碱基;
2. 没有切割酶:CRISPR 旁边总是跟着负责切割 DNA 的 Cas 蛋白,但在 ART 附近找不到类似的酶;
3. 功能未知:目前还不清楚 ART 系统的这些重复序列到底有什么用。
不过,研究团队发现,ART 系统在病毒感染期间非常活跃——在被病毒感染的葡萄球菌中,ART 产生的 RNA 占到了所有病毒 RNA 的 8%,是表达量最高的转录本之一。
AI 是如何“看懂” DNA 的?
为了弄清楚 AI 究竟是如何识别出这些重复序列的,研究团队进行了一系列测试。
他们发现,当 AI 能够直接读取原始的 DNA 序列(而不是经过处理的摘要数据)时,识别重复序列的成功率从 29% 飙升到 76%。对于性能最强的模型,成功率甚至可以达到 96%。
更有趣的是,通过分析 AI 模型的内部活动信号,研究团队发现,模型中存在特定的“神经元”对 DNA 重复序列特别敏感。当 AI 读到重复的 DNA 片段时,这些“神经元”的活跃程度会显著提高,就像人类大脑在看到熟悉图案时会自动产生反应一样。
这种能力被研究团队称为“基因组视觉”——AI 可以直接从原始 DNA 序列中“看见”模式,而不需要依赖预设的分析规则。
这意味着什么?
这项研究的深远意义在于:AI 第一次展示了它能够像人类科学家一样,自主完成科学发现的第一步——注意到数据中的异常现象,并将其作为有价值的研究线索进行追踪。
过去,自动化数据分析只能按照预设的程序运行,无法处理超出预期范围的情况。而这次实验证明,AI 大模型可以:
自主设定期望值:知道什么是“正常”的,什么可能是“异常”的;
做出判断:认为某些异常值得进一步研究;
制定计划:自行设计分析方案来验证假设;
执行分析:编写代码、运行工具、解读结果。
当然,这并不意味着 AI 可以完全取代人类科学家。正如论文作者所说:生物学研究需要在物理世界中实际进行实验,这是 AI 暂时无法替代的。
事实上,对于新发现的 ART 系统,还有很多关键问题等待解答:它的逆转录酶是否真的有活性?那些重复序列具体起什么作用?这个系统对病毒本身意味着什么?这些问题的答案,仍然需要人类科学家走进实验室,亲手操作湿实验才能找到。
这项研究虽然只是第一步,但它预示着科学研究方式的深刻变革——随着 AI 能力的不断提升,人类科学家可能很快就可以将自己的精力更多地集中在实验设计和验证上,而将数据的探索和初步分析交给 AI 来完成。
论文链接:
https://www.alphaxiv.org/abs/2609.ai-agents-discover-reverse-transcriptases
点在看,传递你的品味