Nature | AI生成了首个基因编辑器——和SpCas9差400个氨基酸,但更好用
基因编辑器的开发一直受限于自然界提供的素材——要么从微生物里挖新的Cas9同源物,要么对SpCas9做点突变改造。2025年7月,Profluent公司在《Nature》上发表了一篇很有意思的工作。他们用蛋白质语言模型,基于从26.2 TB基因组和宏基因组数据中挖掘出的CRISPR-Cas序列,直接生成了数百万个全新的Cas9-like蛋白,其中一部分在人类细胞里确实能干活。做得最好的那个,命名为OpenCRISPR-1,与SpCas9有403个氨基酸差异,但编辑效率相当、脱靶明显更低,免疫原性也更低。
研究流程:挖掘26.2 TB序列→构建CRISPR-Cas Atlas(124万个操纵子)→在数据上微调ProGen2语言模型→生成400万CRISPR-Cas蛋白+100万Cas9-like蛋白→序列过滤→AlphaFold2结构验证→挑选209个→HEK293T中测试编辑活性→选出48个进一步表征→确定OpenCRISPR-1→深度测试(PAM兼容性、脱靶、碱基编辑、免疫原性、定制sgRNA)

一、突破点在哪?
传统的Cas9工程要么靠定向进化,要么靠结构指导的理性设计——都依赖对蛋白功能的明确假设。语言模型完全不用结构信息,只从序列里学“什么样的序列能干活”。这篇文章证明,这种方法生成出来的蛋白不仅能折叠、能切割DNA,而且在人类细胞里的表现甚至比天然蛋白更好。关键是,这些蛋白与任何已知自然序列都有几百个氨基酸的差距——相当于跳出了进化给出的所有选项,在没被探索过的序列空间里找到了更好的解。

二、怎么设计的?
第一步:建一个够大的训练集。团队从26.2 TB的基因组和宏基因组组装数据中挖出了124万个CRISPR操纵子,涵盖389,000多个Type II、V、VI单效应器系统。跟UniProt比,他们的CRISPR-Cas Atlas在Cas9家族上多了4.1倍、Cas12a多了6.7倍、Cas13多了7.1倍的蛋白簇。
第二步:训练模型生成序列。用ProGen2在CRISPR-Cas Atlas上微调,生成400万条序列(覆盖45个家族),再用Cas9-only数据微调生成100万条Cas9-like序列。生成出来的序列在家族层面簇数扩大了4.8倍——Cas13扩大8.4倍、Cas12a扩大6.2倍。这还只是保守估计。
第三步:筛出能用的。先做AlphaFold2结构预测,81.65%的生成蛋白平均pLDDT>80。对Cas9那批,98.9%的结构预测显示包含核心结构域(HNH 100%、RuvC 52.1%、PID 92.9%、REC 99.9%)。然后从这批里挑了209个最有可能与SpCas9的sgRNA兼容的,送进HEK293T测编辑活性。
第四步:锁定OpenCRISPR-1。209个里面有131个有可检测的编辑活性,挑了48个进一步测5个位点和15个脱靶位点,表现最好的是PF-CAS-182,命名为OpenCRISPR-1。它与SpCas9差403个突变,与最近的天然蛋白(Streptococcus cristatus Cas9)差182个突变。AlphaFold2显示大部分突变在溶剂暴露表面,催化界面和核酸接触残基基本保留。
数据说明了什么?语言模型的设计成功率(131/209有活性)远高于结构方法(LigandMPNN 0/5有活性)和进化方法(arDCA基本全灭)。说明对于复杂功能的蛋白,序列层面的统计学习比结构约束更有效。

三、验证结果
功能层面:OpenCRISPR-1在92个NGG靶点上编辑效率与SpCas9相当,在43个非NGG靶点上活性显著低于SpCas9(p=0.0005)——意味着PAM特异性可能更强。
脱靶层面:SITE-Seq全基因组脱靶分析,5条gRNA、4个RNP浓度下,OpenCRISPR-1的on-target占比始终高于SpCas9,脱靶位点是SpCas9的子集,没有产生新的切割模式。之前的高保真Cas9变体(eSpCas9、SpCas9-HF1等)没有哪个跟OpenCRISPR-1共享突变,说明它用了一套全新的分子机制来实现低脱靶。
碱基编辑:把OpenCRISPR-1换成nickase(D10A)接上ABE8.20,在3个位点上A-to-G编辑效率35-60%,跟SpCas9版本差不多,indel也没有明显增加。
免疫原性:40份健康人血清的iELISA显示,OpenCRISPR-1和另外两个生成蛋白的抗体结合量在多个稀释度下显著低于SpCas9,提示可能免疫原性更低。
sgRNA兼容性:他们用自己训练的条件生成模型给OpenCRISPR-1定制了sgRNA,31条定制gRNA的编辑效率超过SpCas9的gRNA。

四、价值在哪?
核心贡献是验证了一个新的蛋白设计范式:不需要结构、不需要定向进化的筛选系统,直接用语言模型生成全新功能蛋白。这套方法适用于任何有足够序列数据的蛋白家族,而且生成速度极快(用普通GPU几天就能生成百万条)。另外,他们公开了OpenCRISPR-1的序列和质粒(Addgene),没有商业化限制——这在基因编辑领域比较少见。
文献来源:Ruffolo J.A., Nayfach S., Gallagher J., et al. Design of highly functional genome editors by modelling CRISPR–Cas sequences. Nature, 2025, 645: 1089–1098.
1.提供CRISPR基因编辑相关产品,Cas9,cas12a、cas13a以及其他分子酶产品。
夜雨聆风