


图 | inDecay 研究概览:从细胞环境决定的修复偏好,到 MH-track 检测,再到少样本迁移至小鼠与大动物胚胎(作者绘制)。
🎯 太长不看版
同一位点的 CRISPR/Cas 无模板编辑会引入很多不同的突变。不同产物的偏好其实和细胞类型、甚至细胞的状态有很大关系。既有工具因为 DNA 修复通路的偏好不同,在小鼠胚胎上预测不准。
新 AI 工具 inDecay:
• 高效的特征设计:在多个细胞、多个不同的指标下都领先既有工具。
• 轻量化设计:只需要 30–50 个样本,就能跨越细胞类型学到另一个细胞的修复偏好;这让编辑产物预测得以应用到样本稀缺的场景,比如小鼠胚胎、大动物胚胎的编辑。
• 小鼠编辑的大规模数据集:共 52 个位点、超过 1,878 个胚胎、总共 11,787 条产物。
• 据此训练了适用于小鼠胚胎 2–4 细胞时期的预测模型,并揭示了小鼠胚胎独特的修复偏好。
• 四种大动物——猪、牛、山羊、绵羊的胚胎编辑数据;12 个靶点的小规模数据仍能带来显著的偏好迁移。
🧑💻 代码仓库:https://github.com/StatBiomed/inDecay
🌐 网页预测工具:https://indecay.online/
产物预测?
CRISPR/Cas 的预测,这不是已经很成熟的工作了吗?脱靶率、编辑活性,相关的 AI 预测工具卷上天际,还能玩出什么花来?这次,我们的工具 inDecay 并不只是预测一个数,而是预测一整个图谱——即对每一个靶点序列,我们能预测出它所有可能产生的编辑产物,以及每一种增删(indel)产生的概率。
啥意思?这其实就是说,对于给定的靶点序列和 gRNA,它们每次编辑产生的增删也是不一样的,有点子随机性在里面,就跟抽盲盒、抽卡一样。
CRISPR/Cas 编辑产物的复杂性
下面这张图展示了一个无模板编辑(template-free CRISPR/Cas editing)的增删分布(indel distribution)。

图 | 增删分布示意(文中也叫它「产物分布」「修复画像」;图为AI生成)。
上图展示了五种不同的突变(一种突变引入一种 allele)。编辑产物的多样性来自于删除(deletion)和插入(insertion)各自的随机性:删除的长短和起始位置、插入的长短和碱基组合,各自都组合出大量的产物,最后导致了产物的复杂度。如果只考虑最常见的 1–38 bp 删除和 1–2 bp 的插入,那么一个靶点大约能产生约 300–400 种不同的产物;更长片段删除的频率和位置我们暂不考虑。
决定产物的两大因素:靶点上下文和修复通路偏好
如此复杂的产物,我们从哪里开始预测呢?其实,虽然有随机性,但编辑产物还是和两个因素有关:靶点的上下文,和细胞对不同 DNA 修复通路的偏好。
下图展示了 4 个主要的 DNA 修复通路,它们产生的突变是有迹可循的。其中 HDR 需要模板,SSA 倾向于产生大片段删除——这两类产物都不在我们无模板编辑的系统里。因此我们最需要理解的就集中到 MMEJ 和 c-NHEJ 之中,而具体每个通路会怎么反应,就要看靶点序列的上下文(context)了。

图 | 四大 DNA 修复通路(c-NHEJ / MMEJ / HDR / SSA)如何把同一个切口修复成不同产物(图为AI生成)。
某些类型的产物和靶点上下文强烈相关。比如微同源重组介导的删除(Micro-homology Mediated End Joining,MMEJ),它由剪切位点两端的同源序列匹配、修复过程错误修剪导致。因此,如果我们能把两边匹配的序列都检测下来,并根据它们的距离、匹配程度等制定特征,那么一大类删除产物就能很好地预测了。
c-NHEJ 则更多产生一些短序列插入和突变。大规模的自靶向编辑实验(Massively Parallel Assay of Self-Targeting System)揭示了一些上下文特征:首先,删除和插入事件的相对比例也受上下文序列影响——越接近特定的近剪切位点序列,插入突变的占比越高;其次,还存在插入碱基对邻近序列的「拷贝」现象。了解了这些特点,我们就能设计出合理的特征。
inDecay 的两层设计:第一性原理特征工程 + 轻量化模型
专攻小鼠胚胎编辑的老师和我们提到,既有的预测软件在小鼠胚胎上常常预测不准。这或许和胚胎二细胞时期修复通路的基因表达有关,而这也引申出了后续的合作和 inDecay 的诞生。
既有的预测模型都在大规模平行实验数据上训练(inDelphi 与 ForeCasT),这些数据揭示了一些通用的上下文特征和产物规律。然而这些数据同时也包含了实验用细胞类型的通路偏好,而小鼠配套的偏好和这些已有的都不同。如何既利用已知规律,又剥离细胞特异性,就成了课题的关键。

图 | 初步统计:删除长度呈「MH / 非-MH」双峰混合,删除起始位点则随距离衰减(作者绘制)。
在 Lindel 数据上做初期分析时,我们发现删除事件的概率和其起始位置(start site)有很强的负相关;在删除长度上则出现了双峰分布。我们把数据按有无微同源序列(有 MH → MMEJ 通路;无 MH → c-NHEJ 通路)划分,趋势就变明朗了:没有 MH 时删除越长概率越低;但若有 MH,那么对应长度的概率就会被拉高,从而形成双峰。
基于修复机制的先验知识和数据的初步统计,我们得出了几个核心特征,之后又陆续加入了临近碱基等特征。而对增删(indel)基于两个衰退(decay)规律的建模,就得到了 inDecay(indel prediction by frequency Decay)的最初模型。

原文图 1 | inDecay 模型示意:(A) 微同源(MH)事件检测与特征提取——把序列匹配转化为对角线检测问题;(B) 多阶段的编辑产物预测模型。(引自本文 Genome Biology, Figure 1)
有了高度浓缩的信息特征,我们还缺少细胞通路偏好的建模。可惜的是,我们虽然能对每个细胞类型的通路做统计,但还无法仅凭细胞的特质提前算出其偏好,只能在拿到编辑数据之后再建模(post-hoc)。预测模型的表现往往由特征的表示能力和模型参数量共同决定。因此我们希望把特征优化做好,减少可学习参数的特征提取负担,从而用少量参数就能捕捉细胞类型的特异性——这既提升了效果,也为后续小鼠胚胎等稀缺数据的拟合打下基础(背后的思想很朴素:数据少,那变量就得少,这样才有解)。
inDecay 在五种细胞系上的表现
我们首先在 Allen & Crepaldi 等人生成的多细胞系数据集上评估 inDecay,它涵盖 5 种细胞系、超过 35,000 条 gRNA 的修复产物。我们与 Lindel、inDelphi、FORECasT 等主流方法在同一训练/测试划分下比较,并采用了多种评估指标:包括 top-5 事件召回、分布相似度(Kendall 相关系数、KL 散度),以及移码比例、删除占比等关键组成特征。结果显示,inDecay 在多个细胞系、多个指标上都取得了领先,而且用到的特征远少于既有方法。

原文图 2 | inDecay 在 FORECasT 多细胞系数据集上的表现:与 Lindel / inDelphi / FORECasT 在 6 项指标上的对比(引自本文 Genome Biology, Figure 2)。
实际应用:用 Sanger 测序数据建模小鼠与大动物胚胎编辑
轻量化模型的好处就是利于迁移。在各大数据集上预训练之后,我们发现大约只需要 30–50 个样本(靶点)的数据,就能把重要指标提升到合理水平。感谢我们的合作者提供了大量胚胎编辑数据。这其中最具价值的是,我们打通了基于 Sanger 一代测序数据获得增删突变分布的流程。此前已有数据都基于 NGS 二代测序,需要特殊的实验平台,世界上仅有少数实验室能生产;而 Sanger 测序确实是很多实验室最日常的数据。利用我们的数据处理流程,每个实验室都能搭建专属于自己细胞系或动物模型的编辑预测模型。
为了更好地服务今后基因编辑小鼠的构建,合作者收集了 52 个基因组位点、横跨 1,878 个胚胎、拢共 11,787 条突变的数据。由于小鼠胚胎还需手动操作获取并引导突变,这其中付出了大量人力物力,历经好几位技术员和硕博的接力。在共同一作 Louisa 的努力下,我们处理了胚胎数据并调试出了最优的小鼠模型。
最后我们发现,inDecay 在小鼠数据上能预测出约 80% 的主要事件,并在总体分布、移码突变概率等重要指标上大幅领先既有方法。这其实也是因为现有模型的训练数据和小鼠胚胎数据差异太大,而 inDecay 只需在小样本数据中学到鼠胚的通路偏好,就能在各项指标上超越同行。

原文图 4 | inDecay 在新生成的小鼠胚胎编辑数据集上的迁移与评估:实验流程、数据规模、各项指标及代表性位点的产物预测(引自本文 Genome Biology, Figure 4)。
我们同样在四种大动物——猪、牛、山羊、绵羊的胚胎编辑数据上做了验证。即便每个物种只有约 12 个靶点的小规模数据,inDecay 仍能带来显著的偏好迁移。
数据处理的血与泪
小鼠和大动物的胚胎编辑数据十分珍贵,因此每一条 Sanger 数据都需要仔细分析。然而这样的数据并不像 NGS 那样有许多现成工具可以调用。首先遇到的问题就是 Sanger 的 ab1 数据并不是纯文本,而是信号的综合分布——如果一个位点有多个等位突变,那么该位点的信号就是杂糅的。我们首先需要分解信号,这一步 Louisa 做了大量分析和比较,摸索出 DecodR 与 Synthego 各自的优劣,并最终选定 DecodR 为最终方案;我前期写的大量分析代码也被她重构,在工程上变得更加干净、可复用。当然更要感谢各位合作者和老师们的指导!
快来试试看
最后再为我们的工具打打广告:https://indecay.online/。把靶点序列输入之后,再输入剪切位点(PAM 前三位)和最贴近的细胞类型,就能预测所有产物及其可能性啦。

图 | inDecay网页工具预测示例(作者绘制)该图中展示了小鼠mCD44基因序列的编辑产物预测。结果显示产物D4_L-5C2R2占比约40%。该产物的识别码代表了4bp的删除,从剪切位点左数-5位起到右数第二位, 其中有2bp序列有同源互补。
一键下载预测结果,打开就能看到对应的序列和概率。

图 | 网页工具预测结果预览;每一行展示了 从左到右每一列分别为编辑产物标识码、编辑产物序列产物的占比。(作者绘制)
相关链接
• 代码仓库(GitHub):https://github.com/StatBiomed/inDecay
• 网页预测工具:https://indecay.online/
• 预印本(Semantic Scholar):https://www.semanticscholar.org/paper/1d6959eb20ab5c252e679feccbfbc987685d086a
作者 / 团队介绍
上述研究成果已于近日在 Genome Biology 在线发表,题目为 “Accurate prediction of CRISPR editing outcomes in somatic cell lines and zygotes with few-shot learning with inDecay”。郑炜忠博士,于璐为共同第一作者。黄渊华教授(香港大学),兰国成博士(基因组科技),刘澎涛教授(香港大学),王慧利研究员(江苏省农科院)为共同通讯作者。
Genome Biology
doi: 10.1186/s13059-026-04211-x
参考文献 References:
[1] Shen, M.W. et al. Predictable and precise template-free CRISPR editing of pathogenic variants. Nature 563, 646–651 (2018).
[2] Allen, F. et al. Predicting the mutations generated by repair of Cas9-induced double-strand breaks. Nature Biotechnology 37, 64–72 (2019).
[3] Chen, W. et al. Massively parallel profiling and predictive modeling of the outcomes of CRISPR/Cas9-mediated double-strand break repair. Nucleic Acids Research 47, 7989–8003 (2019).
[4] Zheng, W., Yu, L., et al. Accurate prediction of CRISPR editing outcomes in somatic cell lines and zygotes with few-shot learning with inDecay. Genome Biology (2026).
期刊简介
BMC旗舰刊 Genome Biology 是基因组生物学中排名最高的开放获取期刊, 致力于以基因组和后基因组为对象,研究生物学和生物医学各个领域的重大研究突破。
2025 IF:9.2
2025 下载量:10.3M
Altmetric 提及:9,092
投稿到初审意见:13天(中值)


欢迎扫码了解期刊详情
点击“阅读原文”阅读英文原文
Accurate prediction of CRISPR editing outcomes in somatic cell lines and zygotes with few-shot learning with inDecay

BMC是施普林格∙自然旗下机构。作为开放获取出版先锋,BMC不断推出一系列高质量的同行评议期刊,包括BMC Biology 、BMC Medicine等涵盖范围较广的期刊,以及Malaria Journal、Microbiome和BMC系列期刊等专门刊物。BMC以“科研永不止步”为信条,致力于不断创新,以更好地满足作者群体的需要,确保所发表论文的完整性,并积极推广开放研究。

第一步:点击文章顶端“BMC科研永不止步”公众号;
第二步:点击右上角“...”
第三步:点击“设为星标”
点个“小红心”,下次更新不错过⇣⇣
夜雨聆风