乐于分享
好东西不私藏

使用AI模型从BigWig挖掘候选motif

使用AI模型从BigWig挖掘候选motif
面向读者:生物学家、遗传医学家与功能基因组研究人员适用版本:DGS 0.1.0

拿到 ATAC-seq、ChIP-seq、CUT&RUN 或组蛋白修饰的 BigWig 后,我们常会继续追问:哪些 DNA 序列特征与这些信号有关?哪些转录因子家族值得优先验证?

DGS 提供了一条从 BigWig 连续信号到候选 motif 的路径。更重要的是,在已经启用 DGS Skill 的 Client 中,生物学家可以用一条自然语言指令发起完整分析,不必从几十条中间命令开始。

先强调最重要的边界:DGS 找到的是模型为预测 BigWig 信号所使用的序列证据,不是直接扫描 BigWig,也不等同于实验证实的 TF 结合、调控因果或临床功能结论。

DGS 实际在做什么?

DGS 的逻辑可以概括为四步:

  1. 用 BED 定义要研究的固定长度序列窗口;
  2. 从 FASTA 读取这些窗口的 DNA 序列,并从 BigWig 提取监督信号;
  3. 训练序列模型,在独立测试染色体上判断 DNA 序列能否预测该信号;
  4. 只有模型通过测试,才用 attribution 定位重要碱基,再由 TF-MoDISco 聚合候选 motif。

图 1. BigWig→motif 的教学示意。曲线、attribution 和 motif 不是真实实验结果。

这一步很关键:模型如果不能在未见区域上预测 BigWig,就不应继续解释 motif。 否则得到的 logo 可能只是过拟合、GC 偏差、重复序列或数据拆分泄漏的产物。

开始前准备五项内容

  • 参考基因组 FASTA,并建立.fai索引;
  • 与 FASTA 使用同一 genome build 的等宽 BED;
  • 染色体命名一致、信号定义清楚的 BigWig;
  • 能访问 DeepGeSeq 仓库且已注册$dgsSkill 的 Client;
  • 预先写下窗口、信号聚合、数据拆分和 go/no-go 规则。

BED 不只是坐标文件,它决定模型可以学习什么。建议同时纳入有信号区域与预先定义的背景区域,并尽量匹配 GC、mappability 和距 TSS 等因素。只使用最强 peak,往往会缩窄信号范围并放大选区偏差。

一条可以直接改路径的 $dgs 指令

下面以 hg38 CD4 T 细胞 ATAC-seq 为例。使用前替换文件路径、分析名称和与你实验相符的生物学设定。

$dgs请在当前 DeepGeSeq 仓库中执行完整的 BigWig→motif 分析,不要只生成配置或打印命令。数据:- 分析名称:CD4_ATAC_rep1- 参考基因组:/project/reference/hg38.fa- 序列窗口:/project/regions/CD4_ATAC_summit_1000bp.bed- BigWig:/project/tracks/CD4_ATAC_rep1.normalized.bigWig- 输出目录:/project/results/CD4_ATAC_DGS_motif生物学设定:- BED 是以 peak summit 为中心的 1000 bp 等宽窗口;- 有信号区域与 GC/mappability 匹配背景各约一半;- BigWig 在窗口内取 mean,保留原始归一化尺度;- chr7 作验证集,chr8 作独立测试集;- go/no-go:测试集 Pearson 和 Spearman 均至少为 0.30,  且 MAE 优于恒定预测训练集均值的基线,否则停止 motif;- 仅解释测试集中信号最高的 10%,最多 5000 个窗口;- TF-MoDISco 分析 summit 中央 400 bp,  每个 metacluster 最多使用 2000 个 seqlet;- 这是单个 replicate 的发现性分析,不宣称 motif 已稳定复现。请按高级手册中的正式 TF-MoDISco 路径完成技术检查;不要静默降级。运行后汇报数据拆分、信号分布、测试指标、基线比较、主要 pattern/seqlet 数、报告路径、警告和失败项。

这是一条 Client 自然语言消息,不是新增的 shell 子命令。0.30、前10%5000、中央400 bp2000 seqlets都是示例中预先固定的参数,不是通用标准。

图 2. Client/Skill 应自动完成输入检查、训练、独立测试和 go/no-go 门控。测试不通过时停止 motif,而不是降低标准继续运行。

生物学家真正需要决定的参数

1. 窗口以什么为中心?

peak summit、TSS 与 enhancer center 代表不同生物学问题。窗口太短可能丢失协同元件;太长则可能混入多个调控元件和大量背景。

2. meanmax 还是 sum

  • mean:常用起点,描述窗口平均信号;
  • max:突出局部尖峰,但对噪声更敏感;
  • sum:受窗口长度和轨道尺度影响,跨设置比较时尤其谨慎。

3. 模型窗口和 motif 窗口是否相同?

不相同。模型可以读取 1,000 bp 序列,而 TF-MoDISco 只分析中央 400 bp。前者决定模型可利用的上下文,后者决定哪些位置参与 motif discovery。

图 3. 不同 assay 的信号宽度与常用窗口起点。图中范围为教学建议,不是普适最优值。

BigWig 中的“0”不一定是无信号

真实零信号、轨道无覆盖、NaN 与读取失败,进入模型后可能看起来都是 0,但生物学含义完全不同。DGS 当前版本会把 NaN 和部分读取失败区间转成 0,因此建模前必须统计覆盖比例,并在 genome browser 中抽查高信号、低信号和无覆盖窗口。

图 4. 输入质控的三个核心问题:背景是否可比、聚合方式是否符合问题、0 是否真的是零信号。

什么时候可以继续做 motif?

建议在分析前登记 go/no-go 条件,而不是看完结果再选指标。

输入至少应满足:

  • FASTA、BED、BigWig 的 genome build 和染色体命名一致;
  • 所有窗口等宽、不越界,训练、验证和测试集均非空;
  • 0 值比例、信号分布和异常值符合 assay 预期;
  • 高信号窗口与 genome browser 原始轨道一致。

模型至少应满足:

  • 独立测试集优于恒定预测或其他预先定义的简单基线;
  • Pearson、Spearman 与 MAE 指向一致,而不是被少数异常值主导;
  • 性能不是主要由 GC、重复序列或某条染色体的批次效应驱动。

图 5. chr7 用于验证、chr8 用于独立测试只是一个可审计示例。散点和指标为教学模拟,阈值不是通用标准。

结果出来后看什么?

不要只看“运行成功”或一个 motif logo。最低交付应包括:

  1. 输入版本、窗口定义、背景规则和三个数据集的信号分布;
  2. 独立测试集 Pearson、Spearman、MAE 及基线比较;
  3. 实际参与解释的区域坐标表;
  4. contribution logo、sequence logo 与每个 pattern 的 seqlet 数;
  5. 最佳模型、参数、TF-MoDISco 原始结果和 MEME motif 文件。

候选 motif 还需要与 JASPAR、HOCOMOCO 等数据库比较,结合研究细胞中的 TF 表达或活性证据,并在 replicate、seed、窗口长度和留出染色体中检查稳定性。最终仍需独立 ChIP/CUT&RUN、扰动或报告基因实验验证。

图 6. 数据库命中通常只能提示 TF family。只有加入细胞上下文、稳定性和独立功能证据,才能形成更具体的可验证假设。

最后一句话

DGS 的价值不是“自动给出一个 TF 名字”,而是把 BigWig 信号、序列预测、独立测试和 motif 解连接为一条可追溯的证据链。对于生物学家,最值得关注的不是中间命令,而是输入如何定义、模型是否真正泛化,以及候选 motif 经得起多少独立证据的检验。

引用:https://doi.org/10.1093/bioinformatics/btag584

欢迎使用https://github.com/JiaqiLi1024/DeepGeSeq