拿到 ATAC-seq、ChIP-seq、CUT&RUN 或组蛋白修饰的 BigWig 后,我们常会继续追问:哪些 DNA 序列特征与这些信号有关?哪些转录因子家族值得优先验证?
DGS 提供了一条从 BigWig 连续信号到候选 motif 的路径。更重要的是,在已经启用 DGS Skill 的 Client 中,生物学家可以用一条自然语言指令发起完整分析,不必从几十条中间命令开始。
先强调最重要的边界:DGS 找到的是模型为预测 BigWig 信号所使用的序列证据,不是直接扫描 BigWig,也不等同于实验证实的 TF 结合、调控因果或临床功能结论。
DGS 实际在做什么?
DGS 的逻辑可以概括为四步:
用 BED 定义要研究的固定长度序列窗口; 从 FASTA 读取这些窗口的 DNA 序列,并从 BigWig 提取监督信号; 训练序列模型,在独立测试染色体上判断 DNA 序列能否预测该信号; 只有模型通过测试,才用 attribution 定位重要碱基,再由 TF-MoDISco 聚合候选 motif。

图 1. BigWig→motif 的教学示意。曲线、attribution 和 motif 不是真实实验结果。
这一步很关键:模型如果不能在未见区域上预测 BigWig,就不应继续解释 motif。 否则得到的 logo 可能只是过拟合、GC 偏差、重复序列或数据拆分泄漏的产物。
开始前准备五项内容
参考基因组 FASTA,并建立 .fai索引;与 FASTA 使用同一 genome build 的等宽 BED; 染色体命名一致、信号定义清楚的 BigWig; 能访问 DeepGeSeq 仓库且已注册 $dgsSkill 的 Client;预先写下窗口、信号聚合、数据拆分和 go/no-go 规则。
BED 不只是坐标文件,它决定模型可以学习什么。建议同时纳入有信号区域与预先定义的背景区域,并尽量匹配 GC、mappability 和距 TSS 等因素。只使用最强 peak,往往会缩窄信号范围并放大选区偏差。
一条可以直接改路径的 $dgs 指令
下面以 hg38 CD4 T 细胞 ATAC-seq 为例。使用前替换文件路径、分析名称和与你实验相符的生物学设定。
$dgs请在当前 DeepGeSeq 仓库中执行完整的 BigWig→motif 分析,不要只生成配置或打印命令。数据:- 分析名称:CD4_ATAC_rep1- 参考基因组:/project/reference/hg38.fa- 序列窗口:/project/regions/CD4_ATAC_summit_1000bp.bed- BigWig:/project/tracks/CD4_ATAC_rep1.normalized.bigWig- 输出目录:/project/results/CD4_ATAC_DGS_motif生物学设定:- BED 是以 peak summit 为中心的 1000 bp 等宽窗口;- 有信号区域与 GC/mappability 匹配背景各约一半;- BigWig 在窗口内取 mean,保留原始归一化尺度;- chr7 作验证集,chr8 作独立测试集;- go/no-go:测试集 Pearson 和 Spearman 均至少为 0.30, 且 MAE 优于恒定预测训练集均值的基线,否则停止 motif;- 仅解释测试集中信号最高的 10%,最多 5000 个窗口;- TF-MoDISco 分析 summit 中央 400 bp, 每个 metacluster 最多使用 2000 个 seqlet;- 这是单个 replicate 的发现性分析,不宣称 motif 已稳定复现。请按高级手册中的正式 TF-MoDISco 路径完成技术检查;不要静默降级。运行后汇报数据拆分、信号分布、测试指标、基线比较、主要 pattern/seqlet 数、报告路径、警告和失败项。这是一条 Client 自然语言消息,不是新增的 shell 子命令。0.30、前10%、5000、中央400 bp和2000 seqlets都是示例中预先固定的参数,不是通用标准。

图 2. Client/Skill 应自动完成输入检查、训练、独立测试和 go/no-go 门控。测试不通过时停止 motif,而不是降低标准继续运行。
生物学家真正需要决定的参数
1. 窗口以什么为中心?
peak summit、TSS 与 enhancer center 代表不同生物学问题。窗口太短可能丢失协同元件;太长则可能混入多个调控元件和大量背景。
2. mean、max 还是 sum?
mean:常用起点,描述窗口平均信号;max:突出局部尖峰,但对噪声更敏感;sum:受窗口长度和轨道尺度影响,跨设置比较时尤其谨慎。
3. 模型窗口和 motif 窗口是否相同?
不相同。模型可以读取 1,000 bp 序列,而 TF-MoDISco 只分析中央 400 bp。前者决定模型可利用的上下文,后者决定哪些位置参与 motif discovery。
图 3. 不同 assay 的信号宽度与常用窗口起点。图中范围为教学建议,不是普适最优值。
BigWig 中的“0”不一定是无信号
真实零信号、轨道无覆盖、NaN 与读取失败,进入模型后可能看起来都是 0,但生物学含义完全不同。DGS 当前版本会把 NaN 和部分读取失败区间转成 0,因此建模前必须统计覆盖比例,并在 genome browser 中抽查高信号、低信号和无覆盖窗口。

图 4. 输入质控的三个核心问题:背景是否可比、聚合方式是否符合问题、0 是否真的是零信号。
什么时候可以继续做 motif?
建议在分析前登记 go/no-go 条件,而不是看完结果再选指标。
输入至少应满足:
FASTA、BED、BigWig 的 genome build 和染色体命名一致; 所有窗口等宽、不越界,训练、验证和测试集均非空; 0 值比例、信号分布和异常值符合 assay 预期; 高信号窗口与 genome browser 原始轨道一致。
模型至少应满足:
独立测试集优于恒定预测或其他预先定义的简单基线; Pearson、Spearman 与 MAE 指向一致,而不是被少数异常值主导; 性能不是主要由 GC、重复序列或某条染色体的批次效应驱动。

图 5. chr7 用于验证、chr8 用于独立测试只是一个可审计示例。散点和指标为教学模拟,阈值不是通用标准。
结果出来后看什么?
不要只看“运行成功”或一个 motif logo。最低交付应包括:
输入版本、窗口定义、背景规则和三个数据集的信号分布; 独立测试集 Pearson、Spearman、MAE 及基线比较; 实际参与解释的区域坐标表; contribution logo、sequence logo 与每个 pattern 的 seqlet 数; 最佳模型、参数、TF-MoDISco 原始结果和 MEME motif 文件。
候选 motif 还需要与 JASPAR、HOCOMOCO 等数据库比较,结合研究细胞中的 TF 表达或活性证据,并在 replicate、seed、窗口长度和留出染色体中检查稳定性。最终仍需独立 ChIP/CUT&RUN、扰动或报告基因实验验证。

图 6. 数据库命中通常只能提示 TF family。只有加入细胞上下文、稳定性和独立功能证据,才能形成更具体的可验证假设。
最后一句话
DGS 的价值不是“自动给出一个 TF 名字”,而是把 BigWig 信号、序列预测、独立测试和 motif 解释连接为一条可追溯的证据链。对于生物学家,最值得关注的不是中间命令,而是输入如何定义、模型是否真正泛化,以及候选 motif 经得起多少独立证据的检验。
欢迎引用:https://doi.org/10.1093/bioinformatics/btag584
欢迎使用:https://github.com/JiaqiLi1024/DeepGeSeq
夜雨聆风