生信篇 | 三代测序肿瘤结构变异检测新工具:SAVANA
随着长读长测序(Long-read sequencing)技术的快速发展,研究人员可以更全面地解析复杂肿瘤基因组结构。相比较于传统短读长测序,长读长测序(如Oxford Nanopore 和 PacBio)能够跨越大片重复区域,从而更容易识别结构变异(Structural Variants,SVs)。然而,肿瘤基因组具有极高复杂性,例如:大规模染色体重排、体细胞拷贝数异常(Somatic Copy Number Aberrations,SCNAs)、多克隆肿瘤结构等。这些特征使得传统SV检测算法容易产生大量假阳性结果。为了解决这一问题,Cortes-Ciriano实验室开发了一款计算效率高的算法——SAVANA,并于2025年发表在《Nature Methods》上。
SAVANA: reliable analysis of somatic structural variants and copy number aberrations using long-read sequencing。
1

什么是SAVANA?
SAVANA是一个用于检测肿瘤体细胞SV和SCNAs,并利用肿瘤的长读长序列测序数据推断肿瘤纯度和倍数,无论是否匹配生殖系对照。截止2026年3月15日为止,已更新到v1.3.7版本。软件通过分析肿瘤样本与匹配正常样本的BAM文件,识别支持结构变异的长读长数据,并对候选SV进行聚类和共识断点检测,最终输出 VCF或BEDPE格式结果。
2

核心技术特点
1. 机器学习驱动的SV识别
SAVANA的核心创新之一是机器学习模型。该模型能够区分:真正的肿瘤结构变异;由测序或比对产生的假信号。这一策略显著降低了假阳性率,使长读长测序更适合临床分析。
2. 同时检测SVs和SCNAs
传统SV工具通常只检测结构变异,而SAVANA可以同时分析SVs和SCNAs。算法通过SV断点和SNP信息 计算:肿瘤纯度(tumour purity)基因组倍体(ploidy),从而实现更完整的肿瘤基因组分析。
3. 单倍型分辨率分析
SAVANA利用长读长测序的相位信息(phasing information),能够在单倍型水平(haplotype level)识别结构变异。这种能力对于研究:染色体重排、致癌基因扩增、抑癌基因缺失等具有重要意义。
3

软件安装方法
1. 使用 conda 安装(推荐)
首先,创建一个新的conda环境SAVANA(Python 3.9),并进行激活。

然后,运行以下命令安装SAVANA软件:

2. 从 Source 安装
首先,克隆SAVANA的仓库。

通过conda安装软件所需要的依赖requirements.txt()。

或者通过pip安装和管理依赖。

最后通过Python3来安装SAVANA。

运行时,使用以下命令(注意将相关数据源替换为自己的数据目录):

4

常见参数
1. 必选参数
下面为运行SAVANA软件必须填入的参数,包括肿瘤组织和正常组织的BAM或CRAM格式文件(必须带有.bai或.crai索引文件),一个输出文件地址(文件夹内必须为空),以及参考基因组。

2. 基础参数

5

输出结果
根据运行时参数的不同配置,软件将输入下表所列的不同格式的结果文件。

6

VCF文件中INFO字段解释
INFO字段用于描述结构变异的总体信息(位点级别)。

7

参考文献
1. Elrick, H., Sauer, C.M., Espejo Valle-Inclan, J. et al. SAVANA: reliable analysis of somatic structural variants and copy number aberrations using long-read sequencing. Nat Methods 22, 1436–1446 (2025). https://doi.org/10.1038/s41592-025-02708-0.

扫描二维码关注我们
数字PCR平台|多重细胞因子检测平台|纳米孔测序平台
夜雨聆风