乐于分享
好东西不私藏

生信篇 | 三代测序肿瘤结构变异检测新工具:SAVANA

生信篇 | 三代测序肿瘤结构变异检测新工具:SAVANA

随着长读长测序(Long-read sequencing)技术的快速发展,研究人员可以更全面地解析复杂肿瘤基因组结构。相比较于传统短读长测序,长读长测序(如Oxford Nanopore 和 PacBio)能够跨越大片重复区域,从而更容易识别结构变异(Structural Variants,SVs)。然而,肿瘤基因组具有极高复杂性,例如:大规模染色体重排、体细胞拷贝数异常(Somatic Copy Number Aberrations,SCNAs)、多克隆肿瘤结构等。这些特征使得传统SV检测算法容易产生大量假阳性结果。为了解决这一问题,Cortes-Ciriano实验室开发了一款计算效率高的算法——SAVANA,并于2025年发表在《Nature Methods》上。

SAVANA: reliable analysis of somatic structural variants and copy number aberrations using long-read sequencing。

1

什么是SAVANA?

SAVANA是一个用于检测肿瘤体细胞SV和SCNAs,并利用肿瘤的长读长序列测序数据推断肿瘤纯度和倍数,无论是否匹配生殖系对照。截止2026年3月15日为止,已更新到v1.3.7版本。软件通过分析肿瘤样本与匹配正常样本的BAM文件,识别支持结构变异的长读长数据,并对候选SV进行聚类和共识断点检测,最终输出 VCF或BEDPE格式结果。

2

核心技术特点

1. 机器学习驱动的SV识别

SAVANA的核心创新之一是机器学习模型。该模型能够区分:真正的肿瘤结构变异;由测序或比对产生的假信号。这一策略显著降低了假阳性率,使长读长测序更适合临床分析。

2. 同时检测SVs和SCNAs

传统SV工具通常只检测结构变异,而SAVANA可以同时分析SVs和SCNAs。算法通过SV断点和SNP信息 计算:肿瘤纯度(tumour purity)基因组倍体(ploidy),从而实现更完整的肿瘤基因组分析。

3. 单倍型分辨率分析

SAVANA利用长读长测序的相位信息(phasing information),能够在单倍型水平(haplotype level)识别结构变异。这种能力对于研究:染色体重排、致癌基因扩增、抑癌基因缺失等具有重要意义。

3

软件安装方法

1. 使用 conda 安装(推荐)

首先,创建一个新的conda环境SAVANA(Python 3.9),并进行激活。

然后,运行以下命令安装SAVANA软件:

2. 从 Source 安装

首先,克隆SAVANA的仓库。

通过conda安装软件所需要的依赖requirements.txt()。

或者通过pip安装和管理依赖。

最后通过Python3来安装SAVANA。

运行时,使用以下命令(注意将相关数据源替换为自己的数据目录):

4

常见参数

1. 必选参数

下面为运行SAVANA软件必须填入的参数,包括肿瘤组织和正常组织的BAM或CRAM格式文件(必须带有.bai或.crai索引文件),一个输出文件地址(文件夹内必须为空),以及参考基因组。

2. 基础参数

5

输出结果

根据运行时参数的不同配置,软件将输入下表所列的不同格式的结果文件。

6

VCF文件中INFO字段解释

INFO字段用于描述结构变异的总体信息(位点级别)。

7

参考文献

1. Elrick, H., Sauer, C.M., Espejo Valle-Inclan, J. et al. SAVANA: reliable analysis of somatic structural variants and copy number aberrations using long-read sequencing. Nat Methods 22, 1436–1446 (2025). https://doi.org/10.1038/s41592-025-02708-0.

扫描二维码关注我们

数字PCR平台|多重细胞因子检测平台|纳米孔测序平台

本站文章均为手工撰写未经允许谢绝转载:夜雨聆风 » 生信篇 | 三代测序肿瘤结构变异检测新工具:SAVANA

猜你喜欢

  • 暂无文章