乐于分享
好东西不私藏

10X空间转录组数据的结果说明(3)之Visium HD网页报告解读一

10X空间转录组数据的结果说明(3)之Visium HD网页报告解读一

——点击蓝字 关注我们——

10X空间转录组数据的结果说明(3)之Visium HD网页报告解读一

方老师小课堂

前言

空间转录组结果究竟怎么看?

那么多结果文件究竟先打开哪个?

究竟哪个是结果报告?

结果报告中的指标那么多究竟怎么知道我们数据的好坏?

今天,方老师带大家走进web_summary.html的报告解读,详细了解网页报告的各个细节,让大家充分了解自己的数据质量。

由于10X空间转录组技术有很多种方案,与之对应,Space ranger也有其不同的结果和结果文件夹。包含了:

  • 10x Visium 1.0 Space Ranger 

  • 基于探针的10x Visium 2.0 Space Ranger 

  • 基于探针的 10X  Visium HD Space Ranger

  • 10x Visium HD 3' Space Ranger
这里我们以10Xgenomics官网数据集提供的    Visium_HD_Human_Colon_Cancer的数据的结果报告为例,介绍下报告各个部分的情况。

它是基于探针的 10X  Visium HD Space ranger 的结果。

报告结构

首先报告分为Summary、Imange Alignment、Bin-Level Metrics和Cell Segmentation四个部分。

由于报告内容非常多,今天就介绍第一部分Summary的部分指标。

Key Metrics

指标解读

这里汇总了数据最值得关注的指标:

· Number of 8 µm binned squares under tissue: 

切片组织区域8微米bins分辨率下检测到的数目,这个值的大小主要取决于你铺片有效区域的大小,因此该指标大小主要用于评估样本的覆盖范围。

· Mean reads per 8 µm bin: 

8微米分辨率下每个bins包含的reads数目的均值。这个值其实和测序深度、覆盖度、还有实验中的捕获效率都有关。这个值等同于在单细胞转录组的Mean reads per cell。增加测序量,提高测序深度这个值会提升。 

· Mean UMIs per 8 µm bin: 

8微米分辨率下每个bins包含的平均UMI(Unique Molecular Identifier)数。这个值用来评估细胞内基因表达的复杂度、转录本大小等情况。这个在单细胞转录组中有个类似的指标Median UMIs per cell。这个值的大小和细胞类型密切相关。某些转录本小的细胞类型的这个值可能会偏小。增加测序量,提高测序深度这个值可能会有所改善。 

· Total genes detected: 

整个组织区域检测到的总基因种类数。一般来说这个值如果是人的样本,大概范围是1万7-2万2之间,毕竟人类的基因种类大概就在这个范围内,如果细胞类型更加均一的样本,这个值可能会小于人类基因种类很多。

Mapping

Mapping这里主要是Mapping到Probe set相关指标的情况。❓问号点开它,有各个指标的介绍。

 一、比对的计算MAPQ规则

在介绍指标之前,需要先介绍下10X不同空转技术的Mapping匹配计算MAPQ方法的相关情况,方便大家对后续指标的理解。

匹配计算规则如下(Visium1 和 Visium HD 3'): 

1.如果一个reads,至少50%与基因外显子相匹配,那么Space ranger会将其视为外显子。 

2.如果一个reads,至少50%与基因相匹配,但是匹配的位置不是外显子,那么Space ranger会将其视为内含子。 

3.除此之外,就是匹配到基因间区。 

4.有时候对于一个区域可能存在是这个基因的外显子,同时是一个或多个基因的非外显子区域,这个区域优先考虑成这个基因的外显子。 当这个被认为是可靠匹配到外显子区域的,那么我们定义MAPQ(Mapping Quality Score)为255。 多个匹配结果,采用下方公式计算MAPQ:

Nmap表示reads可以匹配到的外显子类型数目。在bam文件tag NH:i中记录了,如果他为1,Nmap就是1,如果多匹配了就是匹配的数目。

匹配计算规则如下(Visium2 和 Visium HD):

因为VIsium2和 Visium HD都是基于探针probe的方法,因此在基于probe检测中,每个靶基因的一对探针probe组成 探针面板,它和转录组杂交。 

这里会涉及几个点,因为我们在比对时候,space ranger需要设定probe set的参数。reads本身使用STAR比对参考基因组,来确定mapping的位置,不单单要考虑参考基因组,还需要考虑probe探针进行对齐,然后本身比对参考基因组知道位置,就可以知道是什么基因了,这样就可以既考虑匹配探针程度,又考虑参考基因组位置。 

这个方法中,将每个reads分割成两半,每一半(half)匹配的程度来进行定义匹配程度,同理probe也是会分成两半进行。 

1.reads的两个half都完全匹配到相同probe,那么匹配的MAPQ=255,这个才会被纳入UMI计数中。 

2.reads的其中一个half完全匹配到这个probe,另外一个half没有完全匹配,需要将没有匹配的half序列与这个probe进行比对,若这个half最小比对分数大于30,认为这个half其实是confidently mapped这个probe上的,因此该情况下的MAPQ=255。 

3.reads的其中一个half完全匹配到这个probe,另外一个half不匹配,那么该reads的MAPQ就是1,不会被纳入UMI计数中。 

4.reads的其中一个half匹配到probe A ,另外一个half匹配到probe B,那么这个reads的MAPQ就是3,不会被纳入UMI计数中。 

5.此外,probe的两半本身也需要匹配probe set reference的,如果probe的两半(half)没有匹配上probe set reference,即使上述reads能匹配到这个probe,记为MAPQ=0。 同理,还需要和参考基因组匹配,如果没有匹配上,还是记为MAPQ=0。 

因此,probe本身两个half需要检测,同时reads要匹配上参考基因组,也要按上述规则匹配上probe才行。 

在bam文件tag pr:Z记录了MAPQ的情况。MAPQ总共就4个值,255,3,1,0。这里更加直观地看到计算规则的方法。

 二、 指标解读   

好了,说了不同的probe set mapping的规则后,下面介绍下其指标的含义:

·Reads Mapped to Probe Set: 

比对到测序probe基因集上的MAPQ(Mapping Quality Score)值大于0的reads百分比。 

·Reads Mapped Confidently to Probe Set: 

比对到测序probe基因集上的高质量可信MAPQ(Mapping Quality Score)值=255的reads百分比。 

·Reads Mapped Confidently to the Filtered Probe Set:

比对到过滤后的测序probe基因集上的高质量可信MAPQ(Mapping Quality Score)值=255的reads百分比。 

·Reads Half-Mapped to Probe Set:

配对的reads只有其中一条map到探针集上的reads比例。

·Reads Split-Mapped to Probe Set:

比对的reads都比对到了探针集上,但没有比对到同一个探针ID中的reads比例。

其中前三个值值越接近100%,后两个值越低,说明probe set匹配准确性、特异性高。

  三、tips  

·UMI(Unique Molecular Identifier):

其用来区分同一分子但在测序过程中可能被重复计数的序列。每个测序的mRNA都会被分配一个唯一的UMI,以避免重复计数的问题。 

·MAPQ(Mapping Quality Score 是指在测序数据比对到参考基因组时,每个read的比对质量得分。MAPQ分数通常是由比对软件(如BWA、Bowtie2等)生成的,用来衡量该read比对到参考基因组的可靠性和唯一性。

后记

网页报告内容很多,本次我们就介绍到这里,下一期介绍报告中Summary的剩余内容,大家敬请期待。

策划:ZZJ & MultiBioLab

责编:ZZJ & MultiBioLab

一审:史芸轩

二审:赵志杰

关注ZZJ & MultiBioLab

获取生物医学前沿资讯,

引领探索自然科学!