——点击蓝字 关注我们——
10X空间转录组数据的结果说明(3)之Visium HD网页报告解读一
方老师小课堂


前言

空间转录组结果究竟怎么看?
那么多结果文件究竟先打开哪个?
究竟哪个是结果报告?
结果报告中的指标那么多究竟怎么知道我们数据的好坏?
今天,方老师带大家走进web_summary.html的报告解读,详细了解网页报告的各个细节,让大家充分了解自己的数据质量。
由于10X空间转录组技术有很多种方案,与之对应,Space ranger也有其不同的结果和结果文件夹。包含了:
10x Visium 1.0 Space Ranger
基于探针的10x Visium 2.0 Space Ranger
基于探针的 10X Visium HD Space Ranger
10x Visium HD 3' Space Ranger
它是基于探针的 10X Visium HD Space ranger 的结果。

报告结构


首先报告分为Summary、Imange Alignment、Bin-Level Metrics和Cell Segmentation四个部分。

由于报告内容非常多,今天就介绍第一部分Summary的部分指标。

Key Metrics


指标解读

这里汇总了数据最值得关注的指标:
· Number of 8 µm binned squares under tissue:
切片组织区域8微米bins分辨率下检测到的数目,这个值的大小主要取决于你铺片有效区域的大小,因此该指标大小主要用于评估样本的覆盖范围。
· Mean reads per 8 µm bin:
8微米分辨率下每个bins包含的reads数目的均值。这个值其实和测序深度、覆盖度、还有实验中的捕获效率都有关。这个值等同于在单细胞转录组的Mean reads per cell。增加测序量,提高测序深度这个值会提升。
· Mean UMIs per 8 µm bin:
8微米分辨率下每个bins包含的平均UMI(Unique Molecular Identifier)数。这个值用来评估细胞内基因表达的复杂度、转录本大小等情况。这个在单细胞转录组中有个类似的指标Median UMIs per cell。这个值的大小和细胞类型密切相关。某些转录本小的细胞类型的这个值可能会偏小。增加测序量,提高测序深度这个值可能会有所改善。
· Total genes detected:
整个组织区域检测到的总基因种类数。一般来说这个值如果是人的样本,大概范围是1万7-2万2之间,毕竟人类的基因种类大概就在这个范围内,如果细胞类型更加均一的样本,这个值可能会小于人类基因种类很多。

Mapping


Mapping这里主要是Mapping到Probe set相关指标的情况。❓问号点开它,有各个指标的介绍。
一、比对的计算MAPQ规则
在介绍指标之前,需要先介绍下10X不同空转技术的Mapping匹配计算MAPQ方法的相关情况,方便大家对后续指标的理解。
匹配计算规则如下(Visium1 和 Visium HD 3'):
1.如果一个reads,至少50%与基因外显子相匹配,那么Space ranger会将其视为外显子。
2.如果一个reads,至少50%与基因相匹配,但是匹配的位置不是外显子,那么Space ranger会将其视为内含子。
3.除此之外,就是匹配到基因间区。
4.有时候对于一个区域可能存在是这个基因的外显子,同时是一个或多个基因的非外显子区域,这个区域优先考虑成这个基因的外显子。 当这个被认为是可靠匹配到外显子区域的,那么我们定义MAPQ(Mapping Quality Score)为255。 多个匹配结果,采用下方公式计算MAPQ:

Nmap表示reads可以匹配到的外显子类型数目。在bam文件tag NH:i中记录了,如果他为1,Nmap就是1,如果多匹配了就是匹配的数目。
匹配计算规则如下(Visium2 和 Visium HD):
因为VIsium2和 Visium HD都是基于探针probe的方法,因此在基于probe检测中,每个靶基因的一对探针probe组成 探针面板,它和转录组杂交。
这里会涉及几个点,因为我们在比对时候,space ranger需要设定probe set的参数。reads本身使用STAR比对参考基因组,来确定mapping的位置,不单单要考虑参考基因组,还需要考虑probe探针进行对齐,然后本身比对参考基因组知道位置,就可以知道是什么基因了,这样就可以既考虑匹配探针程度,又考虑参考基因组位置。
这个方法中,将每个reads分割成两半,每一半(half)匹配的程度来进行定义匹配程度,同理probe也是会分成两半进行。
1.reads的两个half都完全匹配到相同probe,那么匹配的MAPQ=255,这个才会被纳入UMI计数中。
2.reads的其中一个half完全匹配到这个probe,另外一个half没有完全匹配,需要将没有匹配的half序列与这个probe进行比对,若这个half最小比对分数大于30,认为这个half其实是confidently mapped这个probe上的,因此该情况下的MAPQ=255。
3.reads的其中一个half完全匹配到这个probe,另外一个half不匹配,那么该reads的MAPQ就是1,不会被纳入UMI计数中。
4.reads的其中一个half匹配到probe A ,另外一个half匹配到probe B,那么这个reads的MAPQ就是3,不会被纳入UMI计数中。
5.此外,probe的两半本身也需要匹配probe set reference的,如果probe的两半(half)没有匹配上probe set reference,即使上述reads能匹配到这个probe,记为MAPQ=0。 同理,还需要和参考基因组匹配,如果没有匹配上,还是记为MAPQ=0。
因此,probe本身两个half需要检测,同时reads要匹配上参考基因组,也要按上述规则匹配上probe才行。
在bam文件tag pr:Z记录了MAPQ的情况。MAPQ总共就4个值,255,3,1,0。这里更加直观地看到计算规则的方法。

二、 指标解读

好了,说了不同的probe set mapping的规则后,下面介绍下其指标的含义:
·Reads Mapped to Probe Set:
比对到测序probe基因集上的MAPQ(Mapping Quality Score)值大于0的reads百分比。
·Reads Mapped Confidently to Probe Set:
比对到测序probe基因集上的高质量可信MAPQ(Mapping Quality Score)值=255的reads百分比。
·Reads Mapped Confidently to the Filtered Probe Set:
比对到过滤后的测序probe基因集上的高质量可信MAPQ(Mapping Quality Score)值=255的reads百分比。
·Reads Half-Mapped to Probe Set:
配对的reads只有其中一条map到探针集上的reads比例。
·Reads Split-Mapped to Probe Set:
比对的reads都比对到了探针集上,但没有比对到同一个探针ID中的reads比例。
其中前三个值值越接近100%,后两个值越低,说明probe set匹配准确性、特异性高。
三、tips
·UMI(Unique Molecular Identifier):
其用来区分同一分子但在测序过程中可能被重复计数的序列。每个测序的mRNA都会被分配一个唯一的UMI,以避免重复计数的问题。
·MAPQ(Mapping Quality Score): 是指在测序数据比对到参考基因组时,每个read的比对质量得分。MAPQ分数通常是由比对软件(如BWA、Bowtie2等)生成的,用来衡量该read比对到参考基因组的可靠性和唯一性。

后记


网页报告内容很多,本次我们就介绍到这里,下一期介绍报告中Summary的剩余内容,大家敬请期待。
策划:ZZJ & MultiBioLab
责编:ZZJ & MultiBioLab
一审:史芸轩
二审:赵志杰


关注ZZJ & MultiBioLab
获取生物医学前沿资讯,
引领探索自然科学!
夜雨聆风