——点击蓝字 关注我们——
10X空间转录组数据的结果说明(4)之Visium HD网页报告解读二
方老师小课堂


前言


上一期介绍了Visium HD网页报告中的关于Mapping的介绍。
本次我们介绍Visium HD网页报告中Summary的剩下部分。

Sequencing


这里存放测序数据本身质量的指标。

·Number of Reads:
测序数据比对的总reads数量
·Valid Barcodes:
匹配上矫正后barcode的测序reads百分比,这个值正常情况下,应该在80%以上,甚至90%以上才属于正常,因为barcodes需要正常结构才被认为是正常的捕获情况。
·Valid UMI Sequences:
有效的UMIs百分比,例如UMI不含Ns,也不是均聚物。如上Valid Barcodes一样,也是捕获序列结构完整的体现,这个值一般也要在80%甚至90%才属于正常,因为正常的UMI需要正常结构才会被认为正常捕获,才会纳入基因定量计数。
·Sequencing Saturation:
测序饱和度,测到的UMI,占所有潜在可能被测到的UMI的比例。是计算含有有效barcode和有效UMI的非唯一reads在精确比对reads中占比。 Sequencing Saturation = 1 - (number_deduped_reads / number_reads)。 其中 number_deduped_reads:准确比对的reads中唯一(有效barcode+有效UMI)组合的数量。
number_reads:准确比对的reads中所有(有效barcode+有效UMI)组合的数量。
正常情况下,只要是同时满足完整的barcode和UMI结构的reads比对到参考基因组后被计数,这个被纳入计数的(有效barcode+有效UMI)组合被检测到的次数应该大于1,不是unique的,测序饱和度本身就是指被检测到(有效barcode+有效UMI)组合至少2次的reads占比。
测序饱和度这个值本身取决于文库复杂度和测序深度的情况。目前市面上,饱和度一般会在50%左右,根据我目前经验,这个值低于40%,数据可能feature检测到的并未达到饱和。测序饱和度,一般在未到平稳区,测序的reads越多,它会适当增加,直到趋向于平稳。当然最终测到的features种类数目取决于各个细胞类型的表达谱大小,这就是文库复杂度的影响,因为不同类型细胞含有的mRNA的种类不一样,因此不同的组织,文库复杂度存在差异。举例:比如T细胞分选检测的由于免疫细胞转录本较小,它往往比其他类型的单细胞测序这个值可能存在偏低的情况发生。
注意,加测改善features种类是可以改善,但是注意较低的饱和度下,改善情况明显,在较高的饱和度下,这种改善效果会非常小。甚至在高饱和度下,加测,无法检测到新的features的情况。
·Q30 Bases in Barcode:
Barcode碱基质量值大于30的百分比
·Q30 Bases in Probe Read:
匹配上Probe的read碱基质量值大于30的百分比
·Q30 Bases in UMI:
匹配上Probe的read碱基质量值大于30的百分比
上述三个值都其
实是用来描述测序检测过程中捕获区域(barcodes、UMI还有probe的序列质量)这个一般都会大于90%,很少能碰到这个很低的,如果这个值很低,就该考虑fastp或者fastqc来评估整个测序的reads的质量了。
·Fraction of Bins Under Tissue 8 µm:
用于分析的组织覆盖下的bin 8μm占比
·UMIs per sq mm of Tissue:
单位面积组织区域的UMI数目
·Reads per sq mm of Tissue:
单位面积组织区域的reads数目
·Fraction Reads in Squares Under Tissue:
用于分析的组织覆盖下的barcodes结构完整并且能高置信度匹配probe的reads占比。这个值一般都会大于90%,才会被认可为捕获效率高,整个空转实验效果良好。

Cell Segmentation Metrics



·Number of Cells:
大于等于1的unique的UMI的Cells数目
·Reads in Cells:
每个cell的reads数目与整体实验的reads数目占比
·UMIs in Cells:
每个cell的UMI占比
·Mean Reads per Cell:
中位reads数目
·Median Genes per Cell:
中位基因数目
·Median UMIs per Cell:
中位UMI数目
·Median Cell Area (μm²):
中位cell占据区域大小,是通过计算各个cell按分割鉴定2平方微米方格的占据格子数目情况来计算的。
·Median Nucleus Area (μm²):
中位nucleus占据区域大小,是通过计算各个nucleus按分割鉴定2平方微米方格的占据格子数目情况来计算的。
·Maximum Nucleus Diameter (pixels):
以像素单位检测到Nucleus的最大可能直径。

Total UMI Count to Image Alignment


与图像匹配对齐的UMI总数。

每8µm bin的总UMI计数映射到空间位置,评估不组织检测和对齐情况。
下方图图中,用每个点的颜色,来展示了对齐到组织上的UMI数量。可以调节色标和不透明度,来检查对齐质量。


Sample Metadata


样本的数据情况,包含了10X空间转录组实验和spaceranger软件的一些指标。

·Sample ID:
样本编号,这个都是根据spaceranger和自己样本情况填写的,对应参数是--id
·Sample Description:
样本描述,这个都是根据spaceranger和自己样本情况填写的,对应参数是--description
·Chemistry:
所用的这个空转芯片的产品化学试剂编号
·Slide Serial Number:
空转载玻片序列号,这个都是根据spaceranger和自己空转实验情况填写的,对应参数是--slide和--area
·Probe Set Name:
探针,这个都是根据spaceranger和自己空转实验情况填写的,对应参数是--probe-set
·Number of Genes Targeted:
参考基因组包含基因的数目。
·Transcriptome:
参考基因组名称。
·Pipeline Version:
所使用的scapceranger的版本。
·Image Reorientation:
图像是否重定向,on表示重定向。其实就是图像是否旋转翻转调整。
·Loupe Manual Alignment:
Loupe手动对准,None表示是自动校准。
·Filter Probes:
是否过滤Probes,on表示过滤。

Sequencing Depth Evalution


测序深度评估
这里存放测序数据本身质量的指标。

·Squencing Saturation:
测序深度情况。这个曲线是最常用来评估是否需要加测数据的,横轴是reads,纵轴是测序深度。这个图显示的抽样测序深度的函数直到观察到的测序深度的拟合曲线。当所有探针都被捕获到mRNA且测序检测到,那么测序深度理论上接近于100%。可以看到随着不断的加测,曲线会慢慢进入一个平台期,饱和点。目前图中曲线最右侧最高值 展示的是该数据最终的最终实际下的测序饱和度。用这个曲线可以预测后续如果加测,是否可以改善测序饱和度的情况。

·Median Genes per 8μm bin:
每个8µm bin中位基因情况。与测序饱和度评估曲线类似,横轴是8 µm bin的均值reads数,纵轴是8 µm bin的中位基因数。这个图显示的抽样8 µm bin的中位基因数的函数直到观察到的8 µm bin的中位基因数的拟合曲线。在终点附近的曲线的斜率可以解释为增加测序深度超过该点所能获得的检出新基因种类的可能性,说白了用来用来评估加测后是否能出现新的基因种类数目的效益,右侧曲线越接近平缓平台,加测能获得新的基因的可能性不大。

UMIs from Genomic DNA


UMIs计数来自于基因组DNA的情况。

右侧图本身每个点代表一个基因,该基因既有针对跨越外显子区域的probe(称为剪接,spliced),也有只是捕获对齐在一个外显子区域的probe(未剪接,unspliced),unspliced这类可能来自是开放基因组DNA也可能是RNA,spliced的这类只能是RNA。横轴纵轴这样表示,可以看到紫色unspliced的数目平均值估计了每个unspliced探针识别的UMI背景水平。低于这个水平的情况,会被认为是来自基因组DNA的。
左侧正式基于右侧这个模型评估下得出来的指标。
·Estimated UMIs from Genomic DNA:
基于spliced和unspliced的probe的不一致性,估算出可能UMI来自基因组DNA的比例。
·Estimated UMIs from Genomic DNA per Unspliced Probe:
基于右侧模型推算的每个unspliced的probe包含的UMI可能值,若UMI低于这个值可能该情况主要来自于基因组DNA,这个值本身在右图中就是这个紫色位置(图中做了取对数处理)。其中前三个值值越接近100%,后两个值越低,说明probe set匹配准确性、特异性高。 ·MAPQ(Mapping Quality Score): 是指在测序数据比对到参考基因组时,每个read的比对质量得分。MAPQ分数通常是由比对软件(如BWA、Bowtie2等)生成的,用来衡量该read比对到参考基因组的可靠性和唯一性。

后记
本次介绍完Visium HD网页报告中Summary的所有情况,后续介绍这个报告剩余部分。空转报告最重要也就是Summary部分,其中很多指标决定了空转实验和测序的质量,大家一定要多多关注!
策划:ZZJ & MultiBioLab
责编:ZZJ & MultiBioLab
一审:史芸轩
二审:赵志杰


关注ZZJ & MultiBioLab
获取生物医学前沿资讯,
引领探索自然科学!
夜雨聆风