乐于分享
好东西不私藏

10XscATAC的结果说明(5)之singlecell.csv

10XscATAC的结果说明(5)之singlecell.csv

Skills enhancement

10XscATAC的结果说明(5)之singlecell.csv

方老师小课堂

前言

cellrangerATAC软件的输出结果文件非常多,用于下游分析的文件读取也众多,方老师笔记会逐一介绍各个文件的基本情况,如何在下游进行应用的情况,方便大家理解后合理使用。本次我们介绍singlecell.csv文件,内含很多细胞的cellrangerATAC质控结果。

singlecell.csv文件结构

首先我们需要了解这个文件的各个列所代表的意思,这里举出了各个列的情况,一般而言,主要是关注is_cell_barcode、peak_region_fragments和passed_filters三列,因为这三列主要会纳入后续分析的质控分析。

barcode:细胞barcodes的序列,也就是细胞名,用来区分不同细胞。

total:该细胞的reads总数目。

duplicate:测序比对duplicate的reads数目,这个数值一般为0或很低。

chimeric:测序比对chimeric嵌合体序列的reads数目,这个数值一般为0或很低。

unmapped:测序比对未比对到的reads数目,这个数值一般为0或很低。

lowmapq:测序比对至少一端小于30的reads数目,这个数值一般为0或很低。

mitochondrial:测序比对到线粒体和非核区域的reads数目,这个数值一般为0或很低。

nonprimary:测序比对到非主要的核区域的reads数目,这个数值一般很低。

passed_filters:测序比对到Fragments的reads数目,这个是最终情况。

is_cell_barcode:cell calling后鉴定是否为真实细胞。 excluded_reason:cell calling的详情信息,0是正常纳入,1是因为判读成doublet被鉴定成噪音,2是因为比对的结果太低被鉴定成噪音,3是比对的结果是multiplet多比对情况被鉴定成噪音。

TSS_fragments:与转录起始位点(TSS)区域重叠的片段数量。

DNase_sensitive_region_fragments:与DNase的sensitive超敏感区域重叠的片段数量。

enhancer_region_fragments:与增强子区域重叠的片段数量。

promoter_region_fragments:与启动子区域重叠的片段数量。

on_target_fragments:与转录起始位点(TSS)、增强子、启动子和DNase超敏位点中任一位点重叠的片段数量(按多重性计数)。

blacklist_region_fragments:与blacklist黑名单区域重叠的片段数量。

peak_region_fragments:与peaks重叠的片段数量。

peak_region_cutsites:与peaks的ends重叠的片段数量。

下游如何读取文件

1.python版本

因为他是一个csv表格,可以使用python的pandas工具的read_csv函数读取即可。示例如下。

import pandas as pdsinglecell_file  = "10k_pbmc_ATACv2_nextgem_Chromium_Controller_singlecell.csv"# load without indexscdf = pd.read_csv(singlecell_file, sep=",")# load with barcode as indexscdf2 = pd.read_csv(singlecell_file, sep=",", index_col="barcode" )

2.R版本

可以采用read.csv函数进行读取。

metadata <- read.csv(  file = "10k_pbmc_ATACv2_nextgem_Chromium_Controller_singlecell.csv",  header = TRUE,  row.names = 1)

这些读取都是用于下游分析纳入到对应对象的metadata表格内,部分列是用于后续质控的分析情况。比如我们可以根据peak_region_fragments和passed_filters计算pct_reads_in_peaks的含量。这个指标本身就反映了peaks的检测质量,往往这个比例最好不要低于15%。

后记

任何结果,都需要对其文件的数据结构要有所了解,各个列,各个指标反映的数据情况都要清楚,这样才能利用这些文件的结果进行分析,进行可视化,展示数据的基本情况和统计结果,这样才能更好的反映最终的结果,用来反映检测到的背后生物学意义。因此我们要对各个结果文件有所了解,这也是方老师笔记费尽心把各个需要纳入下游的文件不断解读分享给大家的原因,希望大家都有所了解,便于大家清晰地理解和合理运用结果。

策划:ZZJ & MultiBioLab

责编:ZZJ & MultiBioLab

一审:王若霖

二审:赵志杰

关注ZZJ & MultiBioLab

获取生物医学前沿资讯,

引领探索自然科学!