乐于分享
好东西不私藏

PrimiGenius 新插件发布|本地使用BLAST+

PrimiGenius 新插件发布|本地使用BLAST+
序列比对,是生物信息学分析中最基础、也最常用的步骤之一。

无论是核酸序列鉴定、蛋白质同源搜索、基因功能初步注释,还是远缘同源蛋白挖掘,都离不开 BLAST。但对于许多使用者来说,BLAST+ 的本地安装、数据库构建、程序选择、参数配置和结果格式转换,仍然具有一定的使用门槛。

现在,PrimiGenius 正式推出全新的序列比对插件:

插件基于 NCBI BLAST+ 构建,将常用的 BLAST 命令行程序整合到 PrimiGenius 的图形化操作界面中。

支持程序

blastn
blastp
blastx
tblastn
tblastx
psiblast

无需手动编写命令,即可完成:

✓查询序列输入

✓本地数据库构建

✓BLAST 程序选择

✓比对参数设置

✓多种格式结果导出

✓实际运行参数自动记录

下载安装:可在插件商店直接点击下载;也可下载插件包后,使用 PrimiGenius 的“安装插件”功能完成安装。

PrimiGenius入门及插件安装教程:PrimiGenius | 一款全能的本地数据分析和可视化框架

01一个插件,整合六种 BLAST 程序

不同类型的查询序列和数据库,需要使用不同的 BLAST 程序。

本插件不会自动替换用户选择的程序,而是要求根据查询序列和数据库的分子类型,明确选择对应的分析方法。

01

blastn

核酸序列 vs 核酸数据库

适用于:

· DNA 序列同源性搜索

· 基因片段鉴定

· 克隆测序结果比对

· 引物或短序列匹配

· 不同物种核酸序列比较

blastn 提供四种任务模式:

megablast适合高度相似的核酸序列,是插件的默认模式。
blastn适合相似程度较低或跨物种的核酸序列比较。
dc-megablast适合跨物种核酸序列搜索。
blastn-short适合长度短于 30 nt 的查询序列。
02

blastp

蛋白质序列 vs 蛋白质数据库

适用于:

· 蛋白质同源序列搜索

· 蛋白质功能初步预测

· 保守结构域相关序列筛选

· 不同物种蛋白质序列比较

支持的蛋白质打分矩阵:

BLOSUM62BLOSUM80BLOSUM45PAM30PAM70

BLOSUM62 是默认选择。

BLOSUM80 更适合近缘序列,BLOSUM45 更适合搜索较远同源序列;PAM30 和 PAM70 通常适合较短或相似程度较高的蛋白质序列。

03

blastx

核酸序列翻译后 vs 蛋白质数据库

blastx 会将输入的核酸序列进行六框翻译,再与蛋白质数据库进行比较。

适用于:

· 未注释核酸序列的蛋白编码潜力分析

· 转录本功能初步预测

· 核酸序列中潜在蛋白质同源区域搜索

· DNA 或 RNA 序列的蛋白水平功能鉴定

用户可以设置查询序列使用的翻译密码表,默认使用编号 1,即标准遗传密码表。

04

tblastn

蛋白质序列 vs 翻译后的核酸数据库

tblastn 会将核酸数据库进行六框翻译,再使用蛋白质查询序列进行搜索。

适用于:

· 使用已知蛋白寻找基因组中的潜在编码区域

· 搜索尚未完成注释的同源基因

· 在基因组或转录组序列中定位蛋白质同源区域

· 辅助发现可能遗漏的基因模型

数据库序列的翻译密码表可以在插件中单独设置,默认使用标准遗传密码表。

05

tblastx

核酸序列翻译后 vs 核酸数据库翻译后

tblastx 会同时翻译查询核酸序列和数据库核酸序列,并在蛋白质水平完成比较。

适用于:

· 编码区核酸序列的远缘同源搜索

· 跨物种转录本比较

· 核酸相似性较低、但编码蛋白仍具有保守性的序列分析

查询序列和数据库序列可以分别设置翻译密码表。

06

PSI-BLAST

迭代式蛋白质同源搜索

PSI-BLAST 会根据每一轮搜索结果构建位置特异性评分矩阵,也就是 PSSM,并将其用于下一轮搜索。

适用于:

· 远缘同源蛋白搜索

· 蛋白质家族成员挖掘

· 常规 blastp 难以发现的弱同源序列筛选

插件支持设置:

· PSI-BLAST 迭代次数

· 序列进入下一轮 PSSM 的 E-value 阈值

· 蛋白质打分矩阵

· 最终结果的 E-value 阈值

默认进行 1 轮迭代,PSSM 纳入阈值默认为 0.002。

增加迭代次数可能发现更多远缘同源序列,但也会增加错误序列进入 PSSM 的风险,因此需要结合研究对象谨慎设置。

02查询序列和数据库都支持两种输入方式

为了适应不同的使用场景,查询序列和数据库序列均支持两种输入方式。

方式一上传文件

查询序列支持:

.fa.fasta.fna.ffn.faa.txt

数据库除了支持常见的 FASTA 和 TXT 文件,还支持普通的预构建 BLAST 数据库索引文件。

上传 FASTA 数据库后,插件会自动调用 makeblastdb 完成数据库构建,无需提前在命令行中手动建库。

使用已有 BLAST 数据库时,只需选择其中一个索引文件,并确保其配套索引文件位于同一目录。

方式二直接粘贴序列

不想准备文件时,也可以直接粘贴序列。

支持标准 FASTA 格式:

>seq1 ATCGATCGATCGATCG

也支持直接粘贴裸序列:

ATCGATCGATCGATCG

如果输入内容没有 FASTA 标题行,插件会自动补充序列名称,并对空格、制表符和换行进行规范化处理。

对于少量序列或临时测试,这种方式更加快捷。

03核心参数说明

01E-value

E-value 用于衡量在当前数据库规模下,随机获得相同比对结果的预期次数。

插件默认值为:

1e-5

这一数值可作为常规同源搜索中相对严格的起始阈值。

· E-value 越小,筛选越严格

· E-value 越大,可能保留更多弱相似结果

· 是否具有生物学意义,还需要结合序列覆盖度、序列同一性和研究目的综合判断

02最多保留目标序列数

对应 BLAST+ 参数:

-max_target_seqs

插件默认值为:

500

该参数控制结果中最多保留多少条目标序列。

当输出格式仅选择成对比对文本,也就是 outfmt 0 时,插件不会额外应用这一参数;选择其他结果格式时,该参数会参与结果限制。

03种子词长

对应参数:

-word_size

插件默认设置为:

auto

选择 auto 时,插件不会向 BLAST 程序传递自定义词长,而是使用所选程序和任务模式对应的官方默认值。

也可以根据分析需求填写具体整数。插件会检查填写范围:

· blastn:4—64

· blastp、blastx、tblastn、tblastx 和 PSI-BLAST:2—7

04最低序列同一性

对应参数:

-perc_identity

该参数仅对 blastn 生效,默认值为:

0

设置为 0 表示不额外使用序列同一性阈值进行筛选。例如设置为 90,表示低于 90% 序列同一性的比对结果不会被保留。

需要注意的是,序列同一性阈值并不能替代 E-value、比对长度和覆盖度等指标。

05蛋白质打分矩阵

蛋白质相关程序支持以下矩阵:

BLOSUM62BLOSUM80BLOSUM45PAM30PAM70

默认使用 BLOSUM62。

该参数适用于:

· blastp

· blastx

· tblastn

· tblastx

· PSI-BLAST

blastn 不使用蛋白质打分矩阵。

好啦,今天的分享到此结束,水平有限,才疏学浅,如有问题,请多指教,青山不改,绿水长流,山高路远,顶峰相见。

推荐阅读:

Primigenius的10个JCVI共线性分析插件!

PrimiGenius的ImageJ和序列logo绘制插件来了~

PrimiGenius插件商店来了 & KOfam_scan插件发布!

PrimiGenius的三个插件 | 大文件秒开浏览、多序列比对可视化、综合工具

相关学习资料