无论是核酸序列鉴定、蛋白质同源搜索、基因功能初步注释,还是远缘同源蛋白挖掘,都离不开 BLAST。但对于许多使用者来说,BLAST+ 的本地安装、数据库构建、程序选择、参数配置和结果格式转换,仍然具有一定的使用门槛。
现在,PrimiGenius 正式推出全新的序列比对插件:

插件基于 NCBI BLAST+ 构建,将常用的 BLAST 命令行程序整合到 PrimiGenius 的图形化操作界面中。
支持程序
无需手动编写命令,即可完成:
✓查询序列输入
✓本地数据库构建
✓BLAST 程序选择
✓比对参数设置
✓多种格式结果导出
✓实际运行参数自动记录
下载安装:可在插件商店直接点击下载;也可下载插件包后,使用 PrimiGenius 的“安装插件”功能完成安装。
PrimiGenius入门及插件安装教程:PrimiGenius | 一款全能的本地数据分析和可视化框架

| 01 | 一个插件,整合六种 BLAST 程序 |
不同类型的查询序列和数据库,需要使用不同的 BLAST 程序。
本插件不会自动替换用户选择的程序,而是要求根据查询序列和数据库的分子类型,明确选择对应的分析方法。
| 01 | blastn 核酸序列 vs 核酸数据库 |
适用于:
· DNA 序列同源性搜索
· 基因片段鉴定
· 克隆测序结果比对
· 引物或短序列匹配
· 不同物种核酸序列比较
blastn 提供四种任务模式:
| 02 | blastp 蛋白质序列 vs 蛋白质数据库 |
适用于:
· 蛋白质同源序列搜索
· 蛋白质功能初步预测
· 保守结构域相关序列筛选
· 不同物种蛋白质序列比较
支持的蛋白质打分矩阵:
BLOSUM62BLOSUM80BLOSUM45PAM30PAM70
BLOSUM62 是默认选择。
BLOSUM80 更适合近缘序列,BLOSUM45 更适合搜索较远同源序列;PAM30 和 PAM70 通常适合较短或相似程度较高的蛋白质序列。
| 03 | blastx 核酸序列翻译后 vs 蛋白质数据库 |
blastx 会将输入的核酸序列进行六框翻译,再与蛋白质数据库进行比较。
适用于:
· 未注释核酸序列的蛋白编码潜力分析
· 转录本功能初步预测
· 核酸序列中潜在蛋白质同源区域搜索
· DNA 或 RNA 序列的蛋白水平功能鉴定
用户可以设置查询序列使用的翻译密码表,默认使用编号 1,即标准遗传密码表。
| 04 | tblastn 蛋白质序列 vs 翻译后的核酸数据库 |
tblastn 会将核酸数据库进行六框翻译,再使用蛋白质查询序列进行搜索。
适用于:
· 使用已知蛋白寻找基因组中的潜在编码区域
· 搜索尚未完成注释的同源基因
· 在基因组或转录组序列中定位蛋白质同源区域
· 辅助发现可能遗漏的基因模型
数据库序列的翻译密码表可以在插件中单独设置,默认使用标准遗传密码表。
| 05 | tblastx 核酸序列翻译后 vs 核酸数据库翻译后 |
tblastx 会同时翻译查询核酸序列和数据库核酸序列,并在蛋白质水平完成比较。
适用于:
· 编码区核酸序列的远缘同源搜索
· 跨物种转录本比较
· 核酸相似性较低、但编码蛋白仍具有保守性的序列分析
查询序列和数据库序列可以分别设置翻译密码表。
| 06 | PSI-BLAST 迭代式蛋白质同源搜索 |
PSI-BLAST 会根据每一轮搜索结果构建位置特异性评分矩阵,也就是 PSSM,并将其用于下一轮搜索。
适用于:
· 远缘同源蛋白搜索
· 蛋白质家族成员挖掘
· 常规 blastp 难以发现的弱同源序列筛选
插件支持设置:
· PSI-BLAST 迭代次数
· 序列进入下一轮 PSSM 的 E-value 阈值
· 蛋白质打分矩阵
· 最终结果的 E-value 阈值
默认进行 1 轮迭代,PSSM 纳入阈值默认为 0.002。
增加迭代次数可能发现更多远缘同源序列,但也会增加错误序列进入 PSSM 的风险,因此需要结合研究对象谨慎设置。
| 02 | 查询序列和数据库都支持两种输入方式 |
为了适应不同的使用场景,查询序列和数据库序列均支持两种输入方式。
方式一上传文件
查询序列支持:
.fa.fasta.fna.ffn.faa.txt
数据库除了支持常见的 FASTA 和 TXT 文件,还支持普通的预构建 BLAST 数据库索引文件。
上传 FASTA 数据库后,插件会自动调用 makeblastdb 完成数据库构建,无需提前在命令行中手动建库。
使用已有 BLAST 数据库时,只需选择其中一个索引文件,并确保其配套索引文件位于同一目录。
方式二直接粘贴序列
不想准备文件时,也可以直接粘贴序列。
支持标准 FASTA 格式:
>seq1 ATCGATCGATCGATCG也支持直接粘贴裸序列:
ATCGATCGATCGATCG如果输入内容没有 FASTA 标题行,插件会自动补充序列名称,并对空格、制表符和换行进行规范化处理。
对于少量序列或临时测试,这种方式更加快捷。
| 03 | 核心参数说明 |
01E-value
E-value 用于衡量在当前数据库规模下,随机获得相同比对结果的预期次数。
插件默认值为:
1e-5
这一数值可作为常规同源搜索中相对严格的起始阈值。
· E-value 越小,筛选越严格
· E-value 越大,可能保留更多弱相似结果
· 是否具有生物学意义,还需要结合序列覆盖度、序列同一性和研究目的综合判断
02最多保留目标序列数
对应 BLAST+ 参数:
-max_target_seqs
插件默认值为:
500
该参数控制结果中最多保留多少条目标序列。
当输出格式仅选择成对比对文本,也就是 outfmt 0 时,插件不会额外应用这一参数;选择其他结果格式时,该参数会参与结果限制。
03种子词长
对应参数:
-word_size
插件默认设置为:
auto
选择 auto 时,插件不会向 BLAST 程序传递自定义词长,而是使用所选程序和任务模式对应的官方默认值。
也可以根据分析需求填写具体整数。插件会检查填写范围:
· blastn:4—64
· blastp、blastx、tblastn、tblastx 和 PSI-BLAST:2—7
04最低序列同一性
对应参数:
-perc_identity
该参数仅对 blastn 生效,默认值为:
0
设置为 0 表示不额外使用序列同一性阈值进行筛选。例如设置为 90,表示低于 90% 序列同一性的比对结果不会被保留。
05蛋白质打分矩阵
蛋白质相关程序支持以下矩阵:
BLOSUM62BLOSUM80BLOSUM45PAM30PAM70
默认使用 BLOSUM62。
该参数适用于:
· blastp
· blastx
· tblastn
· tblastx
· PSI-BLAST
blastn 不使用蛋白质打分矩阵。
好啦,今天的分享到此结束,水平有限,才疏学浅,如有问题,请多指教,青山不改,绿水长流,山高路远,顶峰相见。
推荐阅读:
PrimiGenius的ImageJ和序列logo绘制插件来了~
夜雨聆风