乐于分享
好东西不私藏

软件报告的物种名,真的就是这个菌吗?

软件报告的物种名,真的就是这个菌吗?
论文速读

疾控同事把一株分离菌送来复核:仪器报出的物种名分数很高,病例讨论准备按这个名字往下写。师兄把序列放进系统发育树,发现它没有落在那一支;导师随口问了一句:“菌落纯度确认过吗?”

物种鉴定,就是用实验信号和参考资料判断样本里的微生物最可能属于哪个物种。这个名字会进入病例记录、暴发调查、耐药比较和生态学分析;名字报得太细或报偏了,后面的比较就会把不同对象当成同一个对象。

更麻烦的冲突通常发生在报告快交付的时候:分类软件 A 的第一名是 Klebsiella pneumoniae,软件 B 报 Klebsiella variicola;16S 的 top hit 又落在 K. pneumoniae。三行结果都“有名字”,却还不能任选一行贴进报告。要看的,是这些 reads 有没有能力把近缘物种分开,参考库里有没有把该比较的对象放进来,以及分离株或样本本身是否单一。

核心发现3 个要点

软件输出是候选物种清单,不是最终物种结论。 一个物种名来自样本、检测信号、软件、参考库和报告解释的共同作用;任何一层证据不够,结论就该停在更高的分类层级。

- tNGS、mNGS、16S 和 WGS 看到的序列范围不同;Kraken、Centrifuge、BLAST 和 Bracken 处理共享证据的方式也不同。结果不能脱离方法、数据库和参数单独阅读。

- 发生冲突时,沿着“样本 → 原始证据 → 近缘物种 → 独立复核”回查,比急着选一个软件更有效。

01 / 研究解读

一个物种名,是怎样被推出来的?

图 1|自绘:物种名可能从样本、检测信号、数据加工、参考库或报告解释开始偏。图中流程依据 Hosoda et al., 2025(DOI)、Cuénod et al., 2021(DOI)和 Steinegger & Salzberg, 2020(DOI)。

数据库给出的 top hit,只说明它在当前数据库和参数下最接近哪个参考对象。它不替代样本纯度检查,也不保证近缘物种已经被分开。下面按这条链,从前往后看。

样本先决定结果的语境

呼吸道样本有定植和口咽背景;血液、脑脊液常是低生物量样本,试剂或环境背景需要进入判读;组织、脓液和体液还取决于取材是否真正覆盖病灶。培养分离株多一层问题:挑出的菌落是否单一。

小 tips在看 reads、分数或 ANI 前,先给样本写一句“来历”:单菌落、混合培养、低生物量体液,还是复杂环境/宏基因组样本。后续复核动作由这句话决定。

检测方法决定能看见什么、能分到多细

靶向下一代测序(targeted next-generation sequencing,tNGS)预先规定了要捕获或扩增的靶标。靶标之外的物种或变异,即使真实存在,也不会出现在结果里;panel 内的物种名同样需要看靶区能否区分近缘对象。2025 年一项呼吸道 tNGS 验证研究在设计阶段去除与其他病原高度同源的靶区,并对引物特异性与交叉反应做生信和实验验证。Yang et al., 2025

宏基因组下一代测序(metagenomic next-generation sequencing,mNGS)不预先把范围锁在一组靶标上,但短 reads 仍会遇到共享序列。近缘物种、保守基因或可移动元件上的同源片段,可能让同一批 reads 同时支持多个名字。此时“检出到某属的信号”与“能稳定归到其中某一物种”是两层不同的结论。

16S rRNA 基因测序也有分辨率上限。很高的 16S 相似度不自动等于可以确定到种,部分属的物种级分辨力本就有限。Janda & Abbott, 2007 Streptococcus oralis 与 S. mitis 的 16S rRNA 序列只相差 1 个碱基,是单靠 16S 容易误鉴定的一个例子。Sabat et al., 2017 针对可变区的短读长测序,也达不到全长 16S 的分类分辨率。Johnson et al., 2019

不同场景,鉴定方法怎么选?

手上的样本/问题
适合从哪里开始
能得到什么
物种结论前仍要补看的内容
单一、可培养分离株,需要快速常规鉴定
MALDI-TOF 或常规生化;与表型不符时转 WGS
快速候选物种
菌落纯度、数据库覆盖;高风险或近缘群建议 WGS 复核
分离株需要溯源、耐药归属或近缘种确认
WGS + 近缘参考比较
全基因组相似性、核心基因组关系、基因所在背景
组装质量、ANI 的比较对象与比对覆盖、树上的聚类是否稳定
低生物量无菌体液,目标病原范围明确
tNGS + 阴性对照
panel 所覆盖靶标的候选结果
靶区是否能区分近缘种,panel/数据库是否收录目标
呼吸道、粪便、环境等复杂样本,病原范围不确定
mNGS + 阴性对照 + 近缘库复核
广泛的候选分类单元
背景、共享序列、多重命中与跨基因组覆盖
已知细菌群落、目标是群落结构
16S(尽量明确测哪个区域)
多数情况下稳定的属或部分物种群信息
该属能否靠该区域分到种;不要把 top hit 自动写成物种名

这张表安排的是“从哪里起步”,不是不同方法的性能排名。样本量、提取方法、平台、对照和项目目的都会改变可接受的结论层级。

软件决定共享证据怎样被归属

Kraken / Kraken 2、Centrifuge 和 BLAST 都能把序列连到分类信息,但它们用的证据单位不同。Kraken 使用 k-mer;Kraken 2 使用 minimizer 和概率数据结构,并把匹配证据汇总到分类树的最低共同祖先(lowest common ancestor,LCA)。一段 read 同时命中多个近缘参考时,结果常会留在它们共有的分类节点。Wood & Salzberg, 2014 Wood et al., 2019

Centrifuge 用 Burrows–Wheeler transform(BWT)和 FM-index 组织参考序列;BLAST 寻找局部序列相似区段,适合把争议 reads 或 contig 拉回比对层,检查 identity、query coverage、比对长度和近邻命中差距。Kim et al., 2016 Altschul et al., 199080360-2)

方法/算法
它主要把什么当证据
为什么会产生误读
回查动作
Kraken / Kraken 2
read 中的 k-mer/minimizer,在分类树上汇总为 LCA
近缘物种共享大量 k-mer 时,证据停在属/科等共同节点;只盯 species 行会漏掉这些共享证据
同时导出候选 species、上级 LCA 和 unclassified 计数;检查近缘参考是否齐全
Centrifuge
压缩后的参考序列索引匹配与分类归属
近缘参考分数接近、read 多重命中时,归属受参考库组成和规则影响
固定同一输入与参考库比较;保留多个候选命中
BLAST
局部比对的长度、identity、coverage 与相似度排序
保守区段或短局部片段可能让某个物种排第一,却不能代表整条 read/contig
同看 query coverage、前若干近邻和跨基因组覆盖;用定制近缘库复核
Bracken
Kraken 各分类层级计数的概率重分配
重估丰度不是 reads 已唯一归属到该物种
分列 Kraken 直接分类 reads 与 Bracken 重估丰度

Bracken 不再做一次分类,而是根据 Kraken 各层级的计数,概率性地将高层级 reads 重新分配,用于估计目标层级丰度。Lu et al., 2017 因此,直接分类 reads 和重估丰度回答的是不同问题。

参数也在参与判读。输入过滤、去宿主、最低支持、报告层级、identity、query coverage 和是否保留多重命中,都应写进分析记录。不同项目没有一组可照抄的万能数值;适合用 mock、阴性对照和已知阳性样本确定本实验室的工作区间。

一套可以启动复核的“数字门槛”

下面这组数字可作为研究型 mNGS / 分离株复核流程的首版 SOP,用来决定一条软件结果要不要进入人工复核队列;它们不等于临床诊断阈值,也不能直接移植到另一种标本、平台或 panel。实际报告前,应以本实验室的阴性对照、阳性梯度和近缘物种 challenge set 校准。

节点
可从这条线开始设
到这一步能说什么
触发的后续动作
分类器候选清单
某物种有 ≥3 条非重复直接分类 reads
值得人工看一眼的候选;还不是“检出”
看 reads 是否落在 ≥2 个不重叠区域,并调出近缘种结果
物种级复核入口
≥10 条直接分类 reads
,且 reads 分布在 ≥3 个不重叠区域
可进入物种级证据审查
与阴性对照比较;做近缘库回贴与多重命中检查
阴性对照比对
候选物种在样本的 RPM 高于同批阴性对照 ≥10 倍;阴性对照为 0 时仍需满足区域分布条件
批次背景较难解释该信号
若未达到,标记为背景/待复核,不直接写物种结论
BLAST / 回贴复核
对 contig:query coverage ≥80%;对 reads:维持 ≥3 个不重叠区域,且支持不集中于单一保守基因或 rRNA
有跨区域证据
同时比较前 3 个近缘命中;若均接近,退回属/复合群
两个分类器的关系
两者至少在属级一致;若种级不一致,默认不报单一物种
软件差异被显式保留
以定制近缘库、独立靶标或 WGS 定夺
WGS 物种级初筛
ANI ≥95% 且 AF ≥65%,并且在近缘参考树上稳定聚类
可作为“与该物种最接近”的强证据
ANI/AF/树任一不支持时,不以单一物种落笔

其中,“≥3 个不重叠区域”与细菌、真菌或寄生虫的 RPM-r ≥10,来自一项脑脊液临床 mNGS 的本地验证策略;它说明阈值应由具体样本类型和验证集得出,而不是由软件默认值决定。Miller et al., 2019 表中的 3 reads、10 倍阴性对照和 80% 累计覆盖,是便于启动内部复核的示范值,需用本地数据替换为已验证的 cut-off。

参考库决定“最近邻”能不能接近真相

一个物种有多条高度相似的参考基因组时,短 reads 可能同时匹配多个对象;真正物种缺席时,程序只能报告最近的已知对象。参考库还会随版本、命名体系和标签质量变化。Steinegger 和 Salzberg 的大规模分析在 RefSeq、GenBank 和 NR 中均发现受污染序列。Steinegger & Salzberg, 2020

宏基因组里的 MAG(metagenome-assembled genome,宏基因组组装基因组)还要检查 bin 的完整度、污染度、coverage 和 contig 分类是否互相支持。它们打架时,物种名可能只是不同来源片段的平均印象。

常见误判来源:软件报了名,证据可能卡在哪里?

现象
常见来源
报告前最小回查
两个软件报出同属不同种
k-mer/LCA、索引匹配和多重命中处理不同;近缘参考组成不同
取出争议 reads/contig,对同一近缘参考组做回贴或局部比对
只有一个物种排第一,第二名也很接近
参考库缺失真对象,或多个参考高度相似
查看前若干命中、比对覆盖与参考基因组名单,不只看 top hit
16S 很高相似度却无法定种
所测片段过短,或近缘物种在该区域差异很少
明确扩增区域;补全长 16S、其他标记或 WGS
tNGS 报出 panel 内物种
靶标命中不等于整个基因组都能区分该物种
查靶区与近缘物种的同源性、引物/探针覆盖和 panel 版本
mNGS 物种只有少量 reads
低水平背景、污染、共享保守片段或 index hopping
与阴性对照和同批样本并看;检查 reads 分布而非只看总数
某物种“未检出”
取材、低载量、提取失败、panel/数据库缺失
先区分“本方法未见证据”和“样本中不存在”

假阳、假阴与功能归属,别在最后一步越界

假阳性可来自试剂/环境背景、交叉污染、混入片段和不可靠的参考条目;假阴性可来自取材、前处理、低丰度或参考库缺失。混合样本中检出耐药基因,也不等于它属于报告里的那个物种。需要看该基因所在 contig/bin 的分类、coverage 与邻近序列关系,必要时用 reads 回贴或长读长复核。

小 tips罕见物种只在单一样本出现时,至少并排记录:阴性对照有没有同类信号、原始 reads/谱图支不支持、第二种方法能否复现。这里没有通用的“多少 reads 就算真”的数字。

02 / 研究解读

两个案例:这些误差会怎样改变结论?

案例一:仪器报得很像,样本里还有别的答案

Hosoda 等比较了血培养厌氧菌的 MALDI-TOF 与 WGS 结果。研究纳入 69 例、85 株菌;以 WGS 的平均核苷酸一致性(average nucleotide identity,ANI)分析为比较依据,73 株达到物种级鉴定,而 MALDI-TOF 有 43 株在物种级与之相同,另有 6 株只到属。Hosoda et al., 2025

这里真正要带走的不是设备排名。该队列中有 21 例多菌种感染,WGS 在 9 例中发现了 MALDI-TOF 未识别出的多个物种;不一致结果还包括未被收进参考库的物种。Hosoda et al., 2025 它把前文的三层问题连在了一起:样本并不总是单一、信号未必能完整分离、数据库也可能没有答案。

该研究覆盖的是厌氧菌血流感染,不能外推为所有标本和所有设备的性能排序。它支持的行动很明确:当血培养厌氧菌的鉴定与形态、临床或测序信息冲突时,把菌落纯度、多菌种情况和参考库收录纳入复核清单。

案例二:panel 内的物种名,也需要回到靶区和数据库

Gaston 等比较了 BALF 的 mNGS 与针对特定病原富集的 tNGS 工作流。研究中,tNGS 流程没有检出 panel 与数据库均未涵盖的 Pneumocystis carinii,并将 Cryptococcus neoformans 报为 C. gattii;mNGS 流程也因分类学相似性和 Kraken 数据库缺少 P. carinii,将其识别为 P. jirovecii。Gaston et al., 2022

这个案例让“方法边界”和“参考库边界”有了具体后果:同一份 BALF 的结果差异,既可能来自 panel 是否覆盖目标,也可能来自近缘序列和数据库怎样把 read 归到某个物种。研究只覆盖该工作流和这批样本,不能替其他产品背书;它说明了为什么 panel 结果也需要查靶区、近缘对象与数据库版本。

原文图入口查看 Gaston et al. 的原文 Figure 1:两套 NGS 工作流与结果判读流程。该图版权归 American Society for Microbiology(ASM)所有,本文仅提供原文跳转,不嵌入或复用图片。

03 / 研究解读

从结果到结论:怎么把物种鉴定落到项目里?

1. 冻结本次分析的比较对象

记录 FASTQ 质控版本、去宿主策略、软件版本、数据库来源/发布日期、taxonomy 体系、参考基因组清单与去冗余规则。

交付物run_manifest.tsv;数据库版本号;参考基因组清单。

2. 双算法初筛,保留高层级证据

对同一批质控 reads,用同一分类体系运行 Kraken 2 和 Centrifuge。先以“≥3 条非重复直接分类 reads”建立候选清单,保留 read-level 分类结果、上级 LCA 计数和未分类比例;达到“≥10 条直接分类 reads且 ≥3 个不重叠区域”的候选才进入物种级复核。物种丰度表只作为候选清单的起点,具体数值必须由本地验证集校准。

交付物:两套报告文件;候选 taxon 清单;各层级计数对照表。

3. 给候选物种建立近缘对照组

把同属近缘物种、常见误报对象、型株或高质量代表基因组一并纳入复核库。从候选 taxon 抽取 reads 回贴,查看多重命中比例、query coverage、跨基因组覆盖和特异区域支持。对组装 contig,可将“query coverage ≥80%,且不集中于单一保守区”设为进入物种级判读的起点;未组装的低深度 reads 则看是否跨 ≥3 个区域。top hit 与次优近缘命中接近时,仍应停在属/复合群。

交付物:近缘参考库;多重命中摘要;覆盖统计;保留或排除候选的理由。

4. 分开报告直接分类与丰度重估

需要丰度时,可在 Kraken 结果基础上使用 Bracken;同时保留 Kraken 直接分类计数。前者是模型化丰度估计,后者反映直接归属的 reads。Lu et al., 2017

交付物:直接分类 reads、Bracken 丰度、LCA 高层级 reads 并列的结果表。

5. 分离株的 WGS 确认:ANI 后面还要看树

当物种级归属会影响临床解释、溯源或耐药基因归属时,可将候选分离株纳入 WGS 复核。推荐把这件事拆成四步:

1. 质控组装与样本纯度。 看测序质量、组装连续性、污染/混合信号;低质量组装不适合直接拿 ANI 下结论。 2. 建立比较组。 放入候选物种的型株或高质量代表基因组、同属近缘种和常见误报对象;记录 accession、版本和筛选规则。 3. 计算 ANI,并同时看 alignment fraction(AF,比对覆盖比例)。 ANI 衡量可比对基因组片段的平均核苷酸相似度。首版流程可把“ANI ≥95% 且 AF ≥65%”设为物种级复核的进入线;约 95% ANI 常被用作细菌物种划分的经验边界,而 AF 可避免只靠少量可比区域抬高判断。它们不是脱离比较对象、组装质量和系统发育就能自动裁决的单一数字。Jain et al., 2018 Chun et al., 2018 Parks et al., 2020 4. 在 ANI 仍有争议时建系统发育树。 从核心基因组或一组单拷贝标记构建树,连同近缘参考一起看样本是否稳定落入目标物种支。基因组系统发育框架可用于检查分类名称与进化关系是否一致。Parks et al., 2018

ANI 负责回答“与哪些参考基因组整体最接近”,系统发育树负责显示“它在近缘群中的位置”。二者都不能替代样本和组装质量检查;若 ANI、AF 和树的归属互相矛盾,报告应保留为属/复合群或“待进一步确认”。

交付物:组装与污染质控表;近缘参考清单;ANI + AF 矩阵;核心基因组/单拷贝标记树;结论与保留意见。

6. 按争议来源补独立证据

争议发生在哪里
优先补什么证据
结果可以落到哪里
两个分类器报出同属不同种
近缘库回贴、特异区域覆盖、必要时组装 contig
物种;或退回属/复合群
tNGS panel 报出近缘物种
靶区设计、引物/探针特异性、panel 覆盖与独立靶标
panel 内候选;或“近缘物种待区分”
mNGS 只在共享片段上有支持
多重比对、跨基因组覆盖、contig 归属
属或更高层级
16S 给出高相似 top hit
所测区域、同属近缘序列差异;补 16S–23S、其他标记或基因组比较
属、复合群,或经补证据后到种
分离株归属影响耐药/溯源解释
纯度复核、WGS 的 ANI + AF、近缘参考系统发育
经复核的物种级归属

7. 在报告里写明证据等级

物种级支持充分:近缘库复核后仍有特异、跨区域支持,且独立证据一致。 - 可报告到属/复合群:属级信号明确,近缘物种之间共享证据过多。 - 候选或待复核:参考库缺邻近对象、覆盖集中在保守区、方法冲突,或阴性对照/批次背景无法排除。

报告可以这样写
基于 Kraken 2、Centrifuge 的一致属级信号,以及候选物种与近缘参考库的 reads 回贴结果,样本与 X 属 / X 物种复合群最接近。物种级支持主要集中在共享区域,当前证据不足以区分 X1 与 X2;建议结合独立靶标或基因组近邻比较进一步确认。

物种鉴定报告,推荐这样落笔

报告不要只留一行“检出 X”。至少交代:样本和方法、软件与数据库版本、证据形态、结论层级、限制条件和下一步

证据状态
可直接采用的写法
物种级证据充分
“样本检出 X。在本次分析使用的数据库(版本/日期)中,Kraken 2 与 Centrifuge 的直接分类结果一致;近缘参考回贴显示特异且跨区域覆盖。该结论适用于本次样本和分析流程。”
更适合报属或复合群
“样本检出 X 属 / X 物种复合群信号。候选近缘种之间存在大量共享序列,当前 reads 无法稳定区分至单一物种,因此不作物种级归属。”
结果有冲突、需复核
“软件候选结果为 X1 与 X2;争议 reads 主要位于共享区域,且参考库中近缘对象覆盖有限。当前报告为‘X 属候选信号’,建议以独立靶标或 WGS 的 ANI + AF 与系统发育比较复核。”

“未检出”也应写成方法学表述,例如:“在本次 panel、分析阈值和数据库版本下未见 X 的支持证据。”这样不会把检测范围之外的情况误写成样本中绝对不存在。

04 / 研究解读

把名字往回查一遍

图 2|自绘:从软件候选到最终物种结论的复核流程。图中数值是用于启动内部复核的示范门槛;3 个不重叠区域和 RPM-r 的思路参考 Miller et al., 2019(DOI),ANI/AF 的物种比较框架参考 Parks et al., 2020(DOI)。实际 cut-off 须以本地验证确定。

好报告会留下这个名字来自什么标本、哪套数据库、哪些证据,以及哪里仍有不确定性。结果和菌落、临床语境或后续测序对不上时,团队就能沿着证据链找到该复核的地方。

参考资料

1.Hosoda T, et al. Limitations of MALDI-TOF MS in identifying anaerobic bacteremia: challenges in polymicrobial infections and the role of whole-genome sequencing. Microbiology Spectrum. 2025. DOI

2.Gaston DC, et al. Evaluation of metagenomic and targeted next-generation sequencing workflows for detection of respiratory pathogens from bronchoalveolar lavage fluid specimens. Journal of Clinical Microbiology. 2022. DOI

3.Yang J, et al. Laboratory validation of targeted next-generation sequencing assay for pathogen detection in lower respiratory infection. Microbiology Spectrum. 2025. DOI

4.Wood DE, Salzberg SL. Kraken: ultrafast metagenomic sequence classification using exact alignments. Genome Biology. 2014. DOI

5.Wood DE, Lu J, Langmead B. Improved metagenomic analysis with Kraken 2. Genome Biology. 2019. DOI

6.Kim D, Song L, Breitwieser FP, Salzberg SL. Centrifuge: rapid and sensitive classification of metagenomic sequences. Genome Research. 2016. DOI

7.Altschul SF, et al. Basic local alignment search tool. Journal of Molecular Biology. 1990. DOI80360-2)

8.Lu J, Breitwieser FP, Thielen P, Salzberg SL. Bracken: estimating species abundance in metagenomics data. PeerJ Computer Science. 2017. DOI

9.Steinegger M, Salzberg SL. Terminating contamination: large-scale search identifies more than 2,000,000 contaminated entries in GenBank. Genome Biology. 2020. DOI

10.Janda JM, Abbott SL. 16S rRNA gene sequencing for bacterial identification in the diagnostic laboratory: pluses, perils, and pitfalls. Journal of Clinical Microbiology. 2007. DOI

11.Sabat AJ, et al. Targeted next-generation sequencing of the 16S–23S rRNA region for culture-independent bacterial identification—increased discrimination of closely related species. Scientific Reports. 2017. DOI

12.Johnson JS, et al. Evaluation of 16S rRNA gene sequencing for species and strain-level microbiome analysis. Nature Communications. 2019. DOI

13.Cuénod A, et al. Whole-genome sequence-informed MALDI-TOF MS diagnostics reveal importance of Klebsiella oxytoca group in invasive infections: a retrospective clinical study. Genome Medicine. 2021. DOI

14.Jain C, Rodriguez-R LM, Phillippy AM, Konstantinidis KT, Aluru S. High throughput ANI analysis of 90K prokaryotic genomes reveals clear species boundaries. Nature Communications. 2018. DOI

15.Chun J, et al. Proposed minimal standards for the use of genome data for the taxonomy of prokaryotes. International Journal of Systematic and Evolutionary Microbiology. 2018. DOI

16.Parks DH, et al. A standardized bacterial taxonomy based on genome phylogeny substantially revises the tree of life. Nature Biotechnology. 2018. DOI

17.Miller S, et al. Laboratory validation of a clinical metagenomic sequencing assay for pathogen detection in cerebrospinal fluid. Genome Research. 2019. DOI

18.Parks DH, et al. A complete domain-to-species taxonomy for Bacteria and Archaea. Nature Biotechnology. 2020. DOI

05 / 研究解读

图片与许可

本文两张图均为自绘或 AI 生成无文字底图后本地排版,未复用论文原图。图中观点与数据来源见各图图注和正文 DOI 链接。