疾控同事把一株分离菌送来复核:仪器报出的物种名分数很高,病例讨论准备按这个名字往下写。师兄把序列放进系统发育树,发现它没有落在那一支;导师随口问了一句:“菌落纯度确认过吗?”
物种鉴定,就是用实验信号和参考资料判断样本里的微生物最可能属于哪个物种。这个名字会进入病例记录、暴发调查、耐药比较和生态学分析;名字报得太细或报偏了,后面的比较就会把不同对象当成同一个对象。
更麻烦的冲突通常发生在报告快交付的时候:分类软件 A 的第一名是 Klebsiella pneumoniae,软件 B 报 Klebsiella variicola;16S 的 top hit 又落在 K. pneumoniae。三行结果都“有名字”,却还不能任选一行贴进报告。要看的,是这些 reads 有没有能力把近缘物种分开,参考库里有没有把该比较的对象放进来,以及分离株或样本本身是否单一。
- 软件输出是候选物种清单,不是最终物种结论。 一个物种名来自样本、检测信号、软件、参考库和报告解释的共同作用;任何一层证据不够,结论就该停在更高的分类层级。
- tNGS、mNGS、16S 和 WGS 看到的序列范围不同;Kraken、Centrifuge、BLAST 和 Bracken 处理共享证据的方式也不同。结果不能脱离方法、数据库和参数单独阅读。
- 发生冲突时,沿着“样本 → 原始证据 → 近缘物种 → 独立复核”回查,比急着选一个软件更有效。
一个物种名,是怎样被推出来的?

数据库给出的 top hit,只说明它在当前数据库和参数下最接近哪个参考对象。它不替代样本纯度检查,也不保证近缘物种已经被分开。下面按这条链,从前往后看。
样本先决定结果的语境
呼吸道样本有定植和口咽背景;血液、脑脊液常是低生物量样本,试剂或环境背景需要进入判读;组织、脓液和体液还取决于取材是否真正覆盖病灶。培养分离株多一层问题:挑出的菌落是否单一。
小 tips在看 reads、分数或 ANI 前,先给样本写一句“来历”:单菌落、混合培养、低生物量体液,还是复杂环境/宏基因组样本。后续复核动作由这句话决定。
检测方法决定能看见什么、能分到多细
靶向下一代测序(targeted next-generation sequencing,tNGS)预先规定了要捕获或扩增的靶标。靶标之外的物种或变异,即使真实存在,也不会出现在结果里;panel 内的物种名同样需要看靶区能否区分近缘对象。2025 年一项呼吸道 tNGS 验证研究在设计阶段去除与其他病原高度同源的靶区,并对引物特异性与交叉反应做生信和实验验证。Yang et al., 2025
宏基因组下一代测序(metagenomic next-generation sequencing,mNGS)不预先把范围锁在一组靶标上,但短 reads 仍会遇到共享序列。近缘物种、保守基因或可移动元件上的同源片段,可能让同一批 reads 同时支持多个名字。此时“检出到某属的信号”与“能稳定归到其中某一物种”是两层不同的结论。
16S rRNA 基因测序也有分辨率上限。很高的 16S 相似度不自动等于可以确定到种,部分属的物种级分辨力本就有限。Janda & Abbott, 2007 Streptococcus oralis 与 S. mitis 的 16S rRNA 序列只相差 1 个碱基,是单靠 16S 容易误鉴定的一个例子。Sabat et al., 2017 针对可变区的短读长测序,也达不到全长 16S 的分类分辨率。Johnson et al., 2019
不同场景,鉴定方法怎么选?
这张表安排的是“从哪里起步”,不是不同方法的性能排名。样本量、提取方法、平台、对照和项目目的都会改变可接受的结论层级。
软件决定共享证据怎样被归属
Kraken / Kraken 2、Centrifuge 和 BLAST 都能把序列连到分类信息,但它们用的证据单位不同。Kraken 使用 k-mer;Kraken 2 使用 minimizer 和概率数据结构,并把匹配证据汇总到分类树的最低共同祖先(lowest common ancestor,LCA)。一段 read 同时命中多个近缘参考时,结果常会留在它们共有的分类节点。Wood & Salzberg, 2014 Wood et al., 2019
Centrifuge 用 Burrows–Wheeler transform(BWT)和 FM-index 组织参考序列;BLAST 寻找局部序列相似区段,适合把争议 reads 或 contig 拉回比对层,检查 identity、query coverage、比对长度和近邻命中差距。Kim et al., 2016 Altschul et al., 199080360-2)
Bracken 不再做一次分类,而是根据 Kraken 各层级的计数,概率性地将高层级 reads 重新分配,用于估计目标层级丰度。Lu et al., 2017 因此,直接分类 reads 和重估丰度回答的是不同问题。
参数也在参与判读。输入过滤、去宿主、最低支持、报告层级、identity、query coverage 和是否保留多重命中,都应写进分析记录。不同项目没有一组可照抄的万能数值;适合用 mock、阴性对照和已知阳性样本确定本实验室的工作区间。
一套可以启动复核的“数字门槛”
下面这组数字可作为研究型 mNGS / 分离株复核流程的首版 SOP,用来决定一条软件结果要不要进入人工复核队列;它们不等于临床诊断阈值,也不能直接移植到另一种标本、平台或 panel。实际报告前,应以本实验室的阴性对照、阳性梯度和近缘物种 challenge set 校准。
| ≥10 条直接分类 reads | |||
其中,“≥3 个不重叠区域”与细菌、真菌或寄生虫的 RPM-r ≥10,来自一项脑脊液临床 mNGS 的本地验证策略;它说明阈值应由具体样本类型和验证集得出,而不是由软件默认值决定。Miller et al., 2019 表中的 3 reads、10 倍阴性对照和 80% 累计覆盖,是便于启动内部复核的示范值,需用本地数据替换为已验证的 cut-off。
参考库决定“最近邻”能不能接近真相
一个物种有多条高度相似的参考基因组时,短 reads 可能同时匹配多个对象;真正物种缺席时,程序只能报告最近的已知对象。参考库还会随版本、命名体系和标签质量变化。Steinegger 和 Salzberg 的大规模分析在 RefSeq、GenBank 和 NR 中均发现受污染序列。Steinegger & Salzberg, 2020
宏基因组里的 MAG(metagenome-assembled genome,宏基因组组装基因组)还要检查 bin 的完整度、污染度、coverage 和 contig 分类是否互相支持。它们打架时,物种名可能只是不同来源片段的平均印象。
常见误判来源:软件报了名,证据可能卡在哪里?
假阳、假阴与功能归属,别在最后一步越界
假阳性可来自试剂/环境背景、交叉污染、混入片段和不可靠的参考条目;假阴性可来自取材、前处理、低丰度或参考库缺失。混合样本中检出耐药基因,也不等于它属于报告里的那个物种。需要看该基因所在 contig/bin 的分类、coverage 与邻近序列关系,必要时用 reads 回贴或长读长复核。
小 tips罕见物种只在单一样本出现时,至少并排记录:阴性对照有没有同类信号、原始 reads/谱图支不支持、第二种方法能否复现。这里没有通用的“多少 reads 就算真”的数字。
两个案例:这些误差会怎样改变结论?
案例一:仪器报得很像,样本里还有别的答案
Hosoda 等比较了血培养厌氧菌的 MALDI-TOF 与 WGS 结果。研究纳入 69 例、85 株菌;以 WGS 的平均核苷酸一致性(average nucleotide identity,ANI)分析为比较依据,73 株达到物种级鉴定,而 MALDI-TOF 有 43 株在物种级与之相同,另有 6 株只到属。Hosoda et al., 2025
这里真正要带走的不是设备排名。该队列中有 21 例多菌种感染,WGS 在 9 例中发现了 MALDI-TOF 未识别出的多个物种;不一致结果还包括未被收进参考库的物种。Hosoda et al., 2025 它把前文的三层问题连在了一起:样本并不总是单一、信号未必能完整分离、数据库也可能没有答案。
该研究覆盖的是厌氧菌血流感染,不能外推为所有标本和所有设备的性能排序。它支持的行动很明确:当血培养厌氧菌的鉴定与形态、临床或测序信息冲突时,把菌落纯度、多菌种情况和参考库收录纳入复核清单。
案例二:panel 内的物种名,也需要回到靶区和数据库
Gaston 等比较了 BALF 的 mNGS 与针对特定病原富集的 tNGS 工作流。研究中,tNGS 流程没有检出 panel 与数据库均未涵盖的 Pneumocystis carinii,并将 Cryptococcus neoformans 报为 C. gattii;mNGS 流程也因分类学相似性和 Kraken 数据库缺少 P. carinii,将其识别为 P. jirovecii。Gaston et al., 2022
这个案例让“方法边界”和“参考库边界”有了具体后果:同一份 BALF 的结果差异,既可能来自 panel 是否覆盖目标,也可能来自近缘序列和数据库怎样把 read 归到某个物种。研究只覆盖该工作流和这批样本,不能替其他产品背书;它说明了为什么 panel 结果也需要查靶区、近缘对象与数据库版本。
原文图入口查看 Gaston et al. 的原文 Figure 1:两套 NGS 工作流与结果判读流程。该图版权归 American Society for Microbiology(ASM)所有,本文仅提供原文跳转,不嵌入或复用图片。
从结果到结论:怎么把物种鉴定落到项目里?
1. 冻结本次分析的比较对象
记录 FASTQ 质控版本、去宿主策略、软件版本、数据库来源/发布日期、taxonomy 体系、参考基因组清单与去冗余规则。
交付物:run_manifest.tsv;数据库版本号;参考基因组清单。
2. 双算法初筛,保留高层级证据
对同一批质控 reads,用同一分类体系运行 Kraken 2 和 Centrifuge。先以“≥3 条非重复直接分类 reads”建立候选清单,保留 read-level 分类结果、上级 LCA 计数和未分类比例;达到“≥10 条直接分类 reads且 ≥3 个不重叠区域”的候选才进入物种级复核。物种丰度表只作为候选清单的起点,具体数值必须由本地验证集校准。
交付物:两套报告文件;候选 taxon 清单;各层级计数对照表。
3. 给候选物种建立近缘对照组
把同属近缘物种、常见误报对象、型株或高质量代表基因组一并纳入复核库。从候选 taxon 抽取 reads 回贴,查看多重命中比例、query coverage、跨基因组覆盖和特异区域支持。对组装 contig,可将“query coverage ≥80%,且不集中于单一保守区”设为进入物种级判读的起点;未组装的低深度 reads 则看是否跨 ≥3 个区域。top hit 与次优近缘命中接近时,仍应停在属/复合群。
交付物:近缘参考库;多重命中摘要;覆盖统计;保留或排除候选的理由。
4. 分开报告直接分类与丰度重估
需要丰度时,可在 Kraken 结果基础上使用 Bracken;同时保留 Kraken 直接分类计数。前者是模型化丰度估计,后者反映直接归属的 reads。Lu et al., 2017
交付物:直接分类 reads、Bracken 丰度、LCA 高层级 reads 并列的结果表。
5. 分离株的 WGS 确认:ANI 后面还要看树
当物种级归属会影响临床解释、溯源或耐药基因归属时,可将候选分离株纳入 WGS 复核。推荐把这件事拆成四步:
1. 质控组装与样本纯度。 看测序质量、组装连续性、污染/混合信号;低质量组装不适合直接拿 ANI 下结论。 2. 建立比较组。 放入候选物种的型株或高质量代表基因组、同属近缘种和常见误报对象;记录 accession、版本和筛选规则。 3. 计算 ANI,并同时看 alignment fraction(AF,比对覆盖比例)。 ANI 衡量可比对基因组片段的平均核苷酸相似度。首版流程可把“ANI ≥95% 且 AF ≥65%”设为物种级复核的进入线;约 95% ANI 常被用作细菌物种划分的经验边界,而 AF 可避免只靠少量可比区域抬高判断。它们不是脱离比较对象、组装质量和系统发育就能自动裁决的单一数字。Jain et al., 2018 Chun et al., 2018 Parks et al., 2020 4. 在 ANI 仍有争议时建系统发育树。 从核心基因组或一组单拷贝标记构建树,连同近缘参考一起看样本是否稳定落入目标物种支。基因组系统发育框架可用于检查分类名称与进化关系是否一致。Parks et al., 2018
ANI 负责回答“与哪些参考基因组整体最接近”,系统发育树负责显示“它在近缘群中的位置”。二者都不能替代样本和组装质量检查;若 ANI、AF 和树的归属互相矛盾,报告应保留为属/复合群或“待进一步确认”。
交付物:组装与污染质控表;近缘参考清单;ANI + AF 矩阵;核心基因组/单拷贝标记树;结论与保留意见。
6. 按争议来源补独立证据
7. 在报告里写明证据等级
- 物种级支持充分:近缘库复核后仍有特异、跨区域支持,且独立证据一致。 - 可报告到属/复合群:属级信号明确,近缘物种之间共享证据过多。 - 候选或待复核:参考库缺邻近对象、覆盖集中在保守区、方法冲突,或阴性对照/批次背景无法排除。
物种鉴定报告,推荐这样落笔
报告不要只留一行“检出 X”。至少交代:样本和方法、软件与数据库版本、证据形态、结论层级、限制条件和下一步。
“未检出”也应写成方法学表述,例如:“在本次 panel、分析阈值和数据库版本下未见 X 的支持证据。”这样不会把检测范围之外的情况误写成样本中绝对不存在。
把名字往回查一遍

好报告会留下这个名字来自什么标本、哪套数据库、哪些证据,以及哪里仍有不确定性。结果和菌落、临床语境或后续测序对不上时,团队就能沿着证据链找到该复核的地方。
1.Hosoda T, et al. Limitations of MALDI-TOF MS in identifying anaerobic bacteremia: challenges in polymicrobial infections and the role of whole-genome sequencing. Microbiology Spectrum. 2025. DOI
2.Gaston DC, et al. Evaluation of metagenomic and targeted next-generation sequencing workflows for detection of respiratory pathogens from bronchoalveolar lavage fluid specimens. Journal of Clinical Microbiology. 2022. DOI
3.Yang J, et al. Laboratory validation of targeted next-generation sequencing assay for pathogen detection in lower respiratory infection. Microbiology Spectrum. 2025. DOI
4.Wood DE, Salzberg SL. Kraken: ultrafast metagenomic sequence classification using exact alignments. Genome Biology. 2014. DOI
5.Wood DE, Lu J, Langmead B. Improved metagenomic analysis with Kraken 2. Genome Biology. 2019. DOI
6.Kim D, Song L, Breitwieser FP, Salzberg SL. Centrifuge: rapid and sensitive classification of metagenomic sequences. Genome Research. 2016. DOI
7.Altschul SF, et al. Basic local alignment search tool. Journal of Molecular Biology. 1990. DOI80360-2)
8.Lu J, Breitwieser FP, Thielen P, Salzberg SL. Bracken: estimating species abundance in metagenomics data. PeerJ Computer Science. 2017. DOI
9.Steinegger M, Salzberg SL. Terminating contamination: large-scale search identifies more than 2,000,000 contaminated entries in GenBank. Genome Biology. 2020. DOI
10.Janda JM, Abbott SL. 16S rRNA gene sequencing for bacterial identification in the diagnostic laboratory: pluses, perils, and pitfalls. Journal of Clinical Microbiology. 2007. DOI
11.Sabat AJ, et al. Targeted next-generation sequencing of the 16S–23S rRNA region for culture-independent bacterial identification—increased discrimination of closely related species. Scientific Reports. 2017. DOI
12.Johnson JS, et al. Evaluation of 16S rRNA gene sequencing for species and strain-level microbiome analysis. Nature Communications. 2019. DOI
13.Cuénod A, et al. Whole-genome sequence-informed MALDI-TOF MS diagnostics reveal importance of Klebsiella oxytoca group in invasive infections: a retrospective clinical study. Genome Medicine. 2021. DOI
14.Jain C, Rodriguez-R LM, Phillippy AM, Konstantinidis KT, Aluru S. High throughput ANI analysis of 90K prokaryotic genomes reveals clear species boundaries. Nature Communications. 2018. DOI
15.Chun J, et al. Proposed minimal standards for the use of genome data for the taxonomy of prokaryotes. International Journal of Systematic and Evolutionary Microbiology. 2018. DOI
16.Parks DH, et al. A standardized bacterial taxonomy based on genome phylogeny substantially revises the tree of life. Nature Biotechnology. 2018. DOI
17.Miller S, et al. Laboratory validation of a clinical metagenomic sequencing assay for pathogen detection in cerebrospinal fluid. Genome Research. 2019. DOI
18.Parks DH, et al. A complete domain-to-species taxonomy for Bacteria and Archaea. Nature Biotechnology. 2020. DOI
图片与许可
本文两张图均为自绘或 AI 生成无文字底图后本地排版,未复用论文原图。图中观点与数据来源见各图图注和正文 DOI 链接。
夜雨聆风