夜雨聆风学习资料网

ARTICLE · 1091638

WES CNV分析软件服务

WES CNV分析软件服务

一天搞懂NGS技术用于临床遗传病筛查、诊断、质控分析细节

真正能构成竞争差异的不是"做了WES CNV"分析这件事,而是别人做不全、做不准、做不到自动化的那些环节。


1. 性染色体专项:一套深度信号同时解决五类问题

这是差异化最强的部分,因为绝大多数WES-CNV工具只输出常染色体CNV,性染色体要么单独另跑,要么干脆忽略。

我们的方法把比对深度聚类 + log2ratio拷贝数反推 + 高深度SNV辅助三套信号交叉验证,一份数据同时输出:性染色体非整倍体(45,X / 47,XXX / 47,XXY / 47,XYY,含嵌合)、性反转(46,XX+SRY)、录错性别/样本交换、跨性别交叉污染。规则表覆盖17种核型情形。

更关键的是它能覆盖 CNV 层面全外可分析范畴里的几乎全部性染色体异常——非整倍体(含嵌合)、性反转、性染色体非整倍体嵌合、跨性别交叉污染、录错性别,以及拟常染色体区 CNV、AZF 缺失。其中单次性别校验即可识别约一半的样本交换,这意味着它是质控模块而非检测模块,可以无成本地挂到任何 WES/WGS数据流水线上。

2. "以Y裁决"的裁决机制:嵌合与性反转场景下的鲁棒性

这是这套性染色体方法里最硬的一个工程判断。

X 聚类按"均一化深度之和小→男性"来分,但 47,XXY、48,XXYY、45,X 及低比例嵌合样本中,X 的深度会被拉向中间值而误判。Y 染色体在男性中存在、女性中近乎为零,信号对比度极高,几乎不受嵌合比例影响。把裁决权交给 Y,等于在整套方法里埋了一个不受拷贝数扰动干扰的锚点。

同类工具普遍用单一 X/Y 比对率阈值,遇到嵌合就失灵。这条裁决规则是区分两者的核心。

3.  PAR 单独处理

拷贝数公式 copyNumber = baseCN × 2^(log2ratio) 本身不稀奇,稀奇的是 baseCN 的分档表:

PAR1与 PAR2 在减数分裂中配对重组,拷贝数行为不同于非 PAR 区。不单独设 baseCN=2,会在 X/Y 交界产生系统性伪 CNV。这一细节是区分"真缺失"与"比对伪影"的关键,也是 PAR 区 CNV 能报得出来的前提。

4. 同源基因区 CNV:假基因与重复序列区域的系统性处理

WES-CNV 最容易翻车的地方就是同源区,而这也是临床最高频的需求。

你们覆盖 SMN1/SMN2、CYP21A2、HBA1/HBA2、SBDS、IKBKG 等存在同源区域或假基因的基因 CNV——与软文中列出的特殊基因系统化分析能力(CYP21A2、GBA1、CYP2D6、F8、FMR1、HBA1/2、SMN1/2、DMD)形成技术上的咬合。这类基因的处理同时依赖双轴校正(GC 含量分箱 + 低 mappability 加权/回归),因为同源区的伪影主要就来自比对偏差。

基于二代测序CYP21A2的精准分析

α地贫有必要用三代测序么?

关于SMN1的拷贝数的确诊和精确确定SMN2基因的拷贝数(NGS?ddPCR?三代测序?)

5. 小外显子级信号保护性保留

常规 WES CNV 工具的阈值普遍设在三个连续外显子,原始数据里的一两个外显子变异会被 CBS 切掉。

wo 们的策略是在 CBS 判为"拷贝数正常"的区域内,若单个或数个外显子的原始 log2ratio 超阈值则予以保留;在判为异常的大片段内,疑似纯合缺失或拷贝数>3 的外显子级信号同样保留。这一条直接对应 PRKN(早发型帕金森)、DMD(杜氏肌营养不良)、PMP22(腓骨肌萎缩症/Charcot-Marie-Tooth)等基因的单/双外显子致病 CNV——这些样本走常规流程的结论是"阴性"。

配合 IGV 全数据集查看与 PRKN、PMP22、DMD、PLP1、MECP2 等高频 CNV 基因的靶向可视化,构成从"检出"到"可复核"的闭环。

6. 对照集三档自适应

不预设固定对照集,按样本量走三条路径:>500 用 PCA 聚类分组自动剥离批次与平台隐变量;≤500 用 Pearson 相关筛选(r>0.9 且同性别);<10 或某性别<4 时用固定参考集合并后再筛选。

第三档最容易被忽略也最致命——稀有性别样本用全体样本做基线,X/Y 信号会系统性失真。这一档的保留意味着流程在冷启动和稀有性别场景下都不会崩,而"同批次、同性别、同测序平台、同捕获试剂盒"四重约束保证了假阳性从流程入口就被压住。

7. SNV 基因型一致性校验:有文献支撑的假阳性过滤

杂合缺失区不可能与杂合 SNV 重叠——如果重叠,则 SNV 与缺失二者必有一假;默认阈值是该 CNV 内 ≥30% 的重叠 SNV 为杂合即判假阳性。对重复变异,则用模糊逻辑模型按等位基因频率打分(真实重复期望 33%/66%,假阳性为 50%)。

该工具在 3 个 WGS 样本与 541 个 panel 样本、13 个 CNV calling 工具上验证,假阳性减少15.3%–44.8%,FDR 最高下降 10.4%,F1-score 最高提升 20.7%;panel 数据集上未出现将真 CNV 误判为假阳性的情况;中位运行时间 panel 样本 0.85 秒、WGS 3.53 分钟。

我们流程中的"杂合缺失区出现杂合 SNV 即判为假阳性"与之同源,叠加 Trio-WES 亲本溯源(parent-of-origin)确认 CNV 真实性与遗传来源,形成两道独立闸门。

8. 隐性遗传"单杂合 SNV"补查逻辑

这是临床推理层面的优势,不是算法层面的。

对隐性遗传模式且仅检出 1 个杂合 SNV 的情况,主动在 IGV 中排查对应基因是否存在外显子级缺失,作为"第二个打击"——用于解释复合杂合致病机制。这类补查不是参数能调出来的,它要求分析人员既懂遗传模式又懂数据形态,本质上是一条基于临床假设的触发规则,直接对应"表型对不上"的疑难病例。

9. 拷贝数中性前提下的 ROH / UPD / IBD 分析

这部分是"不依赖拷贝数变化"的能力,区分度很高:在拷贝数看不出异常的样本里,通过杂合 SNV 缺失模式识别 ROH(杂合性缺失),结合 Trio-WES 做 UPD / IBD 分析及亲本来源判定,含嵌合情形。

基于NGS的UPD分析工具大全

10. 双指南双工具:一条流程覆盖两种尺度

基因内/外显子级 CNV 转 VCF 后用 VEP 注释,走 ACMG/AMP;多基因区段用 AnnotSV 注释,走 ACMG/ClinGen。两条路径在"基因内容、断点、患者/对照频率、表型匹配"上的考量权重完全不同,混用会导致小 CNV 被低估、大片段被过度判读。

每条候选片段还附带对照 CV 量化波动性,给报告增加一个可靠性维度,MDT 据此决定"可直接入报告"还是"需独立验证"。

11. 非整倍体、多倍体识别

69,XXX / 69,XXY / 69,XYY 等三倍体情形纳入分析范畴,覆盖产前诊断场景。这条属于"低频但极具诊断价值"的能力,多数 WES CNV 流程不具备。

12. 成本结构与一次检测的覆盖面

这条是商业模式上的差异,不是技术上的。

一份 WES 数据同时输出 SNV、CNV(大片段+单基因+外显子级)、ROH/UPD、性染色体异常、iUPD/ROH、跨性别污染(CHARR),不增加任何湿实验。而行业共识已经转向"WES 作为 first-tier,CMA/CNV-seq 作为 second-tier"——CMA 或 CNV-seq 阴性需要序贯做 WES/WGS 进一步分析,检测周期被拉长;若把 CNV-seq 提高到 WES 层面的 3-5x 深度,性价比不如直接加一步全外捕获。

WES 厂家普遍在基础全外上增加 CNV 骨架探针,对 CNV 检测能力进一步增强,在单基因和外显子级 CNV 检测上具有 CMA/CNV-seq 几乎无法覆盖的独特优势。全外显子组分析 CNV 已能提高 5-10% 阳性诊断率(因实验室水平与软件差异,覆盖能力参差不齐)——我们把这份增量收敛成了标准化、可复现的 SOP。


软件提供源码,和详细操作SOP,有需要的欢迎扫码联系。

相关学习资料