乐于分享
好东西不私藏

新组装软件实战(二) | Genome Biology | MGA:仅利用HiFi数据尝试 Near-T2T 组装

新组装软件实战(二) | Genome Biology | MGA:仅利用HiFi数据尝试 Near-T2T 组装

上期,我们使用了 MGA 进行仅使用 HiFi 数据的组装,安装教程与软件运行示例请见:新组装软件实战(一) | Genome Biology | MGA:仅利用HiFi数据尝试 Near-T2T 组装

这次我们来对 MGA 和 Hifiasm 的组装结果进行实测比较!

MGA vs Hifiasm

我们使用 70X HiFi 数据和 100X ONT 数据进行高杂合植物基因组的组装,各组装策略结果如下表所示:

可以看到 MGA(HiFi) 的运行时间确实很长,在文章中有提到,这是主要因为 MGA 还是使用 LJA 软件进行高精度的纠错组装,会比 Hifiasm 要慢上一些。但是,N50 方面 MGA 的值是最高的,而且 contig 的数量也是最少的;而 Hifiasm(HiFi) 同样只使用 HiFi 数据进行组装,其 N50 与序列数量都是四个版本中最差的。

Hi-C 挂载

Hifiasm(HiFi)

使用 HapHiC 进行辅助挂载,结果如下:

可以看到 Hifiasm(HiFi) 版本本身存在一些冗余(图中绿色箭头)却并不是很多,但存在未挂载区很大以及 rDNA 阵列组装不连续的问题。

  • 未挂载区:通过 NT 比对以及重复序列注释,得到未挂载的部分绝大部分是串联重复序列和 45S rDNA,此外,还存在污染序列(来自动物)。
  • rDNA 阵列:如图中紫框所示,多个染色体存在 rDNA 阵列不连续的问题,无法定向,后续只能丢弃。

MGA(HiFi)

使用 HapHiC 进行辅助挂载,结果如下:

MGA 的组装结果会相对于 Hifiasm 要精简一些,图中的冗余大部分是大片段的序列,基本没有 Hifiasm(HiFi) 版本的小片段序列被聚类到染色体部分的问题。此外, MGA 的未挂载区的序列更加的少。MGA 也存在一些其他的问题:

  • 组装错误:如图中黑圈所示,MGA 将应该分开的染色体错误的组装到一起,这可能与没有 Hi-C 数据辅助有关,而 Hifiasm 在使用 HiFi 和 Hi-C 组装后,基本不存在多个染色体错误组装在一条序列的问题。
  • rDNA 嵌合:如图中黄色 X 号所示,MGA 的确将多个染色体做到了一条序列组成一个染色体,但是遇到 rDNA 阵列会错误的将不同染色体的 rDNA 组装到一起,需要人工手动剪开。

共线性分析

将所有版本进行 Hi-C 挂载后,进行 minimap2 比对,使用 Genomesyn2 进行共线性图的绘制,如下所示:

图中使用灰色方框表示 45S rDNA 区域,可以看到 MGA 对于阵列的组装确实很厉害,基本可以达到同样能力比较强的 Hifiasm(ONT) 的水平,完全超过 Hifiasm(HiFi) 和 Hifiasm(HiFi+ONT),不过 MGA 依旧没有把 rDNA 之后的端粒组装出来,这一方面 Hifiasm(ONT) 会比其他几个版本更加完整。

讨论

经过多方面比较,相对于 Hifiasm 来说,MGA 的组装效果确实会更好,在只有 HiFi 数据的情况也能做到更加完整的染色体,更高的连续性,不过由于没有 Hi-C 数据的加持,还是会存在一些需要人为处理的错误不,过问题基本可以忽略。目前笔者认为 MGA 最重要的问题还是运行时间长。测试的基因组才 200 Mb,MGA 就要组装相当长的时间,如果是组装大基因组估计要更久。如果大家不着急的话,确实可以使用 MGA 进行组装。

总结:

  • MGA 只使用 HiFi 数据,可以大幅提高组装连续性,很少产生碎小的序列。
  • 对于受到外源污染的测序数据也能使用,而且基本不受影响。
  • rDNA 阵列组装更加完整,但端粒的组装能力还需要提升。
  • 组装存在嵌合错误需要人为进行干预调整。
  • 相较于 hifiasm 运行时间更长。

最后,附上文章中的各物种的组装花费时间比较:

下期大家想看什么?欢迎评论区留言!