乐于分享
好东西不私藏

AI 设计的蛋白变体,如何真正走进湿实验室?

AI 设计的蛋白变体,如何真正走进湿实验室?

近年来,AI 与机器学习正在快速改变蛋白工程的研发方式。过去,研究者常常依赖定向进化,在野生型蛋白基础上进行一轮又一轮突变、筛选和优化。这种方式曾经推动了许多重要发现,但也存在明显限制:它通常围绕有限区域进行变异,对庞大的蛋白序列空间探索不足,改造幅度也相对有限。而现在,AI/ML 工具可以在计算机中预测、评估和优先排序海量蛋白变体。每一个由模型输出的新序列,都可以被看作一个新的假设。研究者不再只能在已知序列附近缓慢探索,而是可以更有目的地进入更广阔的蛋白序列空间。但问题也随之而来:当 AI 设计出成千上万个具有潜力的长基因变体后,如何把它们准确、均一、规模化地合成出来,并进入湿实验室验证?

这正是 Twist Gene Pools 试图解决的关键瓶颈。

 从“AI 预测”到“湿实验验证”,

基因合成成为关键一步

AI 可以帮助研究者在计算机中筛选潜在高价值变体,但最终,真正有前景的序列仍然需要在湿实验中进行验证。

与传统定向进化不同,AI 设计的变体往往并不只是集中在某几个位点发生变化。它们可能具有组合式突变,变异也可能分布在整个蛋白序列中。这意味着每一个候选变体都需要被单独有目的地、精确地合成出来。

然而,当基因长度超过约 1 kb,尤其是在池化形式下一次性合成数千条不同序列时,传统组装方法可能面临多重挑战:

可能面临的挑战

  • 合成错误增加;

  • 序列合成不均一;

  • 部分变体在文库中缺失;

  • 相似序列之间发生错误重组,形成嵌合体。

图1|池化基因合成中的嵌合体形成风险

标准池化基因合成通常依赖基于同源性的组装和 PCR 扩增。当序列之间存在高度同源区域时,容易发生 PCR 介导的同源重组,产生非预期的嵌合体。Twist Gene Pools 通过更精确的池化基因组装策略,旨在减少这类错误组装风险。这些问题都会降低筛选文库质量,减少真正可用的候选分子数量,并拖慢蛋白工程研发进程。

Twist Gene Pools:

为 AI 驱动蛋白工程打造的

高保真基因文库平台

在这份白皮书中,Twist 展示了 Gene Pools 技术在定制化长基因文库合成中的表现。研究设计了两个 Gene Pools,每个包含 3,800 条序列,长度分别约为 650 bp 和 1.8 kb。为了充分挑战平台能力,研究人员将池内序列设计为最高约 97% 的两两相似性。这类高度相似的序列,对传统 PCR 基础组装方法而言非常容易产生嵌合体。但 Twist Gene Pools 通过结合基于硅芯片的长寡核苷酸合成平台和精确的池化基因组装平台,可将寡核苷酸准确“拼接”为全长、高保真的基因池,从而降低错误与嵌合体风险。

研究随后使用 PacBio 长读长测序,对 Gene Pools 的均一性、drop-out 率、序列错误和嵌合体形成情况进行了评估。

图2|Gene Pool 表征工作流

本研究设计了两个 Gene Pools,长度分别约为 650 bp 和 1.8 kb,序列之间最高约 97% 两两相似。Gene Pools 通过 Twist 基于硅芯片的合成平台生产,并使用 PacBio 长读长测序评估其质量。

高均一性:

让每个变体都有机会被看见

对于蛋白工程筛选来说,文库均一性至关重要。

如果某些变体在文库中过度富集,而另一些变体几乎不存在,筛选结果就可能受到偏倚影响。理想的基因文库应尽可能让每条变体序列都被充分且均衡地表达。

研究结果显示,Twist Gene Pools 具有出色的均一性:

出色的均一性

  • 两个 Gene Pools 中,超过 90% 的序列都位于平均读数的 2.0 倍以内;

  • 约 650 bp 池的均一性指标为 1.28;

  • 约 1.8 kb 池的均一性指标为 1.82;

  • drop-out 率从 0% 到 0.3% 不等。

图3|均一的 reads 分布与低 drop-out 率

reads 分布图显示,两个 Gene Pools 均呈现紧密的类高斯峰。约 650 bp Gene Pool 的 drop-out 率为 0%,约 1.8 kb Gene Pool 的 drop-out 率为 0.3%,说明文库中绝大多数设计序列都得到了有效代表。

这意味着,即使是在包含 3,800 条序列、且序列间高度相似的文库中,Twist Gene Pools 依然能够保持高度均一的变体合成

对于需要大规模筛选 AI 设计候选序列的研究者而言,这一点尤为关键:只有当每个候选变体都能稳定出现在文库中,筛选才更有可能捕捉到真正具有价值的分子。

高准确性:

最高 1.8 kb,仍保持低错误率

长基因合成的另一个难点是准确性。

随着序列长度增加,合成与组装过程中出现错误的概率通常也会增加。这些错误可能导致候选变体功能失真,甚至让筛选结果偏离原本设计意图。

在本研究中,PacBio 长读长测序确认,Twist Gene Pools 的合成错误率约为每 3,000 bp 1 个错误。对于约 650 bp 和约 1.8 kb 的两个 Gene Pools,完美分子比例分别达到 90% 和 72%。

表1|Gene Pool 质量指标总结

两个 Gene Pools 的全长比例均超过 90%;约 650 bp Gene Pool 的完美分子比例为 90%,约 1.8 kb Gene Pool 的完美分子比例为 72%;两个 Gene Pools 均未检测到嵌合体。

图4|读长形成单一紧密峰

读长分布显示,每个 Gene Pool 均形成单一清晰峰,确认不存在大型错误组装副产物或明显短缺失。约 650 bp 池中,94% 的片段位于目标长度 ±1 bp 范围内;约 1.8 kb 池中,96% 的片段位于目标长度 ±1 bp 范围内。

更重要的是,检测到的错误主要是罕见的小型错配、SNP 或小型 Indel,而不是由错误重组产生的结构性错误。

这表明,Twist Gene Pools 不仅能够支持较长序列的合成,也能够以可预测、高保真的方式构建面向筛选的基因文库

  无嵌合体:

降低池化组装中的关键风险

当大量相似序列被放在同一个池中进行合成和组装时,嵌合体是一个重要风险。

嵌合体通常来自相似序列之间的错误重组。对于蛋白工程而言,这类非预期构建体不仅浪费筛选资源,还可能干扰后续分析。

在这项研究中,两个 Gene Pools 的序列相似度最高达到约 97%,这本身就是对平台的一项严苛挑战。

结果显示,在约 650 bp 和约 1.8 kb 的两个池中,均未检测到嵌合体。PacBio 数据中也没有出现大量错误集中于同一读段的情况,而这种情况通常会提示结构性错误或嵌合体存在。

图5|无结构性错误

PacBio 长读长测序用于评估序列错误。零错误代表完美序列分子;一个或两个错误通常代表 SNP 或小型 Indel;如果出现大量错误,则可能提示序列嵌合体。本研究中未观察到这类大量错误读段,支持“无可检测的嵌合体”的结论。

这进一步说明,Twist Gene Pools 能够在池化长基因文库构建中有效降低嵌合体风险。

让 AI 驱动的蛋白工程更接近现实

AI/ML 正在帮助研究者从“随机探索”走向“定向设计”。但要真正释放 AI 在蛋白工程中的潜力,湿实验验证仍然必不可少。这就要求基因合成平台能够做到三件事

第一,准确合成 AI 设计的定制序列;

第二,在大规模文库中保持变体序列合成均一;

第三,在长基因、相似序列和池化组装条件下降低错误与嵌合体风险。

Twist Gene Pools 在本研究中展示出的性能——高均一性、近零 drop-out、可预测的完美分子比例,以及无嵌合体——使其成为 AI 驱动蛋白工程的重要湿实验伙伴

  更大的序列空间,

更快的工程化周期

Twist Gene Pools 可支持最高 1.8 kb 的基因组装,这一长度足以编码 UniProt 中大多数已知蛋白。这意味着研究者可以更准确地生成完整蛋白结构域,甚至完整蛋白,从而探索更广阔的功能空间。

无论是开发新型酶,构建更有效的治疗分子,还是设计更具环境适应性的作物,长基因定制文库都将成为连接 AI 设计与实验验证的重要桥梁。

过去,定向进化项目可能需要数年时间完成。随着 AI/ML 与 Gene Pools 工作流程的结合,蛋白工程有机会进入一个更高效、更精准、更具规模化潜力的新阶段。

结 语

AI 可以帮助我们提出更多更好的蛋白设计假设。但要让这些假设真正接受实验检验,还需要一个能够高保真、规模化合成定制长基因文库的平台。

Twist Gene Pools 通过准确、均一、无嵌合体的池化基因组装能力,为 AI 驱动蛋白工程提供了强有力的湿实验支持。

当 AI 负责拓展想象边界,Gene Pools 则帮助研究者把这些设计带入现实。

Twist Gene Pools,让 AI 设计的蛋白变体真正走进湿实验室。

仅供研究使用,不用于诊断程序

杭州沃森生物技术有限公司是Twist 官方授权代理商,如有Twist 产品需求,欢迎来电交流咨询!客服微信:HZWOSEN

联系我们

公司地址:杭州市西湖区西园八路11号数字信息产业园一期A座4层

网址:www.ws-bio.com   

电话:0571-86495259