ARTICLE · 1156347
不做AI都不好意思说自己是NGS公司?(上)
系列 · 第 1 篇 / 共 2 篇 很多 NGS 企业都开始讲 AI,大家对 AI 的使用程度天差地别 |
一张图看懂 · NGS 公司的 AI 家底 把「自己训的」和「借来的」一次看清
6 家点得回论文 ↓ 2 家开源 ↓ 1 家拿算法证 按 AI 自主度分五级(越左越「自己造」):
接入是应用策略,自研是模型能力——两件事,没有高下。 |
这两年,NGS 公司发新闻稿,不提 AI 都不好意思。
但把这一批国内 NGS 相关主体的公开材料翻完,结论有点尴尬:能点回同行评议论文的只有 6 家,愿意开源代码或权重的只有 2 家,拿到算法类软件三类证的只有 1 家。
真正的差别在程度:有人在从零训基础模型、发论文、开源权重;有人把外面的 DeepSeek 接进系统、做本地化部署;也有人目前只在通稿里出现过 AI 字样——同一句“AI 赋能”,指的其实是三种很不一样的状态。所以本文按 AI 自主度分五级,只回答一件事:这些公司讲的 AI,是自己造的,还是借的;外人又能查到什么程度。
先看总账:6 家点回论文,2 家开源,1 家拿算法证
点得出名字的模型:本文只写点到名的。这一批里能叫出名字的是 GeneT(华大基因)、Genos(华大研究院)、Bream(齐碳科技)、GenseqAMR(金匙医学)、域见医言(金域医学)、INSIGHT(桐树基因)、ProtoPilot(涌生智能);碱基识别(Dorado、DeepConsensus)与海外对照(AlphaGenome、Evo 2)单列,不计入这一批。没在正文出现的名字,本文不展开。这条名单与下面「6 家点回论文」不是同一批——能不能叫出名字看有没有落成产品,能不能点回论文看有没有同行评议,两把尺子。
6 家:能点回同行评议论文——华大研究院(Genos)、世和基因(序语)、芯像生物(emGene)、华大智造(PrimeGen / Concerto)、齐碳科技(Bream)、金匙医学(GenseqAMR),全部落在 L1、L2 里。
出处:Genos(10.1093/gigascience/giaf132)|序语(10.1016/j.xcrm.2026.102866)|emGene(10.23919/ICS.2025.3552542)|PrimeGen / Concerto(Nature 子刊)|Bream(10.3389/fgene.2026.1743148)|GenseqAMR(10.1128/jcm.01805-22)。
对账:主表里「硬」一共 8 家——L1 的 5 家=3 篇论文 + 1 张算法类三类证(迪安医策)+ 1 份招股书(吉因加),L2 的 3 家=3 篇论文。所以能点回论文的是 3 + 3 = 6 家。华大基因的 GeneT 停在 medRxiv、桐树那篇是 MSI 验证研究(非 AI 模型文)、杰毅那篇方法性质待核实,都不计入。
2 家:开源代码或权重——Genos、Bream。
1 家:拿到算法类软件三类注册证——迪安诊断旗下医策科技。
五级:L1 自研大模型 6 家 | L2 自研专用模型 4 家 | L3 自研 AI 产品 8 家 | L4 只接外部大模型 2 家 | L5 工程件 / 算法层 3 家。
这些模型覆盖测序仪 / 测序服务 / 病原检测 / 病理 AI / 研究机构五类,路径从 DNA 语言模型到“架构未披露”。能点回同行评议论文的只有 6 家——其中 5 家是深度学习或基础模型,1 家是传统机器学习(LASSO、XGBoost 那一类)。
模型名不是能力,自研深度和证据出处才是。接入和自研是两个层级,本文只按自主度分层,不评价哪种更好。
先划一条边界:AI 不等于大模型
标题说「讲 AI」,是沿用行业口径——公司通稿、年报里写的就是「人工智能」「AI 赋能」。但真要分层,得先说清一件事:AI 是个大框,大模型只是里面的一种。
用神经网络做碱基识别、用随机森林做耐药预测、用规则引擎做样本质控,都是 AI,而且不少做得很扎实。它们和大模型的差别不在「智不智能」,而在有没有一套可继承的基座权重:传统机器学习没有预训练基座这回事,参数量小、从头训,谈不上「借谁的」;只有大模型才存在「基座是谁的、有没有被自家训练流程改过」这个问题。
所以下面这把尺,量的是大模型这条线上的自主度——主表里只有 L1 站在大模型这一档,往下逐级远离模型自研。在这条线上排得靠后,说的是它没走大模型这条路,不等于它的 AI 不行。
分级之前,先定一把尺:什么叫「自己训的」
「我们用了 AI」这句话涵盖的东西太多了。本系列判定只看一条——模型权重有没有被这家公司自己的训练流程改过。顺着这条线从重到轻,一共六层:
① 从零预训练(Pre-train) 自己攒数据、上算力、训出一套基座权重。造轮子,成本最高,也最难装假的“自研”。 ② 继续预训练 / 全参数微调 拿别人的基座,用自己的数据把整个模型再训一遍。基座不是自己的,训练行为是自己的。 ③ 参数高效微调(LoRA / Adapter) 只训一小撮适配参数,主体冻结。确实改了,但改得很浅。 ④ 检索增强(RAG) 模型一动不动,外挂一个知识库,查到内容再塞进上下文。是工程创新,不是模型自研。 ⑤ 智能体 / 工作流编排(Agent) 调用现成模型的 API,用流程和工具把它串成产品。拼的是产品能力,不是模型能力。 ⑥ 调用 API / 本地化部署 把别人训好的模型接进来用。纯粹的应用方。本地化部署不会让它变成自研。 |
六层压成五级:从左到右,模型越可能是自己造的 那把六层的尺子,对到本系列的五级是:①→L1;②③→L2;④⑤→L3;⑥→L4;够不上任何一条、只在工程细节里用到机器学习的 → L5。②③ 都算「改了模型」,但全参数微改动的是全部权重、LoRA 只动一小撮适配参数,程度差一个量级,本系列并为一档。这五级从「自己造」排到「只是用了」:
⑤⑥ 这两层的表述最容易被误读成「自研大模型」。分到这两层不代表做得差——L4 两家都属中档证据;差别只在「公开材料里有没有走到自研那一步」。 |
先把两边的术语接上:AI 在 NGS 里到底做哪四件事
NGS 专家容易把「自研大模型」四个字看得过重,AI 专家容易把碱基识别当成「造了个模型」。先把这四件事摆清楚:
① 碱基识别(Basecalling) 测序仪把光 / 电信号转成 A/T/C/G。神经网络做这事是工程标配,不算自研大模型。代表:Dorado(ONT)、DeepConsensus(Google × PacBio)。判到工程件这一档的依据,是这家公司的公开 AI 动作只集中在这一层;若另有同行评议的非碱基识别算法论文,按论文归位。 ② 比对与变异注释(Alignment / Variant) 把读段比到参考基因组、找变异。传统 ML 也能做,大模型是新趋势。代表:Genos、AlphaGenome、Evo 2。 ③ 报告解读(Interpretation) 变异 → 临床意义(致病 / 良性)。LLM 主场,注意机构数据要合规。代表:金域域见医言、桐树 INSIGHT。 ④ 实验室自动化(Agent) 湿实验闭环、干湿结合。新兴方向,不算模型自研。代表:涌生 ProtoPilot。 注意:AI 进化酶、AI 样本质控不算 NGS 主链路的 AI 模型——样本质控本身也用机器学习,只是不进数据解读主链路。 |
主表:按 AI 自主度分五级,每级标出证据强度
每级家数下面那行小字,是这一级的证据强度构成:硬=能点回同行评议论文 / 算法类三类证 / 交易所文件;中=预印本 / 监管备案 / 专利 / 公告与中报;软=只有官网或通稿。三者性质不同——论文证明模型能力,注册证证明合规与产品化,交易所文件证明商业披露;这里只表示「外人能查到哪一步」,与自主度是两回事。
层级 | 公司 / 机构 | 一句话判断 |
L1 · 自研基础模型 / 大模型 6 家 硬 5 · 中 1 硬:华大研究院 · 世和 · 芯像 · 迪安医策 · 吉因加|中:华大基因 | 华大研究院、世和基因、芯像生物、华大基因、迪安诊断·医策科技、吉因加 | Genos、序语、emGene 有同行评议论文;迪安医策是算法类三类证;吉因加是港交所招股书;华大基因 GeneT 停在预印本 |
L2 · 自研专用模型 / 算法 4 家 硬 3 · 中 1 | 华大智造、齐碳科技、杰毅生物、金匙医学 | 不是大模型;华大智造(PrimeGen / Concerto)、齐碳(Bream)、金匙(GenseqAMR)点回同行评议论文,杰毅(MLWA)另计 |
L3 · 自研 AI 应用产品 8 家 硬 0 · 中 4 · 软 4 中:涌生 · 金域 · 贝瑞 · 赛陆|软:诺禾 · 予果 · 微远 · 桐树 | 涌生智能、金域医学、贝瑞基因、诺禾致源、桐树基因、予果生物、微远基因、赛陆 | 涌生(arXiv)、贝瑞(medRxiv)、赛陆(bioRxiv)停在预印本;金域是备案+ISO 认证;诺禾、予果、微远只有官网;桐树那篇是 MSI 验证研究、非 AI 模型文 |
L4 · 只接入外部大模型 2 家 中 2 | 圣湘生物、康为世纪 | 圣湘完成本地化部署;康为仅中报提及借鉴。两家都是应用方,不是自研方 |
L5 · 工程件 / 算法层 3 家 中 2 · 软 1 中:真迈 · 燃石|软:赛纳 | 真迈、赛纳、燃石 | 真迈(SURFSeq AI 碱基识别)、赛纳(CycloneSEQ)停在工程件;燃石是 ELSA-seq 建库 / 算法(USPTO 专利 US 12460202 B2),未见命名大模型 |
这张表不是排名,从上到下只表示“模型越可能是自己造的”;家数下面那行强度小字,只表示外人能查到哪一步,也不代表技术好坏。能不能信,还要看每家的证据出处。
主表回答「自己做到哪一层」。还有一种排法——按「外人能查到什么」把技术路线和证据渠道交叉起来,那张矩阵放在第 2 篇的开头,要核对具体某家落在哪一格的,直接翻第 2 篇。
本篇信息均来自公开渠道:官网、发布会、论文、专利、招股书、监管公示。所有“首个”“第一”类表述均为企业口径;未能核实处已标注“本次检索未见”。
自主度分级与披露渠道分类,均仅为公开材料形态描述,不构成对公司技术水平的评价或投资建议。
如与事实不符,欢迎提供依据,我会订正。完整口径与检索方法见第 2 篇。