夜雨聆风学习资料网

ARTICLE · 1156214

AI多肽的10B数据集,真相是没人能替它复核

AI多肽的10B数据集,真相是没人能替它复核

先说一句不讨喜的话⁠:多肽 AI 公司手里那批数据⁠,越是被写成壁垒⁠,越容易被高估⁠。

10 月 10 日⁠,利太智药(LigIT⁠)的种子轮消息传出来⁠,规模近 5000 万元人民币⁠,讯飞创投与 L2F 光源创业者基金领投⁠,光源资本担任独家财务顾问⁠。这家公司 2026 年 7 月才成立⁠,总部在北京海淀⁠,到消息公开时满打满算不足三个月⁠。

据动脉网旗下 VCBeat 的独家报道⁠,这家公司给自己搭的是「数据⁠、模型⁠、分子⁠」三层结构⁠,最上面那层叫 PepUmi⁠,一个自研的闭源多肽合成数据集⁠,数据量近 10B⁠。

近 5000 万元人民币的种子轮⁠,放在国内 AI 制药早期里算不上大数目⁠。真正有意思的是那个 10B的数据集⁠。多肽这个模态⁠,公开结构数据稀缺是写在每一行行业分析里的老共识⁠,一家成立不足三个月的公司把 10B 挂到自己名下⁠,但这 10B 里成功样本占多少⁠,失败样本占多少⁠,除了它自己⁠,谁有资格打开看一眼⁠。

多肽 AI 公司到底在卖什么

在评价任何一家之前⁠,先把尺子摆出来⁠。多肽 AI 这门生意⁠,能被外部检验的只有三样东西⁠。

第一条叫数据可复核性⁠。不是问数据有多少条⁠,而是问这批数据能不能被第三方用同一套方法重跑一遍⁠,或者至少说清它的构成比例⁠、采集条件和失败样本占比⁠。说不清构成的数据量⁠,是个宣传口径⁠,不是资产⁠。

第二条叫模型的规模效应⁠。真正在走 Scaling Law 的模型⁠,能力得随数据量⁠、参数规模⁠、算力投入线性往外长⁠,并且拿得出一条公开的曲线⁠。曲线拿不出来⁠,「遵循 Scaling Law⁠」就只是一句形容词⁠。

第三条叫闭环的产出口径⁠。72 小时走完设计与合成⁠,产出的是「能被合成的分子⁠」还是「能往临床推的分子⁠」,这是两个完全不同的分母⁠。拿前者去答后者的问题⁠,是整个行业最熟练的一种错位⁠。

这三条不是刁难⁠。我的判断是⁠,它们构成了这个赛道里少数几个能在会议室里当场问⁠、当场验的东西⁠。

三层护城河⁠,哪一层最难验

把利太智药公开的信息按这三条排一遍⁠,层次就出来了⁠。

层级
对外说法
外部可验性
数据层 PepUmi
自研闭源多肽合成数据集⁠,近 10B
最弱⁠:构成⁠、失败样本比例⁠、合成成功率均未披露
模型层 PepUni
等变 Transformer⁠,遵循 Scaling Law⁠,环肽亲和力达 nM 级
中等⁠:结合自由能等指标需公开基准才有对照
分子层 PepMirror
D 型氨基酸镜像肽⁠,稳定性数十倍⁠,部分靶点个位数 nM
偏弱⁠:稳定性数据未见第三方复现⁠,体内数据未披露

据中国经济新闻网的报道⁠,PepUni 生成环肽的亲和力确实到了 nM 级⁠,PepMirror 设计的 D 型肽稳定性是常规 L 型的数十倍⁠,部分靶点亲和力到个位数 nM⁠。这些数字单个看都很漂亮⁠,问题在于它们全部是自家平台上跑出来的自家结果⁠。一层比一层更难验⁠,这不是利太智药一个公司的问题⁠。

它恰恰是这个阶段 AI 制药的通用形态⁠:数据层最像护城河⁠,也最不可验⁠;分子层最不像护城河⁠,反而最接近可验⁠。

三类常见手法⁠:把哪一栏悄悄换成了另一栏

手法一⁠,用数据量顶替数据质量⁠。近 10B 是个很有冲击力的数字⁠,但多肽合成的失败样本从来不比成功样本少⁠,而失败样本恰恰是模型真正需要的东西⁠。一家公司如果只报总量不报失败比例⁠,那这 10B 里最有价值的一半可能根本没被收进去⁠。

手法二⁠,用亲和力顶替成药性⁠。有人把一张环肽亲和力表推到我面前⁠,KD 一栏排得很整齐⁠,个位数 nM 那几行还加了粗⁠。我问了一句⁠:这批分子在血浆里能活多久⁠。对面停了两秒⁠,说这个还没测⁠。结合得紧和能在体内存活足够久⁠,中间隔着一整个成药性工程⁠,不是同一个考卷上的题⁠。

手法三⁠,用闭环速度顶替验证深度⁠。据 VCBeat 的报道⁠,利太智药搭了一条 72 小时的生成到合成闭环⁠,覆盖设计⁠、化学合成⁠、生物测试与结构解析⁠,已在多个肿瘤与代谢相关靶点完成验证⁠。这条闭环解决的是「设计出来的东西能不能造出来⁠」,它验证的是工程能力⁠;它不回答「造出来的东西能不能成为药⁠」,那需要体内药效⁠、代谢稳定性和毒理数据⁠。72 小时这个速度值得尊重⁠,但别把它读成疗效信号⁠。

为什么这套说法现在好卖

不是谁在撒谎⁠,是环境在奖励这种表述⁠。

第一重是数据焦虑⁠。据 The Ledger Asia 10 月 7 日的报道⁠,Biohub 牵头的虚拟生物学计划把投入总额推到约 18 亿美元⁠,其中美国能源部在五年内投入超过 5 亿美元用于实验室测量⁠、建模与计算⁠;据科技日报报道⁠,AI 企业与生命科学公司正在把投入往数据生产⁠、实验测量这些上游环节延伸⁠。当整个行业都承认卡在数据上⁠,「我们有一批别人没有的数据⁠」就自动成了最有说服力的句子⁠。

第二重是政策窗口⁠。据《科创板日报⁠》报道⁠,工业和信息化部等十部门印发的《医药工业发展「十五五⁠」规划⁠》提出加快人工智能等新技术赋能药物研发⁠。政策把方向写死了⁠,资本就需要一批能装进这个方向的标的⁠。

第三重是人才溢价⁠。利太智药创始人贾寅君是 2026 年初发表于《科学⁠》的 DrugCLIP 研究的共一第一顺位作者⁠,据公开报道该研究可在 1 分钟内完成千亿规模分子的筛选⁠,速度较传统对接工具提升百万倍⁠;公司核心研发团队清北本博占比达 85%。种子轮定价里⁠,很大一部分买的是这条履历与这支队伍的预期产能⁠,不是任何一项已交付的资产⁠。

三重力量叠在一起⁠,形成一个正反馈⁠:怕错过的人抬高早期估值⁠,估值抬高又吸引更多团队复制同一套三层叙事⁠,而叙事被重复得越多⁠,数据越像护城河⁠。循环到最后⁠,没人再问那个最初的问题⁠。

识别工具⁠:三个问题⁠,好答案和坏答案

这套东西是可以问穿的⁠。把下面三个问题带进会议室⁠,答案质量立刻分层⁠。

问题
坏答案
好答案
这批数据里失败样本占多少
我们只保留高质量样本
失败样本占 X%,构成比例与采集条件可签 NDA 后开放核对
模型能力随数据怎么长
我们的架构业内领先
给出数据量与指标的两组对照点⁠,说明增长是否线性
闭环产出到哪一步算数
已经跑通全流程
明确到合成成功率⁠、体内暴露量⁠、候选化合物三个节点各几例

坏答案的共同点是换了一个更好听的指标⁠;好答案的共同点是给出了一个可以被下次会议复核的数⁠。我认为⁠,判断标准不在于对方讲得多专业⁠,在于他愿不愿意把自己的数字交给别人验一遍⁠。

谁可能活下来⁠:一个能证伪的时间窗

点名说判断⁠,不点名说态度⁠,都是耍滑头⁠。

利太智药这家公司⁠,按公开信息⁠,多条自研管线处于 HIT-to-lead 阶段⁠,预计 2027 年初产出具备成药潜力的候选化合物⁠。这是它给自己设的一个可证伪的锚⁠,我愿意按这个锚去等⁠。我不认为三个月时间足够把一批数据变成壁垒⁠,但我认可把「2027 年初出候选化合物⁠」这句话公开写出来的做法⁠,因为它给了外界一个能打分的日子⁠。它走「平台加管线⁠」双引擎⁠,短期靠模型授权⁠、API 服务与联合研发变现⁠,长期自己做肿瘤⁠、自身免疫⁠、代谢三个方向的管线⁠,这个结构在国内早期公司里是清醒的⁠。

放到同一时间窗里对照⁠,另两家的选择更极端⁠。据 WhiteLab Genomics 官网公告⁠,这家巴黎公司 10 月 6 日完成 2600 万美元 B 轮⁠,把钱直接压在体内验证上⁠,用 AI 设计的 AAV 去撞血脑屏障⁠;据 Brief 报道⁠,巴黎的 Rivercell 在 10 月 7 日带着 2200 万欧元种子轮出隐身⁠,钱花在自建数据生成平台上⁠。

三条路指向同一件事⁠:这个阶段真正稀缺的不是模型⁠,是可复核的湿实验产出⁠。方向性判断就一句⁠:数据生产型看多⁠,纯模型叙事型看空⁠。谁先把自家数据交出去被别人验一遍⁠,谁才配谈护城河⁠。

参考资料

  • 动脉网旗下 VCBeat⁠:关于利太智药种子轮与三层技术体系的独家报道(2026 年 10 月 10 日⁠)
  • 中国经济新闻网⁠:利太智药完成近 5000 万元人民币种子轮⁠,介绍 PepUmi⁠、PepUni⁠、PepMirror 三层体系(2026 年 10 月 10 日⁠)
  • 《科创板日报⁠》:利太智药种子轮融资与十五五规划⁠、AI 制药市场规模预测(2026 年 10 月 10 日⁠)
  • 科技日报⁠:AI 企业向生物学研究链条上游延伸⁠,虚拟细胞数据需求(2026 年 10 月 10 日⁠)
  • WhiteLab Genomics 官网新闻室⁠:2600 万美元 B 轮与 ALFRED 平台体内验证进展(2026 年 10 月 6 日⁠)
  • The Ledger Asia⁠:约 18 亿美元 AI 生物学联盟的资金构成(2026 年 10 月 7 日⁠)

相关学习资料