AI for Science · 一周综述(8月3日–8月7日)
本周主线
本周5篇论文横跨虚拟细胞、AI制药、器官芯片、单细胞基础模型、AI病理五个方向,却指向同一个词:效率。复制数据不如跨环境迁移、加预算不如加个离线向导、逐张标注不如读CAD图纸、盲目堆算力不如先看缩放定律——AI for Science 正在从「大力出奇迹」转向「巧干出成果」。
先抛一个本周最有火药味的问题:单细胞AI到底该多喂数据,还是该多堆算力?过去半年,至少6篇论文为此争论,其中3篇报告「数据加再多也没用」。本周夏威夷大学团队用一张GPU给出反直觉的答案——缩放定律不仅存在,还能精确预测。而这场「数据vs算力」之争,只是本周五个方向的一个缩影。
周一|虚拟细胞:复制数据,不如跨环境迁移?
单细胞扰动图谱有个尴尬现实:同一个基因敲除,常常只在部分细胞环境里测过,在你最关心的环境里恰好缺失。PerturbMap 提出「可信度加权的响应迁移」——把别处测到的响应搬到目标环境,但只采纳被验证可靠的路线。在黑色素瘤 Perturb-CITE-seq 数据(10.9万细胞、200个扰动身份隔离评估)上,预测误差降低4.1%,伤害率仅19.5%,而直接照搬数据的做法伤害率高达49.5%。

图1|PerturbMap流程:本地基线 + 多路线迁移 + 可信度加权融合(arXiv:2607.28090)
周二|AI制药:不加预算,也能8/8全胜
药物分子优化里,AI常「只见终点、不见过程」:奖励要等整条分子生成完才揭晓,模型却要一步一token做决定。Q-Steer 在采样时引入一个离线训练的动作价值打分器,不改任何优化算法、不加在线评估预算,就让8种「模型×优化器」组合的平均得分全部提升(1104次实验,任务级获胜率超八成)。代价也诚实:分子多样性下降——它更像冲刺型选手,而非探索型选手。

图2|Q-Steer方法示意:基线优化器只在终点收到打分,Q-Steer在每一步引导token选择(arXiv:2607.26391)
周三|器官芯片:AI不靠标注,靠「读图纸」
高吞吐微流控活细胞成像的痛点不是算法不够强,而是「找培养区」「清背景」太耗人力。德国团队提出 DART 范式:芯片设计阶段就嵌入十字+圆圈定位标记,AI只需认出标记、把CAD蓝图与实物对齐,上千个培养区自动定位、图像自动剔除微流控结构、单细胞自动分割,全程无需逐张标注。在集成8种培养腔的「瑞士军刀芯片」上,1700+张图31分钟处理完、识别超50万个细胞,图像处理速度首次快过显微镜拍摄速度。

图3|DART范式总览:把CAD蓝图与实物芯片对齐,让图像分析自带结构知识(arXiv:2606.18523)
周四|基础模型:单细胞也有缩放定律
夏威夷大学团队首次为单细胞Transformer拟合出双指数缩放定律:5种模型规模(131万–8390万参数)×多种数据预算(3810万–3.62亿细胞)共22个组合,全部实验仅在一张H100上完成。对从未训练过的规模组合,预测误差小于0.5%。定律给出的算力最优分配「偏向数据」:算力翻倍时,约六成应投给更多细胞、四成投给更大模型——回应了「多样性优先于规模」派的平台期结论:那些实验大多把容量瓶颈误读成了数据无用。

图4|首个单细胞双指数缩放定律:等高线为损失曲面,实线是计算最优前沿(arXiv:2608.02961)
周五|AI病理:热图当「实验地图」
三阴性乳腺癌的复发预测,AI不仅能给出风险评分,还能画出肿瘤内部的「风险地图」。团队以AI风险热图为坐标,用激光把高危、低危区域切下来做空间蛋白质组学,发现高危区富集细胞增殖程序、低危区富集免疫激活程序——AI的「直觉」第一次有了可验证的分子落点。把分子特征与影像评分结合,复发预测C-index从0.68提升到0.74,并在METABRIC队列(261例)外部验证。AI病理从「预测」走向「解释」。

图5|整体框架:病理切片→逐块风险打分→风险热图→患者级复发预测(arXiv:2608.03145)
一张表看懂本周5篇
| 日期 | 方向 | 方法 | 一句话亮点 |
|---|---|---|---|
| 周一 | 虚拟细胞 | PerturbMap | 跨环境迁移,误差降4.1%、伤害率19.5% |
| 周二 | AI制药 | Q-Steer | 离线向导引导采样,8/8组合提升 |
| 周三 | 器官芯片 | DART | AI读CAD图纸,处理速度赶上拍摄速度 |
| 周四 | 基础模型 | 双指数缩放定律 | 算力翻倍,约六成投数据、四成投模型 |
| 周五 | AI病理 | 风险热图+空间蛋白组 | 高危区=增殖、低危区=免疫,C-index 0.68→0.74 |
写在最后
把本周5篇连起来看,一个信号非常清晰:AI for Science 的竞争点正在从「模型多大、数据多海」转向「信息怎么用」。迁移比复制聪明、引导比蛮力聪明、图纸比标注聪明、定律比直觉聪明、热图比盲切聪明——效率成为新的护城河。
但也要泼一盆冷水:PerturbMap 的迁移依赖环境间可迁移性假设,Q-Steer 以牺牲多样性为代价,DART 验证以细菌为主、哺乳动物细胞尚待检验,缩放定律只对预训练损失成立、下游任务未验证,TNBC 的空间蛋白质组学仅2例患者的46个区域。五篇论文的样本量与验证范围,都还配不上它们的野心——这正是这个领域最诚实的现状:方向对了,路还长。
规模与多样性之争、数据与算力之争,答案或许从来不是二选一:规模决定容量上限,多样性决定泛化下限;数据决定知识广度,算力决定压缩深度——缺一不可。
觉得有用?转发给实验室的同学,一起跟进AI for Science前沿。
— END —
组织工程研究前沿
聚焦 AI for Science · 关注我们,每周六回顾本周前沿
夜雨聆风