乐于分享
好东西不私藏

AI一周5篇:数据vs算力,谁说了算?

AI一周5篇:数据vs算力,谁说了算?
 

AI for Science · 一周综述(8月3日–8月7日)

 

本周主线

 

本周5篇论文横跨虚拟细胞、AI制药、器官芯片、单细胞基础模型、AI病理五个方向,却指向同一个词:效率。复制数据不如跨环境迁移、加预算不如加个离线向导、逐张标注不如读CAD图纸、盲目堆算力不如先看缩放定律——AI for Science 正在从「大力出奇迹」转向「巧干出成果」。

先抛一个本周最有火药味的问题:单细胞AI到底该多喂数据,还是该多堆算力?过去半年,至少6篇论文为此争论,其中3篇报告「数据加再多也没用」。本周夏威夷大学团队用一张GPU给出反直觉的答案——缩放定律不仅存在,还能精确预测。而这场「数据vs算力」之争,只是本周五个方向的一个缩影。

周一|虚拟细胞:复制数据,不如跨环境迁移?

单细胞扰动图谱有个尴尬现实:同一个基因敲除,常常只在部分细胞环境里测过,在你最关心的环境里恰好缺失。PerturbMap 提出「可信度加权的响应迁移」——把别处测到的响应搬到目标环境,但只采纳被验证可靠的路线。在黑色素瘤 Perturb-CITE-seq 数据(10.9万细胞、200个扰动身份隔离评估)上,预测误差降低4.1%,伤害率仅19.5%,而直接照搬数据的做法伤害率高达49.5%。

图1|PerturbMap流程:本地基线 + 多路线迁移 + 可信度加权融合(arXiv:2607.28090)

周二|AI制药:不加预算,也能8/8全胜

药物分子优化里,AI常「只见终点、不见过程」:奖励要等整条分子生成完才揭晓,模型却要一步一token做决定。Q-Steer 在采样时引入一个离线训练的动作价值打分器,不改任何优化算法、不加在线评估预算,就让8种「模型×优化器」组合的平均得分全部提升(1104次实验,任务级获胜率超八成)。代价也诚实:分子多样性下降——它更像冲刺型选手,而非探索型选手。

图2|Q-Steer方法示意:基线优化器只在终点收到打分,Q-Steer在每一步引导token选择(arXiv:2607.26391)

周三|器官芯片:AI不靠标注,靠「读图纸」

高吞吐微流控活细胞成像的痛点不是算法不够强,而是「找培养区」「清背景」太耗人力。德国团队提出 DART 范式:芯片设计阶段就嵌入十字+圆圈定位标记,AI只需认出标记、把CAD蓝图与实物对齐,上千个培养区自动定位、图像自动剔除微流控结构、单细胞自动分割,全程无需逐张标注。在集成8种培养腔的「瑞士军刀芯片」上,1700+张图31分钟处理完、识别超50万个细胞,图像处理速度首次快过显微镜拍摄速度。

图3|DART范式总览:把CAD蓝图与实物芯片对齐,让图像分析自带结构知识(arXiv:2606.18523)

周四|基础模型:单细胞也有缩放定律

夏威夷大学团队首次为单细胞Transformer拟合出双指数缩放定律:5种模型规模(131万–8390万参数)×多种数据预算(3810万–3.62亿细胞)共22个组合,全部实验仅在一张H100上完成。对从未训练过的规模组合,预测误差小于0.5%。定律给出的算力最优分配「偏向数据」:算力翻倍时,约六成应投给更多细胞、四成投给更大模型——回应了「多样性优先于规模」派的平台期结论:那些实验大多把容量瓶颈误读成了数据无用。

图4|首个单细胞双指数缩放定律:等高线为损失曲面,实线是计算最优前沿(arXiv:2608.02961)

周五|AI病理:热图当「实验地图」

三阴性乳腺癌的复发预测,AI不仅能给出风险评分,还能画出肿瘤内部的「风险地图」。团队以AI风险热图为坐标,用激光把高危、低危区域切下来做空间蛋白质组学,发现高危区富集细胞增殖程序、低危区富集免疫激活程序——AI的「直觉」第一次有了可验证的分子落点。把分子特征与影像评分结合,复发预测C-index从0.68提升到0.74,并在METABRIC队列(261例)外部验证。AI病理从「预测」走向「解释」。

图5|整体框架:病理切片→逐块风险打分→风险热图→患者级复发预测(arXiv:2608.03145)

一张表看懂本周5篇

日期方向方法一句话亮点
周一虚拟细胞PerturbMap跨环境迁移,误差降4.1%、伤害率19.5%
周二AI制药Q-Steer离线向导引导采样,8/8组合提升
周三器官芯片DARTAI读CAD图纸,处理速度赶上拍摄速度
周四基础模型双指数缩放定律算力翻倍,约六成投数据、四成投模型
周五AI病理风险热图+空间蛋白组高危区=增殖、低危区=免疫,C-index 0.68→0.74

写在最后

把本周5篇连起来看,一个信号非常清晰:AI for Science 的竞争点正在从「模型多大、数据多海」转向「信息怎么用」。迁移比复制聪明、引导比蛮力聪明、图纸比标注聪明、定律比直觉聪明、热图比盲切聪明——效率成为新的护城河。

但也要泼一盆冷水:PerturbMap 的迁移依赖环境间可迁移性假设,Q-Steer 以牺牲多样性为代价,DART 验证以细菌为主、哺乳动物细胞尚待检验,缩放定律只对预训练损失成立、下游任务未验证,TNBC 的空间蛋白质组学仅2例患者的46个区域。五篇论文的样本量与验证范围,都还配不上它们的野心——这正是这个领域最诚实的现状:方向对了,路还长。

 

规模与多样性之争、数据与算力之争,答案或许从来不是二选一:规模决定容量上限,多样性决定泛化下限;数据决定知识广度,算力决定压缩深度——缺一不可。

觉得有用?转发给实验室的同学,一起跟进AI for Science前沿。


— END —

组织工程研究前沿
聚焦 AI for Science · 关注我们,每周六回顾本周前沿