ARTICLE · 1077389
AI应用全球搜|AI能批量提出新发现,为什么验证能力反而更稀缺?

9月23日,Anthropic公布了一项早期生命科学研究:Claude从公开DNA数据库中寻找候选系统,人类科学家再做实验验证,最终发现一种此前未被表征、带有类似CRISPR重复结构的酶系统。
官方披露的流程用了大约21小时、约950个并行智能体和2.1亿token,从二十多万个逆转录酶相关数据出发,逐步收敛到少量候选。真正的实验室工作仍由人类完成,大多数候选也在验证中被排除。
一、这不是“AI独立完成科学发现”
更准确的说法是:AI扩大了搜索、异常发现和候选报告的规模,人类负责判断、实验与确认。被发现系统的具体功能目前仍不清楚,研究也还在继续。
所以这里最值得关注的,不是把模型写成科学家的替代者,而是一个新的应用结构:当提出假设变得极快,验证能力会不会成为真正的瓶颈?
二、Mike 认同什么,又保留什么?
我认同AI可以把原来昂贵的搜索和初筛变成并行工作:先复现已知结果,再找异常,最后形成带证据的候选报告。这种结构不只适用于科研,也适用于运营排查、产品实验和流程优化。
但我保留两点。第一,这是技术提供方公布的早期结果,不能直接外推成“AI已经普遍具备自主发现能力”。第二,候选数量增加,并没有取消实验、反证和人工负责,反而让验证预算更重要。
三、应用者的认知要变:答案多,不等于进展快
过去我们担心没有想法;以后更常见的问题可能是候选太多。模型可以一次给出几十种解释和方案,但团队的时间、数据、实验环境和风险承受力没有同步增长。
因此,应用能力要从“会让AI生成”升级为“会给验证排序”:哪一个候选最值得先试,什么证据足以继续,看到什么信号就停止,谁对结论负责。
四、边界在哪里?
这项工作目前是早期研究,相关预印本与功能解释仍待继续验证。它证明了一个值得跟踪的工作流,不等于证明所有行业都能按同样成本复制,更不等于模型输出可以跳过专业审查。
五、30分钟最小行动
从你今天收到的一条AI建议中,只选一个候选,做四栏卡片:支持证据、反对证据、验证成本、继续或停止的标准。不要再生成更多答案,先把一个候选送进可执行的验证链。
同一条链上的下一个问题是:当AI每天都能产生大量候选时,团队应该由谁、依据什么规则来分配验证预算?
参考来源:Anthropic|Claude discovers novel enzyme system