ARTICLE · 1093780
AI的核心用途,是扩大人类能够负担的搜索范围,以及降低可核验的认知工作的处理成本
“AI的核心用途,是扩大人类能够负担的搜索范围,以及降低可核验的认知工作的处理成本。”这句话有两个核心判断:面对过多的可能性,AI可以帮助确定先试什么;面对大量需要阅读、归纳和起草的任务,AI可以减少形成候选结果的劳动。二者都以检验为前提。生成速度、候选数量和文本流畅度本身不是成果。

图 1生成候选筛选优先级现实检验反馈再搜索
这个框架同时适用于科学研发、产品设计、软件开发和部分企业运营,但价值机制并不相同。科学问题常以实验发现和试错效率衡量,经营问题更需核算净收益,服务工作则必须同时关注质量与完成时间。把这些结果混为一谈,会让技术演示被误认为经济证明。
一搜索指什么
这里的“搜索”不是搜索引擎的检索,而是从许多可能的假设、设计和行动中,寻找值得继续投入资源的一小部分。候选空间可以是蛋白质序列、材料组合、软件实现方案,也可以是企业面对异常订单时的几种处置路径。人受注意力、实验能力和预算约束,无法穷尽所有组合。
AI可能改变两个成本。一是提出候选的成本:原本需要专家逐项构思的组合,可以较快形成待检验的列表。二是决定检验顺序的成本:模型根据已有数据估计哪些候选更有希望或更能提供新信息。但若排序失准,候选池越大,浪费的实验和审核也可能越多。
研究模型将创新视为在巨大组合空间中的有成本搜索,并分析何时更准确的AI预测会缩短探索时间、提高成功机会;结论依赖预测质量、试验成本等条件,而非候选数越多越好。
二从生成更多到发现更多
衡量探索效率,需要同时看候选覆盖面、命中率和检验能力。设一个周期生成N个候选,能够检验的数量为B,每个检验成本为C。即使生成成本接近零,当B受实验室、专家或生产试验能力限制时,实际获得证据的速度也不会无限增长。AI最重要的工作可能从“继续生成”转为“在B个名额中挑选最值得检验的候选”。
这里有一个关键区分:探索利用已有知识寻找高概率答案,可能较快取得改进;探索陌生区域更可能发现意料之外的方向,却面临更低成功率。若只以短期命中率奖励模型,它会偏向熟悉区域,可能压缩长期发现空间。科研团队因此还需保留一定比例的开放探索,不能把排序结果当成科学问题的最终裁判。
一个具体例子是蛋白质工程的SAMPLE系统。研究团队让智能体提出序列、自动化设备做实验,并将测量结果反馈给智能体。在该项针对糖苷水解酶热稳定性的研究中,四个智能体均找到更稳定的酶,搜索的范围少于所定义空间的2%。这证明了该研究设置中“提出—检验—更新”的效率,并不意味着AI已普遍解决开放科学发现。
三降低认知工作的处理成本
认知工作包括理解问题、找证据、归纳、比较、写作、判断以及对外沟通。AI最容易压缩的是准备阶段:读长材料、提取结构、起草初版、定位相似案例。正式完成任务还需要核对事实、修改结果、取得批准并承担后果。只比较“起草前后”而忽略后半段,通常会高估收益。
任务阶段 | AI可能节省的工作 | 不可遗漏的实际成本 |
理解输入 | 从多种格式抽取意图和限制 | 误读需求后重新沟通 |
形成候选 | 生成草稿、方案或代码 | 筛掉不适用、重复与错误内容 |
核对结果 | 提出引用与待核查项 | 独立查证事实、运行测试或请专家审核 |
投入使用 | 按指令准备提交材料 | 审批、集成、监控、回滚与责任 |
判断标准应是端到端成本:人力准备、AI使用、核验、返工和错误损失相加后,是否低于可信的替代办法。传统规则程序、模板或搜索工具已经能可靠完成的工作,通常不因加入语言模型就更便宜。
客服人员研究显示,生成式AI辅助使每小时解决的问题平均增加约14%,新手及技能较低员工收益更大。这说明某些经验能够通过工具更低成本地传递,但研究所测的是特定企业与岗位,不能推断所有认知劳动都将等比例变快。与此相对,针对资深开源开发者及2025年初工具的一项试验发现,使用AI的任务完成时间增加19%;这同样是特定人群与任务的结果,提醒我们同时计算复核和返工。
四两种能力如何相互加强
探索与降本可以形成循环:更便宜的初步分析,使企业愿意检查此前被忽略的问题;新的检查结果又成为下一轮筛选的依据。例如研发团队先用AI筛选材料,再用实验反馈修正模型;软件团队先生成几种实现,再用测试、代码审查与用户反馈淘汰不可用的版本。
但循环中存在两个瓶颈。其一是现实检验能力:实验设备、可信数据和审核人手未同步增加时,生成量上升只会堆积待检队列。其二是目标质量:如果只奖励生成数量或处理速度,系统可能把注意力转向容易完成、价值很低的任务。METR对AI任务收益的分析特别区分“旧任务节省时间”“新任务看似加速”和“最终价值增长”;三者不能互相替代。

图 2候选空间与验证成本共同决定AI任务的试点优先级
五为什么必须强调可核验
核验可以是程序测试、对账、重复实验、真实客户反馈,也可以是经定义的专家评审。它至少要回答三个问题:目标是否真正达到、结果是否可重复、错误被发现之前会造成什么损失。检验手段不必完全自动化,却要足够独立,避免模型自己给自己的输出打分后便宣告成功。
验证并非总是廉价。发现新药时,模型提出一个分子很快,真实试验可能耗时多年;战略建议的正确性,也可能要在市场变化后才显现。因此“越未知越适合AI”只说对了一半:未知领域有更大的潜在价值,也可能有更难的验证、稀薄的数据和更高的失败成本。
一项咨询工作实验观察到,在所测试的一组适合AI的任务上,受试者完成得更快、质量更高;在另一个超出模型能力边界的复杂任务中,AI辅助组作出正确建议的比例反而较低。这说明模型参与后,人的主观信心未必能代替客观核验。
NIST将编造或虚构信息列为生成式AI需要管理的风险。对于医疗、法律、财务或关键运营任务,核验范围、权限和责任必须随错误代价而提高。
六何时值得用AI何时应放弃
任务特征 | 优先判断 | 价值证据 |
候选很多实验可做 | 尝试AI辅助排序与设计下一轮实验 | 在相同试验预算下更快找到有效候选 |
文本量大答案能核对 | 尝试AI处理初稿和整理工作 | 总耗时下降且错误率不升高 |
规则清楚数据标准 | 先用数据库 规则引擎或传统自动化 | AI须证明胜过更简单的替代方案 |
难以验证错误代价高 | 缩小为低风险的辅助环节 | 审核覆盖率和错误损失可接受 |
有两种常见错觉需要排除。第一,AI生成十份方案,实际只增加了九份审核任务;第二,员工用AI多做了原本没有必要做的工作,活动量上升却没有增加客户收益。AI实施前应写清“谁会因结果受益”和“怎样观察这一变化”,随后用对照组、历史基线或预先定义的验收标准核对。
七对组织和知识生产的更深影响
如果形成可靠的反馈回路,AI改变的不只是个人工作速度,还可能改变组织分配稀缺专家时间的方式。专家从大量重复的初步准备中抽身,转而定义问题、检查关键证据、设计实验和处理反常结果。研究也强调AI对科学工作的收益依赖技能与组织安排等配套条件,不能由模型能力单独推出。
更长远的变化可能是“以前做不起的事情”成为日常工作:更多候选方案进入小规模测试,更多过去没人整理的记录得到初步检查,更多小样本问题获得研究机会。但这些新活动未必天然有价值;组织需要舍弃低收益探索,保护多样化尝试,并记录失败提供了什么信息。
据此,战略问题从“部署多少AI功能”转向“提高哪条发现或交付链路的有效产出”。投入更多生成能力的同时,要建设实验、评估、数据记录与反馈能力。若检验能力长期不足,算力和生成量增加可能只会放大待核实内容的积压。这是基于搜索与核验约束作出的推论,而非所有组织都会出现的既定趋势。
结论
这句话的价值不在于宣布AI能替代思考,而在于指出两类可以验证的经济变化:以固定预算发现更好的候选结果,或以更低的总成本完成同等质量的认知任务。前者靠高质量筛选与实验反馈,后者靠端到端成本和质量测量。只有生成、检验、反馈连成闭环,AI扩大搜索范围和降低处理成本才可能转化为知识、产品或经营收益。