乐于分享
好东西不私藏

AI“效率幻觉”实锤:预期省下55.7秒,实测只省7.5秒,2691人实验撕开一个残酷真相

AI“效率幻觉”实锤:预期省下55.7秒,实测只省7.5秒,2691人实验撕开一个残酷真相

如果你现在伸手就能把一道两位数加法丢给AI,你会丢吗?

斯坦福、MIT、纽约大学和普林斯顿的学者们把这个问题做成了实验他们找来两千多人,出了一堆简单到五分钟内必能完成的小任务,算个加减、查个拼写、回忆个常识,然后安静地坐在一边掐表

结果出来那一刻,连研究者自己都觉得讽刺:人们以为自己从AI那里偷回了一分钟,表盘上实际到账的,只有七秒半。

55.7秒的预期节省,7.5秒的真实节省。 这就是那篇五月下旬提交到arXiv的论文《The efficiency-gain illusion》(效率收益错觉)里最扎眼的一组数字。科技博主的概括则更简洁:AI可以让你“感觉”更高效,即使实际收益很小。

这不仅仅是关于效率的故事这是一个关于我们如何悄悄弄丢对自己大脑的判断力的故事。

你比自己以为的,更爱点开那个对话框

论文的研究方法很干净24项任务,覆盖信息查找、信息加工、程序执行、内容创作四类,全是认知上的“小菜”。参与者被分成两拨:一拨预测自己在哪些题上会用AI,另一拨真实地做这些题,随手可以用GPT-4o。

裂痕在两个数字之间撕开:

人们预测自己会在约33%的任务上用AI。人们实际在约47%的任务上用了AI。

简单题尤其暴露了偏差那些容易的变体,比如“黑加白是什么颜色”“27+56等于几”,预测使用率只有约两成,实际使用率接近四成在最极端的几道题上,几乎没人预测自己会碰AI(平均预测率约2.3%),但真实完成组里,有21%到54%的人还是把问题打进了对话框。

▲ 科技博主Rohan Paul用通俗措辞转述了这项研究:AI依赖会从错误的便利感中生长

问题出在我们对自身行为的判断上人们常把自己想成理性的工具使用者,只在“值得”的时候才调用AI,手却往往先于判断行动。

而且,用AI的人并没有变得更快或更轻松独立完成者的主观心力评分甚至更低,自己做反而更不费脑子。用AI的人花时间写提示、等回复、读答案、核对能不能信、决定要不要改。努力没有被消除,只是被重新包装成了“带进度条的拖延”。

用过两次之后,身体会自己伸手

研究三把这种偏差推到了更明显的位置。

参与者先被随机分配去“暴露体验”:要么用AI做完两项任务,要么独立完成。然后进入测试阶段,在两项容易的任务上自由选择要不要用AI。

结果非常干净利落:

暴露阶段用过AI的人,后续继续选AI的比例是44.5%;独立完成的人,后续选AI的比例只有27.7%。

只要用过两次,下一次就更想再点开即便自己动手明明更快 另一个发现同样令人不安:亲手独立做一遍,并不能阻止人们继续依赖AI。 “做一遍便会察觉自己更快”的纠偏并未出现。

作者把这个叫延续效应(carryover),也可理解为“过度依赖的反馈环”用一次,信念就偏一点;信念偏了,下一次就更倾向用;越用,越不认同“这些破事我自己做其实更快”。人的判断就在这样的循环中悄悄偏移。

▲ 一位网友的回复被广泛转发:“55.7秒和7.5秒的落差,痛得熟悉。有时问AI只是带进度条的拖延。”

评论区里最高赞的辩护,来自一位叫David Boyle的用户。他承认自己有一类任务用AI并不更快,但“等待AI草稿的那一分钟,我可以看看窗外、喘口气、摸摸草”。他把这种选择解释为短暂休息和减轻心智负担,体验会更好、更开心。

▲ David Boyle的辩护贴:承认不更快,但主张“更好、更开心”

这话听起来很温柔,但它在逻辑上恰好坐实了论文的核心判断:人们追求的或许是情绪上的轻松效率收益错觉因此多了一层解释:把活外包出去会带来喘息感,代价则是越来越难判断何时亲手完成更快。

更吓人的版本:资深开发者也会判断失准

你可能会说:这不过是众包平台上的算术题,拿来吓唬谁呢?现实里的人又不会拿AI做两位数加法。

那就看看METR在2025年公布的那项随机对照试验。对象是16名长期给百万行级开源仓库贡献代码的资深开发者,任务是从246个真实issue里随机分配的缺陷修复、功能开发和重构。一组允许用AI工具(前沿模型组合),一组禁用。

结果出来,整个圈子都安静了一秒

允许用AI的那一组,完成时间反而长了约19%。

信念层面的数据更加离奇开发者们事前预期AI能让自己快约24%。做完之后,他们明明亲身经历了减速,却仍然相信AI让自己快了约20%。现实向右,信念向左,中间隔着一条深不见底的沟。

这项2025年的历史结果说明,高技能、真实代码库、两小时级任务里同样可能出现效率收益错觉。METR已注明该结果不代表更新模型的当前影响,因此它适合用来说明信念与测量之间的偏差,不宜外推成对所有编程AI的定论。

等等,那客服+14%又是怎么回事?

现在必须给故事加一个急转弯,否则你会以为AI就是个昂贵的安慰剂。

同样是做实验,Brynjolfsson等人在一家大型企业的客服中心部署生成式AI助手后,发现按小时解决工单数计算的生产率平均提升了约14%,而且新手和低技能坐席的提升幅度高达34%到35%这组结果来自实际工单记录

问题来了:为什么客服场景真金白银提速,简单算术题场景反而翻车?

答案藏在任务结构客服坐席面对的是源源不断、格式相对稳定的真实诉求,AI助手嵌入的是已经被组织设计好的工作流,工具适配任务而论文里的参与者面对的是本可独立秒杀的小事,AI的介入反而塞进了一整套界面摩擦:读题、写提示、等回复、核对、判断要不要重试。你原本没有这些环节

问题落在了“什么时候该用AI”的元认知判断上,而人类在这件事上正暴露出系统性的偏差。

96%高管乐观,77%员工说更累了

把镜头再拉远一点,你会看到一道更大的裂缝。

Upwork在2024年对约2500名高管和员工的调查显示:96%的C级高管相信AI会带来效率提升;与此同时,77%的使用AI的员工说工具以至少一种方式增加了他们的工作量。约47%的人直言:不知道该怎么实现老板期待的那种效率。多出来的活包括:花更多时间审核AI生成的垃圾、学新工具、以及因为“AI很快”所以被塞进来更多任务。

▲ mike cook引用的Upwork研究:高管与员工之间巨大的认知温差

这不就是效率收益错觉的组织层复刻版吗?上面的人以为工具已经买了、效率已经在了;下面的人发现每个小时多出了37分钟自证、核对和返工。省下来的7.5秒,被用去开了一个关于“如何用AI提效”的会。

而如果把视角拉到宏观经济尺度,故事会变得更加阴森。诺贝尔奖得主Robert Solow在1987年留下的那句话,今天听来依然锋利:“计算机时代随处可见,唯独不在生产率统计里。” 四十年后,生成式AI正在走进同一条河。

Stripe Economics的Ernie Tedeschi分析道:微观实验越来越多地显示实际收益,但宏观全要素生产率并没有同步加速。一种解释是,AI加速了内环里那些有界任务,却松不开外环里卡住最终产出的下游约束。代码提交量上去了,评审、集成、测试、发布和用户采用还堵在人手里。你用AI把一段文案改写快了40秒,然后花三分钟在工作群里和同事对齐“到底用哪版”。

所以,那个7.5秒的真相,其实是一个三层俄罗斯套娃

  1. 个人层
    :你高估了AI帮你省下的时间,低估了自己使用它的频率。
  2. 组织层
    :高管高估了工具购买力,员工承担了隐形负荷。
  3. 宏观层
    :微观加速被下游瓶颈吞掉,统计数字纹丝不动。

每一层都在自我安慰,每一层都在把代价往下传。

一次元认知警报

这项研究并未宣告“AI没用”它引用了客服场景的实际收益,也引用了写作和咨询任务的加速证据。它指向另一件事:你对“自己什么时候该用AI”的判断,正在被静默地重新编程。

用过两次简单任务,你就会更想继续用。经历过一次减速,你依然相信自己在加速。亲手做过一遍,你依然不会改信念不接触地面,它悬浮在“感觉”里,像一只漂亮的仓鼠轮,转得很完美,哪儿也没去。

▲ 评论区里最狠的一句:“仓鼠轮转得很漂亮,却哪儿也去不了。”

下一次,当你想把一道两位数加法、一个拼写检查、一句短句改写丢进对话框时,先做一件事:

看一眼表

就看一眼表试着估算:写下需求、等待回复、读完、检查、决定改不改,这条链加起来,是否比自己上手更快。然后允许自己得出一个答案:这件事,我的大脑就是那个更快的工具。

那一刻,你在保住一个逐渐稀缺的能力:判断自己何时无需借助它。

这个能力,比那7.5秒值钱得多