乐于分享
好东西不私藏

AI把人类变成了"效率韭菜":预期省时55.7秒,实测只省7.5秒!开发者集体慢19%却坚称自己快20%,实验结果被2691人钉死

AI把人类变成了"效率韭菜":预期省时55.7秒,实测只省7.5秒!开发者集体慢19%却坚称自己快20%,实验结果被2691人钉死

你的AI助手可能是个时间小偷,而且它偷走时间的方式,是让你心甘情愿地觉得自己赚了。这大概是过去一年里,关于人工智能最反直觉、也最让人不安的一个发现。

想象一下这个场景:你坐在电脑前,面对一道30秒就能心算出来的算术题。你的手指却像条件反射一样,打开了ChatGPT。提示词打进去,等三秒,答案弹出来,核对一遍,复制粘贴。你觉得自己高效极了

秒表说:你比直接自己做,还慢了10秒。

这组结论来自斯坦福、纽约大学、MIT和普林斯顿的七位研究者。他们用2691名受试者、三项预注册实验,一秒钟一秒钟量出了差距。那篇名为《效率收益幻觉》的论文已经在arXiv公开。

而这还只是冰山最尖的那一角

▲ 科技博主Rohan Paul的长帖概括了论文的一个判断:依赖可能源于便利错觉,与真实生产率无关

55.7秒的幻觉:你的大脑是怎么被AI"骗"的

研究者干了一件非常"残忍"的事他们找来一帮人,先问:你觉得用AI做这道题能省多少时间?

平均答案:55.7秒人们信心满满

然后他们真的让另一拨人做了这些题,一组可以用AI,一组只能自己干。结果让人大跌眼镜:用AI的人实际只省了7.5秒预期收益是实际收益的7.4倍

注意,这还算是"省了"的情况在那些被归类为"简单变体"的任务上,比如查个单词拼写、算个两位数加法,AI协助组平均比独立完成组慢了整整10秒因为写提示词这个动作本身,平均就要花48.7秒。

读、处理AI返回的答案?平均37.6秒。

写提示词比读答案还费时间而41%的提示词,不过是把题目说明直接复制粘贴进对话框。研究者冷冷地写道:"复制粘贴提示所花的时间,已经超过了自己动手做题。"

但没人觉得自己被坑了用AI的人报告的主观心力负荷更低,感觉更轻松。你的努力没有被外包,它只是被重新包装成了"打字、等待、核对",然后你的大脑给这个新包装贴了个标签:"省事"。

▲ 有评论者一针见血:当AI从"显式写提示"变成环境化建议,摩擦趋近于零,幻觉只会更强,因为使用成本再也感觉不到了

开发者慢了19%,却集体坚称自己快了20%

如果你觉得"普通人做算术被AI骗了"还不够刺激,那我们来聊聊专家程序员被AI骗得更惨这件事。

2025年7月,非营利评估组织METR拉来了16名有经验的开发者,都是长期给数万星标、百万行代码的开源大仓库做贡献的老手。他们在真实开发任务上做了随机对照试验:有些任务允许用AI,有些不行。秒表架好,开始

结果:用了AI的任务,完成时间平均慢了19%。

另外三组数字更惊悚开赛前,开发者们预测AI能让自己加速24%干完活,他们依然坚称自己快了20%而墙上挂着的秒表,全程冷冷地记着:-19%。

感知与现实的误差,高达40个百分点。

他们其实没有撒谎因为AI接管了最烧脑的部分,主动编码和搜索信息的比重下降了,时间被重新填进了提示、等待、审阅模型输出。你以为自己在"开车",AI让你变成了"监工"。而在极熟的代码库里,这帮高手本来的速度,AI根本挤不出多少空间。

▲ METR的官方研究页面,带着一条醒目的黄色警告:"结果已过时,见后续更新。"那个-19%的数字已经在技术社区被反复引用

96%的高管在欢呼,77%的员工在加班

如果说个人被AI"感知欺骗"是一场心理实验,那它被放进公司里,就变成了一场无人踩刹车的加速游戏。

Upwork研究院的数据冷酷到了荒诞的程度:96%的C级高管相信AI会提升公司生产率,与此同时,77%的用AI的员工报告说工作量不降反增。39%的人把时间耗在了审核AI生成的内容上,23%在学怎么用工具,21%的人表示"因为AI,我被要求做更多工作"。

领导者看见的是上升曲线,执行层体验的是深夜的提示词输入框。

▲ Upwork的一手新闻稿:标题直指"员工工作量仍在上升"这个被增长故事淹没的事实

伯克利的研究团队在一家科技公司里蹲了八个月,观察到的东西更有灵魂:员工在午餐时间发提示词,在开会前发提示词,在深夜发提示词。*AI让一切感觉更快,于是人们用省下的每一秒缝隙,填进更多任务。*83%的人说AI增加了自己的工作量。研究者给了它一个名字:workload creep,工作量蠕变。

它是合法的、自愿的、甚至是令人兴奋的。它长着一张"我很高效"的脸,直到某天你发现,整个团队都在以没有人正式宣布过的新速度运转。

客服场景涨了14%:提效是真的,但它是道边界题

我们得说句公道话:AI提效并不全是幻觉。斯坦福的Brynjolfsson和MIT的团队在呼叫中心做的一项经典研究发现,接入AI助手之后,客服每小时解决工单数确实涨了14%,新手的改善幅度甚至接近34%。

差别在哪?任务结构客服对话是脚本化的、可示范的、有标准答案的。而"为一道简单算术打开聊天窗",或者"在自己写了五年的代码库里让AI来补一行",是另一个极端。

MIT Sloan对制造业AI采用的研究则画出了一条更完整的曲线:短期先掉效,长期才回升。J曲线工具先到,配套的数据、流程、组织设计后到。在这个空档期里,账面上的损失是真的,人的不适是真的,但它们会被"我们正在AI化"的口号盖过去。

所以,别急着把AI钉上审判台,也别急着把它捧上神坛。问题在于谁在什么任务上用它,以及那个"用了就更快"的感觉,有没有被任何一块秒表验证过。

▲ 那篇源头论文的arXiv页面:N=2691,三类预注册实验,把"感觉"和"实测"的裂缝量到了小数点

为什么我们集体算错了这笔账?

最让研究者警觉的发现,藏在第三个实验里。

他们让一部分人先"暴露"给AI完成两道题,然后测后续的AI使用意愿。结果用过AI的人,后续选择AI的比例是44.5%,远高于独立完成者的27.7%。而且,用过AI的人更不相信"自己独立做其实更快"

幻觉在自我加固,使用行为在自我训练,错误的信念变得比秒表更可信。

这指向一个更深的洞:我们会给AI的收益算账,但很少算学习成本与机会成本

第一,时间预测依赖你的经验库你对"自己花多久写好一段代码"有充分的记忆,但对"让AI改到能过审要来回几轮"缺乏体感。AI的隐性成本,藏在那些你从未认真计时的环节里。

第二,轻松感会扭曲时间感和AI协作时,你是"验收者",多巴胺来自"看,这活帮我干了"的快感。快乐的十分钟,在记忆里比痛苦的六分钟更短。

第三,组织里没有任何人会为"你没用AI"鼓掌。当AI使用率成为部门汇报的数字,理性的选择可能是:用AI,哪怕它更慢。因为至少看起来你对得起公司交的订阅费。

一位读者的评论像刀子一样扎中了这件事的本质:"很多时候,问AI不过是带进度条的拖延。"

下次在打开聊天窗之前

那篇论文的研究者把干预点指向一个出人意料的词:信念校准他们给出的办法并非"少用点AI",而是让你对自己的速度判断回到地里。

一个具体的小练习:下次想打开AI之前,先自己默默估计一下,"这个活我自己做要多久,用AI实际会多久"。然后真的两个都试一次

大概率,你会被自己的误判吓一跳55.7秒和7.5秒之间的距离,踩中过每一个敲击键盘的我们。

AI不会停,工具会继续进化,界面摩擦会继续下降,大模型会越来越强。但那个"我到底有没有真的变快"的问题,会越来越响亮地悬在每个人的头顶上。

没有谁来替你校准秒表不会说谎,但买秒表的人得是你自己。