

你正在心甘情愿地为一个“带进度条的自我欺骗”打工。
问你一个要命的问题:当AI号称帮你省下55秒时,秒表最终记下了多少?
2026年5月,一篇来自斯坦福、纽约大学、MIT与普林斯顿AI Lab的预印本给出了一个几乎羞辱性的数字:7.5秒。
秒表给出的答案是7.5秒,远低于预期的55.7秒,缩水了八倍有余。
更早之前,非营利评估组织METR对16名资深开源开发者做了一场随机对照试验。这些人在数万星标、百万行代码级的真实大仓库里完成了246个任务,结果呢?
他们以为自己快了20%实际上,慢了19%
| 慢19% | |
这些数字指向一场系统性的人类感知失灵,却不能简单推导出“AI没有用”。类似的偏差正被一场接一场的实验记录下来。

▲ Rohan Paul的长帖概括了论文的核心发现:AI可以让你“感觉”自己更高效,即使实际效率并没有提高多少。
一场“秒级任务”里的集体错觉
这篇论文有个近乎残酷的精巧设计研究者绕开写长文之类的复杂场景,把问题收窄到日常任务:
当任务本身简单到五分钟就能独立完成时,你还会不会打开那个聊天框?
研究者招募了约2691名美国成年人,构造了24道覆盖信息检索、信息加工、流程指引和内容创作的任务,每一道都偏简单,比如“说出一位奥运奖牌得主”,或者“说出一百米短跑世界纪录的大致范围”。
然后,他们开始计时
结果出现了两种互相咬合的幻觉:
第一,加速幻觉 人们预测自己用AI能省下平均55.7秒,但实际只省了7.5秒。人们对“自己独立做要多久”的估计大体准确,预测约99秒,实际约93.7秒。误差几乎都出在他们想象AI速度的环节。
他们对自己的估计尚算准确,却对那个对话框寄予了过高期待。
第二,卸载幻觉 人们准确预测了“用AI时确实不费脑”,却大幅高估了“独立完成”的痛苦程度。亲自动手被想象成负重越野,复制粘贴则像坐缆车;实际走一遍,路程远没有预想中累

▲ 论文播报账号的卡片式摘要,完整列出了标题、作者与arXiv编号。这份预印本研究的是人类对AI使用收益的校准错误。
当“外包”变成“换个工种受苦”
论文还拆解了简单任务的时间结构
在简单变体上,用AI平均比独立完成慢了约10秒。研究团队把“用AI”这件事拆成了三段:写提示、等模型、读并处理回答。结果是,写提示本身平均要花48.7秒,比读和处理回答的37.6秒还长。
其中一个细节颇为荒诞:约41%的提示词,是直接从题目说明里复制粘贴过来的。 也就是说,很多人为了“用AI做一道题”,光是复制粘贴题干再点发送所花的时间,就已经超过了把这题自己做完的时间。
努力并没有被外包,它只是被重新包装成了打字、等待和核验。
这像极了都市生活里的“省时悖论”:你为了省下5分钟煮面,花了10分钟在外卖平台上比价、加购物车、等骑手、然后因为汤洒了一桌子又花5分钟清理。界面摩擦,是那个穿着效率制服的隐形税吏。
用过之后,你反而更“瞎”了
论文在使用经验的后续影响上还记录了一种反常现象。
直觉告诉我们:多用几次AI,人就会“校准”自己的预期。这次吃了亏,下次就知道了
结果恰恰相反
研究三发现:那些在暴露阶段用过AI的人,在后续任务中选择AI的比例高达44.5%;而那些之前独立完成的人,后续使用AI的比例只有27.7%。
用过AI的人在暴露结束后更不同意“独立完成其实更快”这个结论。使用经验没有打破效率幻觉,反倒让它更加巩固。
这就是论文所说的 overreliance feedback loop,过度依赖的反馈环。
误判驱动使用,使用强化误判,误判再驱动更多使用。你每多用一次AI,你对自己大脑能力的判断就变得更钝一点。

▲ METR的官方推文:开发者自己以为快了20%,实际上慢了19%。感知与客观现实的错位,几乎是对称的。
开发者也会误判:+24%的乐观预期,-19%的冰冷现实
如果普通人在算术题上的错觉还可以被归为“不够专业”,那程序员呢?
METR的研究对象是资深开源开发者,他们长期贡献于数万星标、百万行代码的大型仓库,处理的是真实的缺陷修复、功能实现和代码重构。他们用的AI工具是当时的主流配置,Cursor Pro搭配Claude系列模型。他们的报酬是每小时150美元
这是AI使用场景中的“精英战区”
研究开始前,开发者们预测自己会被加速约24%。任务完成后,他们依然相信自己快了约20%。而墙上的秒表显示,他们实际慢了约19%。
这次系统性误判发生在专业选手熟悉的主场。它和普通人的55.7秒对7.5秒形成了精确的镜像,说明自我报告并不足以证明效率提升。
但AI真的没用吗?别急着下结论
如果把故事讲到这里就停笔,那就变成了又一篇“AI是骗局”的情绪文宣。
真相要复杂得多,也冷峻得多
斯坦福与MIT团队基于5179名客服坐席的交错引入数据发现:接入生成式AI对话助手后,每小时解决工单数平均提高了约14%,其中新手和低技能坐席的改善幅度高达约34%。
但同样的AI,放在资深工程师的百万行代码库里,反而慢了19%。
AI是否提效这道题的正确答案是:看情况。 它取决于任务结构、使用者相对工具的技能位置,以及你有没有把完整组织流程跟着一起重新设计。
MIT Sloan对制造业AI采用的研究还给出了一个更宏观的“J曲线”:企业引入工业AI后,短期生产率常常先下降约1.33个百分点,再在更长的周期内逐步回升。工具先换,配套系统仍停留在原处,账本上便可能先冒出混乱,红利要更晚才会出现。
当幻觉“组织化”:从一个人的错觉到一整个团队的过载
再把镜头拉远一点,你会看到一个更惊人的东西。
一次关于科技公司的实地观察记录了这样的场景:员工们没有用AI“提早下班”,反而用它承担了更多。午餐时间发提示、开会前发提示、深夜也在发提示。83%的人报告工作量上升当一个人用AI多接活,整个团队的默认节奏就会被悄悄抬高。
研究者给它起了个名字:workload creep,工作量蠕变。
个人层面的“我应该能更快”,一旦卷入组织齿轮,就变成了所有人一起“被重写成更快”的系统性运转。
伯克利研究者8个月陪跑200名员工的观察,与Upwork的问卷数据形成了共振:约96%的高管预期AI会提升公司生产率,而77%的使用AI员工报告说工具反而增加了他们的工作量或降低了生产率。
两组数据衡量的效率口径不同领导层看的是“完成的任务总量”,员工感受的是“每小时的精神密度”。
你感觉到的快,和墙上的钟,是两种货币
综合这些证据,一篇更朴素的总结浮出水面:
AI带来的轻松感可能很鲜明,秒表记录的收益却未必与之相称。
当交互变得轻松,多巴胺式的小反馈填满了等待间隙,大脑就会错误地把流畅感当作高效感,把低努力当作高产出。你在聊天框里敲下提示的那一刻,感觉自己像驾驭着一台涡轮增压的机器;而实际发生的,可能只是你带着更愉快的心情,在原地多绕了半圈。
AI当然有价值 它带来14%的客服提升,也让新手加速34%,在无数场景中交出货真价实的产出。但它在简单任务上的“近零收益甚至负收益”,却常常被感觉的滤镜调成了“赚麻了”。
那篇论文给出的提醒在于:
校准你的信念,比追逐模型能力的排行榜更重要。
因为当一个人连“什么时候该用自己的脑子”都做不到准确判断时,再强的模型,也不过是一个更贵的、带进度条的拖延工具。
最可怕的版本,是你一步步把方向盘交出去以后,还觉得自己在大步飞奔。

夜雨聆风