
把表掏出来就现在
你以为 AI 帮你省下的每一秒,可能都在另一个账本上悄悄借了回来,还加了利息。
2026年5月,一篇挂在 arXiv 上的论文,把许多人心里那个说不出口的疙瘩,一刀剖开了:The efficiency-gain illusion(效率增益幻觉)。作者名单拉出来能吓一跳:斯坦福、纽约大学、MIT、普林斯顿 AI Lab。2691名参与者,三项预注册研究
结论一句比一句狠:
人们以为自己用 AI 省了约 55.7 秒,实际只省了约 7.5 秒。高估了将近 7 倍。
在简单任务上,AI 辅助反而比自己做更慢,平均慢 10 秒。
只用了两次 AI,人就更容易下次再用,哪怕明明自己做更快。
问题已经超出“工具好不好用”的范畴你的大脑正在被重新校准,而你毫无察觉。

▲ Rohan Paul 的种子主帖浓缩了论文核心:感觉高效≠真高效;55.7秒vs 7.5秒;界面摩擦;安静的再校准。
秒表不会说谎:55.7秒的幻觉,是怎么来的?
研究设计相当“朴实”24个日常任务,全都不难:基础算术、改一句拼写、短改写、回忆一个奥运奖牌得主。独立完成,一般五分钟内搞定
然后给参与者一个选择:自己做,还是让 GPT-4o 帮忙。
结果第一个反转来了:人口层面预测“我会用AI”的比例约 33%,实际使用率约 47%。在简单任务上,差距更大,预测约 20%,实际约 38%。人们尤其低估自己会去点AI的概率,而且是在那些“自己明明几秒就能搞定”的事上。
时间账拉开了更大的差距
参与者平均预期:独立完成约 97.1 秒,用 AI 约 41.4 秒,预期节省 55.7 秒。现实呢?独立完成约 93.7 秒,这猜得挺准;但 AI 辅助实际花了约 86.2 秒,比预期翻了整整一倍。实测节省:7.5 秒
预期省 58% 的时间,实际省不到 8%
效率增益幻觉由此显现:人们系统性低估了“用AI”本身要花的时间。
写提示平均 48.7秒,阅读和判断回复又是 37.6秒。其中约 41% 的提示是直接从任务说明里复制粘贴,你还没开始“省”,将近一分钟已经没了。
界面摩擦:时间耗在了对话框里

▲ 更早一版高互动摘要帖的配图,展示“预期节省”与“实测节省”之间的巨大落差。
很多人以为用 AI 慢是被“不聪明”卡的。错得离谱
论文的结论是:在简单任务上,瓶颈落在界面摩擦。
你要想怎么问、打字或粘贴、等流式输出一个字一个字往外蹦、读完、判断这答案是否可接受、不行还得改 prompt 再来一轮。每一步都在“感觉像在做事”,每一步都实打实吃时间。
NASA-TLX 量表测出的心力数据也很诚实:人们准确估计了“用AI时有多轻松”(预测约1.76,实际约1.74),却高估了“自己做有多累”(预测约2.66,实际约2.36)。
换成日常感受:AI带来的省力少于预期,人们也高估了独立完成的辛苦。中间的差价,就是幻觉
有回复的网友说得一针见血:

▲ Timur Yessenov 称 55.7/7.5 的落差“眼熟得让人难受”,有时问AI只是“带着进度条的拖延”。
带进度条的拖延精准得让人想把手机扔了
两次就上瘾:慢之外,还有“停不下来”
如果说前面的数据是“打脸”,研究3则让人不安。
研究者让一组人先独立完成两个任务,另一组人先用AI完成两个任务。然后进入测试阶段,观察他们在新任务上的选择。
结果:暴露阶段用过AI的人,后续在简单任务上再选AI的比例是 44.5%;独立完成组只有 27.7%
两次只用过两次
AI 使用就在人的决策系统里嵌下了一道默认选项。同时,那组用过AI的人,对“独立其实更快”这一事实的判断力也下降了。时间校准,恶化
论文把这叫携带效应用大白话说:AI 训练出了自己的正当性。一次使用,就在给下一次使用投票
人的能力未必下降,发生的是一种安静的再校准:你渐渐无法准确判断,什么时候自己的大脑才是最快的工具。

▲ David Boyle 的长回复提供了一个重要对照:他明知不更快仍用AI,为的是短暂卸载脑力。“不更快,但更舒服”,情绪价值≠效率价值。
这里得插句公道话David Boyle 式的选择无可厚非。用AI换一点喘息空间、等草稿时发个呆,这是合法偏好。问题在于把“感觉更舒服”误记成“做得更快”。当主观体验和客观秒表脱节,你的时间管理就成了自我欺骗。
专家也中招:METR的开发者RCT,慢得离谱
如果你觉得“这不过是实验室里让普通人做简单任务”的把戏,往下看。
METR 在2025年7月做了一场在真实开源仓库里的随机对照试验。16名资深开发者,平均贡献过数万星、百万行代码的项目。246个真实 issue随机允许或禁止使用 Cursor Pro 和 Claude 3.5/3.7 Sonnet。
结果是:允许用AI,完成时间反而慢约 19%。
人类有多不自知?开发者事前预测AI会让他们快约 24%;做完之后,仍然估计自己快了约 20%
慢19%,一个被坚信“快了20%”的人,是不会去看表的。

▲ Sean Goedecke 的解读把三重对照排成标题:事前预期加速24%,事后仍觉加速20%,实际慢19%。
参与者并非“不会用工具”的菜鸟他们是在自己最熟悉的代码库上被AI绊倒的高手。
别误会:AI得用在合适的战场
公平起见,研究结果并非全都在“唱反调”。
Stanford HAI 报道过 Brynjolfsson 团队的研究:在客服中心,生成式AI让坐席每小时解决的工单数提升约 14%,而且红利主要流向新手,两个月经验+AI的坐席,可以接近六个月经验不用AI的表现。
再比如 GitHub 对 Copilot 的研究,特定编码任务上确有大幅加速。
所以AI的生产力增益是真的存在,但它高度依赖任务结构、技能基线和嵌入方式。
结构化、文本密集、结果易验收、新手可以学到的场景,增益清晰可见。 而那些“自己几秒就能做完、却要穿过对话界面来回摩擦”的琐事,AI 是负资产。
有账号用了一个很妙的比喻:

▲ “别用法拉利开去隔壁。”简单任务不适合绕进对话框,完整工作流更能发挥AI的价值。
从微观到宏观:为什么满世界AI,统计数字毫无波澜?
这片幻觉的涟漪,还在往更大的水域扩散。
Solow 悖论1987年,经济学家 Robert Solow 说过一句经典刻薄话:“电脑时代到处可见,唯独统计上看不见生产力。” 后来 IT 投资猛增而生产率放缓的奇景,就以他命名。
2026年5月,国际劳工组织(ILO) 的研究简报又把这套逻辑搬到AI身上:任务级增益满天飞,企业级证据混杂,宏观统计里看不到清晰的AI签名。

▲ ILO简报核心:微观任务加速,宏观账本安静,扩散、度量与组织适配是中间件。
Stripe 经济团队的研究也被 Ruxandra Teslo 拉到公共讨论里:微生产力增益没有转化为宏观生产力跃升。真实世界摩擦被严重低估

▲ Ruxandra Teslo 的帖子标题点出:“智能并非世界进步的唯一瓶颈”。微观热闹,宏观冷清。
再加上workload creep,工作量蠕变。人类学家和管理评论者发现:AI 让人感觉“一切都更快了”,于是午餐、会前、深夜的缝隙全被填满。自然停顿点消失加速的体感直接变成了更多的工作,闲暇反而被挤走。
美国 Upwork 2024年的调查数字几乎可以当寓言读:96%的高管认为AI会提效,77%的员工说AI让自己更累或更低效。

▲ mike cook 转述的调查数据:高管预期与员工体验之间的巨大裂缝。
最后说几句
这场效率幻觉的核心,其实是一句特别简单的话:
你正在失去判断“什么时候该用自己的脑子”的能力。
变化来自一个反馈环:高估收益 → 多用一次 → 校准再偏一点 → 更依赖一点。它转得又快又静
下次你伸手要点开那个对话框之前,可以做个三秒实验:这件事,我自己做,会用多少秒? 然后问AI,再掐一次表
两个数字之间的距离,就是你被幻觉吃掉的部分。
AI 永远是好工具但前提是:你知道什么时候该把它关掉。

▲ 网友 binji 的评论收束全篇:“仓鼠轮转得很漂亮,却哪儿也去不了。”

夜雨聆风