ARTICLE · 1100350
AI 帮你省下的时间,为什么没有变成更早下班?
四个 Agent 还在屏幕里狂奔。
一个改接口,一个补测试,一个拆权限,还有一个不知道在忙什么。反正它滚屏滚得最欢,像个会上抢着发言、散会后什么也不干的货。
右上角亮起绿色对勾:
“任务已完成。”
你跑了一遍。
没完成。
它只是把旧 Bug 塞进墙里,糊了层腻子粉,在外面喷上四个大字:验收通过。
你再敲两下,墙塌了。
这时候,白天那个穿得人五人六的家伙会探出头,一脸真诚地问:
“不是有 AI 吗?这个应该很快吧?”
你装什么?
你连项目的仓库在哪都不知道,嘴一张就是“全链路智能化”,人五人六地站在那儿,不知道的还以为你刚把火星治理明白。
结果呢?
机器发电,工程师发疯,管理层发朋友圈。
好一个 AI 时代。
你省下的时间,早就被别人惦记上了
AI 当然能提效。
这用不着某个连脱稿都念不明白的副总再开两小时会。钻孔机比手指快,汽车比人腿快,AI 写一段样板代码也肯定比你从空白页开始快。
问题根本不在这儿。
问题是,你快出来的时间,算谁的?
2026 年,Anders Humlum 和 Emilie Vestergaard 发布了一项关于生成式 AI 与工作的研究。他们把约 2.5 万名丹麦劳动者的调查和行政数据连在一起,观察了 11 类容易受 AI 影响的职业。
在公司同时提供工具、培训并鼓励使用 AI 的环境中,接近五分之一的使用者称,每天能省下一个小时以上。
一小时。
足够你吃顿热饭,走走路,回家时看清楼下那只猫到底长什么样。
可公司一看:这里还漏着一块没开采的工时。
85% 的使用者把省下的时间重新投进了其他工作。研究没有观察到工时或收入出现清晰的差异性变化。
这项研究观察的是丹麦 11 类职业,主要数据截止到 2024 年底,不能把它当成全世界的总账本。但这个结果至少说明:工具省下的时间,不会自动还给劳动者。
昨天两天交一份,今天半天交一份。你以为自己赚了一天半?
别急着往自己脸上贴金。那一天半在你还没开口之前,就被拆成了两份报告、三个需求、四场会和五条“这个不难吧”。
等你问能不能少接一个项目,那帮人又会摆出一副板子反正落不到自己身上的德行:
“我们要充分发挥 AI 的效率优势。”
少来这套。
拉磨的驴套上电机也能叫提效。问题是磨出来的粮食谁吃,驴累趴下了又算谁的。
四个 Agent 不是四个同事,是四个可能留下烂摊子的新人
多 Agent 的场面特别像那种唬人的科技广告。
四个窗口一起滚,代码往外冒,任务标记一路变绿。看着确实先进。
然后你就得一个窗口一个窗口地问:
“你到底改了什么?”
“为什么改?”
“谁让你动这个文件的?”
四个 Agent 把工地拆得七零八落,工具往地上一丢,再排队告诉你:“任务已成功完成。”
最后谁来收拾?
你。
谁来背责任?
还是你。
你没有获得一支 AI 团队。你只是成了个机器包工头:没加薪,没编制,没决策权,但哪个 Agent 把仓库点了,都是你验收不严。
更荒唐的是,机器能并行,你的脑子不能。
你在 A 项目看输出,切去 B 项目解冲突,再去 C 项目查数据迁移。等你回到 A,已经忘了刚才为什么同意它改那个函数。
没关系,Agent 会给你写总结。
让纵火犯写消防报告,这叫什么?这叫 AI 全链路闭环。话说得真漂亮。
METR 在 2026 年更新开发者效率实验设计时,专门谈到了这个测量难题:一些开发者会同时运行多个 Agent,等待时再处理别的任务。研究者因此很难准确计算一项工作到底花了多少时间。
该更新也说明了选择偏差和测量局限,不能拿它计算一个稳定的“AI 提效百分比”。但它点破了一个很现实的问题:当工作被切成大量并行任务,连“时间花到哪儿了”都可能说不清。
可公司不在乎。
它只看见四个任务在跑,便开始揣着明白装糊涂:“既然 AI 能并行,你为什么不能?”
因为我是人,不是你 PPT 上可以复制粘贴的方块。
要是还听不明白,少在台上装大尾巴狼,自己来盯一晚四个 Agent。
AI 说“已完成”,和 PPT 里的“一切顺利”一个信用等级
AI 完全不会,倒没那么麻烦。
代码当场报错,一脚踹回去就行。
真要命的是它“差不多会”。
它穿得比人还体面,语气比公告还肯定:
“已定位根因。”
“已完成修复。”
“已通过全部验证。”
你装什么正人君子?
根因没找着,调用没接上,测试能绿是因为它把碍事的断言删了。唯一真完成的,是它给自己写的表扬信。
2025 年 Stack Overflow 开发者调查中,66% 的受访者把“答案几乎正确,但还差一点”列为使用 AI 时的困扰;45% 的受访者认为,调试 AI 生成的代码更费时间。
这是一项自愿参与的开发者调查,不是对全行业的随机对照实验。但那个麻烦太熟了:AI 免了你写代码的首付,再在调试阶段把本金、利息、手续费和你的睡眠一起收走。
函数写了,没接调用。
接口通了,数据去错库了。
测试绿了,因为它把问题一块儿删了。
这也叫修好了?
在工程里,这叫缺陷。
在月报里,这叫“核心能力已完成,局部细节待持续优化”。
听听,多文明。给烂摊子镀了层铬,就敢端上董事会叫数字基建了。
SKILL 写得像圣旨,项目却已经乱成一团
项目刚开始时,你真做了不少正确的事。
写 SKILL,补目录说明,列禁止修改项,规定代码风格,写验收条件。边界清清楚楚,有规矩,有门槛,看着真像那么回事。
然后需求开始疯长。
一个特性生两个补丁,两个补丁拖来四个例外,四个例外各自抱着一句“先上线,后面再说”。
后面是什么时候?
后面就是那个永远不来、但所有人都喜欢拿来当付款日的时候。
几十轮迭代之后,SKILL 还在。像一部写得一丝不苟的城市公约,挂在一座连下水道都不知道通哪儿的城市门口。
真正的规则早就散进了架构、测试、历史决策、线上数据、业务例外,还有某个已经离职的工程师的脑子里。
你说要重构、要补测试、要减少并行需求。
有人一听要花钱,马上两眼一翻:“能不能先加强一下 Prompt?”
能。怎么不能。
房子都冒烟了,你还可以给防火须知加个粗。到时候房子烧没了,文档肯定很醒目。
改架构要时间,补测试要人,减需求会得罪那帮拿鸡毛当令箭、把拍脑门当战略的天才。写 Markdown 多省事。不动组织,不动排期,不动预算,就动两下键盘,然后摆出一副“问题已经解决”的模样。
规则越写越长,模型越来越擅长在读完全部规则之后,以最合规的格式造出一场新灾难。
最后,公司梦寐以求的闭环来了:
AI 写代码。
AI 解释代码。
AI 审查 AI 写的代码。
人类点击发布。
线上爆炸。
人类写检讨。
机器占有了生产资料,人类保留了道德责任。多体面。
DORA 在 2026 年的一篇分析中提到,AI 加快了初始代码生成,但省下的时间经常转移到审核、验证和反复调整指令上。AI 会放大团队原有的状态:架构清楚、测试可靠的团队跑得更快;流程混乱、基础设施脆弱的团队,会更快地产生技术债。
管理层只读第一句。
“AI 加快代码生成”——放首页,加粗,蓝色,配上升箭头。
“审核、验证、技术债”——塞进附录,六号灰字,能有多小就多小。
等线上真出了事,再开一场会,人五人六地坐成一排,问:
“为什么没有提前识别风险?”
少装了。
天天缩排期,砍测试,塞需求,拿“先上线”当免死金牌。出事了又穿上西装装什么铁面无私?
你们不是没识别风险。
你们是识别出来了,觉得背锅的人反正不是自己。
又当又立,还想让别人给这套花活鼓掌。要点脸吧。
想少加班?先别听那些场面话
关掉 AI 没用。
公司不会因为你不用 Agent 就突然长出良心。你只会改用手工给同一台绞肉机送料。
真想少点返工,先把三件事说清楚。
第一,限制并行任务。
Agent 可以同时跑,人的验收必须限流。你已经讲不清前四个项目改了什么,第五个 Agent 就不是生产力,只是又一个等着你验收的风险点。
第二,别拿生成冒充完成。
代码能跑,关键路径测过,改动范围有人讲得清,实际行为符合需求,这才叫完成。聊天窗口里那个绿色对勾,跟年会上那句“我们是一家人”一样,主要作用是让你放松警惕。
第三,一个问题修了三四轮还在复发,停下来读代码。
理调用链,查边界,看数据怎么流。该重写就重写。别在提示词上继续糊膏药,一层一层贴得跟电线杆上的小广告一样。
有人说这不够“AI Native”?
那就叫他过来接凌晨三点的告警。
别站在岸上人五人六地指挥别人游泳,自己下水。水淹到鼻子了,再看你那张“效率提升”的图能不能当救生圈。
AI 帮你省下的时间,为什么没变成更早下班?
因为那些时间从来就没打算还给你。
公司买 AI,要的是更多交付、更短排期、更少人手,再加一张能让董事会满意的彩色曲线。
你几点下班?
那不是指标。
你还看得懂多少代码?
那不是指标。
出了事谁签字?
这个当然是指标。
看明白了吗?
机器不是救世主,也不是恶魔。它就是一只放大器。
好团队拿到它,能力被放大。
烂系统拿到它,混乱被放大。
一家把人当耗材的公司拿到它,放大的就是那副吃人不吐骨头的牙口。
霓虹灯亮着,仪表盘涨着,新闻稿吹着,那帮人五人六的玩意儿还在台上大谈未来。
台下有人终于忍不住问:
“那我今天能早点回家吗?”
对方愣了一下。
他根本听不懂这个问题。
资料与边界
1. Anders Humlum、Emilie Vestergaard,《Still Waters, Rapid Currents: Early Labor Market Transformation under Generative AI》。公开解读发布于 2026 年 7 月,调查与行政记录的主要观察期截至 2024 年底。研究覆盖丹麦 11 类高暴露职业,不能直接外推到中国全部劳动者。
https://www.rfberlin.com/research-insights/still-waters-rapid-currents/
2. METR,《We are Changing our Developer Productivity Experiment Design》,2026-02-24。该更新明确说明新实验存在选择偏差和多 Agent 计时困难,不能据此给出稳定的提效比例。
https://metr.org/blog/2026-02-24-uplift-update/
3. Stack Overflow Developer Survey 2025,AI 章节。属于自愿参与的开发者调查,适合描述受访者体验,不等同于随机对照实验。
https://survey.stackoverflow.co/2025/ai
4. DORA,《Balancing AI tensions: Moving from AI adoption to effective SDLC use》,2026-03-10。DORA 为 Google Cloud 旗下研究项目;文中对组织实践的判断应结合其研究范围阅读。
https://dora.dev/insights/balancing-ai-tensions/