夜雨聆风学习资料网

ARTICLE · 1100350

AI 帮你省下的时间,为什么没有变成更早下班?

AI 帮你省下的时间,为什么没有变成更早下班?
凌晨两点。

四个 Agent 还在屏幕里狂奔。

一个改接口,一个补测试,一个拆权限,还有一个不知道在忙什么。反正它滚屏滚得最欢,像个会上抢着发言、散会后什么也不干的货。

右上角亮起绿色对勾:

“任务已完成。”

你跑了一遍。

没完成。

它只是把旧 Bug 塞进墙里,糊了层腻子粉,在外面喷上四个大字:验收通过。

你再敲两下,墙塌了。

这时候,白天那个穿得人五人六的家伙会探出头,一脸真诚地问:

“不是有 AI 吗?这个应该很快吧?”

你装什么?

你连项目的仓库在哪都不知道,嘴一张就是“全链路智能化”,人五人六地站在那儿,不知道的还以为你刚把火星治理明白。

结果呢?

机器发电,工程师发疯,管理层发朋友圈。

好一个 AI 时代。

你省下的时间,早就被别人惦记上了

AI 当然能提效。

这用不着某个连脱稿都念不明白的副总再开两小时会。钻孔机比手指快,汽车比人腿快,AI 写一段样板代码也肯定比你从空白页开始快。

问题根本不在这儿。

问题是,你快出来的时间,算谁的?

2026 年,Anders Humlum 和 Emilie Vestergaard 发布了一项关于生成式 AI 与工作的研究。他们把约 2.5 万名丹麦劳动者的调查和行政数据连在一起,观察了 11 类容易受 AI 影响的职业。

在公司同时提供工具、培训并鼓励使用 AI 的环境中,接近五分之一的使用者称,每天能省下一个小时以上。

一小时。

足够你吃顿热饭,走走路,回家时看清楼下那只猫到底长什么样。

可公司一看:这里还漏着一块没开采的工时。

85% 的使用者把省下的时间重新投进了其他工作。研究没有观察到工时或收入出现清晰的差异性变化。

这项研究观察的是丹麦 11 类职业,主要数据截止到 2024 年底,不能把它当成全世界的总账本。但这个结果至少说明:工具省下的时间,不会自动还给劳动者。

昨天两天交一份,今天半天交一份。你以为自己赚了一天半?

别急着往自己脸上贴金。那一天半在你还没开口之前,就被拆成了两份报告、三个需求、四场会和五条“这个不难吧”。

等你问能不能少接一个项目,那帮人又会摆出一副板子反正落不到自己身上的德行:

“我们要充分发挥 AI 的效率优势。”

少来这套。

拉磨的驴套上电机也能叫提效。问题是磨出来的粮食谁吃,驴累趴下了又算谁的。

四个 Agent 不是四个同事,是四个可能留下烂摊子的新人

多 Agent 的场面特别像那种唬人的科技广告。

四个窗口一起滚,代码往外冒,任务标记一路变绿。看着确实先进。

然后你就得一个窗口一个窗口地问:

“你到底改了什么?”

“为什么改?”

“谁让你动这个文件的?”

四个 Agent 把工地拆得七零八落,工具往地上一丢,再排队告诉你:“任务已成功完成。”

最后谁来收拾?

你。

谁来背责任?

还是你。

你没有获得一支 AI 团队。你只是成了个机器包工头:没加薪,没编制,没决策权,但哪个 Agent 把仓库点了,都是你验收不严。

更荒唐的是,机器能并行,你的脑子不能。

你在 A 项目看输出,切去 B 项目解冲突,再去 C 项目查数据迁移。等你回到 A,已经忘了刚才为什么同意它改那个函数。

没关系,Agent 会给你写总结。

让纵火犯写消防报告,这叫什么?这叫 AI 全链路闭环。话说得真漂亮。

METR 在 2026 年更新开发者效率实验设计时,专门谈到了这个测量难题:一些开发者会同时运行多个 Agent,等待时再处理别的任务。研究者因此很难准确计算一项工作到底花了多少时间。

该更新也说明了选择偏差和测量局限,不能拿它计算一个稳定的“AI 提效百分比”。但它点破了一个很现实的问题:当工作被切成大量并行任务,连“时间花到哪儿了”都可能说不清。

可公司不在乎。

它只看见四个任务在跑,便开始揣着明白装糊涂:“既然 AI 能并行,你为什么不能?”

因为我是人,不是你 PPT 上可以复制粘贴的方块。

要是还听不明白,少在台上装大尾巴狼,自己来盯一晚四个 Agent。

AI 说“已完成”,和 PPT 里的“一切顺利”一个信用等级

AI 完全不会,倒没那么麻烦。

代码当场报错,一脚踹回去就行。

真要命的是它“差不多会”。

它穿得比人还体面,语气比公告还肯定:

“已定位根因。”

“已完成修复。”

“已通过全部验证。”

你装什么正人君子?

根因没找着,调用没接上,测试能绿是因为它把碍事的断言删了。唯一真完成的,是它给自己写的表扬信。

2025 年 Stack Overflow 开发者调查中,66% 的受访者把“答案几乎正确,但还差一点”列为使用 AI 时的困扰;45% 的受访者认为,调试 AI 生成的代码更费时间。

这是一项自愿参与的开发者调查,不是对全行业的随机对照实验。但那个麻烦太熟了:AI 免了你写代码的首付,再在调试阶段把本金、利息、手续费和你的睡眠一起收走。

函数写了,没接调用。

接口通了,数据去错库了。

测试绿了,因为它把问题一块儿删了。

这也叫修好了?

在工程里,这叫缺陷。

在月报里,这叫“核心能力已完成,局部细节待持续优化”。

听听,多文明。给烂摊子镀了层铬,就敢端上董事会叫数字基建了。

SKILL 写得像圣旨,项目却已经乱成一团

项目刚开始时,你真做了不少正确的事。

写 SKILL,补目录说明,列禁止修改项,规定代码风格,写验收条件。边界清清楚楚,有规矩,有门槛,看着真像那么回事。

然后需求开始疯长。

一个特性生两个补丁,两个补丁拖来四个例外,四个例外各自抱着一句“先上线,后面再说”。

后面是什么时候?

后面就是那个永远不来、但所有人都喜欢拿来当付款日的时候。

几十轮迭代之后,SKILL 还在。像一部写得一丝不苟的城市公约,挂在一座连下水道都不知道通哪儿的城市门口。

真正的规则早就散进了架构、测试、历史决策、线上数据、业务例外,还有某个已经离职的工程师的脑子里。

你说要重构、要补测试、要减少并行需求。

有人一听要花钱,马上两眼一翻:“能不能先加强一下 Prompt?”

能。怎么不能。

房子都冒烟了,你还可以给防火须知加个粗。到时候房子烧没了,文档肯定很醒目。

改架构要时间,补测试要人,减需求会得罪那帮拿鸡毛当令箭、把拍脑门当战略的天才。写 Markdown 多省事。不动组织,不动排期,不动预算,就动两下键盘,然后摆出一副“问题已经解决”的模样。

规则越写越长,模型越来越擅长在读完全部规则之后,以最合规的格式造出一场新灾难。

最后,公司梦寐以求的闭环来了:

AI 写代码。

AI 解释代码。

AI 审查 AI 写的代码。

人类点击发布。

线上爆炸。

人类写检讨。

机器占有了生产资料,人类保留了道德责任。多体面。

DORA 在 2026 年的一篇分析中提到,AI 加快了初始代码生成,但省下的时间经常转移到审核、验证和反复调整指令上。AI 会放大团队原有的状态:架构清楚、测试可靠的团队跑得更快;流程混乱、基础设施脆弱的团队,会更快地产生技术债。

管理层只读第一句。

“AI 加快代码生成”——放首页,加粗,蓝色,配上升箭头。

“审核、验证、技术债”——塞进附录,六号灰字,能有多小就多小。

等线上真出了事,再开一场会,人五人六地坐成一排,问:

“为什么没有提前识别风险?”

少装了。

天天缩排期,砍测试,塞需求,拿“先上线”当免死金牌。出事了又穿上西装装什么铁面无私?

你们不是没识别风险。

你们是识别出来了,觉得背锅的人反正不是自己。

又当又立,还想让别人给这套花活鼓掌。要点脸吧。

想少加班?先别听那些场面话

关掉 AI 没用。

公司不会因为你不用 Agent 就突然长出良心。你只会改用手工给同一台绞肉机送料。

真想少点返工,先把三件事说清楚。

第一,限制并行任务。

Agent 可以同时跑,人的验收必须限流。你已经讲不清前四个项目改了什么,第五个 Agent 就不是生产力,只是又一个等着你验收的风险点。

第二,别拿生成冒充完成。

代码能跑,关键路径测过,改动范围有人讲得清,实际行为符合需求,这才叫完成。聊天窗口里那个绿色对勾,跟年会上那句“我们是一家人”一样,主要作用是让你放松警惕。

第三,一个问题修了三四轮还在复发,停下来读代码。

理调用链,查边界,看数据怎么流。该重写就重写。别在提示词上继续糊膏药,一层一层贴得跟电线杆上的小广告一样。

有人说这不够“AI Native”?

那就叫他过来接凌晨三点的告警。

别站在岸上人五人六地指挥别人游泳,自己下水。水淹到鼻子了,再看你那张“效率提升”的图能不能当救生圈。

AI 帮你省下的时间,为什么没变成更早下班?

因为那些时间从来就没打算还给你。

公司买 AI,要的是更多交付、更短排期、更少人手,再加一张能让董事会满意的彩色曲线。

你几点下班?

那不是指标。

你还看得懂多少代码?

那不是指标。

出了事谁签字?

这个当然是指标。

看明白了吗?

机器不是救世主,也不是恶魔。它就是一只放大器。

好团队拿到它,能力被放大。

烂系统拿到它,混乱被放大。

一家把人当耗材的公司拿到它,放大的就是那副吃人不吐骨头的牙口。

霓虹灯亮着,仪表盘涨着,新闻稿吹着,那帮人五人六的玩意儿还在台上大谈未来。

台下有人终于忍不住问:

“那我今天能早点回家吗?”

对方愣了一下。

他根本听不懂这个问题。


资料与边界

1. Anders Humlum、Emilie Vestergaard,《Still Waters, Rapid Currents: Early Labor Market Transformation under Generative AI》。公开解读发布于 2026 年 7 月,调查与行政记录的主要观察期截至 2024 年底。研究覆盖丹麦 11 类高暴露职业,不能直接外推到中国全部劳动者。

https://www.rfberlin.com/research-insights/still-waters-rapid-currents/

2. METR,《We are Changing our Developer Productivity Experiment Design》,2026-02-24。该更新明确说明新实验存在选择偏差和多 Agent 计时困难,不能据此给出稳定的提效比例。

https://metr.org/blog/2026-02-24-uplift-update/

3. Stack Overflow Developer Survey 2025,AI 章节。属于自愿参与的开发者调查,适合描述受访者体验,不等同于随机对照实验。

https://survey.stackoverflow.co/2025/ai

4. DORA,《Balancing AI tensions: Moving from AI adoption to effective SDLC use》,2026-03-10。DORA 为 Google Cloud 旗下研究项目;文中对组织实践的判断应结合其研究范围阅读。

https://dora.dev/insights/balancing-ai-tensions/

相关学习资料