我采访了5个用不同AI工具的人,效率真相和宣传差太远把这半年里我读到的最真实的几段用户自述翻出来,挑了5个用不同AI工具的人,就想搞清楚一件事。厂商天天把AI能让你效率翻好几倍挂在嘴边,那这5个人的真实体感,到底对得上吗。先说清楚底,这5个样本不是我打飞的挨个坐下来聊来的。是我从这半年公开的真实访谈、开发者自述、还有几份正经调研里,挑出来的最有代表性的5张脸。他们用的工具不一样,干的活不一样,但有一个共同点,都是真人在真用,不是厂商宣传片里那个对着镜头说真香的路人甲。聊完这5个人我才明白,真正的分水岭不在工具里,在你身上的工作流。这句话先放这儿,后面慢慢说。老陈是干了十年的后端,那种你让他看一眼报错就知道是哪层缓存炸了的人。他今年年初开始用 Cursor 配 Claude,按他自己的话说,周围人都在用,不用显得跟不上。厂商怎么宣传的。你打开任意一款AI编程工具的官网,演示视频里都是,打一行注释,唰一下整个功能就出来了,老板看着开心,开发者看着心动。按老陈的说法,写新功能的小模块,确实快,那种从零搭脚手架的活,AI替他省了不少。可一旦碰到他们那个跑了十年的老系统,AI就开始犯浑。上下文塞不进去,它不知道这块代码十年前是谁写的、为什么这么绕,生成出来的东西老陈得一行行审。他有一句特别实在的话,省下来的写代码时间,全花在审AI写的东西上了,有时候还得多花。METR 这家机构去年七月做过一个挺较真的随机对照实验,找了16个资深开发者,在自己干了多年的开源仓库里干246个真实任务,一半允许用AI,一半不让用。结论出来把所有人整不会了,用AI的那组,平均比不用的慢了19%。更绝的是感知差。这些开发者事前预期AI能帮他们快24%,干完之后,他们自己还觉得快了20%。实际是慢19%。你算算,预期和现实之间差了快40个点。顺便说一句,METR 自己都注明,这是2025年初、基于 Claude 3.5 和 3.7 做的实验,到2026年模型又进化了一轮,这个数未必还成立。可那种感知和现实的巨大裂缝,放到今天看依然扎人。为啥会慢。实验里看了录屏,开发者用AI的时候,主动写代码和查资料的时间确实少了,可多出来的,是跟AI对话、等它生成、审它输出,还有大段大段什么都不干的空白。AI生成的代码,他们原样采纳的不到44%。剩下一大半,得自己改。老陈那个老系统,刚好就是AI最怕的那种,又大又老,规矩多,很多坑是十年里人踩出来的默契,AI没有。METR 在报告里点得很直白,像老陈他们这种,测试覆盖、代码规范、十年攒下的隐性规矩,AI一样都不懂。它生成的代码能跑,不代表能进生产环境。所以老陈被拖慢,不是他笨,是他的活,跟演示视频里那个干净的小demo,根本不是一回事。阿May刚工作两年,做营销,日常就是写海报文案、想活动主题、回客户消息。她用的工具是元宝和ChatGPT,哪个顺手开哪个。按阿May自己的说法,AI对她就是开挂。以前想一个活动 slogan 要想一下午,现在丢个背景给AI,它能甩十个版本出来,她挑一个改改就能用。写周报、整理会议纪要,以前得憋两小时,现在二十分钟。对,这就是我开始说的分水岭。阿May的活,边界清楚,标准模糊但容错高,文案差一点没人死,改改就好。她对AI的要求是给灵感、给草稿,不是替她决策。这种活,AI天生就合适。可她也有被AI坑的时候。有一回AI给她写了一段给客户的产品介绍,语气特别顺,她没细看直接发了,结果把竞品的功能安到了自己产品头上。客户回了一句,你们啥时候出了这功能。她当场社死。她现在的做法是,发出去之前,再顺的句子也得自己读一遍。可她还是用,因为那两小时省下来,够她准点下班追部剧了。你看,连最顺的阿May,也有那一层她绕不开的审查。只是这层对她来说轻,对老陈来说重。小林是个外门技术宅,本职跟写代码不沾边,平时就爱折腾新玩意。他最近在用WorkBuddy,把每天对齐进度、写日报、跟客户那些杂活一股脑丢给它。他自述以前每天光是对齐进度写日报就耗掉一个半小时,现在把这些重复的苦活全交给WorkBuddy,自己腾出手干正事。他有一句特实在的总结,省下来的时间我拿来多睡了半小时。这跟老陈、阿May都不一样。小林的活不是写代码那种高门槛,也不是纯创意,而是一堆流程化、重复性、跨好几个软件的对齐和记录。这种活最磨人,但最标准,AI一旦接住了,省的就是实打实的时间。小林能成,关键在他把活分清楚了。脏活累活给AI,要拍板的自己留着。他没指望AI替他做决策,只是让它把那些不值钱的时间接走。上观新闻采访过一位学者,拿AI试做了一百件事。这个样本我特别喜欢,因为它不站队。一百件事里,有一部分惊艳,比如帮着梳理文献、翻译、列提纲,教授直呼好用。可也有相当一部分不尽如人意,比如让它做一个需要严谨推演的分析,它给你一个看上去特别对、其实逻辑塌了的结果,你要是不懂行,很容易被带沟里。教授的原话大意是,它能帮你跑得很快,但跑到哪你得自己看着。这一百次尝试,其实就是把前面三个人的故事压缩在了一个人身上。同一工具,同一种用法,碰上对的活就惊艳,碰上错的活就翻车。差别从来不在工具,在那一刻你让它干的是什么。他后来学乖了,把AI当助理不当裁判,惊艳的留着,翻车的自己兜底。这个人没有名字,因为他代表最广大的一群。不是极客,也不是什么AI原住民,就是每天在钉钉、飞书、企业微信和十几个软件里切来切去。公司IT统一发了一套AI,他也不知道叫啥,将就用着。Glean 他大概率听都没听过,可他要交的那份税,跟 Glean 报告里那群北美数字工人,一分不少。Glean 今年六月发了一份报告,叫 Work AI Index 2026,调研了6000个数字工人。里面有个数特别扎心,大家用AI自动化平均一周省下11个小时,可同时,得花6.4个小时去做一件他们造的词,botsitting,翻译过来就是伺候AI,给它补上下文、审它输出、改它那些自信但错了的答案。算下来,差不多一比一。你每从AI那捞到一个小时的有用产出,就得再搭一个小时让它变得能用。报告里还有个更狠的,75%的人说自己因为AI更高效了,可只有13%的人觉得,公司整体绩效真的被AI带起来了。中间那个六十点的缺口,就是每个人默默伺候AI、却没在公司账本上显形的那层时间。报告里还有个更刺耳的词,botshitting。69%的AI用户承认,至少干过一次,就是懒得审了,AI给啥发啥。省下的时间没进产出,先漏成了隐患。他们今年六月的全球调研,一万一千多人,将近一半,47%,说现在花在管理和指挥AI上的时间,比自己亲手干活的时间还多。注意,是管理AI,不是用AI干活。你想想这画面。一个人坐在工位上,周围飘着五六个AI助手,他不是在写方案,他是在分配任务、审回收物、把跑偏的拽回来。他成了AI的项目经理。BCG 还记了个挺矛盾的发现,67%的常规用户说满意度高了,可同时41%说脑子更累了。活变简单了,难活全堆回人身上,这就是他们叫的 joy paradox,又爽又累。BCG 还顺带给了个解药的线索。有清晰AI战略的公司,比没有的,业务影响高出25个百分点。而只买更好工具、没战略的,只高5个点。算笔账,战略比工具重要差不多五倍。这跟前面老陈那拨人能对上。工具大家都用上了,差别在公司和个人有没有想清楚,这活到底该怎么跟AI切。没想清楚的,买了一堆工具,只是多了一堆要伺候的主。这5个人,用的工具从 Cursor、元宝、WorkBuddy 到公司统一发的那套不知名办公AI,跨度很大。有人被拖慢,有人真香,有人一半一半。你要是只看老陈,你会说AI都是泡沫。只看阿May和小林,你又觉得神话是真的。AI提效这个事,厂商给你看的是均值。什么平均快两倍、平均省十小时。均值这东西最会骗人,它把老陈被拖慢的那19%,和阿May省下的两小时,搅和成一个漂亮的数字。MIT 有个研究,说95%的企业生成式AI试点,到现在还没法在利润表上看出可量化的影响。这个数我犹豫了一下要不要写,因为它听着太绝对,可它恰好戳破了一层幻象。试点阶段人人都在用,真要算账,大部分还停在感觉层面。AI给的东西太顺了,人容易直接信,信了之后才发现它把顺序搞岔了,省下的时间全还回去,还搭上一份心惊肉跳。那之后我学了个乖,AI给我的东西,我默认它是草稿,不是成品。这个心态一变,反而用得更顺了。第一,这活是不是边界清楚、有标准答案的。写文案、做摘要、翻表格,这类AI天生强。要深层推演、要担责任的判断,它现在还嫩。第二,你愿不愿意花时间教它你的上下文。老陈那个老系统,AI不懂十年默契,你又不肯花功夫喂,它就只能瞎编。小林把流程拆干净了再丢给WorkBuddy,它就接得住。第三,你有没有精力审它的产出。 botsitting 那一层人人都逃不掉,区别只是轻重。你省下的时间,够不够覆盖你审查的成本。不够,那这工具对你就是负收益。这三个问题想明白,你大概就知道,自己该不该用、用哪个、用到哪一步。这三个问题没有标准答案,但你想清楚,就不会被宣传册牵着走了。说真的,我现在越来越觉得,这一轮AI最被低估的一句话是,适配度大于工具力。厂商拼命比谁参数多、谁跑分高,可落到你我的屏幕上,决定爽不爽的,不是它多强,是它跟你的活贴不贴。一把再好的电钻,你拿它拧螺丝是神器,你拿它切蛋糕就是灾难。工具没有错,是用法和场景在挑人。一百多年前泰勒搞科学管理,也是到处宣传,按他的方法工人效率能翻几倍。可真进了工厂,工人是被赶着转得更快了,但累的是自己,工厂账上是好看了。今天AI讲的提效故事,和当年那个叙事,骨架几乎一样,先把一个数拍你脸上,再让每个人自己消化后面的代价。区别是,当年的代价是工人的体力,今天的代价,是我们每个人默默伺候AI的那层看不见的时间。一百年前那层代价,工厂账本上写得分明。今天这层,连账本都进不去,它散在每个人的深夜和周末里。我有时候会想,我们这代人好像特别容易相信一个平均数能代表自己。工资被平均、房价被平均,现在连效率都被平均。可效率这种事,从来都是一条分布,不是一个点。厂商给你看均值线,你过的是自己落在上还是落在下的那条命。老陈落在了均值左边,阿May和小林在右边,周教授横跨两边,你隔壁工位那位,在中间纠结。之前老觉得,不用AI就是落伍,用了不爽就是自己不会用。现在明白了,不爽很可能不是你的问题,是那工具跟你的活,压根没对上。5个人,5种体感。真相从来不在厂商的宣传册里,在你自己按下回车、看着它给出的那行字,心里是踏实还是发毛的那一秒。所以别被那个平均数吓着,也别被它哄着。5个人聊完了,最大的收获不是哪个工具好,是终于敢承认,用着不爽的时候,锅不一定在你。既然都看到这儿了,顺手点个赞和推荐呗,如果转发一下,你朋友也能看到。我是Wyat,一个干了20年互联网还在探索AI的人。想聊聊的,评论区留言。参考资料
1. METR,《Early 2025: AI-experienced OS developer study》,2025年7月
16名开发者完成246个任务,对照实验显示使用AI的开发者整体慢19%。
https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/
2. Glean,《Work AI Index 2026》,2026年6月
基于6000人调查,每周省11小时,但“伺候AI”花6.4小时,仅13%的人看到明确绩效提升。
https://www.glean.com/work-ai-institute/reports/work-ai-index
3. BCG,《AI at Work 2026》,2026年6月
调查11,749人,47%花更多时间管理AI;有清晰AI战略的企业,增益高25个百分点。
https://www.bcg.com/publications/2026/ai-at-work-why-strategy-matters-more-than-tools
4. Nanda (MIT),《The GenAI Divide: State of AI in Business 2025 Report》,2025年8月
95%企业的生成式AI试点项目,未在损益表中表现出可量化的影响。
https://mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf