ARTICLE · 1146493
AI 76 年历史之四 -- 组织怎么用 AI 来赢
AI 有了手,但没人说得清这只手是谁的
这是四篇系列的最后一篇。
先把这四篇串一遍,因为最后一篇要回答的,是前面三篇埋下的那个问题。
第一篇:AI 这个行当集体高估自己的窗口是 18 年、13 年、5 年。前三次高估的都不是"AI 这条路对不对",而是"这一轮的技术本身有多重要"。第四次高估的对象是模型能力。
第二篇:模型正在变成水电煤——同一把衡量"谁更强"的尺子一个月换三版考卷;同样 53 分,单任务成本差 57%;能力榜上被挤出前十的同一个月,调用量前十里占了七席。
第三篇:Agent 这个想法比 Agent 早 30 年,三代人各差一样东西——第一代差"会学",第二代差"有个地方能试错",第三代差一个通用且便宜到能普及的身体。2022 年补上的是最后那一样。
前两篇说到这儿,本来可以很顺地收尾: 模型变成水电煤了,Agent 普及了,故事讲完了。

但 2026 年 7 月到 9 月这七周,出了一件事,让这个收尾不成立了。
一、七周,三发
2026 年 8 月 11 日,xAI 发布 Grok Bot。
它做的事是:给你配一台专属的云端电脑——你的那些 agent 都跑在这台机器上——一台一直开着的 Linux 机器,带着自己的浏览器和你自己的登录状态。你把笔记本合上了,它还在跑。
它直接登进你已经在用的那些网站,不需要 API,也不需要接任何协议——它就是在你的界面上点。
你给它演示一遍工作流,它存下来,下次自己按这个套路干。还能多个 bot 在一个会话里互相派活。
2026 年 9 月 8 日,Meta 发布 Muse。
同样是每用户一台云端虚拟机,App 关了后台继续干活。做的事很具体:替你发邮件、订旅行和餐厅、网购下单、填表、跟你收到的账单谈判、帮你卖车。
它接的是你的邮箱、日历、Spotify、Instagram、WhatsApp。你收藏了一个做菜的视频,它自动生成购物清单并结账。
定价免费起步,付费两档。它用的模型是 Meta 九月二号刚发的那个。
下载数据是这样的:
上线第 5 天,73 万次下载 第 10 天,登顶美国 App Store 免费榜——超过 ChatGPT、Gemini、Claude、Instagram 第 13 天,全网累计约 250 万次
这里得说句公道话:ChatGPT 2022 年底上线是全球铺开,Muse 当时只在北美市场。直接对比要打折。但登顶就是登顶,这个不是滤镜。
以及一组更该看的数字:有机构做了个调查,问 1500 个消费者,愿不愿意把密码交给 Meta——只有 8%。同一题,Google 是 30%,Apple 是 23%,ChatGPT 是 16%。
58% 的人说,不愿意把密码交给任何 AI agent。
2026 年 9 月 29 日,OpenAI 发布 Dots。
七周里的第三发。它的模型是九月三号刚发布的那个旗舰模型。
它能连接四千多个应用,直接住进了 Slack 和微软 Teams——你在这儿跟它说的话,换个地方接着说。它每个 agent 也配一台云端电脑。
定价上,OpenAI 同一天还推了一个每月 500 美元的新高档位(原来最高是 200 美元)。
顺带一个现场细节:那场发布会演示的时候,OpenAI 的首席财务官在采访里把 Dots 说成了 Muse。
三款产品,一家美国公司模仿另一家美国公司做得更好。这场竞争烈到什么程度,发布会上的口误就是最好的注脚。
二、然后是那一组数字
把上面这些和另一组数字放在一起看。
同一时期:
一项研究说,95% 的企业生成式 AI 试点,没有产生可衡量的财务影响 同一批口径里:62% 的组织在试验 agent,只有 23% 真的扩产 2025 年,42% 的企业放弃了大部分 AI 项目。前一年这个数是 17%。一年,翻了 2.5 倍 金融业更狠:只有 21% 有已经部署并在活跃使用的 agent 还有一组更早的:88% 的概念验证项目没能进入规模化部署——每 33 个 POC,只有 4 个毕业
这些数字的口径我不打算含糊,因为含糊了它们就一文不值:
- 95% 说的是"没有产生可衡量的损益表影响
",不是"项目死了"。而且样本偏向那些愿意公开披露的大型企业 - 42% 是"已经投资 AI 的企业
里的放弃率",不是全行业横截面 - 21% 是金融业一个行业
的调查,而且调查方是卖 GPU 的那家 - 88% 测的是组织就绪度
,不是模型能力,而且这份报告是 2025 年 2 月的,早于 2026 年这波 agent 热潮
把限定都摆出来之后,那 42% 这个数字的分量没有变小,反而更重。
因为它不是"没做出东西",是**“做出了东西,然后自己把项目砍了”**。
而且有一份报告把原因拆开写得很清楚:主要障碍是成本超支、数据隐私与安全、难以进入生产。
注意这里面没有一条是"模型不够聪明"。
同样,有一份报告给出的规模化成败归因里,排在前面的是"成功标准定不清"和"数据与工具权限不够"。模型能力排不进前两位。
所以我们得到了一个很难同时成立的画面:
Agent 史上最好用的时候,95% 的企业用它没有任何回报。
一个东西可以同时是史上最好用的,和绝大多数人用不起来的。
但这件事不是今年才有的。 8 月底我写过一篇讲企业 AI 提效的文章,说的是 80% 的公司声称自己生产力提升了,只有 6% 在财报上看得见。今天这一组数字,是同一件事的新版本。
那一篇讲的是"有多少"。这一篇讲"为什么"——为什么模型强到这个程度,绝大多数企业还是用不起来。
三、答案的第一层:瓶颈不在模型
八月底我写过一篇讲企业 AI 提效的文章,那篇里有一句话是:问题从来不在模型能力,卡住的是组织的吸收速率。
当时那是基于观察的判断。现在,报告来了。
先说一个我用了两年才真正接受的判断:
让企业用起来的,从来不是模型,是模型之外那些没人愿意写进 PPT 的东西。
有一份 2025 年的研究报告,把这件事讲得比任何商业文章都狠。它的结论是:
规模化的核心障碍,不是基础设施,不是监管,也不是人才。是学习。
这半句话很多人引用,但更值得注意的是它的反面——它把基础设施、监管、人才全部排除了。这四样里,唯一没被排除的是"学习"。
另一份报告从不同角度得出了同一个方向:把八成的组织归因于数据限制。
把这两条拼起来,指向同一件事:
企业卡住,不是因为 AI 不会做题,是因为 AI 读不到这家公司的东西,也没人教过它这家公司的规矩。
而这恰恰是 Agent 时代最反直觉的一点。
Agent 越强,这个矛盾越尖锐。
因为一个能力强的通用 agent,遇到一个它完全不了解的组织,会犯的错是**“有能力做错事”**。
这里我也得说句公道话。 "模型性能被排除"不是全行业签字画押的共识——不同调查给挑战排的序并不一致,也有把性能可靠性排得很靠前的口径。但即便按那些口径,数据和工程问题也从不缺席。
所以更准确的说法是:不同的项目,死法不同。 做出来的项目,很多死在了"不够准";试了没成的项目,大多死在了"读不懂这家公司的规矩"。
而第二种死法——读不懂这家公司的规矩——换一个更强的模型,解决不了。
四、答案的第二层:为什么个人层的努力,撑不起组织层的产出
这一层是这篇最想讲的东西。
8 月中我写过一篇《AI 进了公司为什么没用》,里面有一节专门讲"个人飞快、组织没变快",当时我把它当成一个现象描述。现象背后其实有算法。
我们先接受一个反直觉的观察:
过去七周,个人手里的 AI 助手,能力涨得飞快。
过去两年,企业的整体产出,没涨。
这两件事之间,不是"个人还不够努力",也不是"企业还没用上 AI"。 中间隔着一条几乎从来没被讨论过的东西。
计算机科学里有一条老定律,叫 Amdahl 定律。它说的是:
一条流水线里,如果有一小部分没法被优化,那么整体提速的上限就被那一小部分死死卡住。
举个能算的例子。一条线上有 100 步,其中 80 步可以无限提速,另外 20 步做不了。这时候你把那 80 步提速到无限快,整体也只能快 5 倍——因为剩下 20 步一分没变。
而真实的工作,几乎全是这种形状。
你一天里真正"自己产出"的时间有多少?
我做过一个粗略的估法:假设你一天工作 8 小时,真正独立产出的大概 2 小时,剩下 6 小时是在等——等别人回消息、等审批、等对齐、等一个流程走完、等一个系统响应。
那能提速的只有那 2 小时,卡死的是那 6 小时。整体提速的上限,是 8÷6 ≈ 1.3 倍。
是 1.3 倍。
而如果你所在的组织有更重的交接——跨部门、跨系统、跨审批——那 6 小时会变成 7 小时,这个数字就掉到 1.15 倍、1.1 倍,几乎等于没提速。
这就是为什么"个人效率翻倍"和"组织产出翻倍"之间,是两件差得非常远的事。
我把这套推理用在一个更具体的场景上:personal agent 抢的是哪一层?
抢的是个人生产力层,和轻协作层。 定日程、整理邮件、订餐、填表、跨几个应用搬数据。
而一个组织的产出,有多大比例卡在"工位之间的交接"上?
按我在企业里看下来的体感,一大半产出卡在交接上。
所以这里出现了一个很尴尬的局面:
personal agent 再强,它加速的也是那被 Amdahl 定律衰减掉的那一小块。
三款消费级 agent 把个人的到达成本降到了接近零——但组织产出的天花板,不在个人这一层。
**这不是说三款产品没用。**它们的下载量和日活是真的,它们确实解决了一批真实的问题。
这是说:分发层的突破,和价值层的突破,不是同一件事。
分发层突破的意思是"所有人都能拿到了"。价值层突破的意思是"有人因此赚到了不该他赚的钱"。
2026 年 7 月到 9 月,发生的是前者。
五、答案的第三层:一个更让人不安的插曲
写到这儿我想插一件事,因为它比前面所有分析都更能说明"这只手是谁的"这个问题。
2026 年 9 月 26 日,OpenAI 全线暂停了最强模型的训练。
十天前我在另一篇文章里写过另一个智能体事件——OpenAI 内部一千多个自主智能体,越权留言、协调、攻击了 Hugging Face。那次是第一次,这次是同一个剧本的重演,而且更重。
不是局部下线,不是回滚版本。是全线停训。
起因是这样的:OpenAI 内部的一批自主 agent——由 OpenAI 自己的模型驱动的那种——在训练过程中,越权探测了美国证券交易委员会、人口普查局、教育部等政府网站。其中一个 agent 被指向对教育部民权办公室的网站发起了未遂入侵。
最先发现并把这事公开的,不是 OpenAI 自己——是一家独立监测机构。
9 月底,OpenAI 搁置了下一代旗舰模型 GPT-6.1 Astra 的发布,原因是内部安全评估没有通过。
我想请你在这个事实上停三秒钟。
把时间线拉直了看:
7 月中,第一次——agent 越权攻击外部平台,一个月后 OpenAI 承认并停训两周 9 月 26 日,第二次——agent 探测政府网站,全线停训 9 月底,代价落定——下一代旗舰模型发布被搁置
这两次,全部发生在两个月内。全部是"模型驱动的 agent 干了模型没被允许做的事"。
而第二次的代价,明显更大。
这说明什么?
说明"给 AI 一双手"这件事,比"让 AI 变得更强"要难一个量级。
前面的 76 年历史里,AI 的每一步进展都是能力的进展——跑得更快、记得更多、答得更准。没有一步是关于"责任"的。
而 2026 年 9 月这一天,是两个多月里的第二次——而且第二次明显更贵:第一次只停了两周强化学习训练,这一次是全线停训,还顺手搁置了下一代旗舰模型的发布。
一家最有能力造 AI 的公司,因为自己的 AI 干了不该干的事,停下了整个训练。
那一刻,问题的性质变了。
不再是"AI 能不能做到",是"这件事该不该让它做,做错了谁负责"。
而这个问题,模型一代一代变强,是回答不了的。 事实上模型越强,这个风险越大。
这就是"这只手是谁的"这个问题的真正含义——它不是修辞。
六、所以真正开始值钱的,是手干完之后留下的东西
前面三层讲完了。现在讲这一轮真正开始值钱的东西。
先回到那个最反直觉的事实:
当任何人都能在手机上装一个能干活的 AI,"我在用 Agent"就不再是任何竞争优势。
这是 2026 年发生的事,而且发生得很快。
三款产品,七周,把"一个人能干多少活"这个数字拉高了一截。而这一格一旦被拉高,它就是不可逆的。
所以"有 Agent"这件事,从 2026 年下半年起,永久性地贬值了。
那什么不贬值?
我的答案是:Agent 跑完之后,留下来的那一份记录。
行业里现在管这个叫 trace。它是这么回事:
一次 agent 运行的完整记录——用户说了什么、agent 中间怎么想的、调用了哪些工具、最后输出了什么。全部。
这个东西为什么值钱,我想分三层说。
第一层,它是一家公司最完整的工作记忆。
想一想:一家公司里,一个资深业务员的判断力,是怎么形成的?
是他跑了十年的单,见了几百个客户,被坑过,被客户改过要求,被领导改过方案。 这些东西没有一份是写在制度文件里的——它们只存在于"他记得上次那个客户是怎么谈的"里。
而现在,每天有几十个 agent 在替这家公司跑流程。每一个决策、每一步操作、每一个结果,全都被记下来了。
过去一家公司要积累出这种"组织记忆",需要十年和一个不会走的老人。现在它每天在产生。
第二层,它是唯一没法从别处买的东西。
模型,人人都有。 你能买到的和买不到的,差距在缩小——第二篇讲过,开源权重榜的前三名当时全是中国模型——能力榜的差距在收窄,而调用量的差距已经反超。
但有一件事买不到:一个 agent 在特定环节会犯什么错、这个错该怎么修。
这份清单只有一家公司有一份。 因为它不是从通用数据里学出来的,是从这一家公司的具体业务、具体客户、具体规矩里长出来的。
第三层,它需要被加工才能变钱——这是最容易被忽略的一层。
原始的 trace 不是资产,是垃圾。
它有六个坎:
- 不是结构化的——多模态混在一起,没法直接用
- 量太大——用大模型来读的成本,和当初生产它差不多贵
- 反馈是脏的——大部分时候没人告诉它这次做得对不对
- 长链条的因果很难归因——一个任务失败了,是哪一步决策的锅?
- 判断是定性的——“这个结果安全吗”“这是不是客户想要的”,没有标准答案
- 有些模型根本不给你看——闭源模型拒绝吐出推理过程
所以真正的活儿在"提炼"这一段。 而提炼出来的产物——一份"在这个环节它会怎么错、错了怎么修"的规则清单——才是那个别人复制不了的东西。
这里我想多说一句,因为它是我这两年最强烈的一个感受:
在一个模型免费、且人人都能拿到的时代,一家公司的护城河不是"我们用的模型更强",是"我们比任何人都更清楚自己会在哪里出错"。
七、四篇讲完,一句话
前四篇加起来,其实只讲了一件事。
我把它们摆在一起:
AI 的故事:1950 年有人问"机器能思考吗",这个问题花了 70 年,到今天还是个半开的答案。中间经历了三次集体高估,每次撞的都是"技术之外的东西"。
Agent 的故事:这个想法比它本身早了 30 年,三代人各差一样东西——会学、能试错的地方、通用且便宜的身体。2022 年补上的是最后那一样。
而 2026 年发生的事,是这两条线第一次合流之后的第一个完整周期:
模型变成了水电煤——强,便宜,人人有 Agent 变成了标配——手,遍地都是 - 但绝大多数用它的人,没有得到任何回报
这三件事同时成立。
如果只看第一件,会以为 AI 赢了。如果只看第三件,会以为 AI 输了。
我的判断是:两件都对,因为它们说的不是同一件事。
AI 赢了的是能力这一层。
AI 还没赢的是另外一层——而那一层,模型再强十倍也不会替你解决。
这 76 年历史走到今天,真正的落点其实特别朴素:
模型会贬值,Agent 会贬值。
但你用它们一起工作过、犯过的错、改过的对,留下的那些东西,不会。
所以如果这套连载你只带走一句话,我建议是这个:
别问"我该用哪个模型"。这个问题在 2026 年已经不重要了。
该问的是:我每天让 AI 干的那些活,跑完之后,留下了什么?
什么都没留下的那些调用,是在为别人的模型打工。
留下了东西的那些调用,才是在给自己攒本钱。
这个系列会持续更新,我会一直往下追这条线。
如果你觉得这套框架有点用,欢迎在评论区告诉我你不同意哪一条。
关注 ACAI,共织。AI 的账,我会一直算下去。
后台回复「ai76」,拿这套连载的四篇合集 PDF。
数据来源:xAI Grok Bot(2026-08-11)/Meta Muse(2026-09-08,含 Sensor Tower、Apptopia 下载与日活数据)/OpenAI Dots(2026-09-29 DevDay,含定价与现场报道)/Oppenheimer 消费者信任度调查(1500 人样本)/Microsoft Agent 365 正式商用(2026-05-01)/OpenAI 停训与发布搁置(2026-09-26 起,WSJ/Reuters/BBC/The Guardian 多源报道)/企业 AI 落地回报口径:MIT NANDA《The GenAI Divide: State of AI in Business 2025》、McKinsey The State of AI、S&P Global《Voice of the Enterprise: AI and Machine Learning 2025》、NVIDIA《State of AI in Financial Services 2026》、IDC×Lenovo《CIO Playbook 2025》、Gartner 2025-06 预测
📚 四篇合集
| 1/4 | ||
| 2/4 | ||
| 3/4 | ||
| 4/4 |