乐于分享
好东西不私藏

AI Agent 大赚 20 倍,为什么还说它不会经营公司?

AI Agent 大赚 20 倍,为什么还说它不会经营公司?

CEO-BENCH: Can Agents Play the Long Game?

原文链接:arXiv:2606.18543

这篇论文最抓人的结果是:在一个 500 天公司经营模拟里,最强模型的最佳运行结果,把初始 100 万美元现金做到了 2000 多万美元。

看起来,AI Agent 像是已经能当 CEO 了。

但论文真正想说明的,恰恰不是这个。

上一篇 CEO-Bench 问的是:大模型能不能像 CEO 一样,在多方意见冲突中做一次战略资源配置。

这篇同名 CEO-BENCH 把问题往前推了一步:

AI Agent 能不能真的把一家公司经营下去?

这篇论文最重要的三点

会调用工具,不等于会经营系统。

长期经营最难的,是延迟反馈、隐藏变量和多模块耦合。

顶级 Agent 已经有经营分析雏形,但远远不稳定。

01 让 AI 经营公司 500 天

论文设计了一个创业公司经营模拟器。Agent 要经营一家虚构的订阅制软件公司 NovaMind:开局 100 万美元现金、0 个客户,连续经营 500 个模拟日;如果现金低于 0,公司就破产。

Agent 可以调用工具、写 Python、查业务数据库,还要处理定价、广告投放、市场研究、研发、模型档位、基础设施容量、客服投入、企业客户谈判和社交媒体沟通。

难点在于,这些动作不是独立的。

广告会带来客户,但也会推高基础设施压力;基础设施不足会影响体验,进而带来投诉和流失;研发能提升质量,但要烧钱,而且收益有延迟;企业销售可能带来大单,但报价高了丢单,报价低了伤利润。

所以,这篇论文测的不是 Agent 会不会点工具,而是:

Agent 能不能把工具、数据和行动组织成一个长期经营闭环。

02 这比普通 Agent 任务难在哪里

很多 Agent 评测,本质上还是短周期任务:修一个 GitHub issue,完成一个网页流程,按规则回复一个客服问题。目标明确,反馈也快。

CEO-BENCH 不一样。

它是长周期任务。今天投广告,几周后才看到转化;今天砍客服,后面才看到流失;今天投研发,收益可能更晚才出现。

它也是部分可观测任务。Agent 看不到客户真实满意度、支付意愿和流失倾向,只能从订阅变化、客服工单、收入和社交媒体抱怨里推断。

它还会动态变化。客户偏好会漂移,宏观经济会变化,竞争对手会升级,市场也会逐渐饱和。

这就更接近真实公司经营:

经营能力不是一次正确答案,而是在不完整信息里持续决策、看反馈、修正策略。

03 结果:最好做到 2000 多万美元,但不稳定

论文评估了多个先进模型。结果并不乐观:大多数模型很难稳定跑完 500 天模拟,很多会在中途破产。

只有 Claude Opus 4.8 和 GPT-5.5 的最佳运行结果超过了初始 100 万美元现金。

Claude Opus 4.8 的最佳最终现金约为 2778 万美元,GPT-5.5 约为 2130 万美元。

这个数字看起来很亮眼,但要克制理解。

第一,这是最佳运行结果,不代表稳定能力。论文明确指出,即使是最强模型,也不能稳定盈利。

第二,一个简单规则基线也能做到约 1576 万美元。这个基线不调用大模型,只是固定价格、固定部分策略,并根据使用量调整基础设施容量。

第三,论文估算,这个环境里的理论现金上界大约是 22 亿美元。相比之下,最强模型做到的两三千万美元,距离上界仍然很远。

换句话说:

CEO-BENCH 没有被当前模型刷爆。它暴露的是一个能力缺口:Agent 能做很多局部动作,但还没有稳定掌握长期经营。

04 强模型已经有一点经营分析的样子

这篇论文有意思的地方,不只是模型失败在哪里,也在于强模型开始出现一些能力雏形。

Claude Opus 4.8 会自己写代码,模拟不同客户 cohort 在未来几周、几个月里的现金流变化,用来判断增长策略是否值得继续。

GPT-5.5 会挖掘企业客户谈判历史,从报价、还价、成交和失败记录里,推断企业客户隐藏的价格偏好和质量偏好。

这已经接近真实企业里的经营分析:不是简单问一句“下一步该怎么做”,而是把业务数据取出来,做分析,建预测,形成策略,再执行动作。

但问题也在这里:

这种能力还不稳定。

有些模型过早保守,遇到风险就砍支出,最后活下来了,却没有增长;有些模型过度扩张,短期现金流被打穿;有些模型某一次运行策略不错,换一次运行就可能破产。

这说明当前 Agent 还没有真正掌握“长期战”的节奏。

05 最后

把两篇 CEO-Bench 放在一起看,主线很清楚。

前一篇考的是 CEO 式战略资源配置:在多方意见冲突中做取舍。

这一篇考的是公司经营:在不确定环境里连续做几百个决策,并承受这些决策的后果。

这类 CEO benchmark 变多,本身也很重要。

前一篇给模型设定的是“战略取舍”的评分标准,这一篇给模型设定的是“长期经营”的评分标准。有了可评估的标准,模型训练和产品迭代才会有更明确的靶子。

所以我倾向于认为,这类评测会反过来推动大模型能力改进。不是因为榜单本身多重要,而是因为它把“什么叫更像一个经营者”拆成了可以被测试、比较和优化的任务。

今天很多 Agent 已经能完成单点任务:查资料、写代码、做分析、生成报告、调用工具。

但企业经营不是单点任务。

企业经营是一个长期反馈系统。

CEO-BENCH 的价值就在这里:它提醒我们,AI 从“回答问题”走向“执行任务”已经发生;但从“执行任务”走向“经营系统”,还差一层关键能力。

这层能力,就是长期目标下的反馈闭环。

所以,这篇论文不应该简单理解为“AI 能不能当 CEO”。

它真正问的是:当 AI Agent 拥有工具、数据库和代码执行能力之后,能不能像经营者一样,在几百天里持续推进一个复杂系统?

目前答案是:

已经有雏形,但远远不稳定。

真正的公司经营,不是一次聪明回答,也不是一次漂亮的工具调用。

它是一场长期战。

而今天的 AI Agent,才刚刚开始学习怎么打这场长期战。

相关学习资料