
CEO-BENCH: Can Agents Play the Long Game?
原文链接:arXiv:2606.18543
这篇论文最抓人的结果是:在一个 500 天公司经营模拟里,最强模型的最佳运行结果,把初始 100 万美元现金做到了 2000 多万美元。
看起来,AI Agent 像是已经能当 CEO 了。
但论文真正想说明的,恰恰不是这个。
上一篇 CEO-Bench 问的是:大模型能不能像 CEO 一样,在多方意见冲突中做一次战略资源配置。
这篇同名 CEO-BENCH 把问题往前推了一步:
AI Agent 能不能真的把一家公司经营下去?
这篇论文最重要的三点
会调用工具,不等于会经营系统。
长期经营最难的,是延迟反馈、隐藏变量和多模块耦合。
顶级 Agent 已经有经营分析雏形,但远远不稳定。
01 让 AI 经营公司 500 天
论文设计了一个创业公司经营模拟器。Agent 要经营一家虚构的订阅制软件公司 NovaMind:开局 100 万美元现金、0 个客户,连续经营 500 个模拟日;如果现金低于 0,公司就破产。
Agent 可以调用工具、写 Python、查业务数据库,还要处理定价、广告投放、市场研究、研发、模型档位、基础设施容量、客服投入、企业客户谈判和社交媒体沟通。
难点在于,这些动作不是独立的。
广告会带来客户,但也会推高基础设施压力;基础设施不足会影响体验,进而带来投诉和流失;研发能提升质量,但要烧钱,而且收益有延迟;企业销售可能带来大单,但报价高了丢单,报价低了伤利润。
所以,这篇论文测的不是 Agent 会不会点工具,而是:
Agent 能不能把工具、数据和行动组织成一个长期经营闭环。
02 这比普通 Agent 任务难在哪里
很多 Agent 评测,本质上还是短周期任务:修一个 GitHub issue,完成一个网页流程,按规则回复一个客服问题。目标明确,反馈也快。
CEO-BENCH 不一样。
它是长周期任务。今天投广告,几周后才看到转化;今天砍客服,后面才看到流失;今天投研发,收益可能更晚才出现。
它也是部分可观测任务。Agent 看不到客户真实满意度、支付意愿和流失倾向,只能从订阅变化、客服工单、收入和社交媒体抱怨里推断。
它还会动态变化。客户偏好会漂移,宏观经济会变化,竞争对手会升级,市场也会逐渐饱和。
这就更接近真实公司经营:
经营能力不是一次正确答案,而是在不完整信息里持续决策、看反馈、修正策略。
03 结果:最好做到 2000 多万美元,但不稳定
论文评估了多个先进模型。结果并不乐观:大多数模型很难稳定跑完 500 天模拟,很多会在中途破产。
只有 Claude Opus 4.8 和 GPT-5.5 的最佳运行结果超过了初始 100 万美元现金。
Claude Opus 4.8 的最佳最终现金约为 2778 万美元,GPT-5.5 约为 2130 万美元。
这个数字看起来很亮眼,但要克制理解。
第一,这是最佳运行结果,不代表稳定能力。论文明确指出,即使是最强模型,也不能稳定盈利。
第二,一个简单规则基线也能做到约 1576 万美元。这个基线不调用大模型,只是固定价格、固定部分策略,并根据使用量调整基础设施容量。
第三,论文估算,这个环境里的理论现金上界大约是 22 亿美元。相比之下,最强模型做到的两三千万美元,距离上界仍然很远。
换句话说:
CEO-BENCH 没有被当前模型刷爆。它暴露的是一个能力缺口:Agent 能做很多局部动作,但还没有稳定掌握长期经营。
04 强模型已经有一点经营分析的样子
这篇论文有意思的地方,不只是模型失败在哪里,也在于强模型开始出现一些能力雏形。
Claude Opus 4.8 会自己写代码,模拟不同客户 cohort 在未来几周、几个月里的现金流变化,用来判断增长策略是否值得继续。
GPT-5.5 会挖掘企业客户谈判历史,从报价、还价、成交和失败记录里,推断企业客户隐藏的价格偏好和质量偏好。
这已经接近真实企业里的经营分析:不是简单问一句“下一步该怎么做”,而是把业务数据取出来,做分析,建预测,形成策略,再执行动作。
但问题也在这里:
这种能力还不稳定。
有些模型过早保守,遇到风险就砍支出,最后活下来了,却没有增长;有些模型过度扩张,短期现金流被打穿;有些模型某一次运行策略不错,换一次运行就可能破产。
这说明当前 Agent 还没有真正掌握“长期战”的节奏。
05 最后
把两篇 CEO-Bench 放在一起看,主线很清楚。
前一篇考的是 CEO 式战略资源配置:在多方意见冲突中做取舍。
这一篇考的是公司经营:在不确定环境里连续做几百个决策,并承受这些决策的后果。
这类 CEO benchmark 变多,本身也很重要。
前一篇给模型设定的是“战略取舍”的评分标准,这一篇给模型设定的是“长期经营”的评分标准。有了可评估的标准,模型训练和产品迭代才会有更明确的靶子。
所以我倾向于认为,这类评测会反过来推动大模型能力改进。不是因为榜单本身多重要,而是因为它把“什么叫更像一个经营者”拆成了可以被测试、比较和优化的任务。
今天很多 Agent 已经能完成单点任务:查资料、写代码、做分析、生成报告、调用工具。
但企业经营不是单点任务。
企业经营是一个长期反馈系统。
CEO-BENCH 的价值就在这里:它提醒我们,AI 从“回答问题”走向“执行任务”已经发生;但从“执行任务”走向“经营系统”,还差一层关键能力。
这层能力,就是长期目标下的反馈闭环。
所以,这篇论文不应该简单理解为“AI 能不能当 CEO”。
它真正问的是:当 AI Agent 拥有工具、数据库和代码执行能力之后,能不能像经营者一样,在几百天里持续推进一个复杂系统?
目前答案是:
已经有雏形,但远远不稳定。
真正的公司经营,不是一次聪明回答,也不是一次漂亮的工具调用。
它是一场长期战。
而今天的 AI Agent,才刚刚开始学习怎么打这场长期战。
夜雨聆风