📍 文 / 老Z
AI Agent 现在最擅长制造一种错觉:只要它会查资料、会调用工具、会写脚本,下一步就能接管一整段业务。
开一家跨境小店能把这个错觉打散。选什么货,找哪个供应商,先进多少库存,价格要不要跟竞争对手,客服能不能答准,关税和合规有没有漏。任何一步看起来都像工具调用,串起来却是经营。经营的结果不按步骤给分,只看最后钱有没有回来。
阿里 Accio Team 和 Yale University 这篇 Business Arena 做了一件很直接的事:把 15 个 LLM Agent 放进一个用真实数据校准的跨境 B2B 商场,让它们从采购到销售独立跑完整周期。结果不太像宣传片。15 个模型平均最终净资产相差九倍,51% 的 runs 亏钱,最好模型仍然明显输给人工设计的经营策略。

图:同一个商场、同一段长周期,不同模型最后赚到的钱差距非常大。
会用工具的 Agent,进商场还是会亏钱
Business Arena 的评价对象是经营过程本身。模型拿到的不是“如何提高毛利率”这种问题,它要真的开一家店。它要看供应商报价、最小起订量、运输时间、目标国家需求、竞争对手价格和关税变化,然后决定买什么、卖给谁、卖多少钱、要不要投广告、怎么回复询盘。
它和我们熟悉的代码 benchmark、网页导航 benchmark差异很大。代码修补有测试,网页任务有目标页面,办公任务有可检查的输出。商业经营没有标准答案。今天低价清库存可能是救命动作,也可能是在亏本甩卖;今天不进货可能是谨慎,也可能是错过窗口。一个动作对不对,经常要等后面几天订单、库存、现金和罚款一起结算。
论文里的主结果很有冲击力。15 个模型的平均最终净资产从 20,856 美元到 188,488 美元,差了九倍。只有四个模型每次都保住起始资本。人工设计的最强策略能做到 436,195 美元,是最好模型均值的两倍以上。

图:虚线是人工策略。模型已经能赚钱,但离熟练经营策略还有清楚距离。
这个差距说明一件事:Agent 的商业能力无法由若干单项能力直接相加得到。会写脚本、会查表、会回复客户,都不等于会把资本滚起来。钱买成库存以后卖不动,模型的上下文再长也不能把现金变回来。
商业评测最难的,是错误要过很多天才结账
论文把商业经营拆成四个难点,我觉得很准。
市场证据是噪声。真实需求、买家偏好、竞争对手意图都藏在不完整信号里。反馈是延迟的。今天的采购决定,可能到交付、上架、询盘、成交以后才知道对不对。环境会变。需求、成本、关税和竞争价格都不是静态表格。还有一层最容易被 Agent 忽略的东西:合规、客服和运营成本每天都在发生,不会因为模型还没想好而暂停。
这就是为什么把 Agent 直接扔进真实业务不合适。它可能浪费真钱,误导客户,触碰合规问题,而且市场条件不能为不同模型重复一遍。Business Arena 的价值在于把这些压力做进一个可复现实验场:风险留在模拟里,决策链保持真实。
旧评测很难覆盖这种耦合。一个 Agent 在单次客服任务上答得很准,不代表它知道这笔订单有没有库存支撑;一个模型会写定价脚本,不代表它会在关税变化后更新成本口径;一个模型会做市场研究,也可能迟迟不下单,最后现金趴在账上没有收益。
还有一个细节值得补上:Arena 里的买家和竞争对手会让模型的短期动作产生长期影子。价格压太低,短期订单可能变多,后面 margin 会被吃掉;广告投太猛,流量上来以后库存跟不上,现金也可能被更快烧掉;客服答得漂亮,如果承诺了库存或规格里没有的东西,后面又会转成纠纷和罚款。这些滞后项让 benchmark 更像经营,而不是一次性销售话术考试。
阿里把商业问答升级成卖家流水线
Business Arena 让模型跑的是完整卖家链路。开局要选择店铺方向,研究可进入的市场,决定初始采购组合。正式营业后,它每天可以检查市场、调整 listing、补货、改价、投广告、处理客服、管理财务和合规。环境背后有真实 Alibaba.com 商品、供应商报价、最小起订量、lead time,也有用权威资料校准的需求周期、关税和市场条件。

图:Arena 覆盖选品、采购、定价、销售、客服、合规和财务,Agent 通过工具在完整链路里经营。
技术上,Agent 通过六十多个 typed MCP 工具行动。这个设计比网页 GUI 干净,也比纯表格问答真实。干净在于每个模型面对同一套工具和世界,结果可复现;真实在于它仍然要处理商业里最麻烦的耦合:买错货会占库存,价格错会亏 margin,客服答错会丢转化,合规漏掉会罚款。
更重要的是,论文不只看最终净资产。最终 profit 很关键,但它太粗。一个模型可能因为保守少亏,一个模型可能因为冒险大赚,另一个模型可能前期策略对、后期被罚款打穿。Business Arena 额外拆了资本利用、库存周转、sell-through、订单 margin、路线成本、广告 ROI、买家转化、事实性回复、RFQ 成功率和罚款。这样才知道模型到底是哪里会,哪里不会。
模型像不同老板,有的会卖货,有的只会客服
最有意思的一部分是模型画像。强模型也有短板,弱模型偶尔会在某个单项上冒头。它们更像不同风格的老板。
GPT-5.6 Sol 像 Volume Wholesaler。它资本部署积极,库存周转快,会写规则筛掉风险商品,优先高需求和高 margin 路线,保留一部分现金继续滚动。Gemini 3.1 Pro 更像 Premium House。它用 route-aware repricer 计算供应商成本、运费、关税和竞争价格,坚持 15% margin floor,卖得没那么快,但毛利保护得好。

图:模型能力不是一条线。有的会部署资本,有的会客服,有的卡在合规或工具调用。
还有一些反差更值得产品团队看。Opus 4.8 客服转化很强,能达到 84%,但整体经营不强。它像一个客户服务专家,不像能管全店的经营者。DeepSeek V4 Pro 这类模型会被合规罚款拖累,说明“能完成任务”和“能在约束里完成任务”中间还有距离。
论文的 action-level attribution 也很实用。它能把一条轨迹里的盈亏拆回具体证据、动作和结果。同一个 Gemini 3.5 Flash,在一个 SKU 上选对供应商、算对巴西 landed cost,拿到 31.5% order margin;在另一个 SKU 上低估配送成本,价格低于真实成本栈,最后 margin 亏到 37.0%。如果以后要训练 business agent,这种拆解比一句“这轮亏了”有用得多,因为它知道该强化哪类决策、纠正哪类成本口径。
论文里的机制消融把这个判断又钉了一下。它分别测试了选品、市场事件、定价、关税和客服五个机制:如果使用需求证据选择商品,最终净资产比负面对照高 63.6k 美元;如果完整覆盖成本再定价,比贴近成本乱卖高 50.3k 美元;如果把关税纳入市场选择,也能多出 25.9k 美元。这些对照的意义是排除“模型只是钻模拟器漏洞”。至少在这五个环节上,按正常商业逻辑行动确实带来更高结果。
我会把这看成 Business Arena 最重要的防作弊设计。没有这些消融,排行榜很容易变成又一个分数游戏:某个模型可能刚好利用了世界规则里的缝隙,看起来赚了钱,却没有学会经营。消融把“合理行为”和“忽略机制”“误用机制”放在同一张桌上比较,才让净资产更像能力指标,不能只靠一次模拟运气。

图:赚钱不能只看花钱多少,还要看资本部署、周转和毛利之间的平衡。
这套商场还不完整,但账本足够硬
我对这篇论文的态度比较明确:它没有证明 Agent 已经会做生意;它把“Agent 能不能经营”这件事从口号拉回了账本。
它也有边界。Arena 把外部系统抽象成结构化工具,所以评的是模型怎么决策,不是它能不能稳定操作真实店铺后台、邮箱、CRM 和支付系统。场景集中在跨境 B2B commerce,不能代表餐饮、本地服务、SaaS 销售或内容电商。真实生意里还有品牌、长期客户关系、供应商信任、突发舆情,这些很难完整塞进模拟环境。
但这个边界没有削弱它的价值。相反,结构化环境让比较更干净。至少我们能看见:同一个市场,同一套工具,同一笔起始资金,模型到底怎样把钱变成库存,再从库存变回更多的钱。很多 Agent demo 最擅长展示动作链,Business Arena 逼它展示结果链。
未来我会更关注这类 benchmark,而不是只看“能否完成一个商业任务”。接近商业部署的 Agent,要能在几天、几十天的反馈里修正自己。它要知道什么时候进货,什么时候停手,什么时候降价,什么时候别为了成交把 margin 卖没。开店不能把工具调用排成流程图。开店是每个动作最后都会回到账上。
✍️ 老Z ·
欢迎转发,谢绝洗稿
夜雨聆风