ARTICLE · 1017854
AI 开小卖部亏了钱,给它配个 AI 老板有用吗

让 AI 替你做生意,先别急着给它安排一群员工。看看它会不会拒绝一次打折。
Anthropic 真做过这个实验。2025 年,他们和 Andon Labs 把办公室里的一家小卖部交给 Claude 经营,给这位 AI 店主起名 Claudius。它负责选品、定价和补货决策,人负责搬货上架。
店不大,一台小冰箱,几个货篮。顾客主要是自家员工。

图:这家 AI 小店的真实样子,补货仍由人完成(来源:Anthropic 第一阶段报告,2025 年 6 月 27 日)。
有人开玩笑,问它能不能卖钨块。就是那种沉甸甸的金属方块。它接了这门生意,却在没查清成本时先报了价,后来赔钱卖货。
员工再劝几句,它还肯打折。被指出优惠不合理后,它宣布取消折扣码,没过几天又发起来了。
它知道自己该赚钱,也能承认上一笔生意做得不对。可下一位顾客过来,它还是容易答应。
这是我觉得这个实验最有意思的地方。你很难说它听不懂道理;麻烦在于,听懂之后,并没有一直照着做。第一阶段报告发表于 2025 年 6 月。
小冰箱也配上了 CEO
如果下属太好说话,配个老板会不会好一点?
研究团队真给它加了一位 AI CEO,叫 Seymour Cash。到这里,小卖部已经有点眼熟了:下面有人卖东西,上面有人定目标、看汇报。
按同年十二月公布的第二阶段报告,引入 CEO 后,折扣次数减少了约 80%,免费送出的商品数量也减半了。
看起来,管理见效了。
但退款次数变成了原来的三倍,店内消费抵用额度的发放次数翻了一倍。让利换了个名目继续发生。研究人员并不能确定,生意后来好转究竟有多少是这位老板的功劳。
如果只看“折扣减少”这一项,CEO 的成绩单相当漂亮。可店主需要的是剩下更多钱,顾客收到的是哪种优惠,并没有那么重要。
这段故事让我对“给 AI 再配一个审核 AI”多了一点疑心。
假如前一个答应了客户一项额外服务,后一个只检查回复是否礼貌、流程是否走完,那么两个都能交出合格结果。至于这项服务会多花多少时间、谁来承担,可能依然没人算。
多一双眼睛当然可能有用,但得先说清楚,这双眼睛究竟要盯什么。
后来起作用的改动,很不起眼
第二阶段也有好消息:经营表现改善了。
团队升级了模型,也补了工具。库存系统会显示进货成本,新商品报价前要查价格和交期,还能先收款、后订货。采购付款仍保留人工确认。
这些变化同时发生,不能把改善全算在某一项头上。但报告特别提到,让店主按步骤核实信息,是效果明显的改动之一。

图:净值先降后升。横轴为 2025 年月份,纵轴为美元净值;虚线标出模型升级、CEO、工具和门店调整,并非某一项改动的单独效果(来源:Anthropic 第二阶段报告,2025 年 12 月 18 日)。
这个细节比“AI 会开公司了”更值得琢磨。
在顾客面前,立刻报一个便宜价格、承诺尽快到货,是一句很讨喜的话。查完供应商再回来报价,价格可能更高,等得可能更久。后者听起来没那么能干,却更接近一笔能履行的生意。
一个人如果经常用 AI 干活,应该能体会这种诱惑:它答应得越快,我们越容易觉得任务已经往前走了。
方案排好了,日程列好了,客户回复也写得很周到。你关掉窗口时觉得今天做了不少事,第二天才发现,某个关键条件根本没确认。
小卖部把这件事变得特别直观。没有成本的报价,也能写得像模像样。只有等到进货付款,缺的那一块才会显出来。
想做一人公司,可以先试一张报价单
这不是一个足以断言今天所有 AI 能力的实验。它发生在特定版本和工具条件下,顾客还是一群乐于捉弄模型的员工。
但它很适合拿来检查我们交代任务的方式。
假设你一个人接视频制作的单子,让 AI 帮你回客户。客户提出再加两个版本,它很可能写出一封热情、体面的回复。单看这封信,挑不出什么毛病。
你真正需要它一起看的,是原报价包含几个版本、还剩多少时间、客户有没有付这一项的钱。缺了这些信息,回复写得越顺,越容易让你顺手就发出去。
可以从一个小地方试起:给 AI 一张真实报价单和一段客户的新要求,让它先圈出超出原范围的部分,估算新增工作,再拟回复。估不出来的地方留空,由你补上。
验收时也换个问题。别只问“这封回复写得好不好”,再问一句:“照这封信答应下来,我还要多做什么?”
这不需要先搭一家公司,也不需要安排五个角色互相开会。找一笔你熟悉的业务,就能看出它有没有把账算进去。
小卖部的钨块很好笑。换成你的报价、交期和免费修改次数,就没那么好笑了。
把生意交给 AI 之前,最好先看它能不能替你守住一次不该答应的要求。
来源
Anthropic:Project Vend 第一阶段报告,2025 年 6 月 27 日。 Anthropic:Project Vend 第二阶段报告,2025 年 12 月 18 日。
平行的世界,总有另一个视角。
