ARTICLE · 1120765
只看得见分母:管 AI 支出,为什么只剩下限额这一招
据 The Information 今年 4 月报道,Uber 的 CTO 透露,公司用 4 个月就花完了全年的 AI 预算。[1]
6 月,Uber 发言人对 Bloomberg 说,公司给 Claude Code、Cursor 这类 AI 编程工具定了上限:每个员工每个工具每月最多花 1500 美元。[2]
这个数字回答了"最多能花多少",没回答"花出去的钱换来了什么"。给每个人设同一个上限,等于默认用得多就是浪费。
我的判断是,公司这样管,是因为后一个问题还答不上来:花了多少钱能算到每个人、每一天,换来的产出值多少,却没有公认的算法。
账单变了
以前 AI 编程工具按人头卖席位,每人每月一个固定价,多用不多花。公司只需要决定买不买。
现在越来越多的工具按 token 计费,用得越多,花得越多。
Jellyfish 分析了 200 家公司约 1.2 万名开发者 2026 年第一季度的数据:花得最少的 20% 的人,一个季度约 3 美元;最多的 20% 花了 1822 美元,差约 600 倍。[3]
据 Fortune 报道,Accenture 一次内部分析发现,某个 AI 工具 10 周里用量涨了 113 倍,19% 的用户花掉了约 80% 的钱。[4]
只看得见分母
把 AI 的价值写成一个分数:分子是换来的产出,分母是花掉的钱。
分母算得很细。Claude Code 的花费报表能按人、按模型看估算的花费,每天更新。[5]
分子很少有公司说得清。一种做法是发问卷:DX 让工程师定期自报省了多少时间,平均每周 3.9 小时。[6]
METR 做过一个随机对照实验:16 位资深的开源开发者做了 246 个真实任务,每个任务随机决定能不能用 AI。
能用 AI 时,他们反而慢了 19%,事后却以为自己快了 20%。[7] 那是 2025 年初的工具。
METR 今年 2 月说,现在的提速很可能更大,但新数据太弱,说不清大多少;它也再次提醒,开发者自报的提速可能很不可靠。[8]
看不见分子,就只能管分母。
今年 6 月到 9 月,GitHub Copilot、OpenAI 和 Anthropic 先后在企业套餐里上线或扩展了按人的花费上限,员工用超了可以申请,由管理员审批。[9]
限额背后的那个前提
限额只卡用得最多的人。一刀切地卡住他们,前提是:用得多,大概率是浪费。
这可能对。重度使用里确实有浪费,比如 agent 原地绕圈,或者用最贵的模型做最简单的事。
也可能不对。用得多的人,也可能是最会用 AI、在做最难的活的人。卡住他们,省下的钱可能远小于损失的产出。
哪种情况更多,限额不会告诉你。
连预算本身也常常是猜的:Harness 今年 6 月发布的调研里,700 名千人以上公司的技术决策者和经理,56% 说 AI 预算是"靠猜"的。[10]
也有一种反驳:AI 编程工具本来不贵。Claude Code 的文档说,企业里开发者平均每人每月花 150 到 250 美元。[5]
按美国工程师一年约 20 万美元的全部用人成本粗算,只占 1% 到 1.5%,不值得逐人算账。
这对一般用户也许成立,但限额卡住的不是一般用户。
AI 支出分析公司 Larridin 统计了按用量付费、而且在合并代码的工程师:中位数每月约 920 美元,前 25% 的人每月超过约 2100 美元。[11]
Uber 的 1500 美元上限正好落在两者之间。要回答的,恰恰是这群人的钱花得值不值。

限额也可能只是为了让预算可预测。即便如此,它也是拿被卡掉的产出去换可预测。划不划算,得先知道那部分产出值多少。
分子开始有人算了,但各算各的
已经有几家公司在卖"分子",算法各不相同:
算法不同,结论也对不上。
Jellyfish 的数据里,花得最多和最少的 20% 的人,钱差约 600 倍,合并的 PR 只差 1 倍:一个季度 23 个对 11 个。
每个合并 PR 的成本,从花得最少那一档的 0.28 美元,到最多那一档的 89.32 美元。[3] 看起来是严重的收益递减。

Larridin 比较的是同一家公司的两组工程师。
AI 用得最深的那组里,每周花约 1300 美元的人,按复杂度加权的产出是这组花得最少那一档的 11.8 倍,看起来花得越多,产出越多。
AI 用得没那么深的那组,每周花过约 600 美元以后,边际回报降到约一半。[11]
两家并不直接矛盾:Jellyfish 的数据来自 200 家公司,Larridin 这两组来自一家,分组和算产出的方法也不一样。
口径一变,结论就跟着变。
两家的数字也都只是相关。Larridin 自己承认,因果可能反过来:产出多的人要交付的多,所以花得多。[11]
Jellyfish 也没有排除另一种可能:花得多的人,本来就在做更难、更大的活。
缺的是口径和审计
财务报表能被信任,靠两样东西:一套公认的口径,规定什么算收入、什么时候确认、怎么折旧;还有独立的审计,检查数字是不是按口径算的。
AI 的产出两样都还没有。
Linux Foundation 今年 8 月才成立 Tokenomics Foundation,要给 AI 的价值和 ROI 定口径。[14]
卖分子的公司各用各的口径,上表里的四家,要么很粗,只数 PR;要么没完全公开。这几家都没有拿出证据,证明自己的分子和真实价值相关。
审计更谈不上。上面的数字都是卖分子的公司自己发布的,数据和算法都出自它自己。就算口径定下来,也还要有人独立检查。
会计学处理过的几个难题,这里都有:
什么算一份产出?(计量单位) 一份产出由人和 AI 一起完成,工程师的工资该分多少到它头上?(成本分摊) 今天花的 token,价值要几个月后才看得清。它该算当期费用,还是像开发软件的部分成本那样,记成资产慢慢摊销?(资本化) 合并了、三个月后又被回滚的代码,算什么?(减值)
第一个问题,客服行业已经有一种答法。
Zendesk 的 AI 按结果收费,每次自动解决收 1.5 美元,但工单关闭后 72 小时内客户没有重开,才算一次解决。[15]
代码也可以照着定:合并后 N 个月内没被回滚、没被大改,才算一份产出,这也顺带回答了第四个问题。N 定多长、由谁认定,目前没有公认的答案。
如果你在管 AI 预算:你的限额是怎么定的?你怎么判断一个人用得多是值,还是浪费?
参考资料
The Information,Laura Bratton,2026-04-14,Uber CTO Shows How Claude Code Can Blow Up AI Budgets。正文在付费墙后面,"4 个月"和"CTO 透露"据 TechCrunch 2026-06-02 的转述。https://www.theinformation.com/newsletters/applied-ai/uber-cto-shows-claude-code-can-blow-ai-budgets Bloomberg,Natalie Lung,2026-06-02,Uber Caps Usage of AI Tools Like Claude Code to Manage Costs。https://www.bloomberg.com/news/articles/2026-06-02/uber-caps-usage-of-ai-tools-like-claude-code-to-cut-costs Jellyfish,Nicholas Arcolano,2026-04-15,Is "tokenmaxxing" cost effective? New data from Jellyfish explains。成本按公开的 Claude API 价格估算。https://jellyfish.co/blog/is-tokenmaxxing-cost-effective-new-data-from-jellyfish-explains/ Fortune,Sheryl Estrada,2026-07-29,CFOs are hitting a 'cost wall' on AI。https://fortune.com/2026/07/29/cfo-hitting-cost-wall-ai-tokens-accenture/ Claude Code 文档,Manage costs effectively,2026-10-02 查阅。https://code.claude.com/docs/en/costs DX,2026-05-19,How to measure AI performance in software engineering。https://getdx.com/blog/measure-ai-impact/ METR,2025-07-10,Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity。https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/ METR,2026-02-24,We are Changing our Developer Productivity Experiment Design。https://metr.org/blog/2026-02-24-uplift-update/ 各厂商的公告: • GitHub,2026-06-01,Updates to GitHub Copilot billing and plans。https://github.blog/changelog/2026-06-01-updates-to-github-copilot-billing-and-plans/ • GitHub,2026-09-16,Copilot budget increase requests are generally available。https://github.blog/changelog/2026-09-16-copilot-budget-increase-requests-are-generally-available/ • OpenAI,2026-06,New usage analytics and updated spend controls for enterprises。https://openai.com/index/chatgpt-enterprise-spend-controls/ • Anthropic,2026-07-02,Giving admins more visibility and control over Claude spend。https://claude.com/blog/giving-admins-more-visibility-and-control-over-claude-usage-and-spend Harness,2026-06,2026 State of AI in FinOps。https://www.harness.io/state-of-ai-in-finops-2026 Larridin,AI coding 基准数据,截至 2026-08-02 的 4 周。https://larridin.com/data Ascerta,Forge 产品页。https://ascerta.com/product/forge Faros AI,Token Intelligence 产品页。https://www.faros.ai/platform/token-intelligence Linux Foundation,2026-08-04,Linux Foundation Launches the Tokenomics Foundation to Define the Economics and ROI of AI Value。https://www.linuxfoundation.org/press/linux-foundation-launches-the-tokenomics-foundation-to-define-the-economics-and-roi-of-ai-value Zendesk,按结果计价的介绍,2026-10-02 查阅。https://www.zendesk.com/blog/ai/agentic-ai/outcome-based-pricing/