关注「AI省事手册」,把复杂工作变成可执行步骤
↓
长任务Agent别只看输入单价:把缓存、输出和失败重跑一起算进模型成本
你已经有了一套工具组合——多轮对话、检索、代码执行、子智能体。但账单涨得比预期快。常见的原因只有一个:你用"输入token单价"去估计成本,而长任务Agent的真实交付成本,是由输入、输出、缓存、工具、运行时间、失败重跑和成功率一起决定的。
这篇文章给你一份可复用的"成功交付期望成本"公式,以及一份选型时必查的计费清单。它不给你一张统一价目表——因为不同模型的逐美元标价、折扣条件和适用层级差别很大,混在一起会误导你。下面所有结论都只来自两家厂商的官方定价文档(文末列出),并把 Anthropic 与 Gemini 的口径分开讲。
一、误区:为什么只看输入单价会低估长任务成本

输入单价只是公式里最小的一块。长任务把多轮对话、工具调用与失败重跑常态化之后,被忽略的几块会持续放大:
缓存写入(首轮要把系统提示和工具定义写进缓存)比基础输入贵;
多轮输出与工具结果 token 随轮次累积;
工具调用有固定费或运行时费;
失败的那一跑也要付钱,而分母"成功率"会把它摊到每一次成功交付上。
所以"标价"和"真实成功交付单价"之间有一个缺口,长任务越复杂,缺口越大。
二、公式总览:把全部直接成本摊到一次成功交付上

成功交付期望成本 = (一次尝试的全部直接成本)÷ 交付成功率。
ExpectedCostPerSuccessfulDelivery = ( BaseInput + CacheWrite + CacheRead + CacheStorage + Output + ToolDefinitionTokens + ToolCallFees + ToolResultTokens + Runtime + Grounding + OtherMultipliers + RetryCost ) / DeliverySuccessRate分母是成功率,分子是一次尝试的全部直接成本。只看 BaseInput,就相当于只算了分子里最小的一项。
三、Anthropic 口径拆解

计费结构:分别列出基础输入、5分钟缓存写入、1小时缓存写入、缓存命中与刷新、输出 token。
缓存倍率:相对基础输入价,5分钟写入 1.25 倍、1小时写入 2 倍、缓存读取 0.1 倍。
Batch API:对输入和输出 token 提供 50% 折扣(注意适用条件)。
工具 token:工具成本包含 tools 定义、tool_use、tool_result 和工具系统提示产生的 token;服务端工具可能另收费。
Web Search:每 1000 次搜索 10 美元,另加标准 token 成本;搜索失败不计费。
Web Fetch:无额外调用费,只计进入上下文的标准 token。
Code Execution:与 web search 或 web fetch 配合时无额外执行费;单独使用有 5 分钟最低计时、每月 1550 免费小时,超出后每容器小时 0.05 美元。
Managed Agents:同时计 token 与 session runtime;运行时为每 session-hour 0.08 美元,只累计 running 状态。
区域/数据驻留:部分区域或数据驻留模式存在 1.1 倍 token 价格倍率;适用模型和平台必须单独核对。
四、Gemini 口径拆解

分层:Gemini API 区分 Free、Paid 和 Enterprise 层;Paid 层提供更高限额、Context caching 和 Batch API。免费层和付费层的数据使用条款不同,比较时必须同时注明层级。
按模型计价:各模型分别列出输入 token、输出 token、Context caching 与缓存存储价格,必须按具体模型读取,不跨模型混用。
大提示阈值:部分模型对超过 200k token 的提示采用不同输入、输出与缓存价格阈值,需按模型核对。
Grounding:Grounding with Google Search 可能把一次用户请求拆为多个搜索查询,并按实际查询逐项计费。
Batch API:官方说明可降低 50% 成本,但需同层(Paid)。
五、三个符号化成本拆解示例

以下示例只用符号与已核验倍率/固定费,不臆造具体美元数;具体逐美元价请按模型与日期回官方页面补取。
示例 B1:长任务缓存循环(Anthropic)
ExpectedCostPerSuccessfulDelivery ≈ ( BaseInput + CacheWrite + CacheRead + Output + Runtime + RetryCost ) / DeliverySuccessRate
每轮循环:基础输入(系统提示+工具定义)+ 首次 CacheWrite(×1.25)+ 后续 CacheRead(×0.1)+ 多轮 Output。
失败重跑:RetryCost 覆盖未成功循环重复支付的 BaseInput / CacheWrite / Output / Runtime。
区域/数据驻留若适用,再叠加 OtherMultipliers ×1.1。
示例 B2:工具与运行时附加费(Anthropic)
ExpectedCostPerSuccessfulDelivery ≈ ( BaseInput + Output + ToolDefinitionTokens + ToolCallFees + ToolResultTokens + Runtime + RetryCost ) / DeliverySuccessRate
Web Search:每 1000 次 10 美元(ToolCallFees)+ 标准 token;失败不计费。
Web Fetch:仅上下文 token,无调用费。
Code Execution:配合 search/fetch 无执行费;单用每容器小时 0.05 美元(5分钟最低计时、1550 免费小时/月)。
Managed Agents:token + session runtime 0.08 美元/session-hour(仅 running)。
示例 B3:Context caching + 阈值 + Grounding + Batch(Gemini)
ExpectedCostPerSuccessfulDelivery ≈ ( BaseInput + CacheStorage + Output + Grounding + OtherMultipliers + RetryCost ) / DeliverySuccessRate
按具体模型读取输入/输出/Context caching/缓存存储价,不跨模型混用。
超过 200k token 阈值可能改变输入/输出/缓存价格,需按模型核对。
Grounding 按实际拆分查询逐项计(Grounding),一次请求可能多查询。
Batch API 降低 50% 成本但需同层(Paid);免费层与付费层数据条款不同须同注。
六、决策清单:选型时必查的计费项

基础输入与输出单价:按具体模型 + 生效日期 + 区域/数据驻留读取官方价,别用记忆值或别的 run 的值。
缓存:写入倍率(如 1.25× / 2×)、读取倍率(如 0.1×)、存储费,分别确认是否适用。
工具费:定义/结果 token、服务端工具调用费(如 Web Search 10美元/1000次)、失败是否计费。
运行时费:session runtime(如 0.08美元/session-hour)、容器小时(如 0.05美元/容器小时)、免费额度与最低计时。
折扣与倍率:Batch 50%、区域 1.1× 等,确认适用条件与层级。
阈值与分层:>200k 阈值、Free/Paid/Enterprise 数据条款,同层同模型比较。
成功率:用你自己的 DeliverySuccessRate 把"标价"折算成"成功交付单价",否则会系统性低估。
把上面每一项都查到、分开记、再代入你的实际轮次和成功率,才能得到接近真实的成本。精确逐美元标价请按模型与日期回官方页面核对——本文只引用已核验的倍率与固定费,不替你猜测任何数字。
如果这份成本清单对你有用,欢迎关注「AI省事手册」,继续获取可直接执行的 AI 工作流。
资料来源
计费事实来源(官方定价文档,独立公开来源):Anthropic Pricing(docs.anthropic.com/en/docs/about-claude/pricing);Gemini API Pricing(ai.google.dev/gemini-api/docs/pricing)。Anthropic 与 Gemini 的费率、阈值与折扣未混算;示例均标注 provider。
夜雨聆风