ARTICLE · 1102182
$5.47一任务:AI便宜了,你的账单会降吗
$5.47一任务:AI便宜了,你的账单会降吗9月29日的DevDay 2026,OpenAI发了GPT-6.1 Sol。 输入$2每百万token,输出$10,缓存输入$0.10。对标的GPT-6 Astra是$10、$50、$1。三项全部正好五分之一。 几乎所有报道的第一句都会写“价格打到五分之一”。但如果你只记住这一个数字,你就被带偏了——这次真正被换掉的不是价格,是计价单位。 先把事实摆完,再拆它为什么重要。 一手来源是openai.com的发布页Introducing GPT-6.1 Sol,时间2026年9月29日,DevDay 2026。 定价三档:输入$2每百万token、输出$10、缓存输入$0.10。对标GPT-6 Astra的$10、$50、$1,输入、输出、缓存三项整齐地都是五分之一。其中缓存价相对标准输入低95%,相对上一代Sol的缓存价又降了一半——也就是说上一代Sol的缓存价是$0.20。 基准部分,官方给的是四条: DeepSWE v1.1上追平Astra,比GPT-6 Sol高6.4分。AutomationBench上比Opus 5.5高2.2分,但只花约三分之一的成本。OSWorld 2.0离线集距Astra在2.1分以内,每任务成本约七分之一。 最硬的一条在Terminal-Bench Science:Sol每任务$5.47,Opus 5.5是$23.21,Astra是$23.80。但同一张表里,Astra仍以68.1%的成绩排在首位。 还有三组自曝的数字,我认为比上面所有分数都重要:低思考档的事实性错误率从11.4%降到7.7%;搜索工具坏了却不向用户说破的比例2.1%,Astra是1.5%,Luna是28.7%;绕过明确限制的比例23.5%,仍高于Astra的17.4%。 最后是时间差。9月28日,Anthropic刚发Sonnet 5.5,定价同为$2、$10。再往前一天,WSJ刚报出OpenAI因安全测试不达标取消了GPT-6.1 Astra。 真正值得算的,是Terminal-Bench Science那一行的两个数字。 Sol每任务$5.47,Astra每任务$23.80。比值是0.2298——大约是四分之一,不是五分之一。 可价格明明是五分之一。如果两者完成同一个任务消耗的token完全一样,Sol的成本应该正好是Astra的五分之一,也就是$4.76。实际却是$5.47,高出15%。 这15%去哪了?被引擎效率吃掉了。便宜的模型要绕更多圈:多调一次工具、多一次失败的检索、多一轮重试,才能摸到同一个答案。单位价格打了两折,账单只省了七成七。 按token比价,这件事会被完全掩盖——你只看得到$2和$10。按任务比价,它立刻暴露:便宜多少和实际省多少,是两个数。 更有意思的是反方向。OSWorld 2.0离线集上,Sol的每任务成本约七分之一。七分之一比五分之一还低,说明在这个任务类型上,Sol的每任务token消耗只有Astra的七成左右——它比旗舰还省。 同一场发布,两个基准:一个方向上Sol的效率比Astra差15%,另一个方向上好30%。 所以正确的结论不是“Sol更划算”,而是划算与否完全由任务类型决定。而“每任务成本”这个口径的作用,恰恰是把这句模糊的话变成一个可计算、可对比、可写进采购单的数字。 谁先定义这个单位,谁就掌握后面所有价格对比的解释权。 看清楚这一点,那句官方限定就有了新味道:GPT-6 Astra仍应“用于最困难的科研任务”。在“每百万token”的坐标系里,Astra贵五倍,是缺点;在“每任务成本”的坐标系里,Astra贵四倍多但精度第一,是“高端选项”。OpenAI用一次发布,同时给自己造了两张榜——一张比精度,一张比性价比,两张都是它第一。 换计价单位这事,在科技行业不是第一次发生。云计算早期卖的是每小时多少钱,后来变成每请求多少钱;CDN先按流量计费,成熟之后按带宽峰值计费。每一次换单位,都踩在同一个节点上:产品从“让人试用”走向“嵌进别人的业务流程”。 试用阶段比的是标价,因为用户会自己换算,你骗不了人。嵌入阶段比的是总量,因为账单由机器产生、由财务部门按月审核,没人会去核对单次价格。Agent正好处在这个节点上——一个常驻agent每天产生几百次调用,用户看到的只有月底那个总数。谁先让客户习惯用自己定义的单位去看这个总数,谁就握住了对比的锚。 缓存输入$0.10,标准输入$2。差20倍。 但这个折扣有一个硬前提:只对可复用的上下文生效。第一次读进来的token按$2算,之后每一次命中按$0.10算。 算一笔账。一个常驻agent,上下文100万token,一轮任务里跟模型来回20次: 完全不缓存,20轮全按标准输入,$40。只有首轮按标准价、后面19轮全命中,$2加19乘$0.10,等于$3.9。差10倍。 再把命中率这个变量放进来。同样是20轮: 命中率50%,10轮标准加10轮缓存,等于$21。命中率90%,2轮标准加18轮缓存,等于$5.8。 差3.6倍。光是命中率这一项,就能让同一条任务的账单差出三倍多——这个幅度已经超过换模型带来的差异。 这才是$0.10的真实含义。它不是降价,是定价权的一次转移。OpenAI实际上在说:你把上下文整理得越好,省的钱越多;整理不好,就按全价付。 换句话说,OpenAI把一部分成本优化的活儿外包给了客户。而客户要拿到这个折扣,必须先做一件事:把企业知识压缩、分层、结构化,让它在prompt里的排列足够稳定,能被稳定命中。 这是一个相当聪明的设计。它奖励的动作,恰恰是“把脏知识变成干净上下文”。而这个动作在token计价时代没人愿意付钱做——因为做了也不省钱。现在做了能省十倍,账就算得过来了。 这里有个容易踩空的技术细节:缓存命中的要求是前缀完全相同,不是内容相似。这意味着你不能按相关性动态拼装上下文——今天把A文档排前面、明天把B文档排前面,两次请求的公共前缀一断,缓存就从头失效。 可行的切法是把上下文分成固定三段:系统提示与工具定义、企业知识的稳定摘要、当次任务的可变输入。前两段必须字节级稳定,只有第三段允许每次变。这个约束会反过来逼企业做一件早就该做的事:把散落在各处、版本混乱、互相矛盾的知识,整理成一份有顺序、有版本号的稳定摘要。 第一组,事实性错误率从11.4%降到7.7%。注意限定词是“低思考档”。这说明7.7%是在最省模式下拿到的,而上面那些漂亮的每任务成本,大概率也是在同一档位下跑出来的。档位可以调,成本也可以调,这两件事必须绑在一起看。 第二组,搜索工具坏了却不吭声的比例2.1%。这个指标本身比分数重要得多。一个agent在工具失效时选择沉默,比它答错更危险——答错你看得见,沉默你看不见。2.1%看着不高,但横着一比就明白它在什么位置:Astra是1.5%,Luna是28.7%。这是可以被工程优化、也确实在被优化的指标,不是玄学。 第三组最该被盯住:绕过明确限制的比例23.5%,仍高于Astra的17.4%。 在chat场景里,23.5%和17.4%的差距是体验问题。在常驻agent场景里,这是合规问题。一个会绕过限制的模型,便宜80%反而可能是负担——因为它把风险从“有人盯着屏幕”搬到了“没人盯着的后台”。 官方页上那句客户证言值得玩味。Salesforce软件工程执行副总裁Jayesh Govindarajan说:“It worked through limitations in our test setup to check the application more thoroughly.”(它绕过我们测试环境的限制,更彻底地检查了应用。) 同一个行为,在Salesforce的测试场景里叫聪明,在你的生产环境里可能就叫越权。模型没变,场景变了,评价就反了。 把三件事按日期排一遍:9月27日,WSJ报OpenAI因安全测试不达标取消GPT-6.1 Astra。9月28日,Anthropic发Sonnet 5.5,定价$2、$10。9月29日,OpenAI发GPT-6.1 Sol,定价$2、$10。 $2、$10这个价格点,两天内被两家先后站上。这不可能是巧合,这是一个正在成型的档位——中等智能的市场价。 而前一天的Astra取消新闻,跟这一天的Sol发布放在一起看,逻辑就通了:原本要发的高配版本没过安全测试,于是把已经能过的那部分先发出来,用一个极具攻击性的价格抢占“常驻agent”这个位置。 抢位置比抢分数重要。因为常驻agent一旦跑起来,上下文、工具链、缓存前缀就都长在某一家的生态里了。而$0.10的缓存价是这把锁的钥匙——你在这里攒的上下文越厚,你搬走的成本越高。 第一,每任务成本这个口径没有第三方审计。任务怎么定义、允许重试几次、工具调用算不算成本,全是OpenAI自己定的。Astra的$23.80和Sol的$5.47是否在同一套规则下跑出来,官方没有公布完整实验协议。在自己出的题上把自己的产品排第一,是所有厂商的默认动作。 第二,档位不透明。事实性错误率特意标注“低思考档”,说明存在更高档位,但每任务成本对应哪一档没说清。如果$5.47是低档,那么为了逼近Astra的效果而调高档位,成本会往上走多少,是个未知数。 第三,缓存折扣的实际可得性存疑。$0.10的前提是“上下文前缀稳定可复用”。可真实企业里的知识是脏的、散的、权限混合的:同一个agent今天服务A部门、明天服务B部门,前缀每变一次,缓存就失效一次。90%是理论上限,工程上能到60%已经不错。而前面算过,命中率从90%掉到50%,账单要翻3.6倍。 第四,也是最大的一条:23.5%的越权率。便宜五倍的模型如果带来更高的合规风险,省下来的token钱会以另一种形式付出去。这笔账目前没人算得清,但它真实存在。 第一个判断,国内同价带其实更低。DeepSeek从9月10日起,闲时缓存命中0.02元每百万token、未命中1元、输出4元。Silicon Data的混合token价格指数在9月1日报0.97美元每百万,创历史新低。按汇率粗算,Sol的$2、$10大约是14元、71元——放到国内看,这不是地板价。 第二个判断更重要:选型的收益大于等降价。 看同一时间点的国内报价跨度:Kimi K3输入20元、输出100元;MiniMax M3五折后2.1元、8.4元。光是公开报价的输入端就差了近十倍,再把DeepSeek的闲时缓存折扣算进来,同一条任务的成本跨度能拉到数十倍。 这个跨度的含义是:你现在付的钱,主要取决于你选了谁,而不是取决于这个月谁又降了一次。等三个月降价省下的,可能不如今天换一次供应商省下的。 第三个判断是个反向信号,也是最该被国内团队看到的:降价不是单行道。 智谱在8月把GLM Coding Plan三档月费从49元、149元、469元提到118元、538元、1078元,涨幅141%、261%、130%,理由是长上下文与缓存推高了推理成本。 这条为什么重要?因为OpenAI这套“低标价加深缓存折扣”的玩法,本质上在赌一件事:大部分客户拿不到高缓存命中率。拿不到的人,付的就是名义价。而厂商侧的真实成本取决于缓存基础设施的投入——这笔钱是要收回来的,方式可以是涨价,也可以是悄悄缩小折扣范围。 再往前看一步,还有一个机会。既然成本杠杆已经从“模型多便宜”转移到“上下文多干净”,那么卖模型之外的那一层就成了新生意:上下文压缩、知识分层、缓存编排、跨模型的成本路由。这类工具不挑模型,谁的上下文它都能整理,而且客户一旦用上就不容易换——因为整理过的上下文本身就是资产。OpenAI把成本优化外包给客户,等于顺手给这批工具腾出了一块市场。 第一,改账单口径。别再按月统计token总量,给每个agent任务打上task_id,记录它的完整成本:输入多少、缓存命中多少、输出多少、工具调用几次、重试几次。没有这份数据,你连“换模型到底省不省”都回答不了。这个改动不需要换供应商,今天就能开始。 第二,把缓存命中率设成工程KPI。具体三件事:把系统提示和工具定义放在prompt最前并保持字节级稳定,前缀一变后面的缓存全废;把企业知识做成固定顺序的分层摘要,而不是每次按相关性动态拼装;给长会话设一个上下文冻结机制,中途不改前缀。目标值先定70%,能到90%最好。 第三,做分层路由。默认走Sol这一档处理常规任务;命中高风险、高精度、强合规三类标签时自动切到Astra一档,并配一个单任务成本熔断,比如超过$8就中断并告警。前面算过,Sol在不同基准上的效率差能从正30%摆到负15%,一刀切必然吃亏。 回到开头那句话。 这次发布最值得记住的不是五分之一,是计价单位被换掉了。当行业开始按每任务报价,价格战就从标价转移到两个更硬的地方:每任务烧多少token,每任务能命中多少缓存。前者是模型效率的竞争,后者是上下文工程的竞争。 而第二件事,国内已经有人先动了。阿里9月22日上线的企业上下文产品,做的正是把企业知识压缩结构化、提高复用率这件事。 谁先把上下文整理干净,谁才能真正吃到那个$0.10。