一边是 280B 参数的 dots3-note Preview、号称开源编程能力第一的 GLM-5.3、1M 上下文的 DeepSeek V4 Pro,另一边却是 OpenRouter 的统计,84% 的 token 根本没有用在最前沿模型上。
模型还在变大,但用户已经开始把它们放进价格表、任务表和责任表里比较。真正的竞争,开始从谁最聪明,转向谁更值得长期使用。
01 大模型继续往上堆,但用户先问每次任务多少钱
小红书技术开源 dots3-note Preview,总参数 280B,激活参数 16B,支持 512K 上下文以及文本、视觉、语音多模态理解,重点瞄准复杂推理和长程 Agent 任务。智谱发布 GLM-5.3,编程能力相比前代提升 50%,在 Terminal Bench 3.0 等公开基准中拿到开源第一,权重计划两周后开源。
硅基流动上线 DeepSeek V4 Pro,1M 上下文,输入每百万 token 1.32 美元,输出 3.96 美元,推理强度还分成低、高、最大三档。模型能力、上下文长度、价格档位,一次性都被摆在了用户面前。
但另一组数据更有意思。OpenRouter 统计显示,84% 的 token 来自非 SOTA 模型,常用模型的性能大约是前沿模型的 77%,成本却只有 Claude Fable 5 的 2.5%。
这就像买车。你当然想要跑车,但每天上下班,很多人最后还是会看油耗、维修费和后备箱。
最强模型负责证明上限,真正把账单撑住的,往往是那些没那么耀眼的模型。

02 开发工具开始替用户管理上下文和花费
Claude Code v2.1.233 新增 GitLab 合并请求支持,并加入按用户归因支出的网关设置。Claude 的使用建议也很直接,任务之间用 /clear 清掉无关上下文,不要在同一会话中频繁切换模型或 effort 级别,因为这会破坏提示缓存,增加 token 成本。
这类更新看起来没有新模型发布那么热闹,却更接近真实工作。一个开发团队每天跑几百次代码任务,真正消耗预算的,可能不是某一次大请求,而是上下文重复传输、缓存失效和没有必要的高档模型调用。
以前我们把模型当成一个按钮,按下去就等结果。现在工具开始提醒你,按钮后面还有一块账单。
这才是开发者真正会在意的细节。不是模型会不会写代码,而是它能不能少读一遍已经读过的东西。

03 开源模型的数量已经不重要,能不能被用起来才重要
仓库越来越多,真正被反复使用的却很少。AMD 和 NVIDIA 各自发布了超过 200 个新模型仓库,说明硬件公司也在把模型发布当成生态动作的一部分。
蚂蚁百灵与 ASystem 团队则在 DGX Spark 上跑通了单机 Agentic RL 后训练闭环,用井字棋作为最小任务,训练 400 步后,奖励从约负 0.5 升到 0.4,响应长度降到约 850 tokens,工具调用也变得更稳定。
这两件事放在一起看,一个在提醒你模型生态已经非常拥挤,一个在展示怎样把 Agent 训练到更会做事。
开源真正的门槛,不是仓库里又多了一个名字,而是别人能不能下载、部署、调教,然后让它在自己的机器上稳定跑起来。

04 能力越往现实里走,价格和责任就越不能分开
未来 Claude 模型生成的文本将加入水印,用来判断内容由 Claude 撰写的可能性,方案基于 SynthID-Text,目标是满足欧盟 AI 法案要求。Cursor 被 SpaceX 收购后,计划获得更大的 GPU 集群,继续把代码模型做得更强、更便宜。Gemini 3.7 Flash 则被用于处理多文件、多邮件整合和 Google Workspace 工具调用。
AI 开始进入更多工作场景之后,问题就不再只有模型分数。内容要不要标记,调用成本谁来承担,数据放在哪里,模型出错后能不能追溯,这些都会跟着产品一起落地。
很多人喜欢把 AI 竞争讲成参数竞赛,我觉得这已经不够了。模型当然还会继续变大,但真正难的是让它在价格、部署、合规和任务结果之间同时过关。
能跑起来只是入场券,能被团队长期买单,才算真正赢。

所以,8月15日最值得记住的,不是参数又涨了多少,而是 AI 开始被放进一张更具体的价格表里。
模型要算每百万 token 的成本,开发工具要算上下文有没有重复传,开源生态要算下载之后有没有人真的用,进入现实业务还要再算一遍来源、合规和责任。
以前大家问哪个模型最强,现在更像是在问,哪一个模型值得我每天反复调用。这个问题一变,整个行业的排位方式也会跟着变。
🔥 今日话题:如果只能选一个标准,你会优先看模型能力、调用价格,还是能不能稳定接进自己的工作流?
👇 点个「在看」,转给正在给 AI 选模型、算账单的人。
夜雨聆风