乐于分享
好东西不私藏

模型不再值钱之后,AI编程工具在抢什么

模型不再值钱之后,AI编程工具在抢什么

大家好,我是老王。过去三周 AI 编程工具赛道发生的事,单看每一条都是产品更新,连起来看,是一张明牌——模型军备竞赛结束了,入口战争打响了。

一、三周之内,所有人都在做同一件事

先把时间线拉出来,你看看这密度:

6 月底:开源项目 OpenSquilla 更新到 0.4.0,核心引入编码自我验证机制——AI 在交付代码前先执行测试,为自己生成可复核的证据。同时内置智能路由策略,一个设备本地的轻量分类器根据任务难度自动判断调用低成本模型还是高性能模型。官方数据:综合 Token 成本降低 60% 到 80%。

7 月 3 日:GitHub 宣布 Kimi K2.7 Code 正式进入 Copilot 的模型选择器。这是 Copilot 历史上第一次把一个开源权重模型纳入选择范围,供开发者和最强的闭源模型并列挑选。

7 月 9 日:OpenAI 宣布把独立运行的 Codex 应用整体并入全新的 ChatGPT 桌面客户端,做成 Chat、Work、Codex 三合一的超级应用。原本独立的编程工具,变成一个更大平台里的一个模式选项。

7 月 18 日:两个项目同时更新。桌面级智能体 OpenOcta 发布 v1.0.5,原生打通了 DeepSeek、豆包、通义等一系列国产模型的接入配置,用户可以在同一个客户端里随意切换。终端编程 Agent qwen-code 更新到 v0.19.8,继续坚持多协议开放路线。

7 月 23 日:腾讯云发布 CodeBuddy NPC——不是「帮你写代码」的插件,而是一个直接在云端独立完成从需求到交付全流程的 AI 智能体。它自己读 Issue、写代码、提 PR、跑 CI、修 Bug,直到交付可验收的成果。

六件事,表面上看互不相关。但你把它摞在一起看,结论非常清楚:没有一家还在赌「我的模型最聪明」。所有人都在抢入口。

二、三路夹击:云端、桌面、终端

入口战争怎么打?现在的格局是三路夹击。

第一路,云端智能体——CodeBuddy NPC 的范式切换。

这东西跟现有的 AI 编程工具有什么区别?一句话:其他工具是「你说一句我写一行」,NPC 是「你给个目标我就去干活了」。

你只需要在 Issue 里 @NPC 说「做个支持多端登录的订单中心微服务,要兼容微信小程序 + 鸿蒙原生 App + 海外 iOS App」,剩下的——读需求、分析代码、写方案、编码、提 PR、跑 CI、修 Bug、写测试——它全干了。开发者只需要在开始的时候下达目标,在结束时验收产出。

这里面最狠的不是功能,是架构。NPC 跑在腾讯云的 CNB 研发平台上,直接利用代码仓库、Issue、PR、CI/CD 这些研发资产作为自己的「记忆」。Issue 是需求记忆,代码仓库是工程记忆,PR 是变更记忆,CI 是质量记忆。它不是在编辑器里猜你想写什么代码,它是在整个研发流程里持续推进任务。

而且它支持多 NPC 组队协同——项目经理 NPC 负责需求拆解和任务分配,开发 NPC 写代码,测试 NPC 跑验证,评审 NPC 做 Code Review。腾讯云官方用一支 NPC Team 做了个游戏,从需求拆解到最终验证,全程零人工干预。

关键数据:首轮 Token 消耗从早期的2 万多个降低到约 2000,降幅超过 90%。这意味着长期任务的推理成本被大幅压缩,企业部署的可行性直接拉高了一个量级。

第二路,桌面客户端——Copilot 和 ChatGPT 的超级 App 化。

Copilot 把 Kimi K2.7 Code 拉进模型选择器,不是做慈善,是在给用户一个理由留在 Copilot 的界面里。「你看,不管你想用闭源的还是开源的,便宜的还是强的,都在我这儿。」这是一个典型的平台打法:我不需要在模型上赢,我只需要让你离不开我的入口。

OpenAI 把 Codex 并入 ChatGPT 桌面客户端的逻辑一模一样。Codex 独立跑的时候只是一个编程工具,切出去聊天还得换应用。现在 Chat、Work、Codex 三个模式在一个窗口里无缝切换——你编码的时候切到 Codex 模式,需要分析需求切到 Chat 模式,要出报告切到 Work 模式。用户不再需要关一个开一个,入口粘性瞬间拉满。

第三路,开源 CLI——模型无关化的终极武器。

OpenOcta 和 qwen-code 做的事情本质一样:把模型选择权完全交给用户。你爱用什么模型用什么模型,工具本身不绑定任何一家。OpenOcta v1.0.5 原生打通了 DeepSeek、豆包、通义,qwen-code v0.19.8 坚持多协议开放路线。

这个趋势跟 OpenSquilla 0.4.0 的智能路由是一脉相承的:同一个任务,路由层自动判断难度,简单的用便宜模型跑,复杂的切强模型。对开发者来说,「模型」彻底变成了一个可以随时替换的零件。

三、老王判断:这场战争的胜负手不在技术

老王觉得,三件事已经板上钉钉了。

1. 模型本身不再是护城河。这三个月的变化太剧烈了。Qwen3-Coder 480B 开源后 Agentic Coding 基准测试直接超过 Kimi K2 和 DeepSeek V3,Copilot 转头就把 Kimi K2.7 Code 接进去了。OpenSquilla 的智能路由证明了一件事:组合使用多个中低端模型,token 成本能降到单用高端模型的 1/5,结果质量相差不到 5%。在这种情况下,谁还在赌「我的模型最聪明」,谁就是最后一批明白人。

2. 入口之争的核心是「研发数据闭环」。你以为 Copilot 为什么急着接开源模型?因为每多一个用户留在 Copilot 的界面里写代码,微软就多了一天的行为数据——偏好什么语言、怎么重构、什么场景需要什么模型。这些数据是训练下一代工具最珍贵的燃料。CodeBuddy NPC 更直接——它不只是在编辑器里看你的代码,它是直接介入你的整个研发流程,Issue、PR、CI、构建日志全是它的训练素材。

3. 云端智能体是终局形态,但不是谁都能做。CodeBuddy NPC 之所以能做「直接交付」,是因为它依托的是 CNB 这个完整的研发平台。有代码仓库才能读需求,有 CI/CD 才能自修复,有制品库才能部署预览。这不是一个 AI 模型的能力问题,是一个研发基础设施的完整性问题。腾讯云有 CNB,GitHub 有 Actions,GitLab 有 CI/CD——有完整研发平台的公司,做云端 Agent 天然比纯 IDE 插件公司领先一个身位。

四、现在就去算一笔账

老王给你一个非常具体的建议:算一下你团队现在的 AI 编程工具总成本,然后做一个多模型路由的实验。

拿 OpenSquilla 或 OpenOcta 跑一周,配置一个智能路由策略——简单任务走便宜模型(比如 Kimi K2.7 Code、Qwen3-Coder),复杂任务走强模型(Claude Fable 5、GPT-5.6 Sol)。一周之后对比:总 token 成本降了多少?代码质量有没有显著下降?开发者有没有因为切模型而降低效率?

老王判断,绝大多数团队的结果会是:成本降到原来的 30%-50%,代码质量无明显下降。

如果这个判断成立,那你的团队就应该立刻从「单一强模型」路线切换到「多模型智能路由」路线。因为窗口期不会很长——六个月之内,Copilot、Codex、Cursor 这些大厂产品会把智能路由做成标配功能。到那时候,成本优势就不是你的了。

而对于企业研发负责人,老王建议你看看 CodeBuddy NPC 或者类似的云端 Agent 方案。不是因为它多好用——现在还是早期——而是因为它代表的方向是对的:AI 不应该只是编辑器里的一个补全框,它应该直接进入研发流程,像一个真正的同事一样干活。你们团队现在去试用、去反馈、去定制 SOP 和 Skill,等这波云端 Agent 成熟的时候,你们就是最早拿到生产力红利的那批人。

写在最后 · 简讯区

5 BRIEFS · 一句话速览

1 · AMD Helios 机架正式发布:推理成本再降 30%,Anthropic 直接下单 2GWAMD 在 Advancing AI 2026 大会上发布 Helios 机架级 AI 方案:单机架 72 颗 MI455X GPU,2.9 EF FP4 算力,31TB HBM4 内存,每美元 Token 产出比竞品高 30%。Anthropic 签约部署最多 2GW,OpenAI 预计 Q4 上线,Meta 正在验证。苏姿丰说得很直白:「推理已经超过训练,成为最大的 AI 工作负载。」来源:AMD 官方新闻稿

2 · Qwen3-Coder 480B 开源 + Qwen Code CLI 发布:阿里把最强代码模型和 Claude Code 平替一起给了Qwen3-Coder 480B(MoE,35B 激活)在 Agentic Coding、Browser-Use、Tool-Use 三类任务拿下开源 SOTA,超过 Kimi K2 和 DeepSeek V3。同时开源了 Qwen Code CLI——从 Gemini Code 分叉出来,适配 Qwen3-Coder 的函数调用协议,等于给开发者一个 Claude Code 的开源平替。API 定价 128K-256K 档输入 $3/百万 token,输出 $15/百万 token。来源:Qwen Coder 官网

3 · 阿里真武 M890 超节点成功适配 Qwen3.8:国产芯片首次跑通 2.4 万亿参数大模型64 张真武 M890 通过 ICN Switch 1.0 互联芯片实现 800GB/s 高速互联,显存规模达 9TB,单实例支撑 2 万亿参数 MoE 模型的专家并行推理。这是国产 AI 芯片在大规模推理领域的一次关键突破,「自研芯片 + 自研模型 + 自研云服务」的闭环正在成形。来源:每日经济新闻

4 · 北京发布智能体新政:Harness Engineering 写入政府文件北京市多部门联合印发《关于加快智能体引领发展的若干措施》,首次在政策层面明确支持「驾驭层工程(Harness Engineering)」,围绕上下文工程优化、任务持久化、多智能体协作、系统可扩展等方向推动技术攻关。同时要求加快跨模型跨芯片的通用智能体技术研发。来源:每日经济新闻

5 · LLM-budget-cap 开源:用 Redis 给 LLM API 加原子级支出上限一个基于 Redis 的开源工具,可以精确控制每个用户、每个项目或每个 API 密钥的 LLM 调用预算,防止意外超支。支持实时监控和告警。在 Agent 满天飞、单次任务可能触发几十上百次 API 调用的环境下,这东西不是可有可无——是必须的。来源:GitHub - Rentheria/llm-budget-cap