夜雨聆风学习资料网

ARTICLE · 1113492

AI的下一场仗

AI的下一场仗

QUOTE

模型还重要,但真正拉开差距的,是模型外面的工作系统。

—— 阿宁

「今天最值得关注的,不是又多了几个更强、更便宜的模型。Dots 在后台持续工作,Replit 让模型自己决定何时思考、何时分工,单人开始调度音乐、3D 和图像模型完成整套营销资产。模型当然还重要,但真正拉开差距的东西,正在移到模型外面:上下文、工具、执行环境、评估和协作方式。」

刚刚看完今天这一轮信息,我脑子里一直有一个特别强烈的感觉。

我们可能真的要开始改掉一个习惯了。

过去每次 AI 圈有大更新,所有人第一反应都是:模型又强了多少?榜单涨了几分?价格降了多少?

但今天最有意思的几条消息,偏偏都不只是在讲模型。

OpenAI 在把 Dots 推向更多用户。Replit 在讲怎么设计 harness。Garry Tan 把 test-audit skill 合进 GStack,开始让 AI 反过来审查测试资产。Zara Zhang 用六个 prompts,调动多个模型做完了一个水瓶营销网站。

它们看起来完全不是一回事。

但把这些东西放在一起,你就会发现:AI 的竞争,正在从“谁有最强模型”,变成“谁能把模型组织成一套真正会工作的系统”。

模型,开始只是里面的一块零件了。

— AI 的差距,正在移到模型外面

本文看点

01

Agent 开始持续工作

02

系统决定能力上限

03

个人成为调度系统

01

AGENT

Dots 最重要的,不是它会替你做事

先说 Dots。

OpenAI 对它的定义,是一种持续运行的 agent。你给它一个目标,接上需要的应用,再告诉它哪些事情可以自己决定。它有自己的云电脑,可以在两次对话之间继续推进工作,最后把结果带回来给你检查。[1]

简单来说,它不是一个等你来问问题的聊天框。

它一直在。

Sam Altman 在 Every 的访谈里讲了一个很具体的变化:Dot 帮他重新拿回了清晨的深度工作时间,也能在产品演示之前,主动发现可能带来故障的变更。[2]

这才是 Dots 最值得关注的地方。

过去我们用 AI,动作一般是这样的:

打开对话框 → 描述问题 → 等答案 → 自己接着做。

现在它想把流程改成:

给出目标和边界 → Agent 持续观察 → 自己推进 → 只在需要时找你。

看起来只是把“同步回答”换成了“后台运行”,但底下其实换了一整套东西。

它必须记得上下文,知道什么值得打扰你,有工具能执行动作,还得理解哪些决定可以自己做、哪些必须回来问人。

也就是说,真正难的已经不只是模型会不会推理。

而是它能不能长期、稳定、可控地工作。

— 不是多问几次,是让任务自己往前走

02

HARNESS

一个强模型,为什么还需要 harness

Replit 今天讲的东西,刚好把另一半问题说透了。

所谓 harness,可以先理解成套在模型外面的“工作系统”:给它什么工具、怎么反馈结果、什么时候分任务、怎样评估质量,以及出错以后怎么拉回来。

Replit 的做法挺有意思。

他们没有把每一步都写死,而是让核心 Agent 自己决定三件事:这一步要想多深、什么时候把任务交出去、应该交给哪个更合适的模型或子 Agent。[3]

这背后有一个非常现实的问题。

现在的 frontier model 并不是一条整齐的能力直线。最会写代码的,不一定最会做 UI;最会做幻灯片的,不一定最会写邮件。你拿一个最贵、最强的模型从头干到尾,看起来省事,实际很可能又慢又贵。

所以好的系统,不是永远调用最强模型。

而是在每一步,把合适的任务交给合适的能力。

Replit 的测试里,让主 Agent 自己选择子 Agent 的层级和思考强度,在 DeepSWE 和 Terminal-Bench 上做到了更好的成本—效果平衡;相比只挂一个长期 worker 的 sidekick 架构,也取得了明显更高的分数。[3]

这个结果不能直接推出“所有产品都该用同一种架构”。

但它至少说明了一件事:当模型足够强以后,怎么给它自由,怎么给它护栏,可能比继续塞更多提示词更重要。

— 最强模型,不该干完所有事情

03

ECONOMICS

模型降价,便宜的其实是“让系统多跑几次”

这时候再回头看 GPT‑6.1 Sol,味道就完全不一样了。

OpenAI 官方给出的标准 API 价格是每百万 token 2 美元输入、10 美元输出,缓存读取 0.1 美元;Astra 对应是 10、50 和 1 美元。[4][5]

输入和输出,刚好是五分之一。

如果只把它理解成“又多了一个便宜模型”,其实有点浪费这次更新。

Agent 系统最烧钱的地方,往往不是最后那一段答案,而是它需要反复读取上下文、调用工具、检查结果、失败重试,再把任务交给另一个执行者。

模型每便宜一点,系统就能多做一次检查,多跑一轮评估,多保留一点上下文。

所以缓存读取从 0.2 美元降到 0.1 美元,看起来只差一毛钱的十分之一,放进长期 Agent 里,可能比一次榜单涨分更实在。[4]

便宜,不只是为了让同一个任务少花钱。

便宜是为了让过去跑不起的工作流,终于可以常驻。

04

ORCHESTRATION

一个人,正在变成一个调度系统

Zara Zhang 今天分享了一个特别直观的案例。

她用 Opus 5.5 和六个 prompts 完成了一个水瓶营销网站,同时让 ElevenLabs 做音乐、Meshy 做 3D 资产、OpenAI API 生成图片。[6]

这里最有意思的不是“一个人做了一个网站”。

这种故事我们已经看过很多次了。

真正不同的是,她做的不是一项单点任务,而是在调度一条完整的生产链:文案、视觉、3D、音乐、网页,来自不同模型和工具,最后汇成一个成品。

人没有消失。

人的工作从亲自画每一张图、写每一段代码,变成了定义目标、选择工具、判断结果、把不同输出拼成一个完整产品。

这也是为什么 OpenAI 想让用户未来拥有一整个 Dot 团队,而不是只有一个 Dot。[1]

一个 Agent 负责所有事情,听起来很省心。

但现实世界的任务本来就不是一种能力能解决的。研究、代码、设计、音频、审查、运营,本来就是不同工种。

AI 团队最后大概率也一样。

05

MAINTENANCE

AI 不只会制造代码,也开始清理代码

还有一条很容易被忽略的消息。

Garry Tan 表示,他把 OpenClaw 的 test-audit skill 合并进了 GStack,用来处理不断膨胀的测试。[7]

过去大家最喜欢展示的是 AI 一晚上写了多少代码。

但真正跑过长期项目的人都知道,代码写得越快,后面的维护债务也可能堆得越快。重复测试、失效测试、过度 mock、跑不完的 CI,最后都会变成团队成本。

所以 AI 下一步很可能不只是“继续生成”。

它也要负责审查、压缩、去重和清理自己曾经帮助制造出来的东西。

这其实跟 Dots、harness 是同一条线。

当 Agent 从一次性工具变成长期协作者,评价它的标准就不能只是“这次有没有做出来”。

还得看它有没有让系统越来越乱。

∞

THE END

但现在还不能把方向,当成已经解决的问题

这一轮变化确实很兴奋,但有几个边界必须放在桌面上。

第一,持续运行不等于持续可靠。Agent 越主动,权限、审计、回滚和误操作成本就越重要。

第二,工具越多,系统越难评估。一个任务失败,可能是模型问题,也可能是上下文、工具接口、路由或权限出了问题。

第三,所谓“一个人变成一支团队”,前提是这个人有能力定义目标、验收结果,并且愿意为最终结果负责。不会判断的人,拿到更多 Agent,也可能只是更快地产生更多垃圾。

第四,今天一些案例仍来自当事人的公开原帖,缺少完整复现实验。它们更适合作为方向信号,不该被写成所有人都能稳定复现的能力。

所以我更倾向于把今天看成一个分界点。

过去我们主要在挑模型。

接下来,我们要开始设计系统了。

你给 Agent 什么上下文?它能碰哪些工具?什么时候必须回来问你?结果由谁检查?失败以后怎么恢复?不同模型之间怎么分工?成本上限在哪里?

这些问题,以前听起来像大公司的平台工程。

现在,它们正在变成每一个使用 AI 的人都要面对的基本功。

模型当然还会继续变强。

但下一场真正拉开差距的仗,已经开始发生在模型外面了。

07

SOURCES

来源

[1] 《ChatGPT Release Notes:Meet your dot》,2026-09-29,查看原文

[2] 《How Sam Altman Uses Dots to Take Back His Time》,2026-09-30,查看原文

[3] 《Free the models: Harness design at the frontier》,2026-09-29,查看原文

[4] 《GPT‑6.1 Sol Model》,2026-09-29,查看原文

[5] 《ChatGPT Rate Card》,访问于 2026-10-02,查看原文

[6] Zara Zhang 公开分享,2026-10-02,查看原文

[7] Garry Tan 公开分享,2026-10-02,查看原文

你现在最想交给 Agent 长期运行的工作是什么?欢迎留言。本文为风格参考写作,非原作者作品;正式发布前仍需人工复核。

END

我是阿宁,持续分享 AI 工具、工作流与实践思考。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

— 扫码加我微信,一起把 AI 用进工作里

相关学习资料