乐于分享
好东西不私藏

Agent基建元年:插件标准落地,生态变天

Agent基建元年:插件标准落地,生态变天

Agent基建元年:插件标准落地,生态变天

8月11日三声发令枪:标准、执行环境、模型——Agent从"拼智力"到"拼基建"

一句话总结:8月11日,Agent赛道同时出现三件大事——Agent Plugins 1.0标准发布、Cloudflare推出Agent专用浏览器、中国模型包揽全球Token调用量前四。行业主战场正在从"谁的模型更聪明"转向"谁的基建更扎实"。 

一、8月11日:Agent基建的三声发令枪

8月11日清晨,三件事几乎同时发生。

第一件:Agent Plugins 1.0标准发布。Vercel联合多家厂商推出Agent工具调用的统一规范——定义了manifest声明格式、OAuth 2.1认证流程和错误处理机制。此前各Agent平台的插件互不兼容,开发者迁移一个工具的成本约等于重写一遍。

第二件:Cloudflare推出Agent专用浏览器Kitesurf。把浏览器从"被动渲染网页"改造成"Agent的主动执行环境",内置DOM事件捕获、跨域身份管理和本地推理调度。Agent可以像调用本地函数一样对网页元素执行点击、输入、表单提交,且每一步操作都有结构化记录。

第三件:中国模型包揽全球Token调用量前四。OpenRouter周度榜单显示,8月3-9日全球AI大模型总调用量达69万亿Token,环比增长21.48%。DeepSeek-V4-Flash以8.83万亿Token登顶,腾讯Hy3、DeepSeek预览版、小米MiMo-V2.5紧随其后。中国模型周调用量已连续15周领先美国。

三件事指向同一个结论:Agent赛道的主战场,正在从"谁的模型更聪明"转向"谁的基建更扎实"

二、Agent Plugins 1.0:Agent生态的"HTTP时刻"

Agent Plugins 1.0为什么重要?打个比方:互联网之所以能互联互通,不是因为谁的网页做得好,而是因为有HTTP这个统一协议。在此之前,每个Agent平台都自己定义工具调用格式——OpenAI一套、Anthropic一套、LangChain又一套。开发者写一个插件,深度绑定一个平台,想迁移?基本等于从头来过。

Agent Plugins 1.0做了三件事:

1统一manifest声明规范

工具的名称、描述、参数格式有了标准模板。开发者写一次,多个运行时可识别。

2基于OAuth 2.1的认证流程

不用每个平台各搞一套授权逻辑。Agent调用外部API时的身份验证、权限范围、Token刷新,都有统一规范。

3标准化的错误处理机制

工具调用失败时,Agent知道怎么重试、怎么降级、怎么向用户报告——而不是直接崩溃。

首发支持该标准的包括Vercel、LangChain和多家头部云厂商。值得注意的是,这个标准与OpenAI此前的插件规范不冲突,而是采取了兼容并包的策略——在设计之初就保留了自定义扩展字段,允许平台在此基础上叠加私有能力。

这种务实态度为落地扫清了障碍。标准的意义不在于"完美",而在于"够用且大家都愿意用"

三、浏览器变Agent运行时:执行环境的升级

如果说Agent Plugins 1.0解决的是"工具怎么调"的问题,Cloudflare Kitesurf解决的是"在哪里跑"的问题。

长期以来,Agent要操作网页,得通过无头浏览器或Selenium之类的自动化工具。这些方案有个致命缺陷:不稳定。网页改一个class名,Agent就找不到按钮了;遇到弹窗验证码,Agent直接卡死。

Kitesurf的思路不同——它不把浏览器当"工具",而是把浏览器本身改造成Agent的"原生运行环境"。内置了DOM事件捕获、跨域身份管理和本地推理调度,Agent可以像调用本地函数一样操作网页元素。所有交互都被结构化记录,支持细粒度的操作回放和状态管理。

这意味着什么?Agent执行网页操作不再是"黑箱"。每一步点击、输入、提交都有记录,可以回溯、可以审计、可以复现

更关键的是:Kitesurf原生支持Agent Plugins 1.0协议——符合标准的第三方插件可以直接加载。标准和执行环境,从第一天就绑在了一起。这不是巧合,而是行业从"各自为政"走向"协同共建"的信号。 

四、模型与商业化:从价格战到价值战

基建标准化和执行环境升级的背后,是模型层的激烈博弈。

OpenRouter最新数据中有一个数字特别值得关注:Agent与Coding类应用以19%的应用占比,贡献了81.2%的Token用量。这意味着Agent不再是"尝鲜玩具",而是Token消耗的绝对主力——真正在干活的应用,吃掉了绝大部分算力。

与此同时,商业化也在加速分化。8月11日,阿里千问App上线办公助理付费会员,分高级(19元/月)、精英(49元/月)、旗舰(128元/月)三档,成为继豆包后国内第二款探索付费的头部AI应用。同一天,OpenAI将Luna模型向免费用户不限量开放,API价格下调80%——输入价格从每百万Token 1美元降至0.2美元。

一个在收费,一个在免费。这不是矛盾,而是行业从价格战转向价值战的信号——免费模型做规模,付费模型做深度。最终能跑通的,是那些能在标准化基建上交付真实价值的玩家。

同期,MiniMax开源了新一代模型H3,主打128K长上下文和低推理成本——在消费级显卡上就能跑长文档处理任务。开源模型 + 标准化接口 + Agent专用执行环境,这三层叠加的效果正在显现:开发者构建Agent的门槛,正在以前所未有的速度降低。

五、WorkBuddy的位置:标准已就位,执行已落地

看完标准、执行环境和模型三条线的博弈,一个问题自然浮现:这些基建能力,什么时候能落到普通用户的桌面上?

WorkBuddy给出的答案是:已经在用了

MCP协议支持——与Agent Plugins 1.0理念一致。WorkBuddy从设计之初就支持MCP(Model Context Protocol),允许Agent通过统一接口调用外部工具——企业邮箱、文档系统、项目管理工具、数据库。这和Agent Plugins 1.0要做的事本质上是一样的:把工具调用从"各自为政"变成"标准接口"。区别在于,WorkBuddy的MCP已经在生产环境跑了很久,而Agent Plugins 1.0才刚刚起步。

桌面级浏览器控制——与Kitesurf理念一致,但更早落地。Kitesurf把浏览器变成Agent运行环境,WorkBuddy做的是同一件事,只不过在桌面端。Agent在你电脑上打开浏览器,点击、输入、提交——你亲眼能看到每一步操作。这种"可见性"不只是体验好,更是合规刚需:8月欧盟AI Act生效后,"决策记录可审计"成为硬性要求,而WorkBuddy的桌面级执行天然留痕。

多模型接入——不被单一模型绑定。中国模型包揽前四的背后是模型层的高度竞争。WorkBuddy不绑定单一模型,支持多模型切换——需要代码能力时调Coding模型,需要长文本处理时调长上下文模型,需要快速响应时调轻量模型。在模型价格战和价值战并行的当下,这种灵活性意味着用户永远能用到性价比最优的组合

结语

8月11日这一天,Agent赛道的三声发令枪几乎同时响起:标准、执行环境、模型。这不是巧合,而是行业走到这个阶段的必然——当模型能力不再是唯一瓶颈,谁能把Agent在真实环境中跑稳、跑安全、跑出价值,谁就赢了下一轮

WorkBuddy选择的路很清晰:不做模型竞赛的参与者,做基建标准化的受益者。MCP协议、桌面级浏览器控制、多模型接入——这些能力不是为了炫技,而是为了让每一个普通员工,都能在自己的电脑上,指挥一个真正能干活的数字同事。

标准在统一,基建在成熟,模型在变便宜。剩下的唯一问题是:你的桌面,准备好了吗?

关注 WorkBuddy,让你的桌面成为Agent的运行环境

MCP协议 × 桌面级控制 × 多模型接入

 WorkBuddy 出品 · 让 AI 安全地为工作服务