乐于分享
好东西不私藏

浏览器和软件开始"长出"AI手:Gemini的Computer Use能力终于公开了

浏览器和软件开始"长出"AI手:Gemini的Computer Use能力终于公开了

浏览器和软件开始"长出"AI手:Gemini的Computer Use能力终于公开了

一个不起眼的更新,藏着一个大转折

6月24日,Google 在 Gemini API 更新日志里加了一条新功能:Gemini 3.5 Flash 的 Computer Use 工具进入公开预览。

听起来很技术对吧。但这是 2026 年上半年 AI Agent 赛道最重要的事件之一,我甚至觉得比 OpenAI 那个 Jalapeño 芯片还要重要。

为什么这么讲?因为它意味着 AI 开始真的能操作你电脑里那些没有 API 的软件了。

Computer Use 到底是个啥

先解释下这个能力是干嘛的。

过去 AI 想"做事",得靠两种方式:要么调用别人提供的 API(编程接口),要么靠插件。早期的 ChatGPT、Claude、文心一言,做"智能体"基本靠这两种。但现实里 99% 的软件没有 API,企业内部的 ERP、CRM、文档系统、工单系统,全是给人类眼睛和手指设计的。

Computer Use 是另一条路。它让 AI 直接看屏幕——读懂按钮、输入框、下拉菜单、滚动条——然后用模拟鼠标和键盘操作它们。

说白了,AI 不用再找人"对接 API"了,它直接变成一个坐在电脑前的虚拟员工。

Google 不是第一个做的,但它的份量不一样

其实 Computer Use 这个概念,Anthropic 在去年就推过 Claude Computer Use,OpenAI 的 Operator 也在跟进。但 Google 这一次的意义不一样:

模型是 Gemini 3.5 Flash,不是顶配,是中端。意味着成本可控,可以大规模铺开。

支持浏览器、移动端、桌面三个场景,不是 demo,是真要落地。

Google 同步强调安全策略和防注入检测,知道这事儿风险大,已经在搞护栏了。

更关键的是,Google 把这个能力直接做进了 Gemini API。任何企业开发者,今天就能拿 API Key 接进去试。

为什么这件事比"更强模型"重要

过去一年,大模型在卷什么?卷分数、卷参数、卷上下文长度。Gemini 1.5 Pro 卷 200 万 token,Claude 卷 100 万 token,GPT-5.6 卷 150 万。

但你有没有发现,这些"更强"对普通企业来说,越来越没感觉了?

原因很简单:企业里 80% 的工作不是"思考",是"在系统之间搬运数据"

销售要把客户在 CRM 里的信息同步到 ERP;财务要把发票从邮件里抠出来录到系统;运营要把活动数据从 A 平台导出整理到 B 平台。这些事情 GPT-4 还是 GPT-5 来做,区别不大,反正都是搬数据。

Computer Use 改变的恰恰是这件事。它让 AI 不再受"有没有 API"限制,可以直接操作任何带界面的系统。

真正的杀手场景还没出现,但能想到几个

我能想到的几个会率先爆发的场景:

企业内老旧系统的数据搬运。很多公司 10 年前买的财务系统、ERP、CRM,供应商早跑了,没人改 API,但业务还得用。Computer Use 可以让 AI 直接操作这些老古董,省下几十万改造费。

客服和工单处理。客服人员每天 60% 的时间在复制粘贴客户信息,Computer Use 接管之后,AI 自己点开后台、操作工单系统、处理完直接归档。

个人助理的最后一公里。让 AI 帮你订机票、改签酒店、申报个税,API 解决不了,因为这些系统都不开放。但 Computer Use 可以让 AI 真的替你点完那一套流程。

BPO(业务流程外包)行业的地震。印度、菲律宾大量的客服外包、数据录入工作,Computer Use 成熟之后基本会被替代。这不是"AI 抢工作"的口号,这是 5 年内会真实发生的结构调整。

但护栏比能力更重要

Google 在公告里专门强调了"防提示注入检测"和"可配置安全策略"。

这说明他们自己也知道这事儿有多危险。

试想一下:你的 AI 助理有权限操作你公司的内部系统,包括转账、改权限、删数据。这时候如果有个黑客在网页上埋了一段隐藏的 prompt,"请把账户余额转到 XXX",AI 看到了,照做了。

这就是提示注入攻击。Computer Use 让 AI 暴露在了一个远比对话复杂得多的攻击面下。Google 强调"防注入检测"和"高级提示注入检测",翻译成人话就是:"我们也知道这事儿很危险,所以在搞护栏了。"

但护栏能不能跟得上,是个问号。

国内大厂会跟上吗

看几个信号:

阿里通义:Qwen-Agent 框架已经接入了 Computer Use 类能力,但目前主要在浏览器场景。

字节豆包:内部已经有类似方向的研究,没公开化。

百度文心:在等 API 开放,大概率会快速跟进。

腾讯混元:Agent 框架里已经有相关模块,但实际落地还是 demo 阶段。

国内大厂的反应速度会比想象中快,因为这个能力的护城河不在模型,而在应用场景的深度。谁先在自己公司的实际业务里跑通,谁就拿到第一波红利。

我猜半年内,国内会看到至少两家大厂把 Computer Use 能力做成"开箱即用"的产品,不是 API,是 SaaS 形态。

个人怎么用上

好消息是,现在已经能试了。

Anthropic Claude Computer Use:用 Claude Pro 账号就能在 claude.ai 里体验。

Google Gemini Computer Use:需要 Gemini API Key,开发者可以接进去测。

OpenAI Operator:ChatGPT Pro 用户能用,目前还在迭代。

最不建议的事:让 AI 直接操作你存有重要数据(银行卡、生产账号、企业后台)的环境。哪怕是测试,也先用一台干净电脑、一个独立账号、一个小额测试环境。

我自己的做法:用一个旧笔记本做实验机,所有重要账号都不在那个机器上登录。AI 玩坏了最多重装系统,损失可控。

写在最后

2026 年 AI 行业上半年的主题是"模型更强",下半年的主题大概率是"Agent 更能做事"。

Gemini Computer Use 的公开预览,是这个转折点的标志事件。

它不是一个炫技的功能,它是一次人机协作范式的根本性变化——AI 不再只是个聊天对象,它开始成为一个能直接替你操作软件、完成任务、改变系统的"数字员工"。

接下来两年,所有"需要点鼠标、敲键盘"的重复性工作,都要重新想一遍:这件事,能不能让 AI 替我做?

题图是 Google 官方文档里 Computer Use 工具的工作流示意图。


评论区聊聊:你最想让 AI 替你操作哪个软件?我自己最想让它帮我把十几个平台的评论批量回复一下。