ARTICLE · 1112428
Copilot可代操作桌面软件
对需要在浏览器、演示文稿、报销系统等多个软件间反复切换的人来说,GitHub Copilot 的新功能瞄准了一个很具体的麻烦:有些工作没有现成接口,也无法靠命令行完成,只能手动点按钮、复制文字、拖动页面。
GitHub 于 2026 年 10 月 1 日发布更新称,GitHub Copilot 的“计算机使用”功能已在 Copilot CLI 和 macOS、Windows 版 GitHub Copilot 应用中开放公开预览。开启后,Copilot 可以读取应用中可访问的内容和画面信息,并按用户要求点击控件、输入和修改文字、按键、滚动、拖动,以及在不同应用之间完成流程导航。
这不是一个已经公布大量客户成绩单的案例。GitHub 此次发布的重点,是让 Copilot 从“回答和生成内容”,延伸到“在桌面界面里代为执行指定步骤”。对普通办公团队而言,最该关注的不是它能否完全替人做事,而是:原本卡在旧软件和图形界面里的重复流程,开始有了被辅助执行的可能。
做成了什么:让助手进入原本只能手动点的流程
很多软件的操作并不复杂,却很难自动化。比如,一项工作可能要求先在浏览器查看通知,再把信息填入内部系统,最后更新一份演示文稿。若这些软件没有可供程序调用的接口,员工通常只能在窗口之间来回切换。
GitHub 的说明称,Copilot 现在可以代表用户与桌面应用交互,包括阅读可访问的页面内容和视觉上下文、点击、输入、编辑、滚动和拖动。它覆盖的正是这类“看得见、点得着,但没有现成自动化入口”的工作。
这里的“接口”可以简单理解为:软件专门留给其他程序调用的通道。没有这条通道,并不代表任务无法完成,只是过去往往只能由人直接操作界面。GitHub 将这次能力的适用范围描述为:包括没有接口、命令行或 MCP 集成的旧软件和纯图形界面软件。
MCP 是一种让 AI 助手连接外部工具和数据的方式。GitHub 提到它,是为了说明:即便某个软件没有这种连接方式,Copilot 仍可能通过桌面界面执行操作。但这不意味着它天然理解所有业务规则,更不等于所有流程都应交给它处理。
怎样做到:用户说清目标,Copilot按界面执行
GitHub 给出的使用方法并不把任务描述成“一键托管”。用户需要告诉 Copilot 想得到什么结果、涉及哪些应用,以及有哪些不能触碰的限制。
例如,来源列举了三类可请求的任务:在浏览器中汇总通知、更新演示文稿内容、在桌面应用流程中转移信息。它们的共同点是,用户先明确结果和边界,再让 Copilot 根据界面完成一连串操作。
这与让 AI 单独写一段文字不同。写作任务通常只需要给出主题和格式;桌面操作则需要同时交代目标软件、具体对象和限制条件。若任务描述含糊,助手即使能点击界面,也可能无法判断该选哪一项、哪些内容不该改。
GitHub 的示例图片说明,Copilot 可借助这项能力在 Safari 中导航报销流程。不过,来源没有披露这一流程的完成时间、成功率、是否已用于真实企业报销,也没有给出与人工操作的效率对比。它展示的是已开放的功能路径,而不是一份可量化的客户成果报告。
结果证据:功能已开放,效果证据仍待补齐
目前可以确认的事实有三项:该功能已进入公开预览;可在 GitHub Copilot CLI 以及 macOS、Windows 版 GitHub Copilot 应用中使用;其可执行动作包含点击、键盘输入、滚动、拖动和跨应用导航。
其中,Copilot CLI 是在命令行窗口中使用 Copilot 的方式。用户可通过 /computer on 开启功能,使用 /computer show 查看状态,或用 /computer off 关闭。使用 GitHub Copilot 应用的用户,则可在设置中的 Computer Use 选项里启用。
但“能执行哪些动作”与“在复杂工作中稳定完成多少任务”是两件事。来源未披露客户名单、实际部署规模、任务成功率、费用、实施周期或第三方测试结果,也没有说明公开预览的具体地区、账户类型和使用门槛。
因此,更准确的表述应是:GitHub 已把桌面交互能力放进可试用的 Copilot 产品中,但它的实际可靠性和组织级价值,还不能仅凭此次更新公告下结论。
谁能借鉴:先挑边界清楚的重复任务
对个人用户和小团队来说,这项功能最适合被放进步骤固定、后果可复核的任务里试用。例如,整理浏览器通知、把已确认的信息搬运到指定文档、按既定要求修改演示文稿中的文字。
这里的关键不在于让 Copilot“自己判断”,而在于把原本由人反复点击的步骤交给它协助完成,同时保留最后检查。若任务涉及金额、敏感信息、对外发送或不可逆改动,不能因为它能操作界面,就默认适合自动执行。
从这次发布看,用户仍是流程中的控制者。GitHub 表示,Copilot 在控制应用前会请求批准;用户可以查看或重置此前选择为“始终允许”的应用。macOS 用户还会被引导授予辅助功能和屏幕录制所需权限。对于由组织统一管理的环境,管理员设置可以禁用这一功能。
这套设计传递出一个很现实的使用边界:它不是绕过权限的桌面机器人,而是必须建立在用户授权和组织管理之内的辅助工具。
条件与风险:便利来自权限,也受权限约束
能够读取界面、输入文字和点击控件,意味着工具接触到的内容和动作范围更大。GitHub 已明确提供批准、查看或重置“始终允许”应用的机制,组织也可以关闭功能;这些安排本身说明,权限管理是使用中的必要环节。
实际试用时,团队应先把应用范围缩小到一两个非关键软件,明确哪些字段可以读取、哪些按钮不能点击,并在每次任务结束后核对结果。来源没有提供更细的权限粒度、日志留存方式或异常操作处理细节,不能据此推断其在所有高敏感场景中的适用性。
对普通使用者而言,这次更新最可借鉴的一点是:AI 是否有价值,不只取决于它会不会生成答案,也取决于能否在一个边界清楚、可复核的具体流程里少做几次重复操作。接下来需要重点核实的两个信号是:第一,公开预览是否公布真实任务的稳定性与失败处理方式;第二,企业管理员能否清楚控制应用授权、使用范围和审计记录。
来源
- GitHub Copilot Changelog:《GitHub Copilot can now interact with desktop apps with computer use》
https://github.blog/changelog/2026-10-01-github-copilot-can-now-interact-with-desktop-apps