过去,我们需要把文字复制给AI,把图片上传给AI。现在,一些AI已经可以直接观察浏览器或电脑界面,帮你查资料、填写表格、整理文件,甚至完成一连串操作。
这很容易让人产生两种想象:AI是不是像人一样一直盯着整台电脑?它是不是看见屏幕后,就可以随意操作所有内容?
答案都没有这么简单。
“看见屏幕”只表示系统获得了某种视觉输入;它能不能点击、能访问哪些窗口、能否读取文件或提交操作,则由另一套权限决定。理解这一区别,才能判断它究竟方便在哪里,风险又来自哪里。
01 AI到底是怎样“看”屏幕的?
很多屏幕智能体采用的基本方式,是反复获取当前界面的截图。模型分析截图中的文字、按钮、菜单、输入框和页面布局,再判断下一步应该做什么。
例如,你让它在网站上查找一张车票。它先看到首页截图,找到出发地和目的地输入框;输入内容后,系统再提供一张新的截图;模型看到搜索结果,继续决定滚动、筛选或点击哪个选项。

这形成一个不断重复的循环:看当前屏幕,判断下一步,执行一次操作,再查看操作后的新屏幕。AI不是提前知道每个网站的全部结构,而是像第一次使用某个软件的人一样,根据界面反馈逐步行动。
有些系统直接处理屏幕像素,有些还会结合页面文字、辅助功能信息或应用接口。它看到的范围也取决于产品设计:可能只是一个独立的虚拟浏览器,可能是用户共享的窗口,也可能是在明确授权后访问桌面环境。
所以,“AI能看到你的屏幕”不一定等于它能看到整台电脑,更不等于它全天持续观看。首先要确认的,是系统截取哪个范围、在什么时间截取,以及截图会怎样保存和处理。
02 看得见,不等于可以随便操作
屏幕访问和操作权限是两件事。
第一层是观察。AI只能读取截图、总结页面或指出按钮位置,不能真正改变内容。
第二层是界面操作。系统给AI提供虚拟鼠标和键盘后,它才可以点击、滚动和输入文字。
第三层是数据访问。如果浏览器已经登录邮箱、网盘或后台系统,AI可能通过界面看到其中的信息。它不一定知道你的密码,却可能利用现有登录状态读取邮件、下载文件或修改设置。
第四层是外部后果。发送邮件、提交订单、发布文章、删除文件和确认付款,都会对真实世界产生影响。这些操作的风险明显高于“打开一个页面”。

因此,判断一个屏幕智能体是否安全,不能只问“模型聪不聪明”,还要问它被授予了什么权限。一套能力相同的AI,只能查看网页时风险有限;如果同时拥有邮箱、文件和发布权限,错误操作的影响就会大得多。
成熟的系统通常会在登录、发送、购买、删除等关键步骤前暂停,让用户接管或确认。但确认按钮不是装饰:用户仍需检查收件人、金额、文件名和最终内容,而不是看到弹窗就直接同意。
03 屏幕里不只有信息,也可能藏着给AI的指令
人看到网页上的一句话,会判断它是广告、文章还是可疑提示。AI在处理屏幕内容时,也需要区分哪些文字是任务信息,哪些文字在试图命令它。
攻击者可能在网页、邮件或文档里放入专门诱导AI的内容,例如要求它忽略原任务、读取其他页面的信息,或把数据发送到外部地址。这类攻击被称为提示注入。
对人来说,那可能只是一段奇怪文字;对同时负责阅读和行动的AI来说,它可能被误认为新的操作指令。AI看得越多、连接的账户越多、可执行的操作越广,提示注入造成的后果就可能越严重。

降低风险的第一条原则是最小权限:只开放当前任务需要的窗口、网站和应用,不要为了方便把所有账户一次性连接给AI。
第二条是任务要具体。“查看这三封邮件并整理要点”比“处理一下我的邮箱”更安全,因为后者给系统留下了过大的行动空间。
第三条是敏感信息由人接管。密码、验证码、付款信息和私密内容,尽量不要直接写进对话;需要输入时,应使用产品提供的人工接管模式,并确认此时是否停止截图。
第四条是重要操作必须复核。发送、发布、购买、删除和权限变更,都应该由人确认最终结果。AI可以准备动作,但不应默认拥有最后决定权。
还要留意截图本身也是数据。屏幕上可能同时出现聊天记录、客户信息、通知预览或其他无关内容。即使AI只需要看一个按钮,截图也可能把周围信息一起带走。使用前应了解截图的保存期限、删除方式和是否用于模型改进。
AI看见屏幕的真正意义,不是它突然拥有了一双眼睛,而是它获得了一种通用的电脑接口。过去每个软件都要单独开发接口,现在AI可以通过人类已经熟悉的按钮、菜单和输入框完成任务。
这让AI从“告诉你怎么做”,进一步变成“替你动手做”。而风险也恰好发生在这一步:文字回答错了,可以不采用;一个已经发送的邮件、删除的文件或提交的订单,却未必容易撤回。
因此,最重要的边界不是AI能看见多少,而是我们允许它做多少。让AI负责观察和准备,让人保留敏感信息与关键操作的最终决定权,才是屏幕智能体更稳妥的使用方式。
夜雨聆风