
这可能是2026年企业软件领域最值得关注的问题之一。
过去十几年,企业自动化的主角是RPA。
它可以:
- 自动打开Excel
- 自动登录系统
- 自动复制数据
- 自动填写表单
- 自动下载文件
- 自动发送邮件
- 自动生成报表
只要流程足够固定,RPA就能让一个原本需要人工重复几十次、几百次的工作,变成机器自动完成。
但现在,一个新的变化正在发生。
AI开始自己“看懂”电脑屏幕,并直接操作软件了。
它可以理解网页上的按钮、表格、文本和界面,然后像人一样点击、输入、滚动,再根据执行结果决定下一步。
OpenAI早期的Computer-Using Agent已经展示了这种模式:模型通过屏幕截图理解GUI,再使用虚拟鼠标和键盘执行操作,并在执行过程中根据新的屏幕状态调整下一步动作。(OpenAI)
微软则已经把Computer Use加入Copilot Studio,让Agent可以通过自然语言操作网站和Windows桌面应用;Google也将Computer Use作为Gemini 3.5 Flash的内置能力。(Microsoft Learn)
于是,一个问题摆到了RPA行业面前:
AI都可以自己点鼠标了,RPA还有什么用?
答案可能出乎很多人的预期:
RPA不会消失。但RPA的角色,很可能会发生一次根本性的变化。

一、先搞清楚:RPA到底解决什么问题?
RPA最核心的能力,其实不是“机器人”。
而是:
把确定性的数字工作流程自动化。
例如一家企业每天都要处理1000份订单。
流程可能是:
打开邮件
↓
下载附件
↓
读取订单号
↓
登录ERP
↓
输入订单信息
↓
提交
↓
下载回执
↓
保存到文件夹
↓
发送通知邮件
如果这个流程高度标准化,那么RPA非常擅长。
因为它不需要理解“这个业务到底是什么意思”。
它只需要知道:
下一步应该做什么。
所以RPA的优势一直非常明确:稳定、可控、可重复、可审计。这也是为什么在很多企业里,RPA至今仍然有非常强的生命力。
二、问题在于:现实世界根本没有那么“标准”
真正让RPA头疼的,是企业里的大量“长尾流程”。
比如:
“登录供应商网站,把本月所有异常订单整理出来。”
这句话对于人来说非常简单。
但对于传统RPA来说,里面可能存在大量问题:
- 供应商网站改版怎么办?
- 按钮位置变了怎么办?
- 订单页面结构变化怎么办?
- 某个订单多了一个字段怎么办?
- 页面突然弹出验证码怎么办?
- 某个客户名称格式不一样怎么办?
- 出现异常数据怎么办?
传统RPA通常需要提前把这些情况一一设计进去。
于是自动化开始变得越来越复杂。
最后可能出现一个很尴尬的现象:
为了自动化一个流程,企业花了大量时间维护自动化本身。
三、Agent改变的,恰恰是“理解变化”
这就是AI Agent真正有价值的地方。
假设一个网页原来是:
“提交订单”
后来系统改版:
“确认并提交”
传统脚本可能因为找不到原来的元素而失败。
而Computer Use的思路是:
重新看一遍屏幕。
AI看到:
“这里虽然文字变了,但它仍然是提交订单的按钮。”
于是继续执行。
微软目前的Computer Use就是通过视觉理解屏幕,再进行鼠标点击、菜单选择和文本输入;微软也明确说明,这类能力可以用于没有API连接的网页和桌面应用。(Microsoft Learn)
这就是一个非常重要的变化:传统RPA执行的是预先定义的路径。Agent尝试理解的是当前环境。
四、所以Agent和RPA真正的区别,不是“谁更先进”
很多文章喜欢简单总结:
RPA是旧技术。Agent是新技术。
这种说法其实并不准确。
真正的区别应该是:
RPA更擅长:确定性任务。
- 批量数据录入
- 固定格式报表
- 固定系统之间的数据搬运
- 批量下载文件
- 固定规则的数据校验
- 定时任务
- 标准化审批流程
Agent更适合:具有一定不确定性的任务。
- 理解自然语言需求
- 判断网页内容
- 处理非标准文档
- 根据上下文决定下一步
- 跨多个工具完成任务
- 面对界面变化进行调整
- 将一个目标拆成多个步骤
因此真正合理的关系不是:Agent →淘汰RPA,而是:Agent + RPA。
五、未来最典型的企业自动化,可能长这样
假设企业要完成:
“处理一批供应商发来的采购订单。”
未来的自动化系统可能是:
第一层:Agent
负责理解任务。
“今天有300份订单,需要处理并标记异常。”
Agent开始规划:
- 需要读取哪些文件?
- 哪些订单需要进一步审核?
- 哪些订单可以自动处理?
第二层:AI模型
负责理解非结构化信息。
- 邮件
- 合同
- 图片
- Excel
- 网页内容
AI负责把这些信息转换成结构化结果。
第三层:RPA
负责执行确定性动作。
- 登录ERP
- 创建订单
- 填写字段
- 点击提交
- 下载回执
这些事情没有必要让一个大模型每次都“思考一遍”。
因为:能确定的事情,就不要让AI猜。
第四层:API
如果两个系统有成熟API:
直接调用API。
因为API通常比模拟鼠标点击:更快、更稳定、更容易监控。
所以未来企业自动化可能不是:
“全部用Agent。”
而是:
- API能解决的,用API。
- 规则明确的,用RPA。
- 需要理解和决策的,用AI Agent。
- 高风险动作,由人审批。
这才是更现实的架构。
六、这其实意味着RPA正在从“主角”变成“执行器”
这是整个行业非常重要的一次变化。
以前:
RPA =自动化系统本身
未来:
RPA = Agent可以调用的一种执行能力
你可以把它想象成:
- Agent的大脑:“我要完成这个业务。”
- RPA的手:“我负责把这个确定动作执行掉。”
- API像高速公路:“能直接调用系统,就不要绕路操作界面。”
- 人:“遇到高风险问题,我来做最终决策。”
这实际上形成了一个新的组合:Agent + RPA + API + Human
七、为什么RPA反而可能在Agent时代继续存在?
因为一个非常现实的问题:
AI不是100%可靠。
Agent最大的优势是灵活。
但灵活的另一面,就是存在不确定性。
如果让Agent处理:
“帮我搜索一下这家公司的最新产品。”
出错一次,问题可能不大。
但如果让Agent:
“自动给供应商支付100万元。”
事情就完全不同了。
企业需要:
- 确定的权限
- 确定的流程
- 确定的审计
- 确定的执行结果
这种情况下,传统自动化反而具有价值。因为:越高风险的流程,越需要确定性。

八、所以未来可能出现一种非常有意思的分工
可以把企业任务分成三个区域。
第一类:低风险+ 高确定性
- 批量改文件名
- 数据同步
- 固定报表
- 下载文件
- 定时发送通知
RPA最合适。
第二类:高变化+ 低风险
- 搜索资料
- 整理网页信息
- 阅读大量文档
- 初步分析
- 生成报告草稿
Agent更合适。
第三类:高风险任务
- 财务付款
- 合同最终确认
- 数据库删除
- 关键生产系统修改
- 涉及敏感数据的操作
最合理的方式往往不是:
“完全交给AI。”
而是:
Agent执行→ 系统校验→ 人确认→ RPA/API最终执行。
也就是:
Human-in-the-loop
人在关键节点保留最终控制权。
微软目前的Computer Use也已经提供Human Supervision机制,让Agent在需要确认或补充信息时升级给人;同时微软明确提示,Computer Use需要考虑网页内容中的Prompt Injection等安全风险。(Microsoft Learn)
九、真正危险的不是Agent取代RPA,而是“企业没有重新设计流程”
很多企业现在可能会犯一个错误:
以前有一个RPA流程。
现在加一个Agent。
然后说:
“我们已经完成AI升级。”
其实远远不是。
真正的变化应该是:
重新思考整个工作流程。
以前:
人
↓
Excel
↓
RPA
↓
ERP
↓
人工审核
↓
邮件

未来可能变成:
Agent理解任务
↓
读取数据
↓
调用AI模型
↓
API/RPA执行
↓
自动验证
↓
异常升级给人
↓
完成闭环
这不是简单地给RPA“加一个AI”。而是:重新设计数字劳动力。
十、RPA公司自己也在发生变化
这其实是非常值得关注的行业信号。
如果Agent真的会把RPA淘汰,那么RPA厂商应该逐渐退出。
但现实恰恰相反。
例如UiPath现在已经明确把产品方向放到Agentic Automation上,并强调让Agent、机器人和工作流协同工作;其官方对“Agentic Automation是否会取代RPA”的回答也是:不会,Agent更可能与RPA及智能自动化协同。(UiPath)
微软也已经把Computer Use直接放进Copilot Studio,并提供独立Computer Use工具、运行监控、日志和治理能力。(Microsoft Learn)
这其实说明一个非常重要的趋势:AI没有把自动化行业推翻重来。而是在把原来的自动化体系重新组合。
十一、真正可能被淘汰的是什么?
如果一定要说“谁会被淘汰”,我认为不是RPA。
更可能被淘汰的是:
1.纯人工的重复点击
每天重复几十次、几百次的工作。
2.极其脆弱的UI脚本
只要网页改一个按钮位置,就需要重新维护的自动化。
3. “人负责搬数据”的工作
A系统复制→ B系统粘贴→ C系统再录入,这类工作会越来越难保留人工价值。
4.只会执行、不理解上下文的自动化
未来自动化系统会越来越需要:理解→ 判断→ 执行→ 验证,而不是:点击→ 点击→ 点击。
十二、但这里还有一个经常被忽略的问题:成本
Agent并不是免费的。
传统RPA执行一个固定动作,成本可以非常低,而且结果高度确定。
但Agent每一步都可能涉及:
- 视觉理解
- 模型推理
- 上下文
- 工具调用
- 截图
- 重新规划
微软目前的Computer Use就是按Agent action计费,一个Computer Use步骤可能对应一次或多次底层操作,不同模型的计费档位也不同。(Microsoft Learn)
这意味着:不是所有任务都值得用Agent。
如果一个动作:
“每天固定把A表复制到B表。”
没有必要让一个大模型每次重新思考。
直接RPA或者API可能更合理。这其实是未来企业AI非常重要的一条原则:不要为了AI而AI。
十三、所以未来企业真正需要的,不是“AI化”,而是“自动化分层”
可以建立一个非常简单的判断框架。
能不能直接API?
能。优先API。
没有API,但流程高度固定?
RPA。
有大量非结构化信息,需要理解?
AI。
流程经常变化,需要动态判断?
Agent。
涉及高风险操作?
Agent +自动校验+ 人工审批。
多个系统、多种工具协同?
Agent Orchestration。
这才是未来企业自动化真正可能形成的架构。
十四、那么RPA工程师会不会失业?
这个问题其实比“RPA会不会消失”更值得讨论。
我的判断是:
纯粹只会录制流程、拖拽组件、维护固定脚本的能力,价值会下降。
但懂下面这些东西的人,价值反而可能提升:
- RPA
- API
- Python
- 数据库
- LLM
- Agent
- 工作流
- 权限管理
- 企业系统
- 流程设计
- 自动化治理
因为未来企业需要的不是:一个RPA脚本工程师。而是:能够设计“AI +自动化+ 企业系统”的人。这会成为一个新的职业能力组合。
十五、最后给一个更值得关注的判断
如果把过去十几年的自动化发展放在一起看,会发现一个非常有意思的演变:
第一阶段:人工操作电脑
人负责:理解、判断、点击、输入、检查。
第二阶段:RPA操作电脑
人负责:设计规则。RPA负责:重复执行。
第三阶段:AI Agent操作电脑
人负责:提出目标、设置边界、审核结果。Agent负责:理解、规划、执行、调整。
第四阶段:可能会进一步变成
Agent管理Agent,RPA/API作为执行基础设施。
- 一个Agent负责拆任务。
- 另一个Agent负责分析。
- 另一个Agent负责调用工具。
- RPA负责确定性执行。
- API负责系统级调用。
- 人负责最终决策。
这时候,自动化真正发生变化的就不再是:“谁替代谁?”而是:“谁负责思考,谁负责执行,谁负责控制?”
最后的答案:RPA不会消失,但RPA的时代正在改变
所以,如果有人问:
“AI开始自己操作软件以后,RPA会不会消失?”
我的答案是:
不会。
但传统的:
“录制一个流程→ 自动点击→ 出错维护”
这种单一RPA模式,确实会受到越来越大的挑战。
未来更可能形成:
AI Agent负责理解和决策
↓
API负责高效连接
↓
RPA负责稳定执行
↓
工作流负责流程编排
↓
人负责高风险节点
↓
治理系统负责权限、监控和审计
这不是RPA被AI消灭。而是:RPA从“自动化的主角”,变成了AI Agent可以调用的一双手。
真正值得关注的,也不是:
“RPA还能活多久?”
而是:
“未来一个企业的数字员工,到底会由Agent、RPA、API和人怎样共同组成?”
这可能才是2026年企业自动化真正进入的新阶段。
AI趋势实验室
我们不只追踪“哪个AI又发布了新功能”,更关注这些技术进入真实工作以后,究竟会怎样改变软件、硬件、企业流程和普通人的工作方式。
AI趋势,先知先行。

夜雨聆风