ARTICLE · 1053925
AI 的下一站不是更聪明,而是有工位:拆解 Agent 客户端的三层差异
同样调用大模型,一个只能给你文字,另一个能直接交给你一份 PPT。差距不在脑力,在它被放在了什么地方。
这个场景你一定经历过
你让网页版 AI 写一份行业分析报告。它输出三千字,语句逻辑读起来是通顺的。然后真正的活才开始:复制到 Word、调标题层级、找配图、改格式;突然发现第三段数据不对,回去再问一轮,复制过来覆盖;又想要个图表,再问一轮,拿到一段 Python 代码,还得自己找地方跑。
AI 写了三千字,你干了四十分钟。
多数人会把这归因于"模型还不够聪明"。
但问题不在智商,在处境——它被关在对话框里:没有手(不能操作文件),没有脚(不会自己跑下一步),没有工位(不知道你资料放在哪),没有工牌(进不了公司的 ERP 和数据库)。
同一类大模型,装进不同的环境,能力差距就是这么来的。
一、执行方式:谁来推下一步

网页 AI 的范式从没变过:输入 → 输出 → 结束。
一次只解决一步,进度条在你脑子里,每一轮推进都必须由你手动发起。所以"AI 写三千字、你干四十分钟"里,瓶颈从来不是生成速度,是你在环节中的往返次数。
Agent 客户端换成了 Agent Loop(ReAct 实现):
目标 → 拆解成 N 步 → 执行第 1 步 → 观察结果 → 修正计划 → 执行第 2 步 → … → 自检 → 交付任务拆解、迭代、校验全由模型完成。
实测从零生成一个数据可视化网页(读数据 → 分析 → 选图表 → 写前端 → 本地预览 → 修 bug),2 分 58 秒,全程无人干预。

代价要说清楚:
模型可能在第 1 步走偏,然后基于错误前提跑完 10 步,交出一份"看起来很专业但根上就错了"的东西。
用网页 AI 你逐轮把关,出错代价低;用 Agent 你只在终点把关,出错代价高。这个取舍,直接决定了第四节怎么选。
二、文件处理:交付的是文字,还是文件
网页 AI 处理文件的链路是:
上传 → 云端解析 → 抽成文本 → 塞进上下文 → 输出文本注意最后一步——输出的是文本,不是文件。这带来三个硬伤:
- 格式在解析中丢失
带复杂表格和批注的 Word,解析完大概率只剩纯文字流。 - 输出不能直接交付
转成 docx/pptx/xlsx 的排版工作全部落回你头上。 - 文件是一次性的
每次都要重传,它不记得上周给它看过的那份季度报表。
Agent 客户端是跑在你本机上的程序,可以直接读写文件系统,直接产出 .docx / .xlsx / .pptx / .pdf。这是从"内容交付"到"成品交付"的跨越。
而且本地文件系统不只是"更方便",它解决了网页 AI 结构性地解决不了的四件事:
工作空间:给 Agent 一张办公桌
既然 Agent 要读写本地文件,就得划定范围——这就是工作空间。你指定一个文件夹(比如 D:\AI工作区\Q3财报分析),这个任务的读取和产出都发生在里面。
创建方式两种:新建空白,或直接绑定已有文件夹(推荐)。
三条规范,都是踩过坑的:
- 别只靠上传附件
——文件会落进系统临时目录、日期命名,过两周你根本找不到。先建好语义清晰的文件夹再开工。 - 不要改/删/移动工作空间的文件夹
——Agent 靠路径定位,目录动了这个"工位"就消失了,直接报错。运行期间尤其别动。 - 忘了路径?
任务栏右侧「更多选项」→「打开文件夹」,直接跳到本地目录。
顺带一句:按项目命名( 客户A-竞品分析)而不是按日期命名(2026-09-21)。你给它清晰的语义边界,它的检索准确率会明显更高。
三、工具连接:真正的分水岭
前两层是能力升级,这一层才是质变。
网页 AI 的工具箱里基本只有联网搜索——它只活在公开知识的世界里。而真实工作里高价值的任务,依赖的全是私有数据:这个月的库存周转(在 ERP)、华东区续约率(在 CRM)、工单系统哪类问题涨得最快(在内部工单库)、公司报销标准(在内网)。
这些它一个都答不了,不是不够聪明,是摸不到数据。
Agent 靠三样东西破局:
① Function Calling(工具调用)
模型不再只输出文本,而是输出结构化的调用请求:
{"tool": "query_erp_inventory", "params": {"sku": "A10293"}}运行时捕获请求、真正调用系统、把结果回灌给模型继续推理。这是 Agent 能"动手"的原理。
② MCP(Model Context Protocol)
Anthropic 在 2024 年开源的一套标准协议,解决工具接入碎片化:数据源按统一协议暴露成 MCP Server,AI 应用作为 Client 按需连接,集成成本从 N×M 降为 N+M。这就是"连接器"的真实含义。
③ 技能(Skills):让它知道该怎么干
连接器解决的是"能碰到什么",还有一层是"知道怎么干"——这就是技能。
它通常是一份说明文档(什么时候用、按什么流程做、交付什么格式),外加可选的脚本和模板。装上"财报分析"技能,它才知道该算哪些指标、按什么框架拆;装上"合同审查"技能,它才知道逐条比对哪些风险点。
区别在于:MCP 给的是能力(手能伸到哪),技能给的是方法(活该怎么干)。 类比一下——MCP 是给新员工开账号和权限,技能是给他一份岗位 SOP。只有账号,他不会干活;只有 SOP,他碰不到系统。
而且技能是渐进式加载的:平时只挂名称和描述(很轻),判断任务相关时才把完整内容读进上下文。这是 Agent 控制 token 开销的关键设计。

前两层让 AI 干得更快,这一层让 AI 干得了以前根本干不了的活。
但风险同步放大,这几条底线不能省:
只读查询任务,就给只读账号,别图省事用管理员凭据 未公开财务数据、源代码,单独评估是否允许进入上下文 确认供应商协议:不用于训练、留存期限、存储地域 查询类可自动跑;"下单 / 改库存 / 发消息"这类写操作保留人工确认 留工具调用日志,出问题时这是唯一的追溯依据
四、怎么选:问自己三个问题
按顺序问:
① 需要几轮?
一轮能解决 → 网页 AI;要多步推进 → Agent
② 交付物是什么?
一段回答/结论/代码 → 网页 AI;可直接使用文件 → Agent
③ 数据在哪?
公开信息 → 网页 AI;本地大量文件 / 企业私有数据 → Agent
网页 AI 就够: 资料检索、事实核查、常识咨询、单篇总结与润色、代码解释、头脑风暴——任何"问完就走"的轻量任务。
该上 Agent 了: 跨多文件整合分析(12 份周报 → 月度汇报)、交付物必须可编辑可提交、需要反复迭代校验、要读本地素材或企业数据、流程长到你不愿意盯。
成本:为什么 Agent 明显更贵
token 消耗高出一个量级,是三个效应叠加:
- 系统提示词更重
——工具清单、使用规范、安全约束、输出格式,光这部分就是普通对话的十倍量级。 - 上下文线性累积
——N 轮迭代,历史就要被带入 N 次(除非有 prompt caching)。 - 工具返回会灌满上下文
——读一个 50 页 PDF,几万字进上下文,之后每一轮都带着它。
一次中等复杂度的 Agent 任务,token 达到普通问答的几十倍,是正常现象,不是异常。
比账单更隐蔽的成本是过度工程化:让它总结一段 200 字通知,它可能建工作空间、生成 Markdown、转 Word,再附一份处理说明。你只想要一句话。

三条优化:
任务分级(简单任务坚决走网页 AI,这 10 秒判断最划算);
工作空间做减法(塞 200 个文件进去,它只会读错);
目标写收敛("分析这 3 个文件的销售额趋势,输出带图表的 Excel",远好于"帮我分析一下业务")。
五、最后
把 AI 应用的形态排个序:Chatbot(对话问答)→ Copilot(嵌入软件辅助)→ Agent(有执行环境)。
改变人机分工的关键词是环境,不是模型。AI 拿到了一个能放东西的地方(工作空间)、一套能动手的工具(连接器)、一套能自己推进的流程(Agent Loop)。
于是对人的要求变了:从"会提问"变成"会派活、会验收"。
提示词工程正在让位给上下文工程——重点不再是琢磨那句话怎么说,而是给 AI 准备什么环境:哪些文件、哪些工具、哪些约束、什么算完成。
所以第二节那个看似琐碎的工作空间规范,其实很关键:你整理文件夹的方式,正在成为你和 AI 协作的接口。
选型标准不是"哪个更强",而是"这个活值不值得启动一整套 Agent 循环"。不是所有活都需要导弹。