夜雨聆风学习资料网

ARTICLE · 1053925

AI 的下一站不是更聪明,而是有工位:拆解 Agent 客户端的三层差异

AI 的下一站不是更聪明,而是有工位:拆解 Agent 客户端的三层差异
同样调用大模型,一个只能给你文字,另一个能直接交给你一份 PPT。差距不在脑力,在它被放在了什么地方。

这个场景你一定经历过

你让网页版 AI 写一份行业分析报告。它输出三千字,语句逻辑读起来是通顺的。然后真正的活才开始:复制到 Word、调标题层级、找配图、改格式;突然发现第三段数据不对,回去再问一轮,复制过来覆盖;又想要个图表,再问一轮,拿到一段 Python 代码,还得自己找地方跑。

AI 写了三千字,你干了四十分钟。

多数人会把这归因于"模型还不够聪明"。

但问题不在智商,在处境——它被关在对话框里:没有手(不能操作文件),没有脚(不会自己跑下一步),没有工位(不知道你资料放在哪),没有工牌(进不了公司的 ERP 和数据库)。

同一类大模型,装进不同的环境,能力差距就是这么来的。


一、执行方式:谁来推下一步

网页 AI 的范式从没变过:输入 → 输出 → 结束

一次只解决一步,进度条在你脑子里,每一轮推进都必须由你手动发起。所以"AI 写三千字、你干四十分钟"里,瓶颈从来不是生成速度,是你在环节中的往返次数

Agent 客户端换成了 Agent Loop(ReAct 实现):

目标 → 拆解成 N 步 → 执行第 1 步 → 观察结果 → 修正计划 → 执行第 2 步 → … → 自检 → 交付

任务拆解、迭代、校验全由模型完成。

实测从零生成一个数据可视化网页(读数据 → 分析 → 选图表 → 写前端 → 本地预览 → 修 bug),2 分 58 秒,全程无人干预

代价要说清楚

模型可能在第 1 步走偏,然后基于错误前提跑完 10 步,交出一份"看起来很专业但根上就错了"的东西。

用网页 AI 你逐轮把关,出错代价低;用 Agent 你只在终点把关,出错代价高。这个取舍,直接决定了第四节怎么选。


二、文件处理:交付的是文字,还是文件

网页 AI 处理文件的链路是:

上传 → 云端解析 → 抽成文本 → 塞进上下文 → 输出文本

注意最后一步——输出的是文本,不是文件。这带来三个硬伤:

  • 格式在解析中丢失
    带复杂表格和批注的 Word,解析完大概率只剩纯文字流。
  • 输出不能直接交付
    转成 docx/pptx/xlsx 的排版工作全部落回你头上。
  • 文件是一次性的
    每次都要重传,它不记得上周给它看过的那份季度报表。

Agent 客户端是跑在你本机上的程序,可以直接读写文件系统,直接产出 .docx / .xlsx / .pptx / .pdf。这是从"内容交付"到"成品交付"的跨越。

而且本地文件系统不只是"更方便",它解决了网页 AI 结构性地解决不了的四件事:

问题
本地文件系统
数据合规
敏感材料不出本机,省掉上传审查
体量限制
200MB 素材可分块读,不受上下文窗口限制
断点续跑
中间结果落盘,中断后能接着做
多文件关联
可跨几十个文件建立关联,单次上传做不到

工作空间:给 Agent 一张办公桌

既然 Agent 要读写本地文件,就得划定范围——这就是工作空间。你指定一个文件夹(比如 D:\AI工作区\Q3财报分析),这个任务的读取和产出都发生在里面。

创建方式两种:新建空白,或直接绑定已有文件夹(推荐)。

三条规范,都是踩过坑的:

  1. 别只靠上传附件
    ——文件会落进系统临时目录、日期命名,过两周你根本找不到。先建好语义清晰的文件夹再开工。
  2. 不要改/删/移动工作空间的文件夹
    ——Agent 靠路径定位,目录动了这个"工位"就消失了,直接报错。运行期间尤其别动。
  3. 忘了路径?
     任务栏右侧「更多选项」→「打开文件夹」,直接跳到本地目录。
顺带一句:按项目命名(客户A-竞品分析)而不是按日期命名(2026-09-21)。你给它清晰的语义边界,它的检索准确率会明显更高。

三、工具连接:真正的分水岭

前两层是能力升级,这一层才是质变。

网页 AI 的工具箱里基本只有联网搜索——它只活在公开知识的世界里。而真实工作里高价值的任务,依赖的全是私有数据:这个月的库存周转(在 ERP)、华东区续约率(在 CRM)、工单系统哪类问题涨得最快(在内部工单库)、公司报销标准(在内网)。

这些它一个都答不了,不是不够聪明,是摸不到数据。

Agent 靠三样东西破局:

① Function Calling(工具调用)

模型不再只输出文本,而是输出结构化的调用请求:

{"tool": "query_erp_inventory", "params": {"sku": "A10293"}}

运行时捕获请求、真正调用系统、把结果回灌给模型继续推理。这是 Agent 能"动手"的原理。

② MCP(Model Context Protocol)

Anthropic 在 2024 年开源的一套标准协议,解决工具接入碎片化:数据源按统一协议暴露成 MCP Server,AI 应用作为 Client 按需连接,集成成本从 N×M 降为 N+M。这就是"连接器"的真实含义。

③ 技能(Skills):让它知道该怎么干

连接器解决的是"能碰到什么",还有一层是"知道怎么干"——这就是技能

它通常是一份说明文档(什么时候用、按什么流程做、交付什么格式),外加可选的脚本和模板。装上"财报分析"技能,它才知道该算哪些指标、按什么框架拆;装上"合同审查"技能,它才知道逐条比对哪些风险点。

区别在于:MCP 给的是能力(手能伸到哪),技能给的是方法(活该怎么干)。 类比一下——MCP 是给新员工开账号和权限,技能是给他一份岗位 SOP。只有账号,他不会干活;只有 SOP,他碰不到系统。

而且技能是渐进式加载的:平时只挂名称和描述(很轻),判断任务相关时才把完整内容读进上下文。这是 Agent 控制 token 开销的关键设计。

前两层让 AI 干得更快,这一层让 AI 干得了以前根本干不了的活

但风险同步放大,这几条底线不能省:

  • 只读查询任务,就给只读账号,别图省事用管理员凭据
  • 未公开财务数据、源代码,单独评估是否允许进入上下文
  • 确认供应商协议:不用于训练、留存期限、存储地域
  • 查询类可自动跑;"下单 / 改库存 / 发消息"这类写操作保留人工确认
  • 留工具调用日志,出问题时这是唯一的追溯依据

四、怎么选:问自己三个问题

按顺序问:

① 需要几轮?

一轮能解决 → 网页 AI;要多步推进 → Agent

② 交付物是什么?

一段回答/结论/代码 → 网页 AI;可直接使用文件 → Agent

③ 数据在哪?

公开信息 → 网页 AI;本地大量文件 / 企业私有数据 → Agent

网页 AI 就够: 资料检索、事实核查、常识咨询、单篇总结与润色、代码解释、头脑风暴——任何"问完就走"的轻量任务。

该上 Agent 了: 跨多文件整合分析(12 份周报 → 月度汇报)、交付物必须可编辑可提交、需要反复迭代校验、要读本地素材或企业数据、流程长到你不愿意盯。

成本:为什么 Agent 明显更贵

token 消耗高出一个量级,是三个效应叠加:

  1. 系统提示词更重
    ——工具清单、使用规范、安全约束、输出格式,光这部分就是普通对话的十倍量级。
  2. 上下文线性累积
    ——N 轮迭代,历史就要被带入 N 次(除非有 prompt caching)。
  3. 工具返回会灌满上下文
    ——读一个 50 页 PDF,几万字进上下文,之后每一轮都带着它。

一次中等复杂度的 Agent 任务,token 达到普通问答的几十倍,是正常现象,不是异常

比账单更隐蔽的成本是过度工程化:让它总结一段 200 字通知,它可能建工作空间、生成 Markdown、转 Word,再附一份处理说明。你只想要一句话。

三条优化:

  1. 任务分级(简单任务坚决走网页 AI,这 10 秒判断最划算);

  2. 工作空间做减法(塞 200 个文件进去,它只会读错);

  3. 目标写收敛("分析这 3 个文件的销售额趋势,输出带图表的 Excel",远好于"帮我分析一下业务")。


五、最后

把 AI 应用的形态排个序:Chatbot(对话问答)→ Copilot(嵌入软件辅助)→ Agent(有执行环境)。

改变人机分工的关键词是环境,不是模型。AI 拿到了一个能放东西的地方(工作空间)、一套能动手的工具(连接器)、一套能自己推进的流程(Agent Loop)。

于是对人的要求变了:从"会提问"变成"会派活、会验收"。

提示词工程正在让位给上下文工程——重点不再是琢磨那句话怎么说,而是给 AI 准备什么环境:哪些文件、哪些工具、哪些约束、什么算完成。

所以第二节那个看似琐碎的工作空间规范,其实很关键:你整理文件夹的方式,正在成为你和 AI 协作的接口。

选型标准不是"哪个更强",而是"这个活值不值得启动一整套 Agent 循环"。不是所有活都需要导弹。

相关学习资料