看懂 AI · 第 07 篇
工具链,怎样把模型接进真实世界?
从一次回答走到可执行的工作
AI 导读
模型可以写一封催款邮件,也能分析一份客户清单。可它并不知道哪笔款已经到账,没有权限打开企业系统,更不能自行决定把邮件发给谁。回答生成以后,工作往往才走到一半。
本文沿着一次真实任务往前走:软件先调用模型,系统补充当前资料,再连接企业工具,保存多步骤状态,检查身份与权限,执行动作,最后记录结果并处理失败。模型、MCP、工作流、评测和监控,会在这条链上各自找到位置。
读完以后,判断一家工具链公司可以少看几个连接器,多看三件事:任务能否稳定完成,失败以后能否恢复,动作出了问题由谁解释和负责。客户愿意长期付费的部分,常常藏在这些不容易演示的环节里。
先记住这套颜色
灰蓝:用户、数据与外部软件
绿色:接口、连接器与运行环境
紫蓝:模型与生成能力
黄色:编排、权限、评测与监控
红橙:业务动作、结果与责任
假设我们给 AI 一张逾期客户表,让它找出需要跟进的人,生成邮件并更新客户系统。模型很快就能给出一套处理办法,也能写出措辞得体的邮件。此时没有一封邮件被发出,客户状态也没有发生变化。
中间缺少的工作很具体:读取最新账单,确认客户联系人,调用邮件系统,判断发送权限,等待人工检查,把成功与失败写回客户记录。任何一步出错,都可能把旧账单发给错误的人,或者在网络重试时把同一封邮件发送两遍。
上一篇讲数据怎样进入模型与业务。这一篇继续往应用方向走,看看模型周围为什么会长出一整套工具链。它没有发布会上的模型参数醒目,却决定一项能力能否进入真实工作。
一、模型回答以后,工作还没有完成
图 1|从一句要求到一个业务结果,中间隔着七步
用户提出任务
找出逾期客户,生成提醒并更新记录
↓
读取现场
取得最新账单、联系人和客户状态
↓
模型判断与生成
识别对象,准备邮件和建议动作
↓
检查权限与执行条件
确认谁能发送、哪些客户需要人工复核
↓
调用软件并产生结果
发出邮件、更新记录、留下回执
模型输出的是文字、结构化数据,或者一项工具调用建议。业务结果发生在外部系统里:一封邮件被发出,一条订单被修改,一段代码被合并,一笔退款被创建。两个世界之间需要有人搬运信息、执行规则并留下记录。
早期有一家卫星电视服务商,既不生产节目,也不制造用户家里的设备。它的生意能够成立,靠的是把有用内容稳定送到家庭。工具链也处在相似位置。它不需要拥有模型、客户数据和全部软件,连接质量仍然可以形成独立价值。
因此,评价一个 AI 产品时,要把三种能力拆开。模型决定它理解和生成到什么水平;工具链决定它能连接什么、怎样行动;行业产品决定任务规则、客户体验和责任边界。最终效果来自三者共同工作。
二、模型 API 先把能力交给软件
图 2|API 是模型公司与应用公司的交接面
应用发出标准请求
指令、上下文、可用工具、输出格式与会话状态
模型 API:身份校验、传输、限额、流式返回、错误约定
模型返回可处理结果
文本、结构化内容、工具调用请求或继续交互所需状态
应用决定怎样展示、执行、重试和计费
API 常被理解成一个网络地址。对产品团队来说,它还是一份长期协作合同。应用按照约定发送输入,模型服务按照约定返回结果;双方还要处理身份、限额、超时、流式输出、工具描述和错误信息。
今天的模型接口已经能够接收工具定义和多种输入,也可以把会话状态继续交给下一轮。模型能力由此进入客服系统、开发工具、办公软件和行业应用。推理服务公司则把模型包装成可以部署、伸缩和计费的标准服务,让企业在云上或自己的数据中心调用。
统一接口降低了接入门槛,却没有让模型完全可替换。不同模型支持的上下文、工具格式、速度、价格和错误习惯仍有差异。工具链在这里还要做一层适配,让上层产品少受底层变化影响。
三、上下文系统把任务现场带给模型
图 3|模型每次工作,都要重新拿到当前现场
企业资料
合同、账单、客户记录、内部知识和历史对话
检索、筛选与组装
只取当前任务需要、用户有权查看、时间仍然有效的部分
附上来源与任务状态
告诉模型资料来自哪里、进行到哪一步、哪些规则不能越过
模型在当前现场中判断
相同模型会因资料、权限和任务状态不同给出不同结果
模型训练结束时学到的是过去材料中的一般规律。今天哪位客户已经付款、公司刚更新了什么政策、当前员工能看哪些合同,这些信息不会自动出现在模型里。产品需要在每次任务开始时重新准备现场。
准备上下文也不能把所有资料一次塞进去。系统要先找到相关内容,再检查时间、来源和访问权限,最后按模型能理解的方式组织。资料太少会漏掉条件,资料太多会增加成本,也可能让过期内容干扰判断。
这一步解释了一个常见现象:两家公司使用同一个模型,产品效果可以相差很大。行业知识怎样整理,当前状态怎样保存,错误资料怎样被排除,都会改变模型看到的任务。模型提供通用脑力,场景能力往往生长在上下文系统里。
四、连接器和 MCP 让软件能力可以被发现
图 4|统一连接层,把不同软件翻译成可调用能力
各自 API、认证方式和业务字段
连接器与 MCP 服务器
向上提供工具、资源和说明,向下适配具体软件
发现能力、读取描述、提交参数、取得结果
模型与应用看到统一的调用入口
每套企业软件都有自己的 API、字段和认证方式。如果每个 AI 产品都单独连接一遍邮件、数据库、客户系统和代码仓库,团队会在重复适配上花掉大量时间。连接器把具体系统包装成较稳定的能力,MCP 一类协议又让客户端可以发现这些能力,读取说明并提交参数。
协议解决了交换方式,底层差异仍然存在。连接器要处理登录授权、分页、限流、字段变化和错误返回,还要把“更新客户”翻译成具体系统里的操作。插头尺寸统一以后,电器依然要符合电压和使用规则。
因此,连接器数量适合做产品展示,难以单独证明护城河。客户更在意常用系统能否稳定工作,新版本上线后会不会失效,权限是否清楚,出了错能否定位。工具目录很宽,和每件工具都能进入生产,是两种能力。
五、编排和状态让多步骤任务继续运行
图 5|一项任务需要记住自己走到了哪里
待处理
任务已进入队列,等待资源与执行条件
运行中
模型分析资料,选择下一步动作
等待确认或外部结果
暂停任务,保存现场,稍后从原位置继续
完成
动作成功并留下结果
失败待处理
重试、换方案或交给人
现实任务很少在一次模型调用里结束。查询账单以后可能要等待数据库,生成邮件以后可能要等负责人确认,外部系统也会限流或短暂不可用。任务运行几分钟、几小时甚至几天时,系统必须记住已经完成了什么,接下来要做什么。
编排层负责安排顺序、分支、等待和重试,状态系统保存每一步输入与结果。它还要避免重复动作:读取资料可以多试一次,发送邮件和创建付款却不能在网络抖动时悄悄执行两遍。相同的重试规则,放在不同动作上会产生完全不同的后果。
专业服务常给人一种稳定感,并非因为意外从不发生。客户知道最差结果不会偏离太远,异常出现后也有明确处理方式。Agent 产品走向长期使用,同样要把暂停、恢复、补偿和人工处理做进运行系统。
六、身份和权限决定哪些动作可以发生
图 6|工具调用穿过四道权限检查
确认是谁提出任务
用户、团队、服务账号和所属组织
确认能访问什么
客户范围、文件目录、系统账户和数据字段
确认能做什么动作
只读、修改、发送、删除、付款和对外发布
高风险动作等待人工确认
把决策权留给承担业务责任的人
执行并记录授权依据
以后能够解释谁在何时允许了什么动作
模型可以建议删除一个文件,系统需要判断当前用户有没有删除权限;模型可以准备一笔退款,财务规则还要检查金额和审批人。理解能力越强,系统越要清楚哪些决定仍然属于人和组织。
权限是一种稀缺资源。全程人工审批会拖慢工作,完全放开又会扩大错误。成熟产品会按动作风险分配权限:查询通常可以自动完成,修改需要更窄的范围,付款、删除和公开发布则保留人工确认或更高等级授权。
这部分也会形成工具链公司的长期位置。企业需要统一管理登录、密钥、授权范围、审批和操作记录,还要适配原有组织制度。模型更新得很快,公司的责任体系不会跟着每次发布重新搭建。
七、评测、记录和恢复决定系统能否长期使用
图 7|一次失败,需要沿整条任务链倒查
记录发生了什么
输入来源、模型版本、工具参数、耗时、结果和人工操作
判断错在哪里
资料过期、模型误判、工具失败、权限不足或流程设计有误
选择恢复方式
安全重试、切换工具、回退版本、撤销动作或交给人工
把案例写进评测
下一次更新时重新检查,防止同类错误回来
传统软件出错时,工程师会看日志、指标和调用链。AI 任务增加了新的不确定性:同一句要求可能得到不同方案,模型和提示更新也可能让旧任务退化。因此,记录既要覆盖软件运行,也要保存模型、上下文和工具调用过程。
OpenTelemetry 一类体系把日志、指标和链路追踪变成通用运行能力。放进 Agent 系统以后,团队可以看到一项任务在哪一步变慢,哪个工具频繁失败,费用花在哪里。评测再把常见任务和历史事故整理成固定检查,让每次更新都有一把相对稳定的尺子。
客户购买的也很少是一段漂亮演示。他们需要知道任务是否完成,结果能否追溯,错误会不会扩散。工具链把这些要求沉淀成公共能力以后,应用团队才有可能把精力放回自己的行业问题。
八、怎样看懂工具链里的公司与机会
图 8|工具链产业分布在模型和业务之间
模型服务与推理平台
把模型能力做成可部署、可伸缩、可计费的服务
连接协议、连接器与上下文平台
连接企业数据和软件,准备模型需要的任务现场
编排、状态与托管运行
让长任务能够等待、恢复、伸缩并控制成本
身份、权限、安全与评测
安排动作边界,发现错误,留下运行与责任记录
行业应用与服务
把公共能力放进明确流程,用业务结果获得收入
工具链处在模型公司和行业客户之间,机会自然分散在许多位置。有人提供模型接口和推理服务,有人连接数据与软件,有人管理任务状态,有人专门解决身份、安全、评测和监控,最上层的公司再把这些能力组合进法律、医疗、研发、销售和办公流程。
标准协议普及后,基础连接会逐渐便宜,新的价值会向运行质量和行业责任移动。能接入一百套软件很有吸引力;其中十套能否长期稳定工作,能否理解客户字段,能否在升级后快速恢复,往往更影响续费。
看这类公司时,可以沿任务链逐步检查:它替客户省掉了哪段重复建设,掌握了哪些难以迁移的状态与规则,收入是否随着稳定使用增长,发生事故时又承担多少责任。越接近业务结果,客户价值越容易证明,交付成本和风险也会一起上升。
把工具链放回整张 AI 地图
芯片和数据中心提供算力,数据与模型生产通用能力。工具链再把能力连接到当前资料、企业软件和组织规则里,让一次回答有机会变成可执行、可追踪、可恢复的工作。模型决定上限,工具链决定这份能力能否稳定到达客户手中。
下一篇
看懂AI系列08:Agent,为什么开始从聊天走向办事?
夜雨聆风