乐于分享
好东西不私藏

从0到1搭建可落地的AI Agent与工作流(13):第13期|Agent上线后Token费炸了?给工作流加个「路由大脑」,成本

从0到1搭建可落地的AI Agent与工作流(13):第13期|Agent上线后Token费炸了?给工作流加个「路由大脑」,成本
AI AGENT 实战系列

从0到1搭建可落地的AI Agent与工作流|第12期

你的Agent上线一周,OpenAI账单已经超了预算两倍。但你没法把全部任务都换成便宜模型——有些话一出口,客户就跑了。其实解决思路很简单:让工作流自己判断该用哪个模型。今天我们用n8n搭一个可复现的模型路由系统,给你输入输出契约、测试样例和检查清单,看完就能降本。

实战教程可复现生产级2026-08-07 · 全文约2559字 · 阅读6分钟

本期你将完成

01

多模型路由不是简单降级,而是按任务上下文动态分配模型

02

用结构化权重体系平衡成本和质量,比拍脑袋换模型靠谱

03

模型故障回退必须考虑工具兼容性,否则才出狼窝又入虎口

🗺 BUILD MAP · 本期构建路径

01
多模型路由不是简单降级,而是按任务上下文动态分配模型
02
用结构化权重体系平衡成本和质量,比拍脑袋换模型靠谱
03
模型故障回退必须考虑工具兼容性,否则才出狼窝又入虎口
实战模块 1

三个模型的成本与质量典型权重

gpt-4o成本10分/质量8分,适合高复杂度投诉
gpt-4o-mini成本3分/质量6分,适合简单FAQ
claude-3.5-sonnet成本8分/质量8分,适合中等报告生成
实战模块 2

模型路由决策流程

1. 意图分析HTTP Request调用分类服务,输出意图标签
2. 权重评分Function节点计算成本与质量加权分
3. 模型选择Switch根据最高分选择具体模型
4. 回退切换失败时自动降级到备选模型并告警
STEP_01 →

问题不是账单太贵,是模型选择太僵化

很多工作流上线后,所有任务都走同一个模型节点。但客户问「我的订单到哪了」和「你们的产品有安全问题」需要的处理深度完全不同。一视同仁的结果就是,80%的简单任务耗费了100%的高额Token。

更麻烦的是,你不敢贸然换模型——上次把客服Agent从gpt-4o切成mini,投诉率直接涨了15%。这就是缺少动态路由的典型症状。

本节验证路由的终点不是便宜模型,是让重要的事不降级、让普通的事不超支。
STEP_02 →

模型路由的决策树:一个节点就把费用打下来

参考Hermes Agent的多模型路由设计,我们可以做一个简化版的三级路由。先用HTTP Request调用一个轻量意图分类器(或者直接用LLM判断一次),输出「low」「medium」「high」三个等级。

然后进入核心决策:用Function节点读取等级和预设权重,计算每个候选模型的加权分。比如公式是 (质量权重 * 质量分 - 成本权重 * 成本分) ,你可以根据业务侧重调整这两个权重。

最后Switch节点把请求发给得分最高的模型。规则不是写死的——在n8n里你可以用JSON配置文件存储权重,随时在线调整。

意图分类:抽取用户输入关键词,映射为复杂度等级
权重计算:预设模型的基础分,乘以可配置的权重系数
动态分发:高分中选,且必须满足最小质量阈值
STEP_03 →

在n8n里落地路由:从HTTP Request到Switch节点

第一步,假设你已经有了一个Webhook接收用户消息。我们在它后面接一个HTTP Request节点,请求一个简单的分类API(或者你自己用Function节点写一段判断逻辑)。输出一个JSON,包含字段 「intent」 。

第二步,加一个Function节点,写一小段代码读取意图、成本和权重配置(从环境变量或Static Data节点取),遍历三个候选模型计算总分,输出最高分模型名。

第三步,Switch节点根据模型名路由到三个HTTP Request(或LLM)节点之一。每个节点使用不同的模型参数。记得在每个路由分支后加一个Error Trigger节点,方便捕获调用失败。

注意:不同模型的API结构可能不同,你需要用Set节点统一输入格式,避免下游节点解析出错。

STEP_04 →

成本权重调优:不是数学题,是商业题

你可能会问:质量分和成本分怎么定?没有标准答案。建议你先给团队里最懂业务的人,让他给三个模型在「准确性」和「创造力」上打分(1-10),这是主观权重。

成本分用实际Token价格归一化,比如gpt-4o每1K token价格是mini的3倍,就把成本分调成3。然后再乘上一个业务偏好系数:比如你们对成本敏感,就把成本权重设为0.7,质量权重0.3。

上线后一定要监控:观察每种意图下模型选择的分布,还有客户满意度。如果「medium」任务选了gpt-4o但客户依旧不满意,说明问题不在模型,在流程设计。

本节验证权重是一点点试出来的,不是算出来的。先看数据,再调参数。
STEP_05 →

回退不只是换个模型:检查工具和输出格式

Agent调用了外部工具?那回退模型必须支持同样的工具Schema。比如你的原模型用了function calling,回退模型也得能解析JSON。先在n8n里写一个Validation节点,判断备选模型的输出结构是否匹配。

我们设计一个三层回退:首选模型超时3秒,降级到次选;次选也失败,用静态回复模板返回「系统繁忙」;同时发送一个消息到企业微信或邮件告警。

为了避免雪崩,设置全局并发限制(用n8n的Queue模式),同一时间最多5个请求打给gpt-4o。这些都是第11期部署中用到的配置,直接复用。

STEP_06 →

测试和验收:跑完这3个用例,你就有底

用例1:简单FAQ「退货政策是什么」,预期路由到gpt-4o-mini,回复准确。用例2:负面投诉「你们的产品导致我过敏」,预期路由到gpt-4o,回复专业且道歉。用例3:模拟gpt-4o返回429错误,预期自动降级到claude-3.5-sonnet,且最终回复完整。

在n8n的执行记录里,你可以看到每个节点的输入输出。如果用例1错误地路由到了gpt-4o,去Function节点的日志里看权重计算结果;如果用例3降级后输出格式错误,去Validation节点看报错。

验收标准:1)简单任务走便宜模型的比例 > 90%;2)回退触发后回复正确率 > 95%;3)平均Token成本相比固定模型降低30%以上。

STEP_07 →

生产维护:让路由越用越聪明

上线不是终点。每隔两周拉取一次执行记录,分析不同意图下的模型选择分布和客户满意度。如果发现某类任务一直走贵模型但满意度没提高,就把它的意图权重往便宜模型调。

记得版本化管理:每次修改权重或路由规则,保存一份新的n8n工作流版本,并在执行备注里记录变更。回滚时一键切回旧版。

权限上,确保API key按模型分开存储,避免一个key泄露全部失守。成本监控设置每日上限,超预算自动暂停非关键工作流。

定期复盘路由数据,持续优化权重
版本化管理规则变更,随时可回滚
为每个模型使用独立凭据,设置成本熔断
本期收束

今天就可以做的一件事:打开上期部署的工作流,在LLM节点前加一个HTTP Request和Switch节点,划出三种任务类型分发到不同模型。明天开始观察账单变化,你会发现控制成本并不需要牺牲质量。

ABOUT PARSENOVA

看懂了,更要跑起来

ParseNova帮助中小企业和海外团队优化AI工作流,把方案做成可运行、可评测、可持续优化的业务系统。我们的脱敏成功实践覆盖知识与客服流程整合、海外团队多语言运营和线索分流,以及通过模型路由、提示词压缩、缓存复用、批处理与调用可观测性减少无效Token消耗和AI支出。了解更多请访问www.parsenova.com。

企业级AI应用开发Agent与自动化工作流企业AI化改造咨询数据与RAG知识库

脱敏成功实践

中小企业 · 知识与客服

整合分散文档、常见问题与人工复核,减少重复检索和跨系统录入。

海外团队 · 多语言运营

串联内容本地化、线索分流和跟进提醒,改善跨时区协作与响应。

成本治理 · Token 与 AI 支出

用模型路由、提示词压缩、缓存复用、批处理和可观测性减少无效调用。

你的业务里,哪条流程最该先用 AI?

评论区聊聊你的场景,或私信「行业 + 业务环节」,我们免费帮你梳理一份改造优先级清单。

官网:www.parsenova.com

长按识别,直接和AI专家聊

备注「行业 + 场景」,第一次沟通就切正题

继续阅读

前一天发布的文章

字节拒绝蒸馏、OpenAI放开、DeepSeek涨价:今天的AI风向全变了

引入AI编程助手,别只盯代码补全——一个完整的30天落地路线图

从0到1搭建可落地的AI Agent与工作流(12):第12期|Agent一部署就挂?用n8n搭一条生产级流水线,3个测试跑完就