从0到1搭建可落地的AI Agent与工作流|第12期
你的Agent上线一周,OpenAI账单已经超了预算两倍。但你没法把全部任务都换成便宜模型——有些话一出口,客户就跑了。其实解决思路很简单:让工作流自己判断该用哪个模型。今天我们用n8n搭一个可复现的模型路由系统,给你输入输出契约、测试样例和检查清单,看完就能降本。

本期你将完成
多模型路由不是简单降级,而是按任务上下文动态分配模型
用结构化权重体系平衡成本和质量,比拍脑袋换模型靠谱
模型故障回退必须考虑工具兼容性,否则才出狼窝又入虎口
🗺 BUILD MAP · 本期构建路径
三个模型的成本与质量典型权重
模型路由决策流程
问题不是账单太贵,是模型选择太僵化
很多工作流上线后,所有任务都走同一个模型节点。但客户问「我的订单到哪了」和「你们的产品有安全问题」需要的处理深度完全不同。一视同仁的结果就是,80%的简单任务耗费了100%的高额Token。
更麻烦的是,你不敢贸然换模型——上次把客服Agent从gpt-4o切成mini,投诉率直接涨了15%。这就是缺少动态路由的典型症状。
模型路由的决策树:一个节点就把费用打下来
参考Hermes Agent的多模型路由设计,我们可以做一个简化版的三级路由。先用HTTP Request调用一个轻量意图分类器(或者直接用LLM判断一次),输出「low」「medium」「high」三个等级。
然后进入核心决策:用Function节点读取等级和预设权重,计算每个候选模型的加权分。比如公式是 (质量权重 * 质量分 - 成本权重 * 成本分) ,你可以根据业务侧重调整这两个权重。
最后Switch节点把请求发给得分最高的模型。规则不是写死的——在n8n里你可以用JSON配置文件存储权重,随时在线调整。
在n8n里落地路由:从HTTP Request到Switch节点
第一步,假设你已经有了一个Webhook接收用户消息。我们在它后面接一个HTTP Request节点,请求一个简单的分类API(或者你自己用Function节点写一段判断逻辑)。输出一个JSON,包含字段 「intent」 。
第二步,加一个Function节点,写一小段代码读取意图、成本和权重配置(从环境变量或Static Data节点取),遍历三个候选模型计算总分,输出最高分模型名。
第三步,Switch节点根据模型名路由到三个HTTP Request(或LLM)节点之一。每个节点使用不同的模型参数。记得在每个路由分支后加一个Error Trigger节点,方便捕获调用失败。
注意:不同模型的API结构可能不同,你需要用Set节点统一输入格式,避免下游节点解析出错。
成本权重调优:不是数学题,是商业题
你可能会问:质量分和成本分怎么定?没有标准答案。建议你先给团队里最懂业务的人,让他给三个模型在「准确性」和「创造力」上打分(1-10),这是主观权重。
成本分用实际Token价格归一化,比如gpt-4o每1K token价格是mini的3倍,就把成本分调成3。然后再乘上一个业务偏好系数:比如你们对成本敏感,就把成本权重设为0.7,质量权重0.3。
上线后一定要监控:观察每种意图下模型选择的分布,还有客户满意度。如果「medium」任务选了gpt-4o但客户依旧不满意,说明问题不在模型,在流程设计。
回退不只是换个模型:检查工具和输出格式
Agent调用了外部工具?那回退模型必须支持同样的工具Schema。比如你的原模型用了function calling,回退模型也得能解析JSON。先在n8n里写一个Validation节点,判断备选模型的输出结构是否匹配。
我们设计一个三层回退:首选模型超时3秒,降级到次选;次选也失败,用静态回复模板返回「系统繁忙」;同时发送一个消息到企业微信或邮件告警。
为了避免雪崩,设置全局并发限制(用n8n的Queue模式),同一时间最多5个请求打给gpt-4o。这些都是第11期部署中用到的配置,直接复用。
测试和验收:跑完这3个用例,你就有底
用例1:简单FAQ「退货政策是什么」,预期路由到gpt-4o-mini,回复准确。用例2:负面投诉「你们的产品导致我过敏」,预期路由到gpt-4o,回复专业且道歉。用例3:模拟gpt-4o返回429错误,预期自动降级到claude-3.5-sonnet,且最终回复完整。
在n8n的执行记录里,你可以看到每个节点的输入输出。如果用例1错误地路由到了gpt-4o,去Function节点的日志里看权重计算结果;如果用例3降级后输出格式错误,去Validation节点看报错。
验收标准:1)简单任务走便宜模型的比例 > 90%;2)回退触发后回复正确率 > 95%;3)平均Token成本相比固定模型降低30%以上。
生产维护:让路由越用越聪明
上线不是终点。每隔两周拉取一次执行记录,分析不同意图下的模型选择分布和客户满意度。如果发现某类任务一直走贵模型但满意度没提高,就把它的意图权重往便宜模型调。
记得版本化管理:每次修改权重或路由规则,保存一份新的n8n工作流版本,并在执行备注里记录变更。回滚时一键切回旧版。
权限上,确保API key按模型分开存储,避免一个key泄露全部失守。成本监控设置每日上限,超预算自动暂停非关键工作流。
今天就可以做的一件事:打开上期部署的工作流,在LLM节点前加一个HTTP Request和Switch节点,划出三种任务类型分发到不同模型。明天开始观察账单变化,你会发现控制成本并不需要牺牲质量。
ABOUT PARSENOVA
看懂了,更要跑起来
ParseNova帮助中小企业和海外团队优化AI工作流,把方案做成可运行、可评测、可持续优化的业务系统。我们的脱敏成功实践覆盖知识与客服流程整合、海外团队多语言运营和线索分流,以及通过模型路由、提示词压缩、缓存复用、批处理与调用可观测性减少无效Token消耗和AI支出。了解更多请访问www.parsenova.com。
脱敏成功实践
整合分散文档、常见问题与人工复核,减少重复检索和跨系统录入。
串联内容本地化、线索分流和跟进提醒,改善跨时区协作与响应。
用模型路由、提示词压缩、缓存复用、批处理和可观测性减少无效调用。
你的业务里,哪条流程最该先用 AI?
评论区聊聊你的场景,或私信「行业 + 业务环节」,我们免费帮你梳理一份改造优先级清单。
官网:www.parsenova.com

长按识别,直接和AI专家聊
备注「行业 + 场景」,第一次沟通就切正题
继续阅读
前一天发布的文章
字节拒绝蒸馏、OpenAI放开、DeepSeek涨价:今天的AI风向全变了
引入AI编程助手,别只盯代码补全——一个完整的30天落地路线图
从0到1搭建可落地的AI Agent与工作流(12):第12期|Agent一部署就挂?用n8n搭一条生产级流水线,3个测试跑完就
夜雨聆风