ARTICLE · 1151639
插件体系:一个AI请求如何被插件"接力"加工
插件体系:一个AI请求如何被插件"接力"加工
插件体系:一个AI请求如何被插件"接力"加工
网关里的插件不是随便挂上去的。一个请求进来,会依次经过改写、鉴权、转发和响应处理几个阶段。
每个插件都认领自己关心的阶段。同一个阶段里,数字越大越先跑。比如套模板得先跑,接着填历史,最后限流。顺序一乱,整个链条就跟着错。
优先级是全局一张表。新加插件随手塞个空位,可能正好插在中间。结果它抢先加工了提示词,模型输出直接变差,排查半天才发现是数字定错了。
插件还得登记白名单才会执行。忘了登记也不报错,请求照样转发,但核心功能一直没生效。等发现响应不对劲,才回头查白名单。
配置校验也不能卡太死。类型必填要严,但数值范围得留余地。AI 场景下 token 阈值这些参数,本来就得频繁试验。另外,重型插件挂多了累积延迟很可观,按需挂载就行。
原文插件体系:一个AI请求如何被插件"接力"加工?
山东,1分钟前,