乐于分享
好东西不私藏

AI时代SRE怎么变?从双重AI系统到Agent护栏全套事件架构

AI时代SRE怎么变?从双重AI系统到Agent护栏全套事件架构

本文整理自QCon北京2026 田云龙分享《AI时代SRE变革实践》,通过AI音视频总结工具Ai好记(aihaoji.com)进行转录整理,以下为视频转文字整理后的会议笔记内容。

SRE(站点可靠性工程)这个词在AI时代有了全新的含义。以前保障的是服务、配置、数据库,现在多了模型链路、推理链路、Agent决策链。

混乱的维度翻了几倍,传统的扩容、切流、降级这三板斧根本不够用了。

为什么AI业务的稳定性跟传统不一样?

田云龙上来先给了一个判断:「我们现在已经不是AI业务了,而是实验业务了」。小红书AI搜索问答体系(豆报、问一问、点点等)已在去年上线并持续推广中,成为核心生产系统。

AI业务跟传统业务最大的区别在于都涉及多模型串联。文本模型、多模态模型、排序模型、推理模型像链条一样串在一起,任何一个模型异常都会影响整个链条。一个模型效果波动,可能引发用户吐槽,影响广告收入,同时GPU成本也会被连带波动。

层级
传统保障对象
AI时代扩展对象
基础层
服务、配置、数据库
服务(不变)
中间层
模型链路、推理链路
上层
数据链路、特征链路
顶层
Agent决策链

传统SRE的约束条件是发布、容灾、机房、容量。AI时代的约束变成了Prompt、Tool、Workflow、Memory、权限和模型行为规范。止损方式从简单的扩容、切流、降级演进为策略切换、人工接管、受控执行、基于token的降级。

田云龙的原话是:「我们需要保障整个系统是可判断的、可止损的,并且可被人接管,而不是完全自由化的」。

双重AI系统:既是保障对象,也是保障工具

一个特别有价值的概念是「双重AI系统」。AI时代的SRE面对两套系统:一套是被保障的AI业务系统,另一套是用AI去保障业务生产的工具系统。

两者是相互关联的。被保障的AI系统会用到Agent,Agent在不确定情况下执行错误判断,反过来会放大线上影响。这对SRE的全链条控制能力提出了更高要求。

AI-in-SRE Loop:事前事中事后全流程闭环

田云龙团队将AI引入到SRE的完整工作流程中,形成一条全闭环链条。

事前AI化:巡检、容量评估、风险治理从依赖「人加平台做决策」转为AI自动判断。AI可以无休止工作,更快发现潜在问题。

事中AI化:AI分析告警信息辅助决策,处置阶段采用人机协同。目前还没做到全自动,但分析环节已经完全AI化。

事后AI化:每一次故障的处理经验自动沉淀为知识库,成为下一次迭代的基础。

核心公式:「AI-in-SRE Loop让系统更早被发现,更快形成决策判断,止损更高效,整个过程形成闭环沉淀为下一次迭代的基础」。

Harness工程:给Agent加护栏

Agent不能自由发挥——这是田云龙团队的核心立场。他举了一个很形象的例子:「如果让AI自由发挥,可能对于我们运维来说是一个天灾」。

Harness(约束框架)包含三层控制:

  1. 约束输入
    Agent能接收什么信息,不能接收什么信息,有限定
  2. 约束推理
    推理过程有固定的链式结构,不是自由发散
  3. 受控执行
    Agent做出动作后,必须有反馈校准环节

执行路径上规划了三级递进:从只读建议(人审查后操作)→辅助判断(只需人做action确认)→有限自动化(特定条件下自主执行)。核心原则是「让创造性留在判断层,确定性留在执行层」。

落地案例:怎么把方案变成现实

具体落地上,田云龙展示了几个关键技术方向:

Agent决策链的可观测性。传统链路追踪只能跟踪服务之间的调用,现在要跟踪模型调用和Agent的决策路径。每个决策步骤都要记录上下文,方便事后回溯Agent为什么做这个选择。

基于token的降级策略。传统降级是切流或关闭功能,AI时代的降级可以更精细——减少模型输出的token数,降低推理质量以换取响应速度。这对成本控制也有效。

人机协同的事故处置。告警触发后,AI先做初步分析,给出故障范围、根因推断和推荐操作,人工确认后执行。执行完再交给AI做效果验证。

这套框架适合什么场景

  • 已经在用AI能力支撑核心业务的技术团队
    需要重新定义SRE的保障边界
  • 正在建设Agent平台的团队
    需要参考Harness约束框架的设计思路
  • 对AI运维感兴趣的技术负责人
    想了解同行在AI稳定性方面的前沿实践

常见问题

Q:AI建模SRE需要自研Agent框架吗?A:不一定需要从头自研。可以先利用现有框架快速落地MVP验证,再逐步加入企业私有接口的集成。

Q:Harness约束框架跟传统限流有什么区别?A:传统限流关注的是请求层面,Harness关注的是Agent的决策层面,两者是不同维度的防护。

Q:双重AI系统的概念怎么落地?A:建议从梳理你目前的AI业务系统和运维系统的关联路径开始,找出Agent决策可能影响业务的环节,优先加约束。

Q:token降级在实际场景中怎么用?A:可以理解为一种精细化的流量控制——不关服务,只减少模型输出的计算量。适合对响应质量不敏感的实时告警场景。


以上内容由 Ai好记 转录整理。

Ai好记(aihaoji.com)是一款音视频转图文笔记的AI音视频转录总结工具,支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件,转录后自动视频转文字生成精华速览、思维导图和结构化笔记等内容形式,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。