夜雨聆风学习资料网

ARTICLE · 1063194

Flashduty AI SRE|7x24 小时在线的数字员工

Flashduty AI SRE|7x24 小时在线的数字员工

Flashduty AI 是我们推出的一个 7x24 小时在线、可协作的通用 SRE Agent。

借助 Flashduty AI,任何企业都可以在分钟级为工程师团队配备一个全托管的 AI 数字员工,持续参与故障响应、代码缺陷修复、自动化运维和稳定性优化。
AI agent 在入职企业之前,大脑聪明程度已经超越了所有候选人。但这些 “AI 数字员工”入职后普遍水土不服,有下面几个直接原因:
  • 缺乏后天的持续学习进步能力,不长进,容易丢三落四
  • 协作性较差,融入不了企业内部已有的圈子和流程
  • 缺乏信任,不敢放心的让 ta 访问敏感数据、自主行动
AI agent 的脑子是 LLM 给的,动手的能力、持续学习的能力,则是 Harness 给的。
Flashduty AI 在云端构建了统一的 Harness 运行时,关键概念如下:
Flashduty AI Harness

Session

一次完整调查的状态容器:消息历史、工具调用、产物和恢复点都在里面。

Turn

Session 内的一次执行循环:由用户消息、IM、API 或规则触发;模型思考、调用工具、流式返回事件。

Entry

Session 的入口:Web、IM、API、Automation。入口不同,底层 Session 模型一致。

Environment

工具实际执行的位置:托管 Cloud Sandbox,或部署在客户网络内的 BYOC Runner。

Tool

Turn 里可调用的具体能力:文件 / shell、MCP、Skill、GitHub、询问人、派发子 Agent。

Flashduty AI 定义了完整的知识体系

Knowledge

团队长期上下文:代码仓库、服务目录、拓扑、Runbook。这些内容决定了行动是基于系统事实,还是只靠模型推断。

Skill

可复用的操作过程:把一次有效的排查方法封装成可按名称调用的能力。

Memory

跨 Session 自动带入的信息:重复模式、团队偏好、历史处理经验。

Automation Rule

按计划或事件触发的长期指令,不需要每次都有人手动发起。

Team scope / Account scope

定义知识、Skill、规则的归属和可见性。账号是 Agent 的安全边界,知识绝不会跨企业账号,在企业内部是可以分团队归属和可见的。

Flashduty AI 构建了自动化的知识更新机制

/init

第一次以访谈方式初始化知识库,ta 会扫描你的 Flashduty incident 列表和 on-call 历史、向你提问、把你口述的工作流程、服务拓扑、排查手册、集群访问方式等沉淀成知识文件,并在需要时帮你接入外部工具(MCP)。

/insight

定期运行,找出反复粘贴的信息和缺失的知识,再写回。ta 会自动导出你的历史会话、统计量化指标、逐段分析会话内容,最后汇总渲染成一份报告,整个分析过程对你透明。/insight 会明确的识别 5 类摩擦,包括:重复上下文、缺少运行手册、用错数据源、臆测实体、知识过期,每一类都对应一个明确、可调整的「旋钮」,在取得你确认之后,进行相应调节。

Teach back

解决新问题后,可以直接要求 ta “补一条 Runbook”。通过教学,让 ta 不断地学习新知识、记录知识。

Live fixes

在会话中修 knowledge,下一次模型步骤自动生效;同一对话里想让旧内容也更新,就要求它重新读取文件即可。
Flashduty AI 的持续学习能力,使得 ta 能够越久越好用。
Flashduty AI knowledge pack

数字员工怎么融入企业

Flashduty AI 通过以下几种方式与企业的现实环境进行对接,对接方式包括 App、 Skill、MCP、Agent / Subagent 等。

App

App 包含 GitHub、GitLab 和 Kubernetes App。
GitHub 与 GitLab 用于授权代码仓库:AI SRE 可以在会话中读代码、调查变更 / 提交 / PR,并按需修改缺陷、创建 PR / MR 或 issue。
Kubernetes App 则把指定 Kubernetes 集群接入 AI SRE,并通过配置的 namespace 与权限边界限制 Agent 的操作范围。
Flashduty AI K8s app

A2A & Subagent

把 Flashduty AI 接入外部 Agent 生态则要用  A2A(Agent-to-Agent)——一套让不同 Agent 相互调用的标准协议。A2A 把 Flashduty AI 接入外部 Agent,有两个方向。
  • 出站(Outbound)

在列表中注册的远端 A2A Agent。Flashduty AI 通过标准 A2A 协议把任务委派给它们——例如一个专精指标分析、或对接某个内部系统的外部 Agent。
  • 入站(Inbound)

Flashduty AI 自身也是一个 A2A Agent,对外暴露一张 Agent Card。外部 A2A 客户端把该 Card 地址填入即可反向调用 Flashduty AI,实现双向事件流联动。

Subagent 是平台内置的任务执行器。Flashduty AI 在工作过程中,可以把一个自包含的子任务派发(dispatch)给一个 Subagent 去独立完成——派发统一通过单一的长时运行工具 agent_dispatch 进行,而不是为每个 Subagent 生成一个独立工具。

SKILL

Skill 是可复用的能力包:一段 SKILL.md 说明加上允许使用的工具,供 Flashduty AI 在对话中按需调用。从Flashduty 市场安装、上传自定义 Skill,或在对话中由 skill-creator 新建或从网上找现成的来装。

MCP

MCP(Model Context Protocol)让 Flashduty AI 接入外部工具与数据源。每台 MCP 服务器是一个对外暴露一组工具(函数)的标准化端点,例如查询 GitHub Issue、向 Slack 发消息、读取 Kubernetes 资源、检索可观测平台指标等。
在 Flashduty AI 中,MCP 的作用是把 Agent 的能力从「内置工具」扩展到「任意外部系统」。
你在控制台添加一台 MCP 服务器(声明它的端点、传输方式与认证)。
会话开始时,已启用且在当前作用域可见的服务器即对 Agent 可见、可调用。
Agent 在需要时即可发现该服务器提供的工具并直接调用。
Flashduty AI 支持众多连接器

运行环境

还有个关键问题,全托管的 AI agent 如何安全的进入企业的内网,也就是说 Flashduty AI 的运行环境在哪里?
运行环境(Environment)是 Flashduty AI 实际执行动作的地方。Agent 的每一次工具调用,包括执行命令、读写文件、运行 Skill、连接 MCP 服务,都会落在一个运行环境里。
Flashduty AI 在Cloud Sandbox 之外提供了 BYOC Runner 的解决方案。
Cloud Sandbox vs. BYOC Runner
BYOC(Bring Your Own Compute)Runner 是部署在你自己机器上的 flashduty-runner 进程。它与 Flashduty AI 保持常驻 WebSocket 连接,收到任务后在本机执行命令、读写文件、运行 Skill,并按需连接本机可达的 MCP 服务。
BYOC Runner 的价值来自执行位置:
1、触达真实环境
Runner 跑在你的机器上,因此能访问这台机器本身可达的 VPC、内网、专线、Kubernetes 集群、云厂商 CLI、数据库或跳板机。
2、数据驻留
命令输出、日志、临时文件和工具执行结果优先留在你的网络边界内,Agent 能读取和分析这些信息,但执行面仍由你机器的系统账号、文件权限和网络策略约束。
3、本地权限可控
你可以灵活决定 Runner 运行在哪个 OS 用户下、能访问哪些目录、拥有哪些 CLI 凭据,以及进一步配置收敛可执行命令的范围。

再说说协作

Flashduty AI 支持从 Web 控制台、主流 IM 两个入口向agent 派活,也可以通过 API 或者定义 Automation 任务来灵活派活。
Web 控制台:支持完整工具调用轨迹和产物预览,也可以从故障详情直接发起。
IM:在IM上派活、讨论,和同事的沟通本来就应该这个样子。
API:通过 Agent Card 做程序化调用,适合系统到系统集成。
Automation:按计划或外部事件触发,在后台运行完整 Session。
用你熟悉的沟通方式给 Flashduty AI 派活
Flashduty AI 是 IM 原生的——在 Slack、飞书、钉钉、企业微信的群聊或私聊里 @ 它即可派活和沟通,它在线程内作答。IM 交互覆盖四个主流平台,每个平台都支持入站的 @ 提及(webhook)、历史消息读取与出站回复:
Flashduty AI 的 IM 原生能力

最后是信任

平台底座要可靠、安全、开放,还要有人能兜底。如果大家还记得年初各种Claw 满天飞,但搭建维护复杂、可靠性安全性拉胯的场景,应该有直观的体会。
三个参考场景

1、自动修复线上代码缺陷

当生产环境发生异常报错之后,会自动被Flashduty AI 接管并分析代码,有必要的情况下自动形成修复 PR。
从真实用户报错到修复 PR:RUM × AI SRE 的 8 分钟

2、变更守护

刚刚完成了发布变更?你可以把检查和实时监控的工作派给 Flashduty。
同事已经把后背交给 agent 了

3、告警自动on-call

半夜手机响了,不用爬起来开电脑,试试让 Flashduty AI 先响应!
AI SRE 场景:作战室自动诊断
让 AI agent 真正像员工一样独立承担工作职责,是老板希望看到的;让 AI agent 真正像同事一样分担工作任务,是打工人的梦想。阅读原文了解更多 Flashduty AI 场景案例。

相关学习资料