半夜告警再也不用爬起来一个个翻 dashboard 了。Superlog 把 OpenTelemetry 数据入口和 AI Agent 自动分析揉在一起,开源不到 3 周拿下 931 颗星。这篇文章带你 5 分钟部署、接入测试数据,看清楚 Agent 到底怎么“看病开药”,顺便掰清楚它现在能干什么、还干不了什么。

运维人员深夜看手机告警
凌晨 2:47,手机又响了。
你从床上弹起来,眯着眼看告警——「P99 延迟飙到 3 秒」。打开 Grafana 翻 dashboard,切到 Sentry 查错误堆栈,再跳回 Kibana grep 日志。30 分钟后,发现是隔壁团队新上的 Redis 连接池没限流。
回去躺下,3:41,手机又响了。
干过运维的,上面这段你应该很熟。而今天我要说的这个工具,目标就一句话:让你不用再半夜爬起来看监控。
它叫 Superlog。YC P26 批次投的,6 月 2 号开源,不到 3 周在 GitHub 上拿了 931 颗星。核心卖点就一个:用 AI Agent 自动发现故障,自己“看病开药”的运维可观测平台。
它到底是什么?

Superlog 架构
一句话:Superlog = OpenTelemetry 数据入口 + AI Agent 自动分析 + 故障自愈执行。
具体能做三件事:
- 接入你的遥测数据
——通过 OTLP 协议接收 trace、log、metric(跟 Jaeger、Prometheus 一样) - AI 自动把噪声分组
——几百条告警收敛成一两个 Incident,半夜不会再被刷屏 - Agent 自动排查
——给出根因分析和修复建议,高级版还能自动执行修复
底层的话,PostgreSQL 存业务数据,ClickHouse 存海量遥测,TypeScript 全栈。
5 分钟部署,先跑起来再说

部署步骤
部署门槛很低,机器上有 Node.js 20+、pnpm 9+、Docker 就行。
# 1. 克隆仓库git clone https://github.com/superloglabs/superlog.gitcd superlog# 2. 安装依赖pnpm install# 3. 启动基础设施(Postgres + ClickHouse)docker compose up -d# 4. 初始化数据库pnpm --filter @superlog/db db:migrate# 5. 启动开发环境pnpm dev几条命令下来,访问 http://localhost:5173 就能看到面板。API 跑在 4100 端口,OTLP 数据入口在 4101 端口。
要是运维老手,docker compose 和数据库迁移你天天都在用。唯一可能没碰过的就是 pnpm——但它跟 npm 差不多,npm install -g pnpm 装上就能用了。
把你的应用数据喂给它

数据接入
Superlog 用的是 OpenTelemetry 协议。如果你已经在用 Jaeger、Grafana Tempo 或者 Datadog,接入方式完全一样——把 OTLP exporter 的 endpoint 指过来就行。
# 以 OpenTelemetry Collector 为例# otel-collector-config.yamlreceivers: otlp: protocols: grpc: http:exporters: otlphttp: endpoint: 「http://localhost:4101」 # Superlog 的 OTLP 入口 tls: insecure: trueservice: pipelines: traces: receivers: [otlp] exporters: [otlphttp] metrics: receivers: [otlp] exporters: [otlphttp] logs: receivers: [otlp] exporters: [otlphttp]要是你的应用还没接 OpenTelemetry,下面这个 Node.js 例子 5 行代码就能搞定。
// Node.js 应用 — 5 行代码接入const { NodeSDK } = require('@opentelemetry/sdk-node');const { OTLPTraceExporter } = require('@opentelemetry/exporter-trace-otlp-http');const sdk = new NodeSDK({ traceExporter: new OTLPTraceExporter({ url: 'http://localhost:4101/v1/traces' }),});sdk.start();数据进去之后,Superlog 会自动做三件事:指纹化(把同类 trace 归组)、聚类(把相关信号合并成一个 incident)、评分(按严重程度排优先级)。
AI Agent 到底怎么“查故障”?

Agent 故障排查流程
这是 Superlog 跟 Prometheus/Grafana/Datadog 区别最大的地方。
传统流程:告警响了 → 你打开 dashboard → 你翻 trace → 你查日志 → 你定位根因 → 你修。
Superlog 的 Agent 流程:告警自动收敛成 incident → Agent 读取上下文 → Agent 从 trace/log/metric 里提取证据链 → 生成根因分析报告 → (可选)执行修复动作。
代码层面,Agent 的编排逻辑在 apps/worker 目录下:
# 仓库结构一览apps/web — Vite + React 前端面板apps/api — HTTP API 服务apps/proxy — OTLP 数据入口代理apps/worker — 后台任务 + Agent 编排(核心)packages/db — Drizzle ORM schema + 数据库迁移packages/fingerprint — 遥测数据指纹化社区版默认带了个“社区 Agent”——会自动生成 incident 摘要报告。云托管版 Agent 能力更强,还能自动执行修复。
你可能会想:“这不就是 AIOps 吗?”
对,但不完全是。传统 AIOps(比如 Moogsoft、BigPanda)靠的是规则引擎和统计模型,告警降噪效果依赖大量配置调参。Superlog 的思路更激进——让 LLM 直接读你的 trace 和日志,像高级运维工程师一样推理故障链条。
和现有工具的对比,拿数据说话

Superlog vs Datadog vs Prometheus
| 自建,开源(Apache 2.0) | |||
| 社区版免费,云版有免费层 |
说人话就是:Superlog 开源免费,给了你 Datadog 付费版才有的 AI 分析能力,还额外多了个“自愈”的想象空间。
现实局限:你现在就该知道的事

GitHub 931 星
第一,931 星不等于生产就绪。 Superlog 6 月 2 号才开源,还在快速迭代。如果你管着几百台服务器,现在就拿它替换 Prometheus,不太理智。
第二,Agent 的“自愈”还早。 社区版 Agent 只出报告不修东西。云版的自动修复目前也只是有限场景(比如重启服务、调整连接池参数),离“AI 自己排查并修复任意故障”还很远。
第三,不是所有团队都需要。 你的服务不到 10 个的话,Prometheus + Grafana Alerting 就足够用了。Superlog 的价值在于信号多到人眼看不过来的时候,让 Agent 帮你做第一轮筛选和诊断。
不过话说回来,Docker 2013 年刚开源时也没人敢用到生产环境。3 年后的 Kubernetes 改变了整个行业。
如果你现在花一个下午把它跑起来,接上测试环境的数据,半年后团队讨论“要不要买 Datadog”时,你手里已经有一个免费答案了。
结尾

AI 搭档
别把 AI 当成替代你的威胁。把它当成你工具箱里第一个能熬夜值班的搭档——它看日志不眨眼,你不用凌晨三点被叫醒。
你觉得 AI Agent 能在 3 年内替代值夜班的运维吗?还是永远只能当“辅助”?留言区聊聊你的判断。
今天下班前,用 docker compose 把这套东西拉起来。把测试环境的 OTLP 数据指过去,看看 Agent 能从你的日志里读出什么。
觉得有用?点个关注,持续获取 AI+运维的实操干货。
夜雨聆风