乐于分享
好东西不私藏

你还在手动查日志?3周931星的开源AI工具,凌晨告警不用你亲自爬起来查了

你还在手动查日志?3周931星的开源AI工具,凌晨告警不用你亲自爬起来查了

半夜告警再也不用爬起来一个个翻 dashboard 了。Superlog 把 OpenTelemetry 数据入口和 AI Agent 自动分析揉在一起,开源不到 3 周拿下 931 颗星。这篇文章带你 5 分钟部署、接入测试数据,看清楚 Agent 到底怎么“看病开药”,顺便掰清楚它现在能干什么、还干不了什么。

运维人员深夜看手机告警

凌晨 2:47,手机又响了。

你从床上弹起来,眯着眼看告警——「P99 延迟飙到 3 秒」。打开 Grafana 翻 dashboard,切到 Sentry 查错误堆栈,再跳回 Kibana grep 日志。30 分钟后,发现是隔壁团队新上的 Redis 连接池没限流。

回去躺下,3:41,手机又响了。

干过运维的,上面这段你应该很熟。而今天我要说的这个工具,目标就一句话:让你不用再半夜爬起来看监控。

它叫 Superlog。YC P26 批次投的,6 月 2 号开源,不到 3 周在 GitHub 上拿了 931 颗星。核心卖点就一个:用 AI Agent 自动发现故障,自己“看病开药”的运维可观测平台。

它到底是什么?

Superlog 架构

一句话:Superlog = OpenTelemetry 数据入口 + AI Agent 自动分析 + 故障自愈执行。

具体能做三件事:

  1. 接入你的遥测数据
    ——通过 OTLP 协议接收 trace、log、metric(跟 Jaeger、Prometheus 一样)
  2. AI 自动把噪声分组
    ——几百条告警收敛成一两个 Incident,半夜不会再被刷屏
  3. Agent 自动排查
    ——给出根因分析和修复建议,高级版还能自动执行修复

底层的话,PostgreSQL 存业务数据,ClickHouse 存海量遥测,TypeScript 全栈。

5 分钟部署,先跑起来再说

部署步骤

部署门槛很低,机器上有 Node.js 20+、pnpm 9+、Docker 就行。

# 1. 克隆仓库git clone https://github.com/superloglabs/superlog.gitcd superlog# 2. 安装依赖pnpm install# 3. 启动基础设施(Postgres + ClickHouse)docker compose up -d# 4. 初始化数据库pnpm --filter @superlog/db db:migrate# 5. 启动开发环境pnpm dev

几条命令下来,访问 http://localhost:5173 就能看到面板。API 跑在 4100 端口,OTLP 数据入口在 4101 端口。

要是运维老手,docker compose 和数据库迁移你天天都在用。唯一可能没碰过的就是 pnpm——但它跟 npm 差不多,npm install -g pnpm 装上就能用了。

把你的应用数据喂给它

数据接入

Superlog 用的是 OpenTelemetry 协议。如果你已经在用 Jaeger、Grafana Tempo 或者 Datadog,接入方式完全一样——把 OTLP exporter 的 endpoint 指过来就行。

# 以 OpenTelemetry Collector 为例# otel-collector-config.yamlreceivers:  otlp:    protocols:      grpc:      http:exporters:  otlphttp:    endpoint: 「http://localhost:4101」  # Superlog 的 OTLP 入口    tls:      insecure: trueservice:  pipelines:    traces:      receivers: [otlp]      exporters: [otlphttp]    metrics:      receivers: [otlp]      exporters: [otlphttp]    logs:      receivers: [otlp]      exporters: [otlphttp]

要是你的应用还没接 OpenTelemetry,下面这个 Node.js 例子 5 行代码就能搞定。

// Node.js 应用 — 5 行代码接入const { NodeSDK } = require('@opentelemetry/sdk-node');const { OTLPTraceExporter } = require('@opentelemetry/exporter-trace-otlp-http');const sdk = new NodeSDK({  traceExporter: new OTLPTraceExporter({    url: 'http://localhost:4101/v1/traces'  }),});sdk.start();

数据进去之后,Superlog 会自动做三件事:指纹化(把同类 trace 归组)、聚类(把相关信号合并成一个 incident)、评分(按严重程度排优先级)。

AI Agent 到底怎么“查故障”?

Agent 故障排查流程

这是 Superlog 跟 Prometheus/Grafana/Datadog 区别最大的地方。

传统流程:告警响了 → 你打开 dashboard → 你翻 trace → 你查日志 → 你定位根因 → 你修。

Superlog 的 Agent 流程:告警自动收敛成 incident → Agent 读取上下文 → Agent 从 trace/log/metric 里提取证据链 → 生成根因分析报告 → (可选)执行修复动作

代码层面,Agent 的编排逻辑在 apps/worker 目录下:

# 仓库结构一览apps/web      — Vite + React 前端面板apps/api      — HTTP API 服务apps/proxy    — OTLP 数据入口代理apps/worker   — 后台任务 + Agent 编排(核心)packages/db   — Drizzle ORM schema + 数据库迁移packages/fingerprint — 遥测数据指纹化

社区版默认带了个“社区 Agent”——会自动生成 incident 摘要报告。云托管版 Agent 能力更强,还能自动执行修复。

你可能会想:“这不就是 AIOps 吗?”

对,但不完全是。传统 AIOps(比如 Moogsoft、BigPanda)靠的是规则引擎和统计模型,告警降噪效果依赖大量配置调参。Superlog 的思路更激进——让 LLM 直接读你的 trace 和日志,像高级运维工程师一样推理故障链条。

和现有工具的对比,拿数据说话

Superlog vs Datadog vs Prometheus

维度
Prometheus+Grafana
Datadog
Superlog
部署方式
自建,开源
SaaS,付费
自建,开源(Apache 2.0)
AI 分析
❌ 无
✅ 付费版 Watchdog
✅ Agent 自动分析,社区版就有
自愈能力
❌ 无
❌ 无
✅ Agent 可执行修复(云版)
OTLP 兼容
价格
免费
$15/host/月起
社区版免费,云版有免费层

说人话就是:Superlog 开源免费,给了你 Datadog 付费版才有的 AI 分析能力,还额外多了个“自愈”的想象空间。

现实局限:你现在就该知道的事

GitHub 931 星

第一,931 星不等于生产就绪。 Superlog 6 月 2 号才开源,还在快速迭代。如果你管着几百台服务器,现在就拿它替换 Prometheus,不太理智。

第二,Agent 的“自愈”还早。 社区版 Agent 只出报告不修东西。云版的自动修复目前也只是有限场景(比如重启服务、调整连接池参数),离“AI 自己排查并修复任意故障”还很远。

第三,不是所有团队都需要。 你的服务不到 10 个的话,Prometheus + Grafana Alerting 就足够用了。Superlog 的价值在于信号多到人眼看不过来的时候,让 Agent 帮你做第一轮筛选和诊断。

不过话说回来,Docker 2013 年刚开源时也没人敢用到生产环境。3 年后的 Kubernetes 改变了整个行业。

如果你现在花一个下午把它跑起来,接上测试环境的数据,半年后团队讨论“要不要买 Datadog”时,你手里已经有一个免费答案了。

结尾

AI 搭档

别把 AI 当成替代你的威胁。把它当成你工具箱里第一个能熬夜值班的搭档——它看日志不眨眼,你不用凌晨三点被叫醒。

你觉得 AI Agent 能在 3 年内替代值夜班的运维吗?还是永远只能当“辅助”?留言区聊聊你的判断。

今天下班前,用 docker compose 把这套东西拉起来。把测试环境的 OTLP 数据指过去,看看 Agent 能从你的日志里读出什么。


觉得有用?点个关注,持续获取 AI+运维的实操干货。