几乎每款软件,用户都会撞上两类麻烦:
对应到产品能力,就是两条线:
DataBuff 就是按这个思路做的:一款开源、AI Native 的 OpenTelemetry APM。指标、链路、日志先采进来、看清楚;AI 长在同一份遥测上,不是旁边挂个聊天框。架构刻意压到三件套:
• Ingest——采集接入(OTLP 等)
• Doris——存储与查询
• AI 平台 / Web——看板、对话、数字专家(含运维专家、产品答疑)

极简架构:采集 + 存储 + AI 平台,一条命令就能起
· · ·
自运维:坏了,产品还能上场
先看自运维怎么落地。场景很常见:install 过程中 Doris 出了问题。一般产品到此整站黑屏,人自己 SSH 猜;DataBuff 怎么自己查、自己修。
我们注入一个可复现故障:Doris BE 被卡成 mem_limit: 256m,start.sh 非 0 退出。系统进入排障模式——承认 Doris 未就绪,但 Web 仍然拉起,把修复通道留住。

install 失败,但页面还在——自运维入口被保留
配好大模型,打开 AI 对话,选运维专家,把 SSH 授权交出去,要求定位后直接修复:

人只做授权;查、改、启、验交给运维专家
专家上机后自己跑完闭环:BE 持续 Restarting → 根因是 mem_limit: 256m 触发 OOM → 把内存提到 4g、改持久化配置、拉起 ingest、验到全栈 Healthy。回报里是「修复措施」和「最终健康状态」——已经改完,不是待办清单。

修复措施(256MB→4GB)+ 最终健康状态全部 Healthy
终端侧也对得上:四容器 healthy,Doris SELECT 1 通过。存储恢复后排障模式自动退出,不用再手动重启 Web。「用不了」就这样被拆掉——坏了,产品还能上场,并且修完。

验收:四容器 healthy · SELECT 1 = 1
· · ·
自答疑:好了,产品自己教你
再看自答疑。系统救回来了,「不会用」还在。同一 AI 入口换产品答疑,先问接入与告警——新人最常卡的两件事:

选中产品答疑,提出接入与告警配置问题
它翻产品内文档,直接给出可执行路径:OTLP 端点、环境变量、Java Agent 启动命令,以及告警规则在配置管理里的入口。

OTel 接入步骤 + 告警阈值配置路径
数据能进来还不够——运维专家、产品答疑本身也要大模型。再问一句更贴近上手的:

第二问:大模型怎么配、专家怎么启用
答案同样落到菜单与字段:配置管理 → 模型配置,填 Provider Code / Base URL / API Key / 模型列表,保存前点「测试连通性」。配好后专家自动可用,不用再单独开通——它还把 Base URL 漏写 /v1、未配模型列表等常见踩坑一并列出。

菜单路径 + 必填字段表:从配置到能对话
· · ·
想自己摸一把,给个 Star,或先打开 Demo:
夜雨聆风