
小林第一次独立值班,就遇到了一台生产服务器 CPU 持续偏高。
设备仍在线,业务暂时也没有反馈异常。面对告警,他先打开搜索引擎以及通用的AI软件,输入:
“服务器 CPU 使用率高,应该怎么排查?”
很快,一份完整的排查清单出现在屏幕上:
查看高占用进程、检查系统负载、分析应用日志、确认计划任务、排查磁盘读写……
方法很全,也都没有错。
但小林仍然不知道:

同样是 CPU 偏高,可能只是计划任务带来的短时波动,也可能是应用进程异常,还可能伴随磁盘、内存或网络状态变化。
通用答案可以告诉他“通常有哪些原因”,却无法直接判断这台设备此刻更接近哪一种情况。
于是,小林重新回到运维监控平台。
在当前服务器的监控页面中,他已经可以看到 CPU 趋势、内存状态、磁盘 I/O 等运行数据。于是,他打开平台中的 慧鹰 AI 运维助手,围绕这台设备继续提问:
“结合这台服务器当前的指标趋势和异常信息,CPU 持续偏高应该先检查什么?”

CPU 使用率已经持续处于高位;
内存使用率整体平稳,没有同步升高;
磁盘 I/O 与 CPU 在相近时间开始上升;
设备当前仍正常在线,没有出现其他明显的资源异常。
从这些指标变化来看,当前问题暂时不像是服务器整体资源不足,更可能与正在运行的高负载任务或频繁的磁盘读写有关。
基于这一判断,助手给出优先排查建议:
先查看当前高占用进程,并重点确认是否存在批处理任务或大量磁盘读写;在原因没有确认前,不建议直接重启服务器。
相比通用 AI 罗列出的多种可能,这次回答进一步缩小了排查范围,也让小林明确了第一步应该检查什么。

“生产环境下,可以先做哪些风险较低的检查?”
助手沿着刚才的分析,进一步整理出进程占用、系统负载和磁盘读写状态的查看方法,并提醒他先进行只读检查,涉及停止任务、调整配置等操作时再结合实际情况确认。
按照这个方向,小林很快发现,一项新增的批处理任务正在进行大量数据读取,CPU 和磁盘 I/O 也因此同时升高。
任务结束后,两项指标逐步恢复,服务器没有出现其他异常。
小林没有停在“告警恢复”这里。
他将本次异常现象、关联指标、排查依据、处理结果和后续观察项整理进值班记录:
异常现象:CPU 使用率持续偏高;
关联变化:磁盘 I/O 同步上升,内存保持稳定;
排查结果:新增批处理任务导致资源占用升高;
后续观察:关注同一任务再次执行时的资源变化。
这一次,他不仅完成了问题排查,也能够清楚说明:
为什么没有直接重启,为什么先检查批处理任务。

慧鹰 AI 运维助手更重要的价值,是以运维监控平台已经掌握的设备状态和指标变化为基础,让通用的运维知识能够对应到当前设备和当前问题中。
通用答案告诉你,这类问题通常可以怎么查。
慧鹰 AI 运维助手则帮助你判断:结合眼前的数据,这一次应该先查什么。

夜雨聆风