ARTICLE · 1110802
我这一年真正每天在用的 7 个 AI 工具,和 4 类买回来就吃灰的
我是老张,干了十年运维,正在学 AI。这里只写我亲手做过、翻过车的东西。
这刚好是这个系列的第 50 篇。
前段时间有个同行问我:"你天天写 AI 运维,到底装了多少工具?"我想认真回答一下,就去翻了这一年的工具账单和我的浏览器书签。
翻完之后有点尴尬:我这一年买过、试过、注册过的工具,加起来大概二十几个,但真正每天打开、且离了会难受的,只有 7 个。
更尴尬的是那些吃灰的——每一个当初都让我觉得"这东西能改变我的工作方式"。
这篇我把这两份名单都摊开写:7 个留下的,4 类吃灰的,以及我后来总结出来的一套选工具的判断标准。 这份东西比任何一篇工具测评都更接近真实——因为真实的工作里没人在乎工具有多少功能,只在乎它有没有嵌进你的日常动作。
一、我真正每天在用的 7 个
先说结论:这 7 个里,有 5 个是"免费的"或"已经在用的东西的延伸",只有 2 个是专门为 AI 花的钱。 这个结构本身就很说明问题。
| 决策复核与假设推演 | |||
| 写脚本 / 读老代码 | |||
| 项目记忆(prompt 资产库) | |||
| 把"我想看什么"翻译成查询语句 | |||
| 定时巡检 + 自动生成周报 | |||
| 配置与清单审查 | |||
| 手机上的语音 + AI 对话 | 就是我预告里说的那个"原以为没用"的。 |
重点说第 7 个:我本来觉得它就是玩具
我最初装手机端 AI 应用只是为了通勤时看看资料。结果它成了我值班的标配工具,原因很朴素:
凌晨三点,你不会去开电脑。
我以前的流程是:被叫醒 → 坐到电脑前 → 打开排查工具。中间那段"下床到开机"的时间,脑子是空的——但现在我会在床上先用手机把自己脑子里担心的事问一遍。这个动作只要两分钟,往往能让我在起身之前就想清楚"第一件事该查什么"。
后来我还发现了第二个用法,比第一个更有价值:口述复盘。
值班结束之后,人已经累得不想打字,但那时候记忆最鲜活。我现在会在交班前用语音把整件事口述一遍丢给 AI,让它整理成结构化的时间线。口述比打字快五倍,而"懒得记录"是复盘最大的敌人。
这个工具我原本给它打 3 分,现在它是 9 分。 原因不是它变强了,是它在那个具体场景里的形态是对的——手机、语音、随时可用。工具的价值从来不在功能表上,在你的动作能不能自然发生。
二、买回来就吃灰的 4 类
这一节我写得很诚心,因为我自己就是被坑的那个人。
第一类:重型 AIOps 平台
吃灰原因:它的智能是通用智能,不是关于"我系统"的智能。
销售演示极其漂亮——AI 自动关联指标、自动定位根因、一键生成处置建议。但一旦接上我们的真实数据,效果就打折:它不认识我们的服务命名、不知道"这个指标上升是因为每周三的批处理"、不知道我们三个系统的历史关系。
后来我明白了一件事:AI 平台的价值不取决于模型多强,取决于它对你的系统知道多少。而这些知识在你同事脑子里、在群聊记录里、在八年的脚本注释里——没有一个平台能自动获得。
第二类:功能大而全的"全家桶"订阅
吃灰原因:我们只用了其中 10% 的功能,却付了 100% 的钱,还要维护 100% 的配置复杂度。
最典型的是可观测性的全家桶:日志、指标、链路、告警、AI 分析一应俱全。买了一年,实际重度使用的只有日志和指标。但每次升级、每次对接、每次排查"为什么这个数据不显示",消耗的都是我们全家桶带来的复杂度。
我现在判断这类工具的标准变得很简单:我能不能只用它的一个能力,而不被它的其他部分绑架?
第三类:Prompt 管理和编排工具
吃灰原因:我一个人就管 30 个 prompt,不需要一个管理 2000 个 prompt 的系统。
这类工具解决的是"团队规模化的 prompt 资产管理"问题。但我们当时的情况是:一个人写、一个人用、存在知识库里、版本靠文件名。用一个完整的编排平台来管理这件事,等于用集装箱运一个行李箱。
这类吃灰最普遍,也最隐蔽——因为它不占预算,只占时间。 而时间比钱贵。
第四类:自己训练/微调模型
吃灰原因:我们连自己的数据都没整理干净。
我们曾经很兴奋地讨论过:用我们八年的故障记录微调一个专属模型。热情持续了两周,然后在"数据清洗"这一步停下了——我们的故障记录一半在 IM 里、一半在文档里,格式不一,还有大量脱敏问题。
那次之后我有了一个很实用的判断:任何需要先"整理数据"才能用起来的 AI 方案,先问自己这个整理工作谁做、什么时候做。 如果答不上来,那这个方案的真实启动时间是"永远"。
三、选工具的四个问题(我现在每次都问)
这四条是我交过学费才明确下来的判断标准:
问题一:能用我自己的数据跑一遍吗?
拒绝"只能用演示数据做 POC"的工具。 这条我踩过坑——演示环境里一切完美,接上真实数据立刻现原形。能被演示打动的人,买回来的都是演示。
问题二:没有它,我一周损失多少?
把这个问题量化。答不出具体数字的,基本都不是刚需。 比如第 5 个工具(定时巡检 + 周报),我的答案是"每周省 3 小时",答案清晰、可验证。而那些答不上来的工具,最后都吃灰了。
问题三:三个月后我还在用它吗?
判断方法不是"这个功能长期看有没有价值",而是:它有没有嵌进一个我每周固定要做的动作里?
第 1、3、4 个工具之所以活下来,是因为它们嵌入的动作是"排查"和"写东西"——我每周不做十次也做五次。而吃灰的那些,全都需要我"专门抽时间去用"。
需要你专门抽时间去用的工具,一定会死。
问题四:它的数据要离开我的环境吗?
这条是安全底线,也是我这一年最谨慎的一条。涉及真实 IP、域名、业务数据的内容,一律脱敏后才发;涉及完整拓扑图的,用内网模型或自己描述成抽象结构。
不是不信任工具,是运维这个岗位本来就不该把生产细节往外发——这条规则和 AI 无关,但 AI 时代它的重要性提高了一个量级。
四、比选工具更重要的四个习惯
我越来越觉得,工具本身拉开不了差距——同一个工具在不同人手里效果差三倍,差的是用法。
习惯一:把 prompt 当资产,版本化存起来。
每调好一个 prompt,就存进内网知识库,写明用途、输入要求、注意事项。这是唯一一件"时间越长越值钱"的事。 我现在的资产库里有 30 多个 prompt,其中大概 6 个是我每天都会打开的——它们值我一年前花在调它们上的那几十小时。
习惯二:每个 AI 工具都要留"逃生路径"。
AI 挂了怎么办?答不上来就不算能用。我们所有的 AI 辅助环节,都必须保留一条"手工也能干"的路——自动生成报告挂了,脚本能出原始数据;AI 分诊挂了,全量告警进群(这条我前面写过失灵降级)。自动化越深,越要能手动接管。
习惯三:不追求工具统一,追求"输入输出能串起来"。
我们不需要把所有事都塞进一个平台。需要的是 A 工具的输出能直接喂给 B 工具。 比如排查脚本生成的错误指纹,能直接丢进 AI 对话窗口;AI 分析出的结论,能直接进知识库。工具可以散,数据流不能断。
习惯四:每月做一次工具盘点。
每个月花十分钟问自己三个问题:
这个月它帮我省了多少时间?(说不出的,亮黄灯) 我这个月打开过它几次?(少于 4 次的,亮红灯) 如果现在停掉它,我会立刻难受吗?(不会的,考虑停掉)
这套盘点让我今年退掉了两个订阅。 退订的快感不比自己搭一个工具小。
五、红线:五条
不要给任何 AI 工具生产环境的写权限。 前面写自动处置边界那篇的结论在这里同样成立:AI 可以看、可以建议、可以告警,但按下改变键的必须是经过审核的自动化流程或人。 这条没有例外。 不要把生产细节发到外部模型里。 真实 IP、域名、账号、业务数据——一律脱敏。这是基础纪律,不是谨慎。 不要为工具改变流程。 顺序永远是:先想清楚我们要做什么(流程),再找工具去支撑它。反过来做的人,最后会得到一个由工具功能决定的、谁也说不清为什么长这样的流程。 不要买"演示驱动"的工具。 必须用自己的数据跑、必须能回答"没有它我一周损失多少"。 不要相信"工具越多越专业"。 我见过工具装了一堆、日常还在手工敲同样命令的人。你缺的从来不是第 8 个工具,是把前 2 个用透。
六、收个尾
这 50 篇写下来,如果只留一句话,我留这句:
工具的价值不在于它有多强,在于它有没有嵌进你的日常动作里。
我那份 7 个工具的名单里,没有一个是因为"功能最全"留下的,全都是因为它们长在了我每天必须做的动作上——排查、写脚本、查数据、写材料、值班。而那些吃灰的,无一例外都需要我"专门抽时间去用"。
所以如果你问我该买什么工具,我的回答通常是先别买:把你现在每天重复做的事情列出来,看看哪一件事你已经不可能再用旧方式做了——那个位置的工具,才是你真正需要的。
下一篇我想写点更硬的:今年的 AI 安全事件盘点与运维的应对清单——这一年我见过不少"AI 用出事故"的案例(提示注入、数据外泄、模型被套话),运维在这条线上其实是第一道也是最后一道防线。关注「AI运维实战」,不迷路。