夜雨聆风学习资料网

ARTICLE · 1150391

我把 AI 工具越攒越多这件事想通了

我把 AI 工具越攒越多这件事想通了

国庆8天,20个任务,真正沉淀下来的只有3件事。AI变强的速度比想象中慢,熟练不等于积累。真正值钱的,是把踩过的坑写成脚本和规则,让下一次不再重蹈覆辙。分层管理工具、看清成本真相、用实测数字说话,才是这8天最硬核的产出。

摘要 SUMMARY

真正值钱的,是把踩过的坑写成脚本和规则,让下一次不再重蹈覆辙。

国庆 8 天,4 个平台,20 个任务。

这 20 个任务里,真正能留下来的,就 3 件事。

这件事我想了很久。

先说个最扎心的事实

我这 8 天最大的感受不是 AI 有多强,是它变强的速度,比我想象的慢。

我一开始以为 AI 是那种「啪」一下就变好的东西。用一周,感觉脱胎换骨。

结果这一周我做了 20 个任务,发现能沉淀下来的就 3 件。

剩下的呢?

看起来都很牛。但两周之后你回头看,会发现大部分就是一次性消耗品。

问题出在哪?

我想了很久,后来发现问题不在 AI,在我自己。

我一直以为,我用 AI 的方式是「多跑几遍就会了」。

但根本不是。

多跑几遍只会让你更熟练。

熟练和积累,是两件事。

熟练和积累,是两件事。

你想想看,一个外卖骑手跑了三年,路线已经很熟了。但他银行卡里依然没多出什么。

技能也是。它提升的是你的下限,不是你的资产。

聊这个之前,我得先承认一件事。

我 8 月份的时候,为了搞一个训练营的打卡工作台,折腾了很久,改 bug 改到半夜。

那个 bug 现在还在。

我当时没当回事,觉得这事儿过去了就过去了。

但国庆这 8 天,我在别的地方又踩了一模一样的坑。

那一刻我才反应过来,8 月那个 bug 如果当时沉淀下来,这次就不用重新踩。

同样的道理,这 8 天的 20 个任务,如果没有沉淀,基本就是一次性的。

所以这 8 天最值钱的东西,是这 3 件事

第一件,是我终于想明白了 AI 工具该怎么分层。

第二件,是我搞清楚了钱到底花在哪。

第三件,是那些带数字的实测结论。

我一个个说。

先说分层,这个是我最想分享的

我以前特别纠结,我的 AI 工具库已经很庞大了,但每次做新事情还是从零开始。

后来我发现是我自己的问题。

我把不同的东西该放在不同的地方,但我一直没分清。

现在我的做法是这样。

那种可以直接照着流程执行的动作,放技能层。就是一个脚本、一套固定的动作序列,谁来都一样。比如剪视频的那个流水线,7 个阶段 8 个脚本,跑两支真实录屏就验证过了,全通。

那种需要专业判断的角色,放专家层。这个要有明确人设,会权衡,会说人话。比如我做的那个限时学习辅导教练,它不是一段提示词,它是一个角色。

那种只负责分流的,放编排层。它自己啥活都不干,就是判断这个任务该交给谁,然后交接出去。

我这套东西现在大概是这样,技能层 6 个,专家层 5 个,编排层 1 个。

正好对应三层。

这个分层怎么来的呢,说出来有点丢人。

最早录屏剪辑技能已经 10 个脚本了,转录技能 6 个脚本,我当时就想,新能力进来之后,索性合并成一个大技能吧。

差点把自己搞死。

因为合并之后,两个技能都会去抢同一批触发词,谁都不服谁。SKILL.md 会长成一个没人能维护的怪物。

说实话,我偶尔也会想,这是不是有点过度设计了?

凡是可以照着流程执行的活儿,都应该沉淀成技能。

说真的,这问题我也问过自己。

但后来我想明白了,凡是可以照着流程执行的活儿,都应该沉淀成技能,而不是每次重新描述一遍。

所以后来就定了几条规矩。

凡是复制粘贴的活儿,都不许复制,都得调。

不许抄上游,都得写适配层。

不许改完就完事,都得 grep 一遍引用方。

这三条说出来挺朴素的。但我认为是这 8 天最值钱的产出。

为什么?

因为它把「我这次做成了」变成了「下次还能做成」。

举个具体的例子。

我做剪辑流水线的时候,最难查的一个bug,花了我很长时间。

现象是映射回查随着成片时间线性变差,但帧数一帧不差,音画还是同步的,画面内容也全对。

只看返回码,你永远发现不了这个问题。

根因是 AAC 音频有一个 1024 采样的起始偏移,大概 21.33 毫秒,被写进了容器索引。你带音频去拼接的时候,每个边界都会累加。

55 段实测,20 处帧间距从 1/30 变成了 2/30,累计偏了 0.5257 秒。

试了四五种解法都没用,最后是分段解决才行的,分开处理再合并。

这个过程我记下来了,现在它是我验收标准里的一条。我这人记性还算可以,但这种事光靠记性是撑不住的,必须写下来。

如果我没记,这个 bug 下个月我还会再踩一次。

AI 剪辑成片画面。左侧边栏做了隐私打码,原值 3.11 打码后 0.13,脸部小窗原值 3.78 完整保留

还有一个数字我特别想讲。

有个 skill 是用代码画动画的,不是 AI 生图。我审完安全装上,然后拿我自己手上13 起电控失效案例去实测。

跑完发现两条路线差 38 倍。

同一条片子,一条 8 秒 240 帧,渲 2 秒就完了。另一条 3 秒 180 帧,要 56 秒。

我一开始以为是配置问题,后来发现根本不是,就是这两条路线本身差这么多。

如果我图省事用慢的那条,1 分钟的片子要 9 分钟以上。一个 8 天的假期,光渲染就烧掉一个多小时。

重复任务的成本是每一次的。

这种数字不实测,你永远不知道差多少。

关注
重播 分享 赞

代码画出来的白板动画,用的是我自己手上 13 起电控失效案例里的 PFC 失效机理,不是官方 demo

但我要提醒一句,如果你的活儿是一次性的,说实话,用不上。

你可能就想剪个视频,发个朋友圈,你根本不需要知道什么三层分工。你直接告诉 AI 帮我剪,30 秒之后你就拿到片子了。

这个批评是对的。

三层那套东西,是给那些手里有复现需求的人准备的。

一次性任务的成本是一次性的。

重复任务的成本是每一次的。

我这一周真正省下来的时间,不是我跑得快,是把踩过的坑写成了脚本和规则,让它下一次不用再踩。

这个转念,我觉得是这 8 天最值的。

而且说实话,这里面有很大一部分是运气。

聊一个我觉得挺高级的设计

我做学习系统的时候,一开始想的是造一个能教我的 AI。

后来发现一个 AI 干不了这活。

因为教你的那个,和给你整理资料的,那个,必须分开。

所以我拆成了两个角色。

1

一个只管逼你思考,出题,纠错,打等级,我叫它严师。

2

另一个只管把学过的内容整理成网站。

神奇的事情发生了。

不确定的地方我宁可标注不确定。

学习站在整理的时候,会复算数字,然后发现了严师算错的地方。

但它不改。它只在那个数字旁边标一个「待核对」,然后发回给严师确认。

这个分寸我觉得特别高级。

我后来自己用 AI 做设计的时候,也开始学它这个。不确定的地方我宁可标注不确定,也不自己拍一个看起来很合理的数。

这个我觉得是被这个设计教育到了。

AI 教 AI 的事,我以前不太信。现在信了。

其中一门课的学习站。章节进度、每日路线、互动页数量都在上面,这个套件同时跑着三门完全不同的课

顺便说个我觉得挺有意思的数。

我在跟一个 AI 学强化学习的时候,突然想到,能不能用 RL 来控制空调。

然后我把这个交给另一个 AI 单独做。

出来的结果挺打人的。

最好的一版规则控制,比基线省 2.58%。

然后加上 PPO 算法,只多了 0.04%。

几乎没有差别。

它自己又去做了个消融实验,发现瓶颈根本不在算法,在信息。具体就是设定点日程和回温时刻这些数据拿不到。

评审的老师给的门槛是,3% 以下不值得做 RL,10% 以上继续。

最后落到 4.05%,正好卡在中间。

关注
重播 分享 赞

RL 没有超过规则。这也是结论。

另一支代码动画。3b1b 那种公式逐项浮现的风格,纯代码画出来的

我觉得这才是这 8 天里最值钱的一个数字。

为什么?

因为它是一个负面结果。

RL 没有超过规则。这也是结论。而且它告诉你下一步该去补信息,不是继续加算力。

我一直觉得,一个愿意承认自己没赢的 AI,比一个永远说自己赢了的有用多了。

讲一个我踩过的坑,关于数据的

每条数字必须带标签。

我做知识库的自动化,最早就想让它自己跑。后来发现不行的原因不是技术,是内容不够严谨。

比如有个竞品的简报,我一开始写「9 万连接家庭」,觉得这个数据挺唬人的。

后来核对口径才发现,这是三年多累计的训练数据覆盖,不一定是现在在线的户数。

还有一个数字,公司自己调查说 78.8% 的用户没加入维保计划。但另一家机构给的是 10 万户。

两个都对,但口径完全不一样,不能混着写。

所以现在我给自己的规矩是,每条数字必须带标签。是测的、还是仿的、还是推测的,必须写清楚。没有数据就标「缺」,不补数。

这个看起来是个小事,但它救了我好几次。

一个数据如果它自己站不住,你写得再漂亮,读者一查就崩。

崩一次,你后面所有的可信度就没了。

那个 9 万连接家庭的竞品简报。20 个来源,每个数字都对着原文核过一遍

说钱吧

我之前对 AI 的成本认知很模糊,就觉得贵。怎么说呢,就是完全没有概念。

国庆这 8 天我认真看了一下账单,结果发现我之前的认知全是错的。

我拿了一张用量的截图去问,结果 AI 给我的答案把我吓了一跳。

一个会话,274 美元 53 美分。

你以为是 50 个人在干活,其实是 25 个人在开会。

通用 subagent 占掉了会话限额的 72%。最贵那个模型占成本的 98%。

我一开始以为问题出在用的模型太贵,或者 subagent 用得不够高效。

结果完全不是。

真正的成本大头,是缓存读取。1.395 亿 token。

翻译成人话就是,每个 subagent 在多轮对话里,都在反复重读上下文。不是它输出得多,是它一直在读。

而且最贵的那批,不是 50 个小的抽取 agent,是 25 个负责合并和综合的大 agent。单个 23 万到 50 万 token,30 到 69 次工具调用。

有点离谱对吧。你以为是 50 个人在干活,其实是 25 个人在开会。

我第一次看到这个分布的时候,真的一脸问号。???

因为按常理,抽取是最累的活,25 个小 agent 各自跑,多合理。

结果完全反过来。

RL 控制仿真的四个气候区节电结果。注意,这是仿真数据,不是实机

这里有个挺有意思的细节。

AI 自己一开始诊断的时候,说启动上下文是数量级杠杆,能省一大截。

我让它把实际数据拿出来。

然后它自己承认了,说真正能削减的只有 25% 到 30%,不是数量级。

这段其实挺值得说的。

以 AI 的第一轮诊断为准,是挺危险的。

你得让它把实测数据拿回来修正它自己。

我自己也给了一个跟它不一样的判断。

成本集中在合并端,但它给的方案针对的是抽取端。所以这个方案对总成本的贡献,大概率有限。而且它建议做的那个 A/B 测试,只验证了白名单能不能降低启动上下文,回答不了总成本问题。

它缺的那一半是合并端的,也就是降档、拆粒度、减少单 agent 的工具调用。

这个我还挂着,没做完。

我拿一个单一指标,去下一个很重的结论。

诚实地说,这一块是我自己判断的,还没验证。

我说这个不是为了显得我比 AI 聪明。

这三条不是技术,是纪律。

是因为我被 AI 坑过一次,也被自己坑过一次。

那块拼图是我自己补的,补得对不对,得跑一遍才知道。

说到 AI 犯错这件事,我想讲一个我自己犯的错

这 8 天我犯错了 3 次,而且 3 次都是同一个模式,就是拿错误结论去改正确的东西。

1

第一次,我拿到一份转写文本,看着像乱码。我判断这人口播不连贯,准备删掉一段。结果我单独重转了一遍,文本完全通顺。原来是热词把「队列」带偏成了「被虐」。所以我用工具的一个 bug,去删了一段本来没问题的内容。

2

第二次,我用像素差异检测,发现有 19 段画面是完全静止的。我一算,这个画面应该有问题,准备处理。结果回画面一看,那个 3D 模型的爆炸进度是在动的。只是界面上大部分区域不动,导致像素差值很低。指标骗了我。

3

第三次更离谱。我看到一条缓存的 ENOENT 警告,就判断渲染失败了。结果那只是缓存警告。真正判断成功,要看有没有产出确认行。

这三次其实都是同一个毛病。我拿一个单一指标,去下一个很重的结论。

后面我给自己定了三条:

第一,指标只能当线索,不能当判决。

第二,先定义清楚成功长什么样,然后再去看日志。

第三,凡是工具报错了,先单独复验一遍,再去动内容。

监控本身是有成本的。

这三条不是技术,是纪律。

但说实话,纪律这玩意,比技术难多了。

顺便说个自动化的事,可能对你有用

我之前给自己的一套学习系统,配了一个每 15 分钟一次的巡检。

逻辑是,如果 AI 卡住了,让巡检去催一下。

结果一天下来,额度从 33% 用到 75%。

而那天,一次需要催的情况都没有发生。

那 20 个任务里,有 3 个是空的。

我后来复盘出原因了。巡检一天要跑大概 60 次,每一次都要叫醒主助手,还要加载两个严师的完整对话记录。而那天,两个严师都好好的,一次都没卡。

监控本身是有成本的。

这个成本有个特点,就是它不给你报错。它不会跟你说,我这次浪费了多少 token。它就在那儿安安静静地烧。

所以我现在的做法是,能按需触发的不定时轮询。

开完新的自动化,第二天一定要看一眼用量曲线。

这个习惯说出来挺土的,但它真的有用。

我见过太多人在这里踩坑了,自动化跑得很开心,账单看不懂。

那 20 个任务里有 3 个是我一开始就想做但最后没做完的

一个 GEO 基线,卡在了浏览器远程控制那个工程环节上,我降级成了给一段提示词。

一个人生建议网站,我按规矩出了规划就停手了没写代码。

还有一支片子,片尾我压根没留任何入口,网址和二维码都没有。对引流来说这是一票否决,后期怎么剪都救不回来。

所以别觉得我是什么都做成了。

那 20 个任务里,有 3 个是空的。

回到开头

这 8 天,4 个平台,20 个任务。

真正留下来 3 件。

有 3 件是空的。

有 4 次我判断错了。

两支 AI 剪辑成片的封面

每周一早上自动生成的行业周报,这个是第一期

顺便把这 8 天出过的推广片也放一起。横版和竖版各几支,都是同一个套件出来的。

给项目做的推广片抽帧,横版

学习站的竖版推广片抽帧

最后那张,是那个我没做完的人生建议网站。(现在已经上线,迭代了 4 版,地址:https://life.geopro.top)

这些数字我都写在复盘里了。

如果你也这么折腾过,欢迎来评论区聊聊你踩过什么坑。

说不定我们踩的是同一个。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标

谢谢你看我的文章,我们,下次再见。

相关学习资料