乐于分享
好东西不私藏

一条视频0播放后,我做了3个AI工具,找出2个限流风险

一条视频0播放后,我做了3个AI工具,找出2个限流风险

同一条视频,发到视频号有 1.5 万观看。

发到小红书,播放量是 0。

这是我做短视频以来的第一个小爆款,也是第一次碰到两边数据差这么多的情况。

我当时有点懵。到底是内容有问题,还是账号被限流了?我也不知道。

这篇就记录一下,我是怎么从这条 0 播放的视频开始,连续做出三个 Skill 的。第一个负责把手机长截图转成 Markdown Skill,第二个负责把视频转成逐字稿 Skill,第三个是拿这两个 Skill 去做限流风险检测的 Skill。

图 1 视频号与小红书对比

1. 先确认是不是真被限流

我先按网上的方法,给这条视频尝试开薯条推广。薯条是小红书的内容加热工具。结果这单投不出去,系统提示无法加热。

到这里,我确认的是:这条内容无法通过薯条加热。至于具体触发了哪条规则,不能只凭这一项结果下结论,还得继续对照规范。

图 2 薯条加热未通过提示

具体可能命中哪条规则,还得继续查。

2. 规则查到了,但怎么查具体原因犯了难

小红书的薯条内容审核规范写得很细,什么能发,什么不能发,都列在里面。我想把它复制下来,逐条对照。结果发现文档做了防复制,只能用手机一张张截成长图。截下来以后,麻烦才刚开始。

长图里文字、表格、图片混在一起。想从里面找限流原因,只能一张张看。几份规范看下来,眼睛先受不了了。

我就想,能不能做个工具,把长截图直接转成能搜索的文档。以后再遇到手机截图,直接转成 Markdown,至少能少一些重复盯图找字的工作。

于是有了第一个工具,screenshot-to-markdown Agent Skill。

先简单说一下 Agent Skill 是干嘛用的。它可以理解成一套写好的操作说明和脚本,交给大模型以后,模型按照这套流程处理文件。把长截图丢进去,它会把文字整理成 Markdown,标题、列表、表格尽量保留,截图里的图片也会单独裁出来保存。

图 3 生成的 markdown 展示效果
图 4 生成的 markdown 目录

做这个工具时,我碰到的第一个问题是,大模型不一定能识图。有的模型可以直接读截图,有的模型不行。所以我做了两条路,能识图的模型自己读取截图切片,不能看图的模型就自动调用本地 OCR。Mac 和 Windows 都能跑,两条路最后共用同一套拼装逻辑。

图 5 screenshot-to-markdown 流程图

怎么判断模型到底能不能识图?大模型帮我写了个小检测。脚本每次生成一张带6个随机字符的测试图,让模型读出来,读对了才算通过。随机字符不会打印到终端,模型得真的看见图片才行。

长截图怎么切成小片,也有讲究。优先按空白带切,尽量不切在文字行中间。找不到空白带,就先整块保留,到了上限再强切。裁剪参数是我拿真实截图反复试出来的。

遇到带圆角背景的卡片,也不能直接填充背景色,还得从内容边缘往外扫描。图片里的说明文字会在背景上挖洞,直接填充很容易漏掉顶部。

这些细节都不是凭空设计出来的,都是拿真实截图一遍遍试出来的。

3. 还要检测视频本身

规则转成文字以后,还得查视频本身。我现在发的视频大多是口播,要判断有没有违规,先得知道里面到底说了什么。

于是有了第二个 Skill,video-to-markdown。

视频丢进去以后,它会自动提取音频,转成带时间戳的逐字稿,并在顶部生成摘要。全程本地运行,不需要 API key,也不用为每次转录付费。

图 6 video-to-markdown 结果图

这个 Skill 也支持 Windows。我的电脑是 Mac 的 M 系列芯片,用 mlx-whisper 转录。Windows 和 Intel Mac 用 faster-whisper,工具会自动检测平台并选择后端。别人拿走以后,不用先研究自己的电脑该装哪套引擎。

4. 两个 Skill 组合,成了限流检测 Skill

规则文本有了,视频文字也有了,两个 Skill 组合起来,小红书限流检测 Skill 就有了。

它的流程其实很简单。screenshot-to-markdown 把官方规范长图转成文字,我再从里面提炼出9个判定维度。检测时,video-to-markdown 把视频转成逐字稿,检测引擎拿着逐字稿逐条对照规则,最后输出报告。

我把小红书的4份官方规范提炼成9个判定维度。每条命中都带规则出处,拿到报告的人可以自己回到原文复核。拿这条 0 播放、且无法通过薯条加热的视频跑了一遍,识别出2项风险,分别是拉踩智谱和海外名。每一项都能定位到具体的规范来源,但报告只能用于风险自查,不等同于平台的最终判定。

图 7 小红书限流检测 Skill 流程图

终于,我可以检测一下到底是什么原因了,几分钟后,我拿到了检测结果:

图 8 视频检测结果

下次录视频我终于知道有哪些坑需要避开了。

5. 这个工具能做什么,不能做什么

它现在能查的是视频里的音频。口播说了什么,一句句转成文字,再逐条对照规则,最后定位到具体句子。

画面暂时查不了。视频里出现了什么画面、什么 logo、什么文字,现在都不会被检测到。这部分要加入视觉识别,后面有需要再补。

工具也还会继续改。有人拿去用,遇到什么问题反馈回来,我再照着修。

6. 总结一下

把这段经历捋一遍,其实没有什么复杂规划。

一条视频突然没播放,我不知道原因,于是先去找规则。规则需要截图保存,可文档又复制不了,于是做了截图转 Markdown。视频的问题藏在口播里,于是又做了视频转文字。两个工具组合起来,才有了限流风险检测。

最后拿自己的视频跑一遍,识别出2项风险,每一项都有规则出处。

做 Skill 没有想象中那么难。很多时候,就是把一件反复让你烦、又绕不开的小事拆开,让 AI 和脚本各自去做。

需要注意的是,工具能不能真的解决问题,还是要看实际运行结果。语法检查通过,不代表工具一定能跑;模型说自己能识图,也最好用随机字符测试一下。

我的三个 Skill,就是从一条播放量为0的视频开始的。

如果你也想试试这三个 Skill,可以在公众号后台回复「限流」。我会发你一段安装指令,直接丢给 Codex 或 Claude Code 就能安装。

如果你不想使用安装指令,也可以直接打开仓库:https://github.com/BambooXiu/AgentSmithy

欢迎留言交流,互相学习。