这两天我在忙着准备月底为从事特殊教育的老师做一场 AI 培训,想了一些针对他们的场景,就着这些场景特别想搞清楚一个问题——那些听起来很厉害的 AI 视频工具,到底能不能真的帮到这些没有AI基础的老师和孩子?光讲概念没用,得做出一个能用的东西出来看看。
其实在动手做这张卡片之前,我已经踩过一轮坑了:之前我做过一个「丰子恺风格视频」技能,靠 hyperframes + MINIMAX 两个 Skill,就能把一段文案自动生成竖版视频,还专门写了一篇文章讲这套「两个 Skill 自动生成视频」的玩法(这篇旧文我会在文末作为参考附上)。
这次做特教卡片,第一步就是借鉴那个技能:拿它改了一版《当愤怒来敲门时》——一支 30 秒的心理辅导动画,也是丰子恺风格、矢量手绘、平涂留白。把它跑通,等于把基础管线又验证了一遍,也给后面打好了底。
正是这段底子,让我有底气接着做更难的特教场景。于是我挑了一个最朴素也最典型的场景:《认识大自然——下雨了》。这是一张多感官识字卡片:同时面向听障和视障儿童,要「看得清、听得见、读得出」。
01
PART
背景:为什么是「下雨了」
BACKGROUND
特殊教育里,多感官教学是基本功。听障孩子靠「看」,视障孩子靠「听」,一套好的识字卡片必须两头都顾上。
视觉上:高对比、主体大、背景干净,孩子一眼就能抓住「下雨、雨滴、打雷」这几个核心词;
听觉上:旁白要形象,把声音的质感说出来——「淅淅沥沥」「轰隆隆」,让孩子光听就能在脑子里画出画面。
我做这张卡片,既是给培训攒一个真实案例,也是想验证一件事:AI 能不能把「专业老师才知道怎么做的卡片」,变成普通人动动嘴就能生成的东西。
02
PART
结果:从「跑通」到「满意」
RESULT
今天我一共做了两支视频,正好是一次「从能用到好用」的进阶。
第一步(借鉴我之前做的技能):《当愤怒来敲门时》。 我之前写过一个「丰子恺风格视频」技能,用 「hyperframes」 + 「minimax-voice-clone」 两个 Skill 就能把一段文案自动生成竖版视频。这次做特教卡片,我先拿那个技能改了一版《当愤怒来敲门时》——一支 30 秒的心理辅导动画,丰子恺风格、矢量手绘、平涂留白。把它跑通,等于把基础管线又验证了一遍,也给后面打好了底。
第二步:正式做特教识字卡《认识大自然——下雨了》。 有了前面的底子,我先照着同样的方法(hyperframes + MINIMAX)做了一版 15 秒视频。但说实话,效果不太理想——矢量手绘的画面虽然能跑通,却总觉得差点意思:绿叶不够「绿」、雨滴不够「透」、整体少了点儿童绘本该有的鲜活,毕意这个技能只是用来画线条图,太简单了。
第三次,我换了个思路:先让 Agnes 把三张图画出来,再把图拼进视频。 这一改,质感完全不一样了。Agnes 出的图,大绿叶上挂着晶莹的大雨滴、背景是干净透亮的蓝,色彩鲜艳、主体清楚,一看就是给小朋友看的。再配上克隆音色的旁白,以及雨声、雷声、小鸟叫,那段「下雨了」终于对了味。
说真的,如果让我再做一版,画面会更精致,节奏会更准。但普通人做出来的第一版就能用、而且还能变得更好,这恰恰是最大的价值——瑕疵不是丢人的,它是你能改得更好的证据。
03
PART
WorkBuddy 生成视频的工作流(三个 Skill)
WORKFLOW
做《当愤怒来敲门时》时,我只用了 hyperframes + MINIMAX 两个技能就跑通了基础管线;做到《下雨了》才把 Agnes 也拉进来负责出图,画质一下子提了上来。这次能跑通,靠的是 WorkBuddy 里三个各司其职的 Skill 打配合:
Agnes 文生图(agnes-image-gen)——负责「出图」。给它一句画面描述,它就生成高质感插画。免费、稳定,这次三张主图都靠它。 Minimax 声音克隆(minimax-voice-clone)——负责「出声」。上传一段你的声音,它就能克隆出音色,把文案念成自然旁白。识字卡里那些「淅淅沥沥」「轰隆隆」,就是它念出来的。 hyperframes——负责「合成」。把图片、旁白、音效按时间线排好,加上转场和字幕,渲染成一段成品视频。大字词卡(下雨 / 雨滴·打雷 / 太阳)也由它叠加,专门照顾听障孩子。
一句话总结这条流水线:Agnes 画图 → Minimax 配音 → hyperframes 拼成片。三个 Skill,各干各的活,串起来就是一支小小的制作团队。
04
PART
具体怎么做:从安装到成片(普通人照着做)
HOW-TO
很多人卡在第一步「这东西怎么装」。其实在 WorkBuddy 里,Skill 是「应用市场」式的,不用你懂命令行。下面把这次「下雨了」的真实路径,拆成任何人都能跟做的 7 步。
打开 WorkBuddy 首页,点左侧的「专家」→「技能」,就进入了技能市场。
在列表里找到这三个技能:agnes-image-gen(agnes文生图,负责画图)、minimax-voice-clone(负责配音)、hyperframes(负责拼视频)。找到后点「试用」,就装好了——不用懂命令行,不用敲一行代码。
NOTE
一句话总结这条流水线:Agnes 画图 → Minimax 配音 → hyperframes 拼成片。三个 Skill,各干各的活,串起来就是一支小小的制作团队。
hyperframes 安装比较麻烦:它底层要依赖电脑上的几个本地程序(Node 工具、Edge 无头浏览器、ffmpeg 视频编码器)。如果安装时、或第一次运行报错,别自己折腾——把屏幕上的红色报错文字原样复制下来发给 WorkBuddy,它会自动帮你把缺的依赖程序装上。
Minimax 声音克隆也是同样的情况:接入时如果提示缺环境或依赖的报错,把错误丢给 WorkBuddy,它会同样帮你补齐。
一句话:安装报错不可怕,把错误交给 WorkBuddy,它比你更会装。
装好后,在对话框里输入 @skill:技能名 就能调用,比如 @skill:agnes-image-gen。技能一加载,它自带的能力(画图引擎、配音接口、视频渲染器)就跟着就绪了。
Minimax 需要两个凭证:你自己的 API Key 和 GroupId(去 MiniMax 开放平台注册后就能拿到)。WorkBuddy 会引导你填好、并帮你存成声音克隆的配置文件。声音克隆不是「直接开口念」,而是先上传一段你的录音、训练出一个专属音色,得到一个音色编号后,就让这个音色去念任意文案——所以你全程不用自己对着镜头念稿。
Agnes 这个技能自带一把免费共享 key,零配置就能出图。后来我换成了自己的 key:做法是把它写进系统的「环境变量」AGNES_API_KEY,脚本优先读环境变量、没有再回退到共享 key——个人密钥不烤进技能文件,安全也灵活。普通人用这个 API 免费额度基本能应付日常出图,如果大量出图的话可以会员订阅。
图片、旁白、音效都准备好后,用 hyperframes 把三者按「0–5 秒 / 5–10 秒 / 10–15 秒」三个镜头排好,加上转场和字幕,渲染输出 15 秒的 MP4 视频。文案、画面描述、音效标记,都是用自然语言说清楚就行,不用写代码。
AI 生成的首版成片往往不是一步到位,得靠你用大白话指挥它微调,主要解决时长、节奏和细节上的问题。
拿时长来说,第一版合成出来经常超预算:43 秒(《当愤怒来敲门时》那支)和 17 秒(《下雨了》这支),离 30 秒 / 15 秒的目标都差不少。原因在于配音默认语速偏慢,尤其「一、二、三、四」这种数数句,拖得特别明显。修法也不复杂——精简文案、把语速提到 1.0~1.12 倍,两下就压到 30.7 秒和 15.0 秒了。
这一步说白了,就是你把 AI 的初稿「说」成真正能交付的成品,全程不用打开剪映之类的剪辑软件。
如果你打算长期做这类视频,这步非常重要。它不是替代 Step 5 的精修,而是在交付成品之后,额外把整套制作流程沉淀成自己的可复用技能。
具体来说,就是把这次验证过的步骤、参数、踩坑经验整理成 WorkBuddy 里的技能配置,下次做同类视频直接一句话调用,不用从头再趟一遍雷。
技能越攒越多,制作门槛越来越低,从每次摸索变成直接复用。
05
PART
踩过的坑:安装与制作中遇到的问题
PITFALLS
这部分最值钱——光说「多简单」是骗人的,我确实前前后后花了不少时间,但最后发现根本不用自己硬扛。
安装和制作过程中确实遇到不少问题,比如环境报错、渲染卡死、适配出岔子,每一个单拿出来都够折腾半天。但我的思路很简单:遇到问题不自己钻研原理,直接把报错或现象描述给 WorkBuddy,让它去排查解决就好。
省下的是时间,换来的是顺利跑通的成片。
除了上面 Step 5 提到的「时长超预算」,还有几个典型坑:本地依赖装不全(Step 0 已说,把报错丢给 WorkBuddy 即可)、低内存机器渲染容易崩(让 WorkBuddy 用单进程+限核的低内存模式跑)、给大图加模糊滤镜会让截图渲染卡死(改用透明度+缩放的轻量转场)。这些坑都有解法,而且解法是可复用的经验,不是天堑。
06
PART
总结:工具平权是真的,前提是你愿意用
SUMMARY
回头看这件事,最让我感慨的,不是某个工具多厉害,而是一个完全不懂编程的人,只要愿意动手,就能在一下午里做出一段给特殊儿童用的教学视频。
过去,做这种带画面、带声音、带字幕的卡片,要么靠专业团队,要么靠老师自己手绘剪切,门槛不低。现在,AI 把「画图、配音、剪辑」这三件事,拆成了三个能对话的技能——你只要会说清楚想要什么,它们就替你干完。
当然,它也并不「无脑」:安装链路、低内存渲染、时长控制、模糊滤镜卡死……每一步都可能卡你半天。但关键是,这些坑都有解法,而且解法是可复用的经验,不是天堑。
这就是 AI 时代的工具平权:能力不再被少数人会的技术锁死,谁都能上手。但它有个前提——你得愿意用、愿意试,愿意在第一次不满意、甚至渲染卡死的时候,换个方法再来一次。
那场「下雨了」,连同更早那支《当愤怒来敲门时》,是下给从事特殊教育的老师以及特殊孩子的,也是下给我的:别怕工具新,动手就平权。
如果你看完觉得没那么精美,那说明你确实看得出门道。与其挑毛病,不如自己动手做一支,试试看你能作出什么自己满意的作品。
07
PART
延伸阅读
REFERENCE
我之前写的那篇《不写代码,用眼用心,用 WorkBuddy 把 AI 工具调成「我想要的样子」》(讲的就是「丰子恺风格视频」技能:hyperframes 负责合成画面、MINIMAX 负责配音,把一段文案一键变成竖版视频)。这次《当愤怒来敲门时》和《下雨了》的基础管线,都源自它。来看看这两个小视频的差别吧
我是 Lulu,用 WorkBuddy 把 AI 工具变成普通人也能上手的实战经验。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见
THANKS FOR READING
夜雨聆风