乐于分享
好东西不私藏

我敢说 AI 工具平权真来了——靠 WorkBuddy,零编程不用自己念稿甚至没剪辑,我做出了给特教老师用的教学视频

我敢说 AI 工具平权真来了——靠 WorkBuddy,零编程不用自己念稿甚至没剪辑,我做出了给特教老师用的教学视频

这两天我在忙着准备月底为从事特殊教育的老师做一场 AI 培训,想了一些针对他们的场景,就着这些场景特别想搞清楚一个问题——那些听起来很厉害的 AI 视频工具,到底能不能真的帮到这些没有AI基础的老师和孩子?光讲概念没用,得做出一个能用的东西出来看看。

其实在动手做这张卡片之前,我已经踩过一轮坑了:之前我做过一个「丰子恺风格视频」技能,靠 hyperframes + MINIMAX 两个 Skill,就能把一段文案自动生成竖版视频,还专门写了一篇文章讲这套「两个 Skill 自动生成视频」的玩法(这篇旧文我会在文末作为参考附上)。

这次做特教卡片,第一步就是借鉴那个技能:拿它改了一版《当愤怒来敲门时》——一支 30 秒的心理辅导动画,也是丰子恺风格、矢量手绘、平涂留白。把它跑通,等于把基础管线又验证了一遍,也给后面打好了底。

正是这段底子,让我有底气接着做更难的特教场景。于是我挑了一个最朴素也最典型的场景:《认识大自然——下雨了》。这是一张多感官识字卡片:同时面向听障和视障儿童,要「看得清、听得见、读得出」。

01

PART

背景:为什么是「下雨了」

BACKGROUND

特殊教育里,多感官教学是基本功。听障孩子靠「看」,视障孩子靠「听」,一套好的识字卡片必须两头都顾上。

视觉上:高对比、主体大、背景干净,孩子一眼就能抓住「下雨、雨滴、打雷」这几个核心词;

听觉上:旁白要形象,把声音的质感说出来——「淅淅沥沥」「轰隆隆」,让孩子光听就能在脑子里画出画面。

我做这张卡片,既是给培训攒一个真实案例,也是想验证一件事:AI 能不能把「专业老师才知道怎么做的卡片」,变成普通人动动嘴就能生成的东西。

02

PART

结果:从「跑通」到「满意」

RESULT

今天我一共做了两支视频,正好是一次「从能用到好用」的进阶。

第一步(借鉴我之前做的技能):《当愤怒来敲门时》。 我之前写过一个「丰子恺风格视频」技能,用 hyperframes + minimax-voice-clone 两个 Skill 就能把一段文案自动生成竖版视频。这次做特教卡片,我先拿那个技能改了一版《当愤怒来敲门时》——一支 30 秒的心理辅导动画,丰子恺风格、矢量手绘、平涂留白。把它跑通,等于把基础管线又验证了一遍,也给后面打好了底。

第二步:正式做特教识字卡《认识大自然——下雨了》。 有了前面的底子,我先照着同样的方法(hyperframes + MINIMAX)做了一版 15 秒视频。但说实话,效果不太理想——矢量手绘的画面虽然能跑通,却总觉得差点意思:绿叶不够「绿」、雨滴不够「透」、整体少了点儿童绘本该有的鲜活,毕意这个技能只是用来画线条图,太简单了。

第三次,我换了个思路:先让 Agnes 把三张图画出来,再把图拼进视频。 这一改,质感完全不一样了。Agnes 出的图,大绿叶上挂着晶莹的大雨滴、背景是干净透亮的蓝,色彩鲜艳、主体清楚,一看就是给小朋友看的。再配上克隆音色的旁白,以及雨声、雷声、小鸟叫,那段「下雨了」终于对了味。

说真的,如果让我再做一版,画面会更精致,节奏会更准。但普通人做出来的第一版就能用、而且还能变得更好,这恰恰是最大的价值——瑕疵不是丢人的,它是你能改得更好的证据。

03

PART

WorkBuddy 生成视频的工作流(三个 Skill)

WORKFLOW

做《当愤怒来敲门时》时,我只用了 hyperframes + MINIMAX 两个技能就跑通了基础管线;做到《下雨了》才把 Agnes 也拉进来负责出图,画质一下子提了上来。这次能跑通,靠的是 WorkBuddy 里三个各司其职的 Skill 打配合:

  • Agnes 文生图(agnes-image-gen)——负责「出图」。给它一句画面描述,它就生成高质感插画。免费、稳定,这次三张主图都靠它。
  • Minimax 声音克隆(minimax-voice-clone)——负责「出声」。上传一段你的声音,它就能克隆出音色,把文案念成自然旁白。识字卡里那些「淅淅沥沥」「轰隆隆」,就是它念出来的。
  • hyperframes——负责「合成」。把图片、旁白、音效按时间线排好,加上转场和字幕,渲染成一段成品视频。大字词卡(下雨 / 雨滴·打雷 / 太阳)也由它叠加,专门照顾听障孩子。

一句话总结这条流水线:Agnes 画图 → Minimax 配音 → hyperframes 拼成片。三个 Skill,各干各的活,串起来就是一支小小的制作团队。

04

PART

具体怎么做:从安装到成片(普通人照着做)

HOW-TO

很多人卡在第一步「这东西怎么装」。其实在 WorkBuddy 里,Skill 是「应用市场」式的,不用你懂命令行。下面把这次「下雨了」的真实路径,拆成任何人都能跟做的 7 步。

Step 0先把三个技能装进 WorkBuddy(安装)

打开 WorkBuddy 首页,点左侧的「专家」→「技能」,就进入了技能市场。

在列表里找到这三个技能:agnes-image-gen(agnes文生图,负责画图)minimax-voice-clone(负责配音)hyperframes(负责拼视频)。找到后点「试用」,就装好了——不用懂命令行,不用敲一行代码。

NOTE

一句话总结这条流水线:Agnes 画图 → Minimax 配音 → hyperframes 拼成片。三个 Skill,各干各的活,串起来就是一支小小的制作团队。

hyperframes 安装比较麻烦:它底层要依赖电脑上的几个本地程序(Node 工具、Edge 无头浏览器、ffmpeg 视频编码器)。如果安装时、或第一次运行报错,别自己折腾——把屏幕上的红色报错文字原样复制下来发给 WorkBuddy,它会自动帮你把缺的依赖程序装上。

Minimax 声音克隆也是同样的情况:接入时如果提示缺环境或依赖的报错,把错误丢给 WorkBuddy,它会同样帮你补齐。

一句话:安装报错不可怕,把错误交给 WorkBuddy,它比你更会装。

Step 1一句话加载技能(开始用)

装好后,在对话框里输入 @skill:技能名 就能调用,比如 @skill:agnes-image-gen。技能一加载,它自带的能力(画图引擎、配音接口、视频渲染器)就跟着就绪了。

Step 2接上声音:克隆一次你的音色

Minimax 需要两个凭证:你自己的 API Key 和 GroupId(去 MiniMax 开放平台注册后就能拿到)。WorkBuddy 会引导你填好、并帮你存成声音克隆的配置文件。声音克隆不是「直接开口念」,而是先上传一段你的录音、训练出一个专属音色,得到一个音色编号后,就让这个音色去念任意文案——所以你全程不用自己对着镜头念稿。

Step 3接上画图:Agnes 的 key 怎么来

Agnes 这个技能自带一把免费共享 key,零配置就能出图。后来我换成了自己的 key:做法是把它写进系统的「环境变量」AGNES_API_KEY,脚本优先读环境变量、没有再回退到共享 key——个人密钥不烤进技能文件,安全也灵活。普通人用这个 API 免费额度基本能应付日常出图,如果大量出图的话可以会员订阅。

Step 4组装成片:说清楚你想要什么

图片、旁白、音效都准备好后,用 hyperframes 把三者按「0–5 秒 / 5–10 秒 / 10–15 秒」三个镜头排好,加上转场和字幕,渲染输出 15 秒的 MP4 视频。文案、画面描述、音效标记,都是用自然语言说清楚就行,不用写代码。

Step 5用大白话指挥 AI 精修(不用开剪辑软件)

AI 生成的首版成片往往不是一步到位,得靠你用大白话指挥它微调,主要解决时长、节奏和细节上的问题。

拿时长来说,第一版合成出来经常超预算:43 秒(《当愤怒来敲门时》那支)和 17 秒(《下雨了》这支),离 30 秒 / 15 秒的目标都差不少。原因在于配音默认语速偏慢,尤其「一、二、三、四」这种数数句,拖得特别明显。修法也不复杂——精简文案、把语速提到 1.0~1.12 倍,两下就压到 30.7 秒和 15.0 秒了。

这一步说白了,就是你把 AI 的初稿「说」成真正能交付的成品,全程不用打开剪映之类的剪辑软件。

Step 6沉淀自己的可复用技能(可选但很重要)

如果你打算长期做这类视频,这步非常重要。它不是替代 Step 5 的精修,而是在交付成品之后,额外把整套制作流程沉淀成自己的可复用技能。

具体来说,就是把这次验证过的步骤、参数、踩坑经验整理成 WorkBuddy 里的技能配置,下次做同类视频直接一句话调用,不用从头再趟一遍雷。

技能越攒越多,制作门槛越来越低,从每次摸索变成直接复用。

05

PART

踩过的坑:安装与制作中遇到的问题

PITFALLS

这部分最值钱——光说「多简单」是骗人的,我确实前前后后花了不少时间,但最后发现根本不用自己硬扛。

安装和制作过程中确实遇到不少问题,比如环境报错、渲染卡死、适配出岔子,每一个单拿出来都够折腾半天。但我的思路很简单:遇到问题不自己钻研原理,直接把报错或现象描述给 WorkBuddy,让它去排查解决就好。

省下的是时间,换来的是顺利跑通的成片。

除了上面 Step 5 提到的「时长超预算」,还有几个典型坑:本地依赖装不全(Step 0 已说,把报错丢给 WorkBuddy 即可)、低内存机器渲染容易崩(让 WorkBuddy 用单进程+限核的低内存模式跑)、给大图加模糊滤镜会让截图渲染卡死(改用透明度+缩放的轻量转场)。这些坑都有解法,而且解法是可复用的经验,不是天堑。

06

PART

总结:工具平权是真的,前提是你愿意用

SUMMARY

回头看这件事,最让我感慨的,不是某个工具多厉害,而是一个完全不懂编程的人,只要愿意动手,就能在一下午里做出一段给特殊儿童用的教学视频。

过去,做这种带画面、带声音、带字幕的卡片,要么靠专业团队,要么靠老师自己手绘剪切,门槛不低。现在,AI 把「画图、配音、剪辑」这三件事,拆成了三个能对话的技能——你只要会说清楚想要什么,它们就替你干完。

当然,它也并不「无脑」:安装链路、低内存渲染、时长控制、模糊滤镜卡死……每一步都可能卡你半天。但关键是,这些坑都有解法,而且解法是可复用的经验,不是天堑。

这就是 AI 时代的工具平权:能力不再被少数人会的技术锁死,谁都能上手。但它有个前提——你得愿意用、愿意试,愿意在第一次不满意、甚至渲染卡死的时候,换个方法再来一次。

那场「下雨了」,连同更早那支《当愤怒来敲门时》,是下给从事特殊教育的老师以及特殊孩子的,也是下给我的:别怕工具新,动手就平权。

如果你看完觉得没那么精美,那说明你确实看得出门道。与其挑毛病,不如自己动手做一支,试试看你能作出什么自己满意的作品。

07

PART

延伸阅读

REFERENCE

  • 我是 Lulu,用 WorkBuddy 把 AI 工具变成普通人也能上手的实战经验。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见

在看
收藏

THANKS FOR READING