夜雨聆风学习资料网

ARTICLE · 1123093

这个GitHub项目,让AI用代码做动效视频,不用任何软件和素材

这个GitHub项目,让AI用代码做动效视频,不用任何软件和素材
MOTION · 纯代码出片2026.10

做视频一定要会剪辑软件?

他 3 天做了 10 条动效视频

一分钱工具都没买

10% 靠提示词 · 90% 靠流程

提示词占一成,流程占九成

MIT 开源零付费

📦 7 Parts + Conclusion

👉 滑动

PART 01

一句大实话

10% 与 90%

PART 02

它不画视频

只写程序

PART 03

先出 4 张图

最值钱的一步

PART 04

看着高级

叠帧与弹簧

PART 05

时间账

1 秒等 1 分半

PART 06

声音

别信自动节拍

PART 07

自己考自己

每项 8 分

PART ///

写在最后

210 颗星

提示词占一成,提示词外面那套流程占九成

前几天刷到一篇长文,27 万浏览。

一个老外,用 Opus 5.5,3 天做了 10 多条动效视频。不是剪的,是写代码写出来的。没有 After Effects,没有 Remotion 授权,没有剪辑软件。做完之后,他把整套做法连代码带文档全部开源了。

我盯着屏幕看了半天,心情有点复杂。

7 月我用 Codex 加 HyperFrames 批量做过一批视频,当时觉得自己已经挺会了。看完这篇才发现,我卡在一个特别蠢的地方:我都是整条做完,才发现问题,然后从头再来一遍。

他不一样。每做一个镜头,先生成 4 张静态图,看完、改完,才开始渲染。就这一个顺序差别,我 7 月那几个晚上本来能省下来。

01

PART

他说了句大实话:提示词只占 10%

PROMPT 10% · HARNESS 90%

「The prompt is 10 %, the harness is 90 %.」

出自仓库内 motion-design 技能的说明文档,注明来源为 Opus 5.5 使用手册,日期 2026-10-02

翻译过来就是:提示词占一成,提示词外面那套流程占九成。

网上那种「一句话出片」,他说只对了一半。有的第一遍确实能用,但那是运气。他自己产品的宣传片,改了 5 次才交付。这句话写在仓库 README 里,原话是「用 Opus 5.5 加上这个技能,一共做了 5 个版本」,成片 24 秒 60 帧。

这句话我读了三遍。因为我一直以为,做不出来是因为提示词写得不够好。

02

PART

他到底怎么「用 Opus 做视频」?

HTML + PLAYWRIGHT + FFMPEG

先说清楚,不然容易误会:Opus 不会画视频。

它从头到尾只干一件事:写字。写 HTML,写一个 JavaScript 里的 seek(t) 函数,每一帧调一次,算出这一帧画面上所有东西的位置。

然后另一个人干活:Playwright 打开 Chromium,把 seek(t) 切成逐帧截图,ffmpeg 再把这几千张图串成 mp4。仓库 README 第一句话把这件事说得很明白:

...README

HTML + Playwright + ffmpeg. No After Effects, no Remotion license, no editing app.

所以本质上,这不是「AI 生成视频」,而是AI 写了一个确定性动画程序。

这里有个细节我认为是全篇最值钱的:seek(t) 必须没有状态。不能有 CSS transition,不能有 setTimeout,不能用一个变量记住「上一帧在哪」。因为渲染可以并行、也可以只重渲某几秒。一旦动画依赖「上一帧是什么」,重渲的结果就和原来对不上了。

他文档里写得很死:同一秒渲染两次,必须产出完全一样的帧。所以他连随机数都不用 Math.random,改用固定种子。

这一条决定整条路走不走得通。有状态就不能并行;不能并行,50 秒的片子就得排队等一小时。

03

PART

顺序,比技术值钱

FOUR STEPS · NO SKIPPING

这是我最想抄的部分。他的流程是固定顺序,一步都不许跳:

它规定的顺序

01 · Inputs 问你要品牌资料、logo、色板、截图、真实数字。没有 facts.md 就不许出现任何数据,每条数字都要带来源和日期。

02 · Beat map 算出 BPM 和拍长,每个镜头卡在拍上。音乐高潮必须落在关键画面上,且不能有超过 1 秒的静止。

03 · 4 张静态图 先出 4 张定妆照,自己看一眼,改完,才允许全量渲染。这一步就是我 7 月一直跳过的。

04 · 渲染与交付 正式渲染、检测异常闪帧、配音效、合流、打开文件看。交付时附真实说明,不吹。

第 3 步的分量,他放了一句很重的话:

「4 stills (or a one-frame-per-beat sheet) → look at them (Read) → fix → only then the full render.」

我 7 月的做法正好相反:直接全量渲染,渲完再看,发现构图不对、字太小、颜色不对,改一行,重渲一遍。而他每一步都有明确关卡,不过关就不往下走。

这里可以直接抄走的对话模板

想试的话,这段可以直接复制给 AI:

...复制给 AI

这个视频一共 24 秒,先别渲染。

按这个顺序做:

1. 先写 BEATMAP.md:算出 BPM 和每拍时长,把每个镜头排在拍点上,

   音乐高潮必须落在最关键的那个画面上。不许有超过 1 秒的静止画面。

2. 然后只生成 4 张静态图(STILL_01.png 到 STILL_04.png),

   覆盖:开场、中间转折、核心演示、结尾 logo。

3. 生成完停下来,什么都别做,等我回复。

我确认这 4 张之后,你再写 seek(t) 引擎和全量渲染。

注意最后那句「等我回复」。这个卡点就是省时间的全部秘密。

04

PART

怎么让动效看起来「高级」,而不是一眼 AI

ANTI-AI MOTION RULES

他文档里有一整节叫「反 AI 动效规则」,挑三条最实用的。

第一,一个画面同一时间只动一样东西

原话是 one thing moves at a time。听着简单,但回想一下那些一眼假的 AI 视频,基本都是所有元素一起飞进来。

第二,弹簧要有阻尼,不能弹成卡通

他规定弹簧的阻尼比 ≥ 0.72,只允许一点点过冲,而且明确禁止「卡通式回弹」。速度预设也分档:UI 按钮这类用 320/30,普通容器和镜头用 170/26,重字和大 logo 用 120/24。

第三,运动模糊不是靠软件加的,是「叠帧」叠出来的

这一条我之前完全没想到。他让 Playwright 在一帧的时间里拍好几个子帧,再用 tmix 混在一起:快速运动用 6 到 8 个子帧,慢的用 4 个。快门角度按 180° 走(代码里是 SHUTTER = 0.5)。

你 8 张画面叠在一起,就是电影感;叠 1 张,就是 PPT。

默片一句话测试

把做好的循环静音放给别人看,如果他一句话能概括(「按钮变成了播放器」),就成了;如果他犹豫,就是动得太多了。

05

PART

成本:1 秒成片,要等 1 到 1.5 分钟

WALL TIME · RENDER BUDGET

这部分必须说实话,不然容易误导人。

他文档里写得很清楚:8 个子帧的设置下,1 秒成片大约需要 1 到 1.5 分钟的实际等待时间。也就是一条 24 秒的片子,渲染要 25 到 35 分钟。超过 25 秒的片子,他会强制拆成 3 段并行渲染:55 秒的片子并行约 20 分钟,顺序跑要约 55 分钟。

再叠上他自己那个「5 次迭代」的记录:做一条能交付的片子,实际是一整天的事。

他省下的是买软件的钱,不是力气。这句话他在长文里也说了,我觉得挺诚实。

06

PART

声音:别信自动节拍,用能量自己找

SOUND DESIGN · -14 LUFS

音频这块他踩过坑,写得很细。

他的原话是 never trust an auto grid,意思是别信软件给的自动节拍网格。他自己的例子:某首曲子软件标 119.99 BPM,自动网格算出来的 drop 点偏了整整 2 拍。

正确做法是读音频能量曲线,自己找真正的 drop。音效也一样,他不凭感觉拖时间线,而是按实测峰值来放。音量也压得很保守,0.04 到 0.3 的增益。最后两遍 loudnorm 统一到 -14 LUFS,真峰值不超 -1.3。

音乐和音效全是免费素材:Mixkit 的曲子,或者直接用代码合成。

顺便说个很可爱的细节:他文档的音效库里有个音效叫 bread crunch,编号 118,法棍面包的咔嚓声,用来做某个「脆」的转场。这种音效我 7 月绝对想不到要去用。

说明一下:长文里提到的「软件标错两下」「法棍 4 声咔嚓」这两个具体数字,我在仓库文档里没找到对应记录,属于作者在 X 长文里的叙述,这里按原文保留。

07

PART

让 AI 自己看自己做的片子

SELF CRITIQUE · 7 SCORES

最后一步也是我觉得最妙的。片子渲完,他不自己一帧一帧看完,而是让 AI 自己审。

具体做法是把成片抽帧拼成一张 contact sheet(2 秒一帧、缩到 270 像素宽、拼成 6x5 网格),然后让 AI 看图,按 7 项打分:开头 2 秒的钩子、360 像素下的可读性、运动质量、变化节奏、构图、品牌与数据准确性、音画同步。

每项 1 到 10 分,他文档里就一句话:

「Repeat until every score is 8+.」

他还加了一句我特别认同的话:要当个苛刻的导演,别当个得意的作者。

他那张诊断表也值得抄,随手举三个:

他的诊断表(节选)

症状 某段成了「死拍」(画面不动)病因 镜头之间没接上节奏修法 回到 beat map,让每个镜头都有明确落点

症状 快速运动糊成一团病因 子帧给多了,出现鬼影修法 快速运动反而要减子帧,6 到 8 是上限

症状 循环接缝处跳一下病因 只检查了位置,没检查速度修法 首尾帧要同时对齐位置和速度

///

LAST

写在最后

TOOLS DON'T FIX TASTE

我 7 月那批视频,说实话不差。但我是用「做完一整条,再发现问题」的方式做的。

看完这篇最大的收获不是某个技巧,而是那个顺序:先出 4 张图,看一眼,再往下走。

以及那句「提示词 10%,流程 90%」。我们平时最容易被吸引的,是最前面那 10%:那句话怎么写、什么提示词更神。但真正决定成品能不能看的,是后面 90%:卡点、关卡、自检、迭代。

仓库实况 · 截至 2026-10-03

210 ★ · 21 fork · 32 次提交 · Python · MIT 协议

创建于 2026-09-27,最后一次推送 2026-10-02。作者是 Raphaël Aubry,Howseen 创始人。

地址:github.com/howseen-ai/claude-motion-design

它是 Claude Code 的一个 Skill,装法很简单:把 skill/motion-design 复制到 ~/.claude/skills/,再跑 pip install playwright imageio-ffmpeg numpy pillow 和 python -m playwright install chromium。

提醒一件事:仓库文档和长文里的技巧,都是给做产品宣传片准备的。想拿它做剧情、做真人、做口播,不适用。它只会做图表、界面、logo 这类东西的运动。

最后引用一句长文里的话收尾,对他这 3 天是个准确的总结:他省的是买软件的钱,不是省力气。不给样片,照样一眼 AI。

工具不解决审美,只解决重复劳动。剩下的那部分,还是得自己看、自己改、自己重来。

提示词占 10%,流程占 90%

先出 4 张图看一眼,这一步最容易跳过

数据说明:仓库元数据取自 GitHub API,复核时间 2026-10-03。流程细节、代码规范、性能数据均取自仓库内 README.md 与 skill/motion-design/SKILL.md。文中「7088 张截图」「3 天 10 多条视频」「27 万浏览」「改 5 次」等数字来自作者在 X 平台发布的长文,非仓库官方文档数据,引用时已逐处标注。

你做视频的时候,是先出图还是先渲染?

在评论区聊聊 

相关学习资料