
昨天打算把一段中文日记制作 3:4 竖屏手绘动画。剪映拆分文案、PS 绘制画面、AE 制作动效、PR 最终合成,来回切换多款工具效率极低,文本与画面对齐反复调试非常耗费精力。后来翻到开源项目 story-to-handdrawn-video,整条流水线封进了 Agent Skill。装进 Codex / Claude Code / Kimi Code 后,一句话提示词就能出片。MIT 协议,Remotion 工程化底座。
核心定位:一套面向 AI Agent 的视频 Skill,并非独立软件
story-to-handdrawn-video 并非独立 GUI 软件,也不能直接当作普通 CLI 命令工具单独运行;整套项目以Agent Skill为核心范式,需要搭载支持 Skill 的 AI 编码代理使用。仓库里两部分:渲染器项目在根目录(Remotion 工程,负责分镜、动效、渲染),Codex/Agent Skill 在 skill-package/(装进 Agent 后用自然语言驱动渲染器)。装进哪个 Agent 都行——Codex、Claude Code、Kimi Code 三条路径都支持。README 原话:「全部通过自然语言驱动,分句、分镜、图片生成、导入、渲染由 Agent 按 Skill 约定自动完成」。你不再跑脚本,你跟 Agent 说话。
底层是 Remotion——React 写视频,渲染过程是工程化的、可检查、可重放,不是黑盒。这跟通用 AI 视频工具追写实或电影感的路线完全错开。
标志性动效:三层渐进渲染,手绘漫画专属视觉逻辑
手绘日记漫画的视觉语言被它拆成了 4 项核心动效:中文故事自动分句和动态分镜(保留原文措辞,一个完整句子一个节拍),自动拆分上下区(上方文字区 + 下方插画区),本地生成对齐的黑白层(跟彩色插画位置严格对齐),从左到右揭示(文字逐步显现 → 黑白线稿平滑展开 → 彩色图层完整渲染)。再加上可选的右下角卷页翻书转场——保留原始页面,从右下角卷起,纸背保留淡化的原页纹理。这种动效语言不是凭空造的,是从手绘日记漫画这个细分体裁里抽象出来的。
素材生成双路线:内置生图 / 自定义上传手绘稿
图片生成有两条路径:默认走 Codex Image2(不需要 OPENAI_API_KEY,开箱即用),OpenAI API 只在显式要求时才走(需要 OPENAI_API_KEY)。也可以不上 AI 生图,直接上传已有漫画页或手绘图片——按文件名顺序生成,保持原构图不裁剪。值得提的一个细节是敏感场景护栏,README 明确写了:「遇到时间跳跃、指代不明、医疗场景或年龄敏感角色时,建议先让 Agent 给出视觉规划(两位场景编号为键的 JSON),确认后再生成」。这是内容工具该有的克制,不是给你随便生成任何东西的护身符。
标准化输出:3:4 竖屏,区分预览 / 正式版本
输出规格是这个项目值得专门讲的一块:正式 1080×1440,预览 720×960(缩放比 1:1.5),H.264 编码,全部静音。四种路径分别是故事文本正式/预览(out/picture_silent.mp4 与 -preview.mp4)和上传图片正式/预览(out/uploaded_picture_silent.mp4 与 -preview.mp4)。3:4 竖屏适配短视频平台。静音是为了留口子给后期——配音和 BGM 是后期工作,不在 Skill 范围内。这种「职责清晰划边」的工程做法,比那些承诺「一条龙出片」的工具更可信。
| 输入 | 模式 | 路径 | | --- | --- | --- | | 故事文本 | 正式 | out/picture_silent.mp4 | | 故事文本 | 预览 | out/picture_silent-preview.mp4 | | 上传图片 | 正式 | out/uploaded_picture_silent.mp4 | | 上传图片 | 预览 | out/uploaded_picture_silent-preview.mp4 |
极简上手:一段提示词驱动完整视频流水线
装好 Skill 后,用法就是跟 Agent 说话。故事文本走默认提示词:
使用 $story-to-handdrawn-video 把这段故事生成可后期配音的手绘动画。<在这里粘贴故事文本>上传图片走顺序(把这几张图片按顺序生成手绘动画 后跟完整路径列表),翻书效果是独立开关(做成翻书效果的手绘动画,保留原始页面从右下角卷页),预览先行可以低成本试错(先给这个故事生成一个预览版,720×960 确认后再出正式版)。节奏控制有个隐藏技巧:故事里按句分行就是一个节拍,想拉长镜头节奏直接分行就行,不用学参数。
项目优势、适用人群与运行硬性约束
工程化亮点集中在 3 项:Remotion 底座(React 写视频,渲染过程可检查可重放);Skill contract 修改需充分理由(README 明确警告 skill-package/ 与 src/、scripts/ 是核心);字体随附(站酷马善政毛笔 Ma Shan Zheng,SIL Open Font License),不需要单独装。适合的是 4 类读者——内容创作者(小红书/抖音/视频号做手绘日记体短视频)、AI Agent 开发者(看 Skill contract 设计范式怎么落地)、教育/亲子内容生产者(绘本故事视频化)、短视频 MCN(手绘日记漫画这个细分赛道降本)。硬约束别忽视:Node.js 20+ / Python 3.10+ / FFmpeg / Chrome 共 4 项依赖,缺一不可;它是 Agent Skill,不是单独 CLI——你得先装好支持的 Agent 才能用。
https://github.com/gnipbao/story-to-handdrawn-videostory-to-handdrawn-video 是 Agent Skill 范式的实践。如果你在做内容创作或者研究 Skill contract 怎么设计,clone 下来跑一段你自己的中文故事最直观。项目主打手绘日记漫画单一视觉风格,暂不支持自定义多种画风、镜头推拉运镜;视频仅输出画面轨道,配音、背景音乐、字幕精细对齐均需要后期二次处理。
如果你对这篇文章感兴趣,欢迎关注!
开源长篇写作工具:告别 AI 健忘症,解决 AI 写小说人设崩坏
DramaClaw 开源短剧流水线:自建 AI 短剧生产线,解决角色跨集穿帮
夜雨聆风