2026 年 8 月,我把一份 1979 字的动画短片想法,交给了 AI 帮我做剧本。
里面什么都有:未来废土、风之族、14 岁男孩、吹口哨御风、高山草甸、守护动物、神庙、变异怪兽、人与自然共生。我挺得意的,觉得这世界观够完整了,下一步不就是丢给 AI,让它扩写成完整剧本吗?
结果 AI 没急着写。它先给我找了 7 个 bug。
这 7 个 bug,后来成了我整条 AI 电影工作流里最值钱的东西。下面是我走通的 8 个步骤,你可以直接照着用。

1979 字的《风之子》idea
步骤一:先分清楚,你手里是「设定」还是「剧本」
我那份 1979 字的 idea 长这样:
「未来废土世界,科技不发达,类似天空之城虫王的设定。每次飞之前吹一声口哨,风就会出现,借助风飞起来。男主 14 岁,父母飞行遇难。还有族群、神庙、怪兽。最终讲人与自然。」
有背景、有人物、有世界观、有主题。看起来很完整对吧?
但后来我才意识到:这不是剧本,这是一堆设定。而且设定之间彼此没有咬合。男主为什么要飞行?他的对手是谁?口哨和风的关系到底是什么?5-8 分钟的短片到底要讲哪一件事?
答不上来,就说明你还停留在「脑洞集合」阶段。
步骤二:先找对标,别闷头原创
我以前的工作流是反的:先有想法,再想办法证明它行得通。
更好的工作流是:先找已经跑通的东西,再把你的 idea 往上套。
先定类型:动画还是真人?真人里还要分言情、古装、恐怖、都市、伪纪录;动画里要分皮克斯、迪士尼、日本 2D/3D、中国水墨。每一种类型的观众期待不一样,不能混着来。
再找对标作品:我的 idea 参照宫崎骏调性,我就去拆《天空之城》和《风之谷》。不是看剧情,是看结构——它们怎么开场、怎么放世界观、怎么让男孩和女孩结伴、怎么把「工业文明」变成反派。
我以前怕「借鉴」显得没创意。现在发现正好相反:不借鉴,才会把想法憋死在半空。所有成熟的作品,都是站在前人肩膀上长出来的。

在小红书搜「天空之城」
步骤三:给 AI 喂参考图,比喂文字重要
我的剧本里写「很高的平原、高山草甸」。这种地方现实里有原型。
我现场去搜图:罗赖马山、五瓦山、四川大瓦山。最后锁定大瓦山——那种平地拔起的桌山,和「风之族居住的高原」气质完全对上,直接把图片贴进剧本里。

把大瓦山图片贴进剧本
我后来养成了一个习惯:每写一个场景,先找三张真实参考图。 不是给读者看的,是给 AI 看的。
人的想象力是有限的,如果你脑子里没有真实参照,AI 只能靠它自己的训练数据乱猜,出来的东西就飘。
步骤四:结尾先定死,中间交给 AI
剧本阶段的操作反而简单:把 idea 和参考图一起丢给 AI,让它先分析,再写。
但有个关键规则:结尾必须提前告诉 AI。
中间可以让它随便编,结尾一定要定死,不然故事容易烂尾。
我的结尾是:男孩和小女孩最终和自然一起努力,释放邪恶生物。AI 拿到这个锚点,中间的所有情节都不会跑太远。
我以前让 AI 自由发挥时,它动不动给我加一条爱情线、再加一个反转、再加一个神秘老人。不是 AI 坏,是我没给它边界。

WPS 里剧本+AI 分析
步骤五:让 AI 先挑刺,再动笔(这步最值钱)
AI 读完我的想法,没急着扩写,而是先列了 7 个问题。我看完冷汗都下来了,因为这些 bug 我自己一个都没发现。
挑三个最狠的:
1. 男主的缺陷不能只是「没熟练」
我原来的设计:男孩控制不好风,飞的时候摔倒受伤,这是技巧问题。
更好的设计是成长问题:「他把风当工具在命令,这恰恰就是毁灭世界的人类的思维方式。他学会先听、先问、先给,风才回应。」人物弧光 = 主题本身。一句话把整个故事点透了。
2. 口哨是灵魂机制,不能只靠台词
我原本想靠台词说「人与自然要和谐共处」。
不用台词。口哨就是主题。前面口哨是命令,结尾口哨是请求,观众自己就懂了。高潮处让男孩摘下父亲给的眼镜再吹口哨,胜过一百句台词。
3. 怪兽不能「战胜」,要「释放」
我原设定是「战胜另一个族群或邪恶生物」。
宫崎骏从不真正消灭怪物,王虫、幽灵公主里的邪神,全是被人类伤害的存在。把「战胜」改成「释放」。怪兽是被旧文明毒素扭曲的森林,安定下来——这才是主题真正落地。
这三个 bug 改完,我才敢说我有一个「剧本」。之前那只是「脑洞集合」。
步骤六:主题不是喊出来的,是机制变出来的
我最大的收获,不是 AI 有多聪明,是主题怎么落地。
我以前的写法:角色说一句金句,点题。
更好的写法:把主题变成一套机制。
男孩对风的态度,从「命令」变成「请求」,就是主题的视觉化。不需要旁白,不需要说教。观众看到口哨变奏的那一刻,情绪自己会上来。
这个思路不止做电影有用。做短视频、做口播、做知识类内容也一样:不要最后点题,要把题设计成结构。 观众自己感受出来的道理,比你说出来的有用十倍。
步骤七:让 AI 一次性出三份文件
bug 修完之后,让 AI 以导演口吻,一次性出三个文件——剧本、分镜、资产。
你不只要一个会飞的男孩,你还要:
他的名字、服装、配饰、配色 他住的村庄长什么样,风神庙长什么样 每个场景的「视觉毛点」(一眼能认出的焦点) 所有场景默认 3/4 角度,空间感更大
以前我直接跳到生成画面,角色每镜都换脸。现在我才知道:不是 AI 不听话,是我没给够约束。

剧本/分镜/资产三文件
步骤八:AI 绘画不是一键出片,是反复锁画风
到 AI 绘画阶段,我的噩梦又来了。

Higgsfield AI 生成的角色资产
我想要的飞行器是「背部长出来的木质翅膀,拉绳子打开」,结果 AI 画成了滑翔翼。
后来发现这很正常:画出来一看不对,就回去改剧本和设定。不是 AI 错了,是你没写清楚。
还有画风漂移。某些模型会把 2D 画成 3D,颜色乱飘。解决办法是「参考图锁定」——把想要的画风参考图塞进去,模型就被锁住了。目前画衣服细节最稳的版本是 8.2。
这一环节我最大的教训:不要指望 AI 一次画对。要准备改三到四轮。
给所有做内容的人
研究 AI 电影越久,我越觉得一件事:
AI 把「执行成本」打下来了,但「决策成本」一点没降。
定类型,是决策。 找对标,是决策。 判断男主缺陷该是什么,是决策。 决定高潮要不要摘眼镜,是决策。 锁画风、改提示词、取舍资产,全是决策。
这些不是「提示词技巧」,是导演基本功。你提示词再长,方向错了也是白搭。
如果你也做短视频、做口播、做小红书、做知识内容,这套思路完全通用:
不要写完脚本就直接生成画面,先问「这句台词在画面上要证明什么」。 不要一次让 AI 干身份+动作+情绪+文字,一次只让它解决一个问题。 不要把「风格统一」交给运气,把不能变的东西写成清单。
我现在显示器上多了一句话
「先判断拍什么,再问 AI 怎么拍。」
AI 不是导演,是副导演。它能在你判断清楚之后,帮你跑得快一点。
我把那 1979 字的 idea 重新写了一遍。现在它还在改,角色名、飞行翅膀、风神庙的细节都没定。但没关系了,因为我知道问题在哪。
如果你也在用 AI 做视频,评论区说说你最大的坑是什么。我大概率也踩过。
夜雨聆风