ARTICLE · 1145834
两个国产 AI 工具,一条短视频,从脚本到成片,零剪辑
两个国产 AI 工具,一条短视频,从脚本到成片,零剪辑
工具太多太乱,反而出不了片。把分工定死,流程就顺了。
TL;DR
想做 30 秒 AI 短视频,不用全用海外工具。豆包负责动脑,元宝负责出图,剪映负责成片。三个工具各司其职,从零出片。
先说分工:把工具各管一摊,流程就顺了
最近很多朋友问我,想做 AI 短视频,但工具太多、流程太乱,到底怎么组合才高效。
我反复测下来,豆包和元宝其实是一对非常互补的组合。豆包负责动脑,元宝负责出图,再配合剪映这类剪辑工具,就能把一条短视频从 0 到 1 做出来。
很多人一开始会把工具混用,导致效率很低。我的经验是,把三个工具各管一摊:
豆包负责创意构思、脚本撰写、分镜拆解、提示词优化、图生视频提示词撰写、剪辑灵感。
元宝只负责生成图片,把分镜画面变成可视化素材。这里有的小伙伴可能就要问了,为什么生图要用元宝,而不是豆包等国产模型呢?就这么和你说吧,现在为止,公认生图质量最NB的是MJ,而在众多国产模型中,艺术感能和MJ最接近的,元宝是其中的佼佼者。但是,千万不要在元宝里进行图生图的迭代,它产生的黑噪点,会让你看的怀疑人生。以后大家做设定图,可以用元宝和其它模型做做对比。
剪辑工具负责把动态片段整合,加音乐、加字幕、做转场。
这样分工非常清晰,豆包解决内容怎么写、画面怎么动,元宝解决画面怎么做,最后剪辑工具负责把片子串起来。
第一步 · 让豆包出分镜:脚本做出来,后面画面才不散
做短视频,第一步一定不是画图,是先把脚本做出来。脚本没做好,后面画面再漂亮也容易散。我一般会直接让豆包帮我生成一份可落地的分镜脚本。
大家可以直接复制下面这个提示词:
我想制作一条 30 秒的短视频,主题是【这里替换成你的主题】。请用表格形式输出完整分镜脚本,包含分镜编号、时长、画面描述、字幕文案、背景音乐风格、音效、AI 绘图提示词。要求画面有镜头感,适合短视频呈现。
举个例子,如果你想做一条红酒短视频,把主题替换掉就行。豆包输出脚本后,重点检查两点,画面是不是完整,有没有漏掉酒杯、人物、产品特写这些关键元素。提示词是不是具体,如果描述太笼统,画面出来就会普通。
发现问题不用慌,直接继续让豆包改。比如「这个分镜缺少酒杯画面,帮我补一个画面描述和 AI 绘图提示词」「这一屏画面不够高级,重新优化成更有质感的 AI 绘图提示词」。这一步的目标很简单,把每个分镜都变成一张可以直接交给元宝生图的画面提示词。
第二步 · 元宝逐镜生图:生成一张、核对一张
六分镜静态帧 ·

镜1静态帧

镜2静态帧

镜3静态帧

镜4静态帧

镜5静态帧

镜6静态帧
脚本确定后,就轮到元宝上场了。但这里要注意,元宝只负责生图,不要把写脚本、想创意、做剪辑的任务都压给它。我们把豆包生成的绘图提示词,逐一分镜复制给元宝,让它输出对应的静态画面。
我的操作方式是,把豆包生成的每个分镜提示词,单独复制到元宝。生成一组画面后,先筛选最符合脚本的一张。如果画面不对、不喜欢、或者风格跑偏,就把问题告诉豆包,让豆包重新优化提示词,再回元宝生成。直到每个分镜都有一张可用图片。
这里分享一个小技巧,不要一次生成完所有图就结束。最好生成一张、核对一张,确认画面、产品、风格、色调都统一后,再继续做下一张。这样后面剪辑的时候,片子整体感会更强。
第三步 · 图生图迭代:每版只改一个变量,画面渐进不跳变
在出最终画面之前,我用的是「图生图」来迭代,不是一次成型。把初版图当成垫图,再喂给元宝微调,一步步把画面推到可用。下面是镜3和镜6的迭代过程,两张图让自己的产品融入视频:
图生图迭代过程 ·
·

V1【产品图,使用豆包替换镜3、镜6中的产品】

V2【镜3】

V2【镜6】
使用豆包图生图基本不会破坏原图的光影效果和镜头感,但有一点很明显的BUG。镜3的酒瓶是悬浮的,这里我没有对其进行下一步的迭代。
元宝产出全部静态图片之后,图生视频的提示词,这一步还是交由豆包完成。动态效果依旧借助图生视频工具,我们用到的仍然是豆包。
帮我为这张画面生成一段图生视频提示词,要求镜头运动自然,节奏缓慢,质感高级。
把豆包写好的动态提示词连同图片一起导入图生视频工具,每个分镜生成 3 到 6 秒的动态片段。导出后统一保存,准备进入剪辑环节。
补一个偷懒方法:因为豆包现在用的 Seedance 2.5 支持 30S 视频音画直出,所以也可以把六张参考图和豆包生成的分镜表、旁白直接扔给豆包,一条 30 秒、带画面带声音的成片就直出了,不用逐镜再生动态、再单独配音。多一种方法,看你选。
第四步 · 剪辑灵感:让豆包给你三个转场方案再挑
画面有了,动态片段也有了,接下来就是剪辑。很多人会卡在这里,画面怎么连、转场怎么做、音乐怎么加。
我的建议是,别硬想,直接让豆包给你灵感。比如你可以问,「这两个画面之间适合做什么转场」「红酒倒入酒杯的画面,适合加什么音效」「产品特写镜头,怎么剪辑更有高级感」。
我有个很实用的技巧,不要只让豆包给一个方案,让它给你三个,你再挑最适合的。豆包可能会建议淡入淡出、圆形蒙版、遮挡转场、光影闪白、推拉镜头衔接。你选一个最贴合风格的,再去剪映实现。
第五步 · 剪映成片:五小点把素材串成 30 秒成片
最后一步,把所有素材导入剪映,按这个顺序操作。
一,导入动态分镜片段。把图生视频工具输出的动态片段,按分镜顺序导入剪映。
二,调整时长和节奏。特写镜头 2-4 秒,氛围镜头 3-5 秒,产品镜头 2-3 秒,结尾镜头 3-4 秒,总时长控制在 25-30 秒。
三,添加转场。画面切换柔和用淡入淡出,有倒入、扫过、遮挡动作用遮挡转场,想做高级质感用圆形蒙版或光影转场。
四,添加音乐和音效。让豆包提前建议音乐风格,音效选倒酒声、玻璃轻碰声、快门声这些,让视频更真实。
五,配音和字幕。如果需要旁白,用 AI 配音工具生成,语速不要太快,音色贴合视频调性。字幕剪映自动生成后再手动调整字体和位置。
成品视频 · 30s 完整成片,无剪辑
镜3的BUG在视频里更明显,这种情况,有两个选择1是修改镜三静态帧提示词重新生图然后重新出镜3的视频,再在剪辑软件中替换片段,或者使用剪辑工具将镜3片段整体放大,使酒瓶底部出镜,全大幅度减轻BUG感。
实操案例 · 30s 红酒广告:一套可直接抄的完整参数
上面讲完流程,下面给一个完整可抄的案例,30 秒红酒广告。整体调性,高级静谧、轻奢氛围感,适合短视频平台。
BGM 风格,低沉舒缓的钢琴纯音乐,轻微大提琴铺垫,慵懒高级,不压人声旁白。配音选沉稳温润解说音,语速偏慢。
六镜图生视频提示词,豆包逐镜输出,直接送图生视频工具。镜 1 镜头缓慢向前推进,葡萄园晚风吹动枝叶,落日光影流动,电影氛围感。镜 2 镜头静止,葡萄水珠微微反光,光影极轻微,动态克制。镜 3 镜头缓慢横向平移,光影明暗变化,安静高级。镜 4 红酒缓缓倒入高脚杯,酒液弧线流畅,光影随酒液流动。镜 5 酒杯小幅晃动,酒液轻柔旋转,挂杯缓缓形成。镜 6 镜头缓慢拉远,光斑闪烁,画面静谧,氛围拉满。
剪辑灵感,镜 3 到镜 4 用圆形蒙版转场,从酒桶画面过渡到倒酒特写,高级丝滑。其余镜头用淡入淡出。字幕用细衬线白字,加轻微黑色描边,放画面底部,不遮挡主体。旁白音量低于 BGM。
旁白全文,时光沉淀,风味自现。一颗好葡萄,酝酿醇厚果香。橡木陈酿,锁住层次香气。缓缓入杯,邂逅宝石红的浪漫。轻摇酒杯,感受绵长回味。一席佳酿,敬每一个温柔时刻。整段直接丢 AI 配音。
干货清单 · 六步走:整理成一张能直接抄的清单
整理成一张能直接抄的清单,六步走:
① 豆包生成分镜脚本表格② 提取每条 AI 绘图提示词,复制到元宝逐镜生图③ 拿每张图交给豆包,生成对应图生视频提示词④ 图片加动态提示词送图生视频工具,导出 6 段动态短片⑤ 豆包构思转场、音效搭配方案⑥ 剪映导入片段,配音、加字幕、配乐,输出成片。
你学会了吗?
下期写什么,你说了算。我手上还攒着一堆没拆的翻车现场。你最近在哪个环节返工最多,评论区说一句,或后台直接甩给我,哪怕就三个字。我挑提到最多的那个,下一篇就拆它。

寒社视觉
干过平面、杂志、报纸,现在做 AI 漫剧。纸媒教我的最后一课是:稿子要改到最后一秒;AI 教我的第一课是:改到最后一秒也没用,它有自己的想法。
作品有《余念》《姐姐,别躲了》《婴宁的歪理公寓》《黄沙镇》。
别人分享经验,我分享病历——坑全是自己掉进去的,掉得还挺整齐。关注我,你先别踩。
// EOF
觉得有用?点赞在看转发,让更多做 AI 漫剧的人少走弯路。