用同一句提示词分别输入 Midjourney 和 Runway,结果可能天差地别。本文从时间维度、镜头语言、物理逻辑、风格一致性、参数体系 5 个维度,系统拆解 AI 生图与生视频提示词的本质区别,帮你建立跨模态提示词思维,避免「生图逻辑套视频」的常见误区。
上周我做了一个实验:把同一句提示词——「一位穿红色连衣裙的女士走在雨中的巴黎街头」——分别输入 Midjourney v6 和 Runway Gen-3。
Midjourney 产出一张令人惊艳的静态画面:雨滴凝固在半空,光影层次分明,氛围感拉满。
Runway 生成的视频却让人困惑:女士走路像在飘,雨滴忽大忽小,第三秒时她的发型突然变了。
问题不在工具,而在提示词逻辑本身。
生图提示词和生视频提示词,看起来都是「用文字描述想要的画面」,但底层思维完全不同。理解了这一点,你的 AI 视频产出质量会有质的飞跃。
一、静态快照 vs 动态叙事:时间维度的本质差异
生图提示词的底层思维是快照思维——你只需要描述某一个瞬间的状态。
「一只猫坐在窗台上,阳光透过百叶窗洒落,温暖午后。」
这句话对生图来说足够完整。AI 会补全光影、构图、质感,产出一张精美的静态图。
但如果直接套用到视频生成上,结果很可能是:猫纹丝不动,画面像一张 JPG 被强行拉成视频——因为 AI 不知道这只猫接下来该做什么。
生视频提示词必须考虑时间线。
一个有效的视频提示词,本质上是在描述一个「事件」而非一个「状态」。
对比一下:
- ❌ 生图逻辑(静态):「一只猫坐在窗台上」
- ✅ 视频逻辑(动态):「午后,一只橘猫跳上窗台,伸了个懒腰,然后蜷缩起来打盹,阳光随时间缓慢移动」
关键方法:时间轴描述法
把视频想象成一条时间轴,你需要标注关键节点上的动作或状态变化:
[0-2 秒] 起势/引入 → [2-5 秒] 核心动作 → [5-8 秒] 收尾/情绪落点比如描述一个咖啡拉花视频:
「特写镜头,0-3 秒缓缓推进到咖啡杯,3-6 秒牛奶倒入奶缸产生白色漩涡,6-8 秒拉花在液面逐渐成形,一朵叶子图案清晰呈现。」
这种「时间戳+动作」的结构,能让 AI 更准确地理解动态意图。

左侧静态快照思维 vs 右侧时间轴动态叙事示意图
二、镜头语言:视频提示词的「导演思维」
这是生图提示词和生视频提示词最直观的差异。
生图提示词几乎不涉及镜头。你可以写「一位老人坐在公园长椅上」,Midjourney 会自动选择一个不错的视角。
但视频不行。你不告诉 AI 怎么「看」,它就会自己瞎看。
必须掌握的核心镜头术语:
镜头运动:
推镜头(push in / dolly in):画面从远到近,聚焦主体拉镜头(pull out / dolly out):从特写拉远,展现场景摇镜头(pan):镜头水平或垂直转动跟镜头(tracking shot):镜头跟随主体移动航拍(aerial shot / drone shot):从上往下的俯瞰视角
景别:
特写(close-up):聚焦面部或物体细节中景(medium shot):人物膝盖以上全景(wide shot):展示完整场景鸟瞰(bird's eye view):正上方向下看
改写对比:
- ❌ 无镜头语言:「一个人在城市街道上行走」
- ✅ 有镜头语言:「中景跟镜头,一位穿黑色风衣行人在雨中行走,镜头始终保持平行跟随,背景是模糊的城市灯光,慢速推进到面部特写」
后者生成的视频质量会显著更高,因为它给了 AI 明确的「导演指令」。
一个实用技巧: 如果你不确定该用什么镜头,可以借鉴电影语言。想制造紧张感用快速推镜头,想营造孤独感用缓慢拉镜头,想展示环境用航拍开场。
三、运动描述与物理逻辑:为什么 AI 视频容易「穿帮」
AI 视频生成中最让人出戏的问题,往往不是画面不好看,而是物理逻辑崩了。
常见问题包括:
- 人物走路像滑行,脚不落地
- 水流往上飘,重力消失
- 物体在帧与帧之间突然变形
- 动作不连贯,像 PPT 翻页
这些问题很大程度上可以通过提示词中的物理约束词来缓解。
有效的物理约束表达:
- 「符合自然重力规律」
- 「连贯的步行循环,双脚交替落地」
- 「液体沿杯壁缓慢流淌,符合流体动力学」
- 「动作过渡平滑,无突变」
- 「物理真实的布料飘动」
不同工具对物理的理解能力差异很大:
Sora 在物理模拟上表现突出,能较准确地处理重力、碰撞和流体。Runway Gen-3 在人物动作连贯性上较强。Pika 则在风格化视频中物理逻辑相对宽松。
了解各工具的特性,能帮助你调整提示词策略——在物理模拟强的工具上可以更细致地描述物理过程,在物理模拟弱的工具上则应避免过于复杂的物理场景。
四、风格一致性:从单帧到多帧的挑战
生图只需保证一张图内部风格统一,生视频则要保证几十甚至上百帧之间风格连贯。
这是视频生成中最棘手的挑战之一。常见问题:
- 人物发型/服装在视频中突然变化
- 场景色调忽冷忽热
- 画风在写实和卡通之间反复横跳
解决方案:风格锚定词
在提示词中明确指定一个「锚点风格」,让 AI 以此为基准保持一致性:
「整体风格为电影《银翼杀手 2049》的视觉风格,赛博朋克美学,橙青对比色调,全程保持一致。」
人物一致性策略:
- 描述具体而非笼统:「一位短棕色卷发、穿深蓝色西装的 30 岁女性」 比 「一位女士」 好得多
- 指定固定特征:「左脸颊有一道细疤」这种独特标识能帮助 AI 锁定人物
- 避免过度复杂的服装细节,减少 AI「记不住」的概率
对于长视频,还可以考虑分段生成再拼接的策略,每段提示词中重申关键视觉锚点。

风格一致性策略对比,左=无锚定词导致风格漂移,右=有锚定词保持连贯
五、参数体系差异:各平台提示词的特殊语法
不同工具的提示词参数体系差异很大,了解这些差异能让你少走弯路。
通用参数(大多数工具支持):
- 风格描述:
cinematic、photorealistic、anime style - 画质描述:
8K、highly detailed、sharp focus - 光线描述:
golden hour lighting、dramatic shadows
平台专属参数:
| 工具 | 专属语法 | 示例 |
|---|---|---|
| Midjourney | --ar 比例、--style 风格化、--v 版本 | --ar 16:9 --style raw --v 6 |
| DALL·E | 无特殊参数,纯自然语言 | 直接描述即可 |
| Runway Gen-3 | motion brush 控制运动区域 | 通过界面操作而非文本 |
| Pika | /animate 命令、运动强度参数 | motion: high |
| Sora | 自然语言为主,支持时长指定 | generate a 10-second video of... |
跨平台通用模板:
[镜头类型] + [主体描述] + [动作/事件] + [环境] + [风格] + [时间结构]示例:
「航拍镜头,一位穿白色连衣裙的女性在花田中奔跑,风吹动裙摆和花海形成波浪,电影感暖色调,开场缓慢下降至地面,跟随人物穿过花田,最后拉远展示整片花海。」
这个模板在大多数视频生成工具上都能获得不错的结果。
从提示词工程师到跨模态创作者
回到开头的实验——为什么同一句提示词在生图和生视频上结果差异这么大?
因为生图是在「画一个瞬间」,生视频是在「讲一个故事」。
两者的底层逻辑差异决定了提示词结构的根本不同:生图靠「状态描述」,生视频靠「时间叙事」。
AI 内容创作正在从「单模态调参」走向「跨模态叙事」。未来最有竞争力的创作者,不是能背最多提示词模板的人,而是理解不同模态底层逻辑、能灵活切换思维框架的人。
建议你现在就做一件事: 选一个你熟悉的生图提示词,用本文的方法改写成视频提示词,实际跑一遍,对比差异。实践一次,胜过阅读十篇教程。
觉得有用?点个关注,持续获取优质内容。
夜雨聆风