一张图变成视频已经不稀奇。真正难的是:只用 15 秒,让人看懂它在卖什么、适合放在哪里,还能记住一句话。
我第一次只让台灯亮起、镜头慢慢靠近。画面确实动了,却更像产品展示,不像广告。于是我重新做了一版:不再只追求运镜,而是安排书桌、床头和产品定版三个镜头,并把广告语真正放进成片。
最后得到的是一条完整的 15 秒竖屏广告:先提出夜晚用灯的场景,再展示它从书桌走到床头,最后用产品特写和一句广告语收尾。
下面左边是唯一输入图,右边是最终广告的定版画面。

左:唯一输入图;右:带场景和广告语的最终定版画面
输入仍然只有一张台灯图
为了不借用真实品牌,我准备了一张 AI 生成的原创台灯概念图。它没有 Logo、包装和现成场景,只有一盏奶白色柱状灯。
我没有给它编造护眼、续航、调光档位等未经验证的功能,只保留一个画面能够表达的卖点:一束适合书桌和床头的柔和暖光。
这次真正补进去的不是更多商品素材,而是广告结构:先让观众感受到夜晚光线太生硬,再看到台灯进入两个熟悉的生活场景,最后留下产品和一句能记住的话。

本次使用的唯一输入图:一张无品牌台灯概念图
先看成片:这次一眼能看出在卖什么
成片开头是一张偏暗的书桌,台灯亮起后,屏幕上出现“夜深了,别让光太用力”;接着镜头切到床头的书和眼镜,告诉观众它不只适合书桌;最后回到产品近景,用“暖光桌面灯,把夜晚,调成温柔模式”完成定版。
画面字幕和中文口播使用同一组广告语,不堆功能参数。场景负责让人理解用途,声音负责把感受说出来,最后一个镜头负责让人记住产品。
点击下方视频,可以查看这次重新制作的完整 15 秒成片。
15 秒不是一条运镜,而是三个广告镜头
时间 | 画面 | 广告语与作用 |
0-5 秒 | 偏暗书桌中,台灯被暖光点亮。 | “夜深了 / 别让光太用力”,先提出夜晚用灯的需求。 |
5-10 秒 | 切到床头、书和眼镜,台灯处于使用状态。 | “从书桌,到床头 / 一盏刚刚好”,说明它能进入哪些生活场景。 |
10-15 秒 | 从灯体细节拉回完整产品,停在干净定版。 | “暖光桌面灯 / 把夜晚,调成温柔模式”,留下品类和记忆点。 |
三个镜头分别负责需求、使用和记忆。少了前两个,视频就只剩产品在动;少了最后一个,观众看完场景却记不住到底在卖什么。
下面这张图就是三段画面的关键帧:书桌负责吸引注意,床头负责补足用途,产品定版负责收尾。

书桌、床头、产品定版:三段画面分别负责需求、使用和记忆
我怎么把一张图拆成三个镜头
我没有让模型一次生成一条包含所有变化的 15 秒长镜头,而是始终使用同一张产品图作为身份参考,分别生成三段 5 秒素材。这样每一段只解决一个问题,产品不容易突然变形,场景和镜头也更容易控制。
第一段只做“夜晚需要一盏灯”。场景设在偏暗的书桌,台灯从熄灭变成暖光点亮。画面里不放人物,不增加第二件产品,让观众第一眼就看到光线变化。
第二段只做“它能放在哪里”。台灯进入床头环境,旁边出现书和眼镜。这里不再重复亮灯动作,而是让产品处于已经被使用的状态,把用途从书桌自然延伸到床边。
第三段只做“最后记住什么”。镜头先看到灯体细节,再缓慢拉回完整产品。背景尽量干净,为产品名称和收尾广告语留出空间。
三段生成完成后,我再把它们按“需求—使用—产品”的顺序剪成 15 秒。这个顺序比单纯从远景推到近景更像广告,因为每次切换都在回答一个新问题。
广告语没有交给视频模型写
真正进入成片的六句文字是:
夜深了 别让光太用力 从书桌,到床头 一盏刚刚好 暖光桌面灯 把夜晚,调成温柔模式 |
这些字幕和对应的中文口播都是生成画面之后单独加入的。视频模型擅长补场景、光线和运动,但直接生成中文容易出现错字、变形或闪烁。广告语、品牌名和价格这类必须准确的信息,放到后期处理更可靠。
哪些是 AI 做的,哪些是后期完成的
MiniMax Design | 根据同一张台灯图生成书桌、床头和产品特写三段画面,并完成亮灯、光影变化和镜头运动。 |
后期处理 | 筛选并裁掉生成画面的白边,拼接三段镜头,加入准确的中文字幕与中文口播,并统一转场和声音响度。 |
我没有把三段 AI 素材直接首尾相接。生成视频的边缘和原生声音并不一致,如果不处理,切镜时会看到白边跳动,声音也会显得奇怪。最终版统一裁掉白边,并完全弃用三段素材的原音轨,只保留同一声音完成的三段中文口播。
这次实测的规格和消耗
测试日期 | 2026 年 8 月 20 日 |
工具版本 | MiniMax Design 3.0.0 |
输入 | 1 张 PNG 台灯图,896 × 1120 |
生成素材 | 3 段独立的 5 秒竖屏视频 |
最终输出 | 15.052 秒,768 × 1344,H.264,24 FPS |
音频 | AAC 双声道,48 kHz |
积分净变化 | 2701 → 1894,共减少 807 积分 |
807 积分是这次生成三段新素材前后观察到的余额净变化,不是官方承诺的固定价格。套餐、模型和当时的计费规则不同,实际消耗也可能变化。
我的结论
只给一张商品图,AI 的确可以补出过去需要重新布景拍摄的书桌、床头和产品特写。但“能生成三个镜头”还不等于“会做广告”。真正决定观众能不能看懂的,是先想清楚三个问题:它解决什么感受、会出现在哪里、最后要让人记住哪句话。
这次成片里,MiniMax Design 负责把静态产品带进不同场景,后期负责把广告语和节奏钉准。两部分合在一起,才从一段产品动效变成了一条能看懂的广告。
所以一张图确实可以成为广告的起点,但不能只让镜头拉近。至少要有使用场景、清楚的广告语和最后的产品记忆画面。
工具入口
MiniMax Design:https://design.minimaxi.com
夜雨聆风