乐于分享
好东西不私藏

只给一张台灯图,AI 真能做出广告吗?我用 MiniMax Design 做了条 15 秒成片

只给一张台灯图,AI 真能做出广告吗?我用 MiniMax Design 做了条 15 秒成片

一张图变成视频已经不稀奇。真正难的是:只用 15 秒,让人看懂它在卖什么、适合放在哪里,还能记住一句话。

我第一次只让台灯亮起、镜头慢慢靠近。画面确实动了,却更像产品展示,不像广告。于是我重新做了一版:不再只追求运镜,而是安排书桌、床头和产品定版三个镜头,并把广告语真正放进成片。

最后得到的是一条完整的 15 秒竖屏广告:先提出夜晚用灯的场景,再展示它从书桌走到床头,最后用产品特写和一句广告语收尾。

下面左边是唯一输入图,右边是最终广告的定版画面。

左:唯一输入图;右:带场景和广告语的最终定版画面          

输入仍然只有一张台灯图

为了不借用真实品牌,我准备了一张 AI 生成的原创台灯概念图。它没有 Logo、包装和现成场景,只有一盏奶白色柱状灯。

我没有给它编造护眼、续航、调光档位等未经验证的功能,只保留一个画面能够表达的卖点:一束适合书桌和床头的柔和暖光。

这次真正补进去的不是更多商品素材,而是广告结构:先让观众感受到夜晚光线太生硬,再看到台灯进入两个熟悉的生活场景,最后留下产品和一句能记住的话。

本次使用的唯一输入图:一张无品牌台灯概念图          

先看成片:这次一眼能看出在卖什么

成片开头是一张偏暗的书桌,台灯亮起后,屏幕上出现“夜深了,别让光太用力”;接着镜头切到床头的书和眼镜,告诉观众它不只适合书桌;最后回到产品近景,用“暖光桌面灯,把夜晚,调成温柔模式”完成定版。

画面字幕和中文口播使用同一组广告语,不堆功能参数。场景负责让人理解用途,声音负责把感受说出来,最后一个镜头负责让人记住产品。

点击下方视频,可以查看这次重新制作的完整 15 秒成片。

已关注
关注
重播 分享

15 秒不是一条运镜,而是三个广告镜头

时间

画面

广告语与作用

0-5 秒

偏暗书桌中,台灯被暖光点亮。

“夜深了 / 别让光太用力”,先提出夜晚用灯的需求。

5-10 秒

切到床头、书和眼镜,台灯处于使用状态。

“从书桌,到床头 / 一盏刚刚好”,说明它能进入哪些生活场景。

10-15 秒

从灯体细节拉回完整产品,停在干净定版。

“暖光桌面灯 / 把夜晚,调成温柔模式”,留下品类和记忆点。

三个镜头分别负责需求、使用和记忆。少了前两个,视频就只剩产品在动;少了最后一个,观众看完场景却记不住到底在卖什么。

下面这张图就是三段画面的关键帧:书桌负责吸引注意,床头负责补足用途,产品定版负责收尾。

书桌、床头、产品定版:三段画面分别负责需求、使用和记忆          

我怎么把一张图拆成三个镜头

我没有让模型一次生成一条包含所有变化的 15 秒长镜头,而是始终使用同一张产品图作为身份参考,分别生成三段 5 秒素材。这样每一段只解决一个问题,产品不容易突然变形,场景和镜头也更容易控制。

第一段只做“夜晚需要一盏灯”。场景设在偏暗的书桌,台灯从熄灭变成暖光点亮。画面里不放人物,不增加第二件产品,让观众第一眼就看到光线变化。

第二段只做“它能放在哪里”。台灯进入床头环境,旁边出现书和眼镜。这里不再重复亮灯动作,而是让产品处于已经被使用的状态,把用途从书桌自然延伸到床边。

第三段只做“最后记住什么”。镜头先看到灯体细节,再缓慢拉回完整产品。背景尽量干净,为产品名称和收尾广告语留出空间。

三段生成完成后,我再把它们按“需求—使用—产品”的顺序剪成 15 秒。这个顺序比单纯从远景推到近景更像广告,因为每次切换都在回答一个新问题。

广告语没有交给视频模型写

真正进入成片的六句文字是:

夜深了                  别让光太用力                  从书桌,到床头                  一盏刚刚好                  暖光桌面灯                  把夜晚,调成温柔模式

这些字幕和对应的中文口播都是生成画面之后单独加入的。视频模型擅长补场景、光线和运动,但直接生成中文容易出现错字、变形或闪烁。广告语、品牌名和价格这类必须准确的信息,放到后期处理更可靠。

哪些是 AI 做的,哪些是后期完成的

MiniMax Design

根据同一张台灯图生成书桌、床头和产品特写三段画面,并完成亮灯、光影变化和镜头运动。

后期处理

筛选并裁掉生成画面的白边,拼接三段镜头,加入准确的中文字幕与中文口播,并统一转场和声音响度。

我没有把三段 AI 素材直接首尾相接。生成视频的边缘和原生声音并不一致,如果不处理,切镜时会看到白边跳动,声音也会显得奇怪。最终版统一裁掉白边,并完全弃用三段素材的原音轨,只保留同一声音完成的三段中文口播。

这次实测的规格和消耗

测试日期

2026 年 8 月 20 日

工具版本

MiniMax Design 3.0.0

输入

1 张 PNG 台灯图,896 × 1120

生成素材

3 段独立的 5 秒竖屏视频

最终输出

15.052 秒,768 × 1344,H.264,24 FPS

音频

AAC 双声道,48 kHz

积分净变化

2701 → 1894,共减少 807 积分

807 积分是这次生成三段新素材前后观察到的余额净变化,不是官方承诺的固定价格。套餐、模型和当时的计费规则不同,实际消耗也可能变化。

我的结论

只给一张商品图,AI 的确可以补出过去需要重新布景拍摄的书桌、床头和产品特写。但“能生成三个镜头”还不等于“会做广告”。真正决定观众能不能看懂的,是先想清楚三个问题:它解决什么感受、会出现在哪里、最后要让人记住哪句话。

这次成片里,MiniMax Design 负责把静态产品带进不同场景,后期负责把广告语和节奏钉准。两部分合在一起,才从一段产品动效变成了一条能看懂的广告。

所以一张图确实可以成为广告的起点,但不能只让镜头拉近。至少要有使用场景、清楚的广告语和最后的产品记忆画面。

工具入口

MiniMax Design:https://design.minimaxi.com