
做短视频的人对这个场景应该特别熟悉。
手里一份产品PPT,要变成能发的竖屏视频。脚本重写,分镜拆解,素材翻找,剪辑对轴。一条30秒的东西,一下午就没了。
累。
更头疼的是走AI生视频那条路。以前的模型单次基本只出3到5秒,想凑够30秒,得生成七八段再自己拼。人物换个镜头就变脸,场景光线前后完全对不上。拼完发出去,评论区一眼认出。
很丢人。
据21世纪经济报道,8月6日晚阿里云宣布 Wan3.0 开启公测。这次有两条对内容生产真正有用:单次稳定出30秒,doc/xls/ppt/pdf/md 这些文档格式可以直接当输入。
官方数据显示,480P / 720P / 1080P 的 API 价格分别为 0.3 / 0.6 / 1.2 元每秒,API 接口近期全量开放。
那份躺在文件夹里的 PPT,理论上能直接当素材源了,不用你先把它翻译成提示词。
下面四步,按抖音和视频号的实际发布链路排。
一、先把这笔钱算明白
按秒计费,不是按条。看到"0.6元"就觉得便宜,是相当典型的误判。得换算成成品才真的有意义。
抖音上跑量的口播和产品展示,多数落在 15 到 30 秒。按 15 秒 720P 一条 9 元算,一个月 30 条素材,270 元。这个数对小团队确实友好,比外包一条三五百好接受太多。
等等,有个更要紧的成本没算进去——废片率。
你绝对不会一次就出对。前几条大概率要重跑,改提示词,调分镜。真实成本得在理论价上乘个系数。个人感觉起步按 2 倍估比较稳,跑顺了再往下压。
对比参考一下。据腾讯新闻报道,Seedance 2.5 输入不含视频时是 480P 0.67 元每秒、720P 1.51 元每秒。同样 30 秒 720P,那边 45.3 元,这边 18 元。
不过这条得说清楚:来源是知情人士口径,而且 Wan3.0 还在公测,正式定价完全没最终公布,后面极有可能调。别拿这个数去做半年的预算表吧。

二、文档怎么写,模型才读得准
文档能直接输入,不等于随便丢一份进去就出好片。这一步真的最影响成片质量。
模型读文档,读的是结构和信息密度。一份排版混乱、全是装饰性废话的 PPT,出来的视频也是散的。看着特别闹心。
更准确地说,模型不是读不懂你的 PPT,是你那份 PPT 本来就没把话说清楚。
可以直接抄的结构:
【视频目标】 一句话说清要让观众记住什么 【时长节奏】 30秒。0-3秒钩子,3-22秒主体,22-30秒收尾 【分镜清单】 镜头1:产品特写,从暗到亮 镜头2:手部操作,单手切换档位 镜头3:使用场景,办公室久坐人群 镜头4:产品立起,留白给后期加字 【视觉规范】 主色:冷灰+橙点缀 光线:柔和侧光,不要强反光 画幅:竖屏9:16 禁止出现:logo、人脸正面特写、文字水印 【一致性】 全片同一只手、同一外观、同一光线方向关键在最后两块。"禁止出现"和"一致性"这两段,是把返工彻底挡在生成之前的闸门。人脸正面特写这条格外要紧——涉及肖像的 AI 内容在平台审核里极其容易卡,卡了还查不出原因,非常折磨。
那已经有现成 PPT 的人怎么办呢?完全不用重做。在最前面补一页,把这五块信息写进去就行。
三、竖屏适配,别等出片了才想
抖音和视频号主流是 9:16 竖屏,1080×1920。这事必须在生成之前定。
横屏裁竖屏是整条链路上最大的坑。16:9 裁成 9:16,左右各切掉约 44%。主体只要不是死死居中,裁完就残——人物半张脸在画面外,产品被切一半。这种片子的确是重生成比修快。
安全区记这组数:上留 8% · 下留 20% · 左右各留 5%
下方那 20% 绝对不是浪费。抖音的文案区、账号名、话题标签全压在底部,视频号的互动条也在下面。主体压太低,发出去直接被 UI 盖住。白干。
还有,字幕千万别让模型生成。AI 出的中文字幕,字形错乱、笔画粘连是常态,改都改不了,看着实在难受。留到剪映或者必剪里加,可控得多。

四、发之前过这几条
生成完不等于能发。
AI 内容要标识
《人工智能生成合成内容标识办法》已于 2025 年 9 月 1 日施行,平台要求发布者对 AI 生成内容做声明。抖音和视频号发布页都有对应开关。别抱侥幸。主动勾上完全不影响推荐,被判定为未声明的 AI 内容才影响。
真人形象最敏感
用 AI 生成像真人的出镜人物去做口播、测评、效果对比,非常容易被判定为误导。产品展示、场景演示、动画风格相对安全。
效果类表述别让模型自由发挥
画面如果暗示了功效、疗效、收益,哪怕文案里没写,画面本身也会被审。美妆、健康、金融这三类尤其要盯紧。
素材版权
文档里放别人的产品图当参考,生成出来的东西权属十分模糊。用自己拍的、自己有授权的,省心。
从哪儿开始试
据阿里云消息,目前入口有阿里云百炼、万镜一刻、万相官网、千问创作 PC 端、IF STUDIO、堆友,千问 APP 是灰度开放。
万相官网 wanxiang.aliyun.com ,走 API 的话在百炼的模型市场里找 Wan3.0。
第一次试,建议这么排:拿一份现成的、信息最完整的产品 PPT,按第二步补一页目标和分镜,选 480P 跑一条 30 秒的,9 块钱,看结构对不对。结构对了再切 720P 出正式素材。别一上来就 1080P。废片成本实在太高,心疼。
不对,还得补一句。
这波不只阿里在动。同期字节的 Seedance 2.5、Minimax 的 H3 都更新了。据新京报报道,京东 8 月 5 日还开源了实时流式视频编辑模型 JoyAI-Video-Edit,能一边播一边改人物穿搭和场景,超级适合直播带货那种要反复改的场景。
换个说法。工具迭代得太快,别急着把工作流焊死在某一个模型上。把文档结构和分镜规范这套东西牢牢沉淀下来,换模型的时候只换执行层就行。
真正决定成片质量的,从来不是你用哪个模型。是你那份文档写得够不够清楚。
你现在做短视频,卡在哪一步最多呢?
脚本写不出来?生成的画面不能用?还是发出去没量?
说实话,这三个卡点的解法完全不一样。讲真,留言说说你的情况吧,我挑集中的问题在后面单独拆一篇。
夜雨聆风