
8月6日,阿里视频生成模型Wan3.0开启公测。除文本、图片、音频和视频外,它首次支持doc、xls、ppt、pdf、txt、key、pages、numbers、md等文档格式,还能接收文件或链接。配合提示词,官方给出的应用方向包括教学课件、产品演示、动态图表和业务汇报。
以前把一份文档做成视频,通常要先摘出重点,再把文字改成脚本或提示词;PPT里的图表、产品图和页面结构,还要分别导出、整理,最后再生成多个短镜头并剪到一起。
Wan3.0真正挪走的,是“先把办公文件翻译成视频模型能理解的材料”这层中间劳动。
这里面最确定的节省,是文件转换。过去需要把PPT拆成图片、把PDF文字复制出来,或者先整理成模型能接收的提示词;现在文件可以直接进入生成链路。至于脚本整理、画面设计和剪辑能省多少,要看模型对具体材料的读取与呈现效果,不能只凭“支持上传”三个字预先算出工时。
输入边界也决定了它更适合怎样的任务。Wan3.0一次最多接收一个文件或链接,文件不超过100MB、页数不超过50页。如果一份业务汇报的数据散落在多个表格、文档和网页里,人仍要先合并材料;几十分钟的课程也不能靠一个30秒片段直接交付,仍需拆分内容并组织前后关系。
30秒本身仍然有用。一段产品功能介绍、一页动态图表说明,或者课件中的单个知识点,有机会在一次生成里讲完整,不必为了几秒钟的上限反复续镜头。Wan3.0还提供智能时长与视频延长能力,但延长画面不等于自动补齐叙事,事实顺序、重点取舍和前后衔接仍需要人来把关。
尤其是数字、合同条款、产品规格和对外口径,画面做得像不等于内容正确。模型可以读取源文件并生成视频,人仍要逐项检查信息有没有漏、图表有没有表达错、品牌元素有没有跑偏。公测解决的是“材料怎样更快进入视频”,不是替内容负责人签字。
Wan3.0目前已在阿里云百炼、万镜一刻、万相官网和千问创作PC端开启公测,千问App为灰度开放。官方公布的480P、720P和1080P API单价分别为每秒0.3元、0.6元和1.2元,按满30秒机械计算,单次理论费用分别是9元、18元和36元。这只是单价乘以时长的理论生成费用,不能直接当作一条可用成片的完整预算;API接口也仍处于近期全量开放的安排中。
这里是我的AI牛马,让 AI 替你打工,下期见。
夜雨聆风