AI视频正从「生成一个镜头」走向「讲完一段故事」——阿里把文档与PPT也接进了生成链路。
阿里巴巴视频生成大模型万相(Wan)是其多模态产品线中的视频底座,面向营销、教育、演示与内容生产等场景。Wan 3.0是该系列最新一代公开公测版本:叙事重点不再只是「文生视频/图生视频」,而是把办公文档当作一等输入,让结构化材料直接驱动成片。
8月6日,Wan 3.0开启公测。公开材料称,模型在生成时长、万能创作、全能参考与真实世界还原等维度升级。单次可生成约30秒视频,并提供智能时长,可按提示词推荐合适长度——连续运镜、一镜到底等镜头语言因此更有空间。在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入,单个文件或链接不超过约100MB、约50页。
产品与商业侧可核对要点:
所谓「文档驱动视频」,白话就是别再从一张海报或一句提示词硬编故事,而是让已有的PPT大纲、表格与说明文自己长成镜头。对市场与培训团队,这意味着视频生成开始嵌进既有内容生产流水线,而不是另开一条「提示词作坊」。
把边界读清楚。公测不等于全渠道稳定商用;文档理解在真实企业模板(复杂母版、大量图表、密密麻麻脚注)上的表现,仍要以实测为准。声音与字幕被公司主动点名「仍有空间」,对买家反而有用——验收时应把口型、旁白与屏幕文字单独列入检查项。
下一观察点是文档理解在企业模板上的稳定性,以及声音与字幕准确度何时追上画面叙事——当PPT能直接变形象片,竞争焦点就会从「像不像电影」转向「像不像你司品牌规范」。