阿里|云栖大会摊开全模态拼图,指向三年原生全模态

PromptTree|阅读 0
2026/09/23 07:48
阿里云栖大会QwenWan3.0全模态
2026云栖大会上,阿里摊开Qwen3.8全家桶与多模态新品,预告下一代视频模型与Qwen4训练;郑波称三年内指向原生全模态统一生成,陆川团队约5天用AI重建明代爆炸现场。

云栖不只是发布会清单,更像一次把「听、说、看、画、剪、译」拆开又重新拼回的全模态路线图。读者若只关心单点新品,容易漏掉它真正要说的话:阿里要把生成式能力收成同一套原生全模态叙事。

阿里巴巴集团旗下通义千问(Qwen)与通义万相(Wan)是其大模型与视频生成主力产品线。2026云栖大会上,公司集中展示语言、图像、音频、实时翻译与视频方向的进展,并把时间表说到「三年内原生全模态统一生成模型」。

影视侧给出了一个可感知的样本。导演陆川团队称,约用5天借助AI重建明代爆炸历史现场;视频生成环节中阿里模型贡献超一半;同类爆炸戏若走传统流程约需19天。团队称烟尘、碎片等细节准确度达到预期95%以上。这类口径属于创作方与厂商联合披露,重点不在「替代全部传统流程」,而在说明多模态管线已能嵌入高成本镜头的制作节奏。

语言与下一代底座:

  1. Qwen3.8-Max被置于自我训练叙事中,强调模型可参与自身能力迭代
  2. Qwen3.8-Flash指向下一代架构,偏吞吐与成本敏感场景
  3. Qwen3.8-Omni引入思考分区,把多模态输入与推理过程做结构化切分
  4. Qwen4已开练,参数规模公开瞄准约5万亿至10万亿量级

多模态货架同步亮相: Qwen-Image-3.1、Happy Shrimp 1.1、HappyOyster 2.0 Preview、Qwen-Audio-3.1,以及此前已单独发布过的Qwen3.8-LiveTranslate。本次作为云栖整体布局一句带过即可:实时同传能力已并入大会展示矩阵,而非本条主线。下一代视频模型预告于11月亮相;Wan3.0公开口径为单次可生成约30秒视频,并曾登上Artificial Analysis文生视频与编辑相关榜单。

全模态(omni-modal)在此语境下,不只是「一个入口接多种文件」,而是希望文本、图像、音频、视频在同一生成与理解框架里共享表示与调度。郑波在大会上称,目标是在三年内做出原生全模态统一生成模型,并点出Agentic Video方向——视频不再只是一次性出片,而是可被智能体规划、剪辑、改写与再生成的工作流介质。

产业上看,这是把「模型清单」收成「时间表+统一叙事」:短期看11月视频模型与各模态迭代能否兑现制作侧体验;中期看Qwen4万亿级训练与成本结构;长期看原生全模态是否真能消解多套专用模型拼接的工程税。云栖给出的是拼图边界,落地仍取决于各模态产品是否按同一接口与同一质量标准往回收。