生数科技|发布Vidu S2实时互动与视频编辑双模型并开放体验

PromptTree|阅读 0
2026/09/17 07:24
生数科技Vidu S2视频生成实时互动
9月16日生数科技发布Vidu S2并称全量开放体验,含S2-Avatar与S2-Editing双模型;Avatar强调约720P实时输出与动态参考图,Editing可实时改风格/服装/人物/背景,并探索空间视频生成。

视频生成若只能「点一下、等一会儿、拿一段成片」,很难撑住直播互动、边录边改、角色持续听指令改动作。创作者真正要的,往往是低延迟的对话感,而不是又一次离线渲染。9月16日,生数科技正式发布Vidu S2,并称全量开放在线体验——把产品从「出片工具」往「可交互视频工作流」再推一步。

生数科技是国内视频生成与世界模型方向的重要团队之一,Vidu是其面向创作者与应用方的视频生成产品线,长期处在「时长、可控、实时」三重竞赛中。公司近窗亦在世界模型与真机操作等方向同步发力;Vidu S2此轮的重点,不是再堆一个离线旗舰样片,而是把实时互动与实时编辑拆成可分别调用的能力。

产品要点(公司公开口径):

  1. S2-Avatar:面向持续交互的数字角色生成;实时输出公开称提升至约720P
  2. 动态参考:互动过程中可随时加入新参考图,角色持续响应新指令与视觉信息
  3. 指令跟随:公开强调更强动作指令能力(如舞蹈等)
  4. S2-Editing:面向持续输入的视频流,可实时改变风格、服装、人物与背景
  5. 空间视频:探索在Avatar与Editing上做实时空间视频生成的可行性
  6. 开放:称全量开放在线体验;相关技术报告以《Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation》形式出现在公开预印本渠道

所谓实时互动数字人,白话是角色不只生成一段固定视频,而是边听你说、边改动作与外观。所谓流编辑,白话是对着正在播放的画面直接换衣、换人、换景,而不是另开工程重渲染一遍。所谓动态参考图,白话是互动中途还能塞进新照片,让角色「认」上新衣服或新道具,而不必从头开一场。

放在全球视频大模型竞赛上下文里,各家都在卷分辨率、时长与可控编辑;真正难的是延迟、一致性与指令跟随同时成立。Vidu S2选择双模型同发,等于告诉市场:实时对话与实时改片可以是两条产品线,而不是一个万能开关。竞品若只有离线成片、给不出可玩的低延迟Demo,创作者侧对照会更吃力;若只有样片、缺少可复核的开放体验入口,热度也会更快退去。

产业影响上,若公测流量下卡顿率可控、长会话外观不崩,会强化「实时视频交互」作为独立品类;若长期只有演示分辨率、复杂遮挡与多人场景仍不稳,市场会迅速打折。需要把边界读清楚:开放体验不等于商用SLA与稳定配额;空间视频仍属探索叙事;预印本时间点与产品发布窗口可能不完全重合。下一观察点是高并发下的延迟与画质曲线,以及与公司既有世界模型产品线的协同接口是否公开。