视频生成若只会「好看」,下一题往往是:物体会不会凭空穿模、重力像不像真的、口型与环境声能不能跟着镜头一起对上。9月15日,智象未来(HiDream.ai)正式发布原生全模态视频生成模型HiDream-O1-Video-1.0(简称HD-V1)。公开口径称,模型支持文本、图片、视频等多种模态输入,可一键直出约5至20秒1080p高保真视频,并在意图理解、物理规律理解、自主规划叙事与音画一体化生成等维度升级。
智象未来是国内生成式多模态公司,叙事强调「一个原生全模态底座、四大模型同源演进」。此前已布局图像生成模型HiDream-O1-Image、交互式世界模型HiDream-O1-World与具身世界模型HiDream-O1-Embodied;HD-V1被定位为同一底座上的视频分支。创始人梅涛公开表述公司致力于让四条产品线同源演进,而不是彼此割裂的单点模型。
能力与评测要点(公司公开口径):
所谓物理规律导向,白话是让生成结果更像「世界里可能发生的事」,而不是只拼贴好看的帧。所谓音画原生一体化,白话是声音不是后期硬贴,而是和画面在同一套生成过程里对齐。对创作者与广告制作方,这对应「少修穿模、少对人嘴型」的效率叙事;对评测方,则要看榜单协议是否可复核、名次是否随对照模型快速波动。
放在全球视频大模型竞赛上下文里,各家都在卷时长、分辨率与可控编辑,真正难的是物理一致性与声画同步。HD-V1选择把物理与音画写成架构卖点,并同步给出第三方榜单位次,等于用可对照名次回应「中国视频模型在不在第一梯队」。竞品若只有样片、给不出同协议榜单,说服力会分层。
产业影响上,若内测后迅速公测并稳住一致性,会强化智象在视频侧的产品完整性;若长期停在申请表与样片,市场热度会随新闻周期退去。需要把边界读清楚:榜单名次随时间窗与对照集变化;内测不等于开放商用SLA与稳定配额。下一观察点是公测开放节奏、长视频与复杂多镜头一致性,以及与既有世界模型产品线的协同接口。