智象未来|发布物理规律导向视频模型HiDream-O1-Video-1.0

PromptTree|阅读 0
2026/09/16 07:49
智象未来HiDreamHD-V1视频生成
9月15日智象未来发布HiDream-O1-Video-1.0(HD-V1),支持文本/图片/视频输入,可生成约5–20秒1080p视频,强调物理规律与音画一体化;公开称Artificial Analysis图生视频(With Audio)约列全球第四,Arena.ai盲测约列第八,目前内测。

视频生成若只会「好看」,下一题往往是:物体会不会凭空穿模、重力像不像真的、口型与环境声能不能跟着镜头一起对上。9月15日,智象未来(HiDream.ai)正式发布原生全模态视频生成模型HiDream-O1-Video-1.0(简称HD-V1)。公开口径称,模型支持文本、图片、视频等多种模态输入,可一键直出约5至20秒1080p高保真视频,并在意图理解、物理规律理解、自主规划叙事与音画一体化生成等维度升级。

智象未来是国内生成式多模态公司,叙事强调「一个原生全模态底座、四大模型同源演进」。此前已布局图像生成模型HiDream-O1-Image、交互式世界模型HiDream-O1-World与具身世界模型HiDream-O1-Embodied;HD-V1被定位为同一底座上的视频分支。创始人梅涛公开表述公司致力于让四条产品线同源演进,而不是彼此割裂的单点模型。

能力与评测要点(公司公开口径):

  1. 输入:文本、图片、视频等多模态
  2. 输出:约5–20秒1080p视频;时长可随内容自主规划
  3. 规划:前置多模态意图理解模块,结构化规划镜头时长、场景、角色动作表情、运镜焦段、台词与背景声等字段
  4. 物理:把重力、碰撞、惯性、光影衰减与空间连续性等约束写入生成逻辑
  5. 音画:文本、视频、音频联合建模,追求镜头切换时环境声过渡、人物口型与情绪同频
  6. 榜单:Artificial Analysis图生视频(With Audio)公开称约列全球第四;Arena.ai图生视频盲测约列全球第八
  7. 开放:目前为内测申请阶段

所谓物理规律导向,白话是让生成结果更像「世界里可能发生的事」,而不是只拼贴好看的帧。所谓音画原生一体化,白话是声音不是后期硬贴,而是和画面在同一套生成过程里对齐。对创作者与广告制作方,这对应「少修穿模、少对人嘴型」的效率叙事;对评测方,则要看榜单协议是否可复核、名次是否随对照模型快速波动。

放在全球视频大模型竞赛上下文里,各家都在卷时长、分辨率与可控编辑,真正难的是物理一致性与声画同步。HD-V1选择把物理与音画写成架构卖点,并同步给出第三方榜单位次,等于用可对照名次回应「中国视频模型在不在第一梯队」。竞品若只有样片、给不出同协议榜单,说服力会分层。

产业影响上,若内测后迅速公测并稳住一致性,会强化智象在视频侧的产品完整性;若长期停在申请表与样片,市场热度会随新闻周期退去。需要把边界读清楚:榜单名次随时间窗与对照集变化;内测不等于开放商用SLA与稳定配额。下一观察点是公测开放节奏、长视频与复杂多镜头一致性,以及与既有世界模型产品线的协同接口。