交互式世界模型解决「在数字世界里想明白」,具身世界模型要回答「在物理世界里做稳妥」。9月7日,智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied。公司公开叙事强调原生全模态:打通图像、视频、3D、动作等模态,贯通理解—推演—执行,把统一世界模型基座从模拟世界推向真实任务执行。同期首次参评具身智能评测平台RoboColiseum,在核心的Robustness(扰动适应)子榜以平均分0.692登顶。
智象未来是聚焦原生全模态世界模型的创新型大模型企业,产品家族已覆盖视觉生成、交互式世界模型与具身世界模型。CTO姚霆公开表示,完整世界模型基座需要同时具备全模态表达、因果推演与物理世界构建能力;HiDream-O1-Embodied被定位为技术战略从「模拟世界」迈向「真实世界」的关键里程碑。不到一个月前,公司刚发布交互式世界模型HiDream-O1-World,并在交互式视频世界模型评测基准WBench的Navi分榜以平均分80.9登顶——前者偏理解与推演,后者偏操作与执行,形成互补。
评测与能力要点:
所谓扰动适应,白话是考试不考「温室理想条件」,而考光线乱、镜头歪、指令绕弯时还能不能稳住;所谓原生全模态闭环,白话是看、想、动尽量共用一套表征,而不是拼装互不通话的模块。对具身团队,榜单分数只是入口,真正难的是仿真高分能否迁移到真机连续工况。
放在世界模型赛道上下文里,行业刚经历一轮「能生成好看视频」的热潮,下一棒竞争转向「能不能把推演结果接到机械臂与轮足上」。智象用O1-World与O1-Embodied拆成理解—执行两段,等于主动邀请对照:交互榜与具身榜是否由同一套原生全模态底座支撑。数据飞轮叙事——模型既做考生也做出题人——也会抬高后来者冷启动成本。
产业影响上,若扰动适应成为采购方默认可对照指标,仿真评测平台权重会上升;若真机复现不足,市场会迅速回到「榜单与交付两张皮」。需要把边界读清楚:分数为仿真评测口径;真机部署、跨本体迁移与失败案例公开仍待更多材料。下一观察点是其他子榜表现、真机案例,以及生成增强样本是否进入可审计训练清单。