机器人动作数据最贵的往往不是算力,而是遥操作与专项采集。亮源想用海量人类视频把预训练底座先铺厚。
亮源新创9月21日发布全身智能基础模型Light-O1。公开叙事把它放进公司Physical AI三段范式的「规模化预训练」一环:此前已有规模化对齐与规模化部署成果,Light-O1补上预训练侧模型实践。路径是把互联网视频中的人类移动、操作与交互整理为多模态动作数据,经自回归预训练形成动作先验,再在目标机器人数据上适配。
关键口径为:基于视频的人类动作预训练拓展至约10万动作小时;随预训练规模扩大,适配后动作预测损失呈幂律下降,离线开环评估中全身姿态误差降低。公司据此称验证了人类全身动作预训练的跨本体迁移扩展规律。真机侧,搭载Light-O1的自研小型人形LightBot演示递毛巾、打开鞋柜归置拖鞋、捡垃圾等连续任务,并称可在失败与干扰后重试调整。官网同步开源通用动作生成模型Light-O1-Preview,用户可用自然语言描述目标并查看推理过程。
这把竞争从「再采几千小时真机」部分挪到「人类视频先验能否跨本体兑现」。观察点是开源预览权重的可复现性,以及适配到第三方本体时误差曲线是否仍成立。