人走进陌生的家不用重新学铺床。机器人至今大多相反:在哪采集数据,就只能在哪干活。Figure用Helix 2.5试着打破这件事。
Figure做人形机器人。9月17日,公司在官网发布Helix 2.5,称这是它造过的最强神经网络。前代Helix 02已经能协调全身做长时程任务,例如卸洗碗机,或在物流任务里自主运行200小时,但那些策略学的是机器人将来要去的地方。2.5要回答的是:能不能走进没见过的家,立刻用全身干活。
公司的做法是先在Index上预训练。Index是Figure的人类行为数据集。从一个基础模型分出三种行为:整理客厅、折毛巾、铺床,然后进入旧金山湾区30个家庭。官方强调,这些家里没有采集数据,也没有针对环境或物体做微调。
官方给出的关键结果:
整理客厅的及格线是散落的13到15个玩具全部放进筐,每个玩具1分钟超时。毛巾要折好并放进筐,每条3分钟超时。铺床要求两个枕头和被子角放到床头三分之一区域,被子拉平。安全需要人工介入的回合,直接记失败。
公司还报告了一种缩放关系:在模型规模和下游训练不变时,把Index预训练数据扩大到8倍,下游机器人动作预测损失随数据翻倍而下降。官方称,只用较小规模的实验,就能在训练前把最大那次的测试损失预测到小数点后四位,预测误差约为全程波动的0.54%。Index现在大约每秒产生35分钟新的人类经验,公司称已承诺35亿美元算力用于训练Helix。
这组数字是Figure自己组织的盲测,不是独立实验室复现。56%意味着将近一半完整任务仍然失败。零样本也不等于「什么家务都会」:三种行为事先学过,换的是房子和物体。自我纠错——后退、换站姿、绕床修正——被官方当作Index带来的定性变化,视频之外还缺第三方计时。
即便如此,它把「人类经验能不能迁到人形机器人」从口号变成了可对照的9%对56%。若其他家只有展台视频、没有「从零 vs 预训练」的同条件对照,讨论会继续停在演示。下一观察点是30个家的原始回合能否被外部复核,以及成功率离开这三种家务后还剩多少。