Figure|发布Helix 2.5,在30个陌生家庭测试全身家务

PromptTree|阅读 0
2026/09/19 09:07
FigureHelixIndex人形机器人
Figure于9月17日发布Helix 2.5。官方称在30个未见过的湾区家庭中,Index预训练把完整任务成功率从9%提高到56%,任务为整理客厅、折毛巾和铺床。

人走进陌生的家不用重新学铺床。机器人至今大多相反:在哪采集数据,就只能在哪干活。Figure用Helix 2.5试着打破这件事。

Figure做人形机器人。9月17日,公司在官网发布Helix 2.5,称这是它造过的最强神经网络。前代Helix 02已经能协调全身做长时程任务,例如卸洗碗机,或在物流任务里自主运行200小时,但那些策略学的是机器人将来要去的地方。2.5要回答的是:能不能走进没见过的家,立刻用全身干活。

公司的做法是先在Index上预训练。Index是Figure的人类行为数据集。从一个基础模型分出三种行为:整理客厅、折毛巾、铺床,然后进入旧金山湾区30个家庭。官方强调,这些家里没有采集数据,也没有针对环境或物体做微调。

官方给出的关键结果:

  1. 对照实验里,从零训练的策略完整任务成功率为9%,Index预训练后为56%,官方称超过6倍
  2. 成功不给部分分:玩具都收进筐、毛巾都折好,或整张床铺完,才算过
  3. 「零样本」指评估用的家和被操作物体没见过;任务本身仍用别处采集的数据做了指定
  4. 每种任务在30个家里用同一个固定检查点,不用评估结果来挑checkpoint
  5. 相对一次代表性的Helix 02行为,任务专用数据用了一半,泛化范围扩到30个家
  6. 没有单一评估任务在Index预训练数据里占比超过1.90%

整理客厅的及格线是散落的13到15个玩具全部放进筐,每个玩具1分钟超时。毛巾要折好并放进筐,每条3分钟超时。铺床要求两个枕头和被子角放到床头三分之一区域,被子拉平。安全需要人工介入的回合,直接记失败。

公司还报告了一种缩放关系:在模型规模和下游训练不变时,把Index预训练数据扩大到8倍,下游机器人动作预测损失随数据翻倍而下降。官方称,只用较小规模的实验,就能在训练前把最大那次的测试损失预测到小数点后四位,预测误差约为全程波动的0.54%。Index现在大约每秒产生35分钟新的人类经验,公司称已承诺35亿美元算力用于训练Helix。

这组数字是Figure自己组织的盲测,不是独立实验室复现。56%意味着将近一半完整任务仍然失败。零样本也不等于「什么家务都会」:三种行为事先学过,换的是房子和物体。自我纠错——后退、换站姿、绕床修正——被官方当作Index带来的定性变化,视频之外还缺第三方计时。

即便如此,它把「人类经验能不能迁到人形机器人」从口号变成了可对照的9%对56%。若其他家只有展台视频、没有「从零 vs 预训练」的同条件对照,讨论会继续停在演示。下一观察点是30个家的原始回合能否被外部复核,以及成功率离开这三种家务后还剩多少。