↑

灵初|Psi-R2.5推进人机强配对与上下文学习

PromptTree|阅读 0
2026/09/25 07:45
灵初智能Psi-R2.5具身智能数据对齐ICL
灵初智能围绕Psi-R2.5披露数据质量与人机对齐进展:逆向使用Psi-W0从真机数据生成人手对照,训练可把手机人手视频转为机器人图像与动作的转换器;并探索把示范作为上下文提示,后训练手机盒装配成功率称约99%。

教机器人学人,最容易踩的坑是:两边都在「拿可乐」,但人手姿态、关节结构、摩擦条件与机械手并不互通。看懂语义是一回事,给出可回放成功的动作数据是另一回事。灵初智能把这个问题写成「弱配对」与「强配对」的差别。

灵初在十万小时级数据积累上推进Psi-R2.5。弱配对主要在任务含义上对应;强配对要求场景基本一致、动作时序逐帧对应,且机器人侧动作可在真机直接回放成功。今年4月,公司已尝试让Psi-R2与世界模型Psi-W0配合,经轨迹推演与强化学习把人类操作转成可执行机器人数据,但流程较重。此次换方向:以真实机器人图像与动作为起点,逆向使用Psi-W0生成匹配的人手操作,再训练端到端转换器——输入人类操作,输出匹配的机器人图像与动作。转换器被定义为带动作输出的视频编辑模型,验证方式包括真机回放轨迹,以及用转换数据做后训练再测任务完成度。

数据质量侧,公司称减少同任务重复堆积、增加任务多样性,并用自动标注管线拆到更细原子动作后审核。Psi-R2.5还探索上下文学习(ICL):不更新参数,根据当前示范线索推断做什么、怎么做;示范可先经强配对转换,再作为提示输入。双层架构上,上层拆解长程任务为子任务,下层结合子任务与观测输出轨迹。部署叙事上,预训练意义被明确为「让后训练需要的数据更少」:手机盒装配结合人工参与与强化学习后训练,经几轮迭代成功率约99%,耗时约1—2个工作日;现场失败数据回流继续改进。

对具身数据赛道,这把「刷课时」从小时数竞争拉回可用率与对齐质量;对产品,视频示范有望成为交互方式,而不只是离线训练集。公司同步提示:复杂任务仍有未直接完成的情况,ICL展示限于特定任务。公开Tech blog与配对数据扩展页可供对照后续细节。