宇树|宣布UnifoLM-WLA-1.0全面开源,单模型统筹桌面与全身操作任务

PromptTree|阅读 3
2026/09/11 08:45
宇树科技UnifoLM-WLA具身智能VLA
9月10日宇树宣布全面开源UnifoLM-WLA-1.0:约6B参数,约2500小时真机数据,单模型统筹约64项桌面与全身操作任务,并强调跨末端执行器泛化;代码/权重/数据集按项目页推进。

人形赛道刷完高动态演示之后,下一题往往是:同一套大脑能不能既拧螺丝又挪箱子,还换得了手。9月10日,宇树科技宣布全面开源新一代通用人形机器人基础模型UnifoLM-WLA-1.0,口径覆盖代码、模型与数据集,项目主页已上线。相对此前UnifoLM-X2高动态搏击演示,此轮重点转向可复用的视觉—语言—动作(VLA)基座。

宇树是科创板人形与四足平台厂商,近期在上市后持续用高动态任务证明控制上限,同时把「可开源的大脑」推到生态桌面。UnifoLM-WLA-1.0约6B参数,融合大规模多模态感知理解与交互中心的世界建模,公开称在多项具身推理评测中领先开源并可比肩部分闭源模型。

开源与能力要点(项目页/公司口径):

  1. 参数:约6B的VLA基座
  2. 数据:约2500小时高质量真机数据;含Unitree Open Datasets、BitRobot-HIW-500等;ER侧公开称超约500万样本
  3. 任务:单模型统筹约64项任务,约54项桌面操作、约10项全身操作
  4. 末端:支持两指夹爪与多种五指灵巧手,强调跨任务、跨末端泛化
  5. 路径:UnifoLM-ER强化空间感知 → 光流动态区域离散为mask token → 末端/手部/下肢动作分别残差向量量化 → MMDiT动作专家闭环
  6. 状态:项目主页已上线;部分入口仍可见Coming soon,资产按披露节奏推进

所谓一模型驱动多任务,白话是少做「一任务一策略」的烟囱式部署,尽量用同一套表征覆盖桌面精细操作与全身移动操作;所谓交互中心世界建模,白话是先预测「我这么动,场景哪一块会变」,再生成动作,而不是只背动作库。对生态开发者,这降低了从演示视频跳到可训练基座的门槛;对本体厂,则意味着「自家手爪能不能接上同一套动作语言」将成为新的对照项。

放在具身开源竞赛上下文里,过去半年行业一边刷格斗与田径,一边补世界模型与操作数据。宇树选择把搏击证明过的高动态能力,转译成可下载、可对照的WLA基座,等于把讨论从「会不会打」推进到「别人能不能接着训」。竞品若只有闭源演示、给不出真机小时数与跨末端评测协议,对照会更吃力。

产业影响上,若权重与数据集真正齐套,会抬高开源具身基座的复现密度;若长期停在「宣布开源、下载未齐」,市场会迅速打折。需要把边界读清楚:宣布开源不等于全部权重已可稳定下载;评测领先为团队/项目页口径。下一观察点是权重与数据集实际上线节奏,以及第三方在非宇树本体上的复现成功率。