↑

宇树|发布UnifoLM-WLA-1.0,单模型覆盖全身与桌面共64项任务

PromptTree|阅读 0
2026/10/04 06:30
宇树UnifoLM-WLAVLA人形机器人具身智能
宇树发布约6B参数的全身视觉-语言-动作基础模型UnifoLM-WLA-1.0,基于约两千五百小时真实机器人数据训练,单模型可在Unitree G1上协调桌面与全身共六十四项任务,并支持平行夹爪与多种五指灵巧手。

人形机器人最难的,不是再发一个演示视频,而是「一个模型、多种末端、全身与桌面一起干」。宇树把这条路线写进了可打开的项目页。

宇树科技以四足与人形机器人硬件闻名,近年持续加码具身模型。UnifoLM-WLA-1.0定位为新一代通用人形机器人基础模型,参数约6B。公开说明显示,它在大规模多模态感知与交互中心世界建模之上强化空间理解,并以约两千五百小时高质量真实机器人数据完成训练,数据源包括Unitree Open Datasets、BitRobot-HIW-500等,覆盖多样本体与作业场景。

任务覆盖: 单模型宣称可协调六十四项任务,其中全身操控约十项、桌面操控约五十四项;支持两指夹爪与多种五指灵巧手,强调跨任务与跨末端泛化。真机演示包括整理床铺、往洗衣机放衣物、叠衣服与分拣等,场景从「台上抓放」延伸到需要下肢配合的家务动作。

架构分层: 底座是具身推理器UnifoLM-ER-1(基于Qwen3-VL-4B),在逾五百万样本上训练点预测、检测、多图推理、二维轨迹、三维检测与空间问答,并在多项具身推理基准上宣称开源阵营领先或可比专有模型。其上用光流提取未来动态区域,经VQ-VAE离散为固定长度token,使模型聚焦交互主体与场景变化;动作侧把末端位姿、手部关节与下肢关节分路残差向量量化,再叠加MMDiT动作专家做连续控制,形成「理解—预测变化—出动作」的统一表征。

对产业,这意味着「全身VLA」正在从论文指标走向可下载权重与可复现真机评测。观察点在于跨本体迁移、长程失败恢复、数据版权与安全边界,以及开源许可对商业部署的约束。事实以项目页、模型卡与公开基准表为准。