清华|联手无问芯穹与正行创新开源具身智能体基础设施RPent

PromptTree|阅读 0
2026/09/22 06:30
RPent无问芯穹具身智能VLA
清华大学、无问芯穹、正行创新联合开源RPent,连接通用大模型规划、VLA执行与记忆接口;在LIBERO-PRO上报告约92.6%成功率,Flash Mode将端到端耗时压缩约7倍。

数字世界里的智能体已经会拆任务、调工具;物理世界里,还得看得见、做得到、记得住。RPent把这件事收成一套可开源的基础设施。

项目由清华大学、无问芯穹、正行创新联合发起,核心团队来自大规模具身强化学习框架RLinf。公开定位不是「一个模型包办一切」,而是分层协作:通用大模型负责理解与规划,VLA、WAM等专家模型负责高精度动作,记忆系统沉淀经验,框架负责连接工具与机器人接口,形成观察—规划—执行—反馈—再规划闭环。代码仓库地址为 github.com/RLinf/RPent。

公开口径中的关键数字:

  1. LIBERO-PRO上,RPent搭载GPT-6 Astra报告约92.63%任务成功率
  2. 同框架下Opus-4.7约82.4%;相较部分基线拉开更大差距
  3. Flash Mode把LIBERO Object评测平均执行时间从约283.6秒降至约40.9秒,约7倍加速,成功率仅下降约3.5个百分点

架构上分用户层、智能层、接口层与环境层。接口侧用MCP描述可调用能力,RPC连接模型服务与机器人环境,并引入面向物理设备的统一抽象。当前公开支持LIBERO-PRO、RoboCasa、RoboTwin等仿真,以及Franka、双臂Franka、YAM、SO101等真机。Flash Mode的核心是任务卡:探索阶段把验证过的流程压缩为可复用卡片,稳定流程少调大模型,异常时再回到规划器。

对开发者,这是「大模型当大脑、专家模型当手」的可复现脚手架;对产业,它把讨论从单点VLA演示推进到可延时、可记忆、可跨本体接入的系统工程。榜单数字为项目自测口径,第三方复现仍待社区验证。