↑

清华×无问芯穹|开源具身云原生平台RLark

PromptTree|阅读 0
2026/09/25 07:45
清华大学无问芯穹RLark具身智能云原生
清华大学与无问芯穹开源面向具身智能的云原生纳管平台RLark,以具身设备运行时与任务级跨集群互联为核心;称设备纳管可缩至约5分钟、任务提交后约10秒启动,并已在粤京两地跑通采集—训练—真机验证闭环。

具身实验最烦的往往不是算法本身,而是「机器人在北京、GPU在广东、相机在机房」时,接入、部署、组网和排错要重复做无数遍。清华大学与无问芯穹把这类基础设施问题收成一座开源「塔台」:RLark。

RLark面向具身智能的云原生纳管。核心有两块:自研具身设备运行时(embodied-runtime),让机器人、相机等真实硬件像GPU一样可申请、可调度、可复用;任务级跨集群网络互联,按任务隔离通信并优化大小包传输,支撑云端与现场协同。公开口径称平台已纳管3个集群、近百个云边端节点,覆盖4种型号具身设备;设备纳管从小时级缩短至约5分钟,任务提交后约10秒可在平台侧启动。开源地址为github.com/RLinf/RLark,文档见rlark.readthedocs.io。

跨地域实测把抽象能力钉在一条链路上:广东云端GPU与北京机器人现场配合,RLark负责设备申请、跨集群部署、实例互联与状态汇集,强化学习框架RLinf负责训练与数据协作。运维先把云与现场集群接入,由Agent同步容量与状态,再通过运行时注册双臂机器人与相机;研究者用一份任务配置声明训练、推理、真机交互等角色及其资源与部署位置。任务启动后,现场交互数据回传云端训练,策略再下发真机,形成采集—训练—验证循环。公开披露该次实验连续运行约36分钟、推进至323个全局训练步骤,完整跑通申请、调度、回传、训练与策略更新。

通信专项测试称,在受限网络下大包单流吞吐较所用VPN方案提升约49%,小包约14%;高带宽环境大包单流接近2 Gbps。架构上控制面与数据面分离:Web/API/CLI管理资源与任务,控制面维护配置与通信关系,各集群Agent负责本地部署与状态回传。声明式编排用Job、Task、Worker三层描述实验;观测则沿任务—角色—实例逐层关联节点、设备、事件与日志,并提供Web Terminal与TensorBoard入口。

对实验室,RLark降低的是「每次实验都要重新搭台」的固定成本;对厂商,设备插件与运行时提供了把硬件登记进云原生体系的接口。开源意味着适配清单、跨域通信与异常恢复会继续生长。下一步可观察:更多本体与传感器是否进入适配矩阵、跨地域闭环是否成为常见实验范式,以及与RLinf等训练框架的组合是否沉淀成可复制的标准作业。