无问芯穹|联合清华、上交开源具身端侧推理引擎APXInf

PromptTree|阅读 1
2026/09/16 07:49
无问芯穹APXInf具身智能端侧推理
无问芯穹联合清华、上交开源具身端侧推理引擎APXInf;首发支持π0.5与WALL-OSS,覆盖RTX 4090、Jetson Orin与Thor。公开称Thor上π0.5 FP8端到端延迟约从278ms降至26ms以内,频率约38.46Hz。

具身模型在云端跑得再好看,搬到机器人本体上仍可能卡在三件事:加载慢、推理抖、接入难。对需要连续感知与实时控制的机器人,几百毫秒延迟不再是「体验差一点」,而可能是轨迹不连贯、任务反复失败。9月15日前后,无问芯穹联合清华大学、上海交通大学正式开源具身智能端侧推理引擎APXInf,定位覆盖模型开发、效果验证到本体部署的端侧推理链路;开源仓库公开指向RLinf生态下的APXinf-robo项目。

无问芯穹是国内做大模型与具身基础设施的团队之一。约2025年9月,其联合清华大学等团队开源面向具身智能大规模强化学习后训练的RLinf框架;APXInf被描述为把能力从训练与评测,延伸到机器人端侧推理与部署,形成同一条工程链路上的前后端。目标不是把云端聊天推理框架原样搬上车载算力板,而是在有限算力、功耗与成本约束下,兼顾小Batch、低延迟与长时间稳定运行。

开源与性能要点(团队公开口径):

  1. 硬件:支持RTX 4090、Jetson Orin、Jetson Thor等平台
  2. 模型:首发适配π0.5、WALL-OSS;路线图提及Qwen、Groot等适配中
  3. 性能:Jetson Thor上,π0.5的FP8端到端推理延迟公开称由约278毫秒降至约26毫秒以内;推理频率约达38.46Hz
  4. 优化:Pipeline、Graph、Kernel与量化等多层端到端优化;Agent4Kernel等融合算子叙事
  5. 架构:Rust极简运行时 + Python易用接口;强调内存安全与长期连续运行稳定性
  6. 生态:作为RLinf开源生态中的端侧推理项目首发

所谓端侧推理引擎,白话是专门为「小批量、低延迟、长时间连轴转」优化的推理系统。所谓端到端延迟,白话是从传感器输入进模型到动作决策吐出来的整段耗时,而不是某一个算子的峰值成绩。对本体厂与集成商,约38Hz量级的频率叙事,意味着控制环有机会更接近实时;但数字必须绑死在具体模型、精度与硬件组合上理解。

放在具身规模化落地上下文里,行业一边刷VLA与世界模型海报,一边发现「模型会做」不等于「板上跑得动」。APXInf选择开源补上部署环,等于把讨论从榜单分数推进到闭环频率与工程可接入性。竞品若只有云端Demo、给不出端侧延迟与硬件清单,采购评审会更吃力。

产业影响上,若第三方在非官方机台复现延迟曲线,会抬高「端侧推理」作为可复用基建的权重;若长期只有首发两款模型、国产芯片后端缺位,覆盖面仍有限。需要把边界读清楚:公开性能为特定评测条件;国产算力后端与更多世界模型适配仍在路线图。下一观察点是第三方复现报告,以及Qwen、Groot等适配落地进度。