具身模型在云端跑得再好看,搬到机器人本体上仍可能卡在三件事:加载慢、推理抖、接入难。对需要连续感知与实时控制的机器人,几百毫秒延迟不再是「体验差一点」,而可能是轨迹不连贯、任务反复失败。9月15日前后,无问芯穹联合清华大学、上海交通大学正式开源具身智能端侧推理引擎APXInf,定位覆盖模型开发、效果验证到本体部署的端侧推理链路;开源仓库公开指向RLinf生态下的APXinf-robo项目。
无问芯穹是国内做大模型与具身基础设施的团队之一。约2025年9月,其联合清华大学等团队开源面向具身智能大规模强化学习后训练的RLinf框架;APXInf被描述为把能力从训练与评测,延伸到机器人端侧推理与部署,形成同一条工程链路上的前后端。目标不是把云端聊天推理框架原样搬上车载算力板,而是在有限算力、功耗与成本约束下,兼顾小Batch、低延迟与长时间稳定运行。
开源与性能要点(团队公开口径):
所谓端侧推理引擎,白话是专门为「小批量、低延迟、长时间连轴转」优化的推理系统。所谓端到端延迟,白话是从传感器输入进模型到动作决策吐出来的整段耗时,而不是某一个算子的峰值成绩。对本体厂与集成商,约38Hz量级的频率叙事,意味着控制环有机会更接近实时;但数字必须绑死在具体模型、精度与硬件组合上理解。
放在具身规模化落地上下文里,行业一边刷VLA与世界模型海报,一边发现「模型会做」不等于「板上跑得动」。APXInf选择开源补上部署环,等于把讨论从榜单分数推进到闭环频率与工程可接入性。竞品若只有云端Demo、给不出端侧延迟与硬件清单,采购评审会更吃力。
产业影响上,若第三方在非官方机台复现延迟曲线,会抬高「端侧推理」作为可复用基建的权重;若长期只有首发两款模型、国产芯片后端缺位,覆盖面仍有限。需要把边界读清楚:公开性能为特定评测条件;国产算力后端与更多世界模型适配仍在路线图。下一观察点是第三方复现报告,以及Qwen、Groot等适配落地进度。