机器人要不要在动手之前先在内部把结果「放映」一遍?智元给出的进展是:这条闭环已经跑通,而且能连续推演数分钟。
智元机器人做具身智能,产品包括远征等人形平台。7月22日,它正式发布AWE 3.5,定位是具身原生大模型,并称率先跑通了完整闭环,方法论被验证成立。具身原生,意思是模型为机器人的感知和动作而训练,不是先做一个聊天模型再外挂控制器。闭环,是感知、决策、动作、再感知连成一圈,而不是只演示一个预先编好的动作。
AWE 3.5继承并加强了AWE 3.0的三条路线。OSD是全视角通感决策,让决策用上周围的感知,而不是单摄像头。HTS是高密度触觉感知,补上「碰到了什么」。LAS是隐空间里的丝滑动作,隐空间是把高维状态压成模型更好计算的内部表示,用来让动作更连贯。三条加在一起,原文的判断是:动作更流畅、更稳健、更精准。
新的一层是世界引擎驱动的后训练。后训练是预训练之后,用额外目标继续改模型。世界引擎在这里的作用,是在隐空间里推演未来状态:先估计不同动作会带来什么结果,再选更优的下一步。它不是在真机上把每个错误都试一遍,而是先在内部预演。通过扩大预训练数据和参数,预测推理的连贯性、时长和稳定性被描述为显著增强。这被对照为大模型里熟悉的规模定律:数据和参数变大,能力跟着上一个台阶。规模定律本身不保证每一个机器人任务都成功,它只说明智元把这条经验用到了具身模型上。
基于此,AWE 3.5已支持数分钟的连续、交互式闭环推演,并被指向工业、商业服务和家庭里的精细操作。数分钟是时间尺度,不是「可以上班八小时」的承诺。交互式,是中途可以改条件,而不是播一段固定视频。
这发生在远征A3 Ultra入选世界人工智能大会镇馆之宝之后。展台上的整机和这次的模型发布是两件事:一台说明身体能被做出来,一套模型说明长程任务有没有内部闭环。具身智能若只有身体,仍是遥控或脚本;有了数分钟的推演,才开始具备把一段任务做完的条件。下一步看的是这数分钟在工厂或门店里的失败方式,而不是再增加一条路线的缩写。