机器人从展会Demo走向产线与门店,瓶颈常从「会不会动一下」变成「做错一次之后能不能自己改」。9月2日,星尘智能方面确认,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入,将重点负责机器人强化学习方向的技术研发与应用探索,并继续扩充相关团队。
星尘智能是聚焦具身智能与绳驱机器人本体的公司,公开叙事强调「Design for AI」:身体、数据与模型不应被割裂设计,并逐步形成基座模型、前端Agent与强化学习后训练协同的技术闭环。孙鹏的加入,被定位为补齐「真机反馈驱动策略进化」这一环——过去两年行业主要在解决「会不会」,商业化阶段比拼「稳不稳」。
履历与职责要点:
所谓机器人强化学习后训练,白话是让策略在真实接触力、摩擦与失败里继续学,而不是只在仿真里刷分;所谓全栈协同,白话是本体、操作系统与模型不能各做各的。数字世界的RL已经被游戏与LLM后训练反复验证;物理世界多了接触不确定性、安全约束与数据获取成本,难度更高,也更决定交付能不能签长单。
放在人才竞争上下文里,行业抢人正从视觉与VLA扩展到能扛分布式RL与真机闭环的人。对客户,团队补齐后要看故障恢复、任务泛化与连续运行是否可合同化;对同行,则是「有没有人能把RL从游戏与LLM后训练搬到物理世界」的对照。需要把边界读清楚:人事变动以公司确认口径为准;具体产品节点仍待后续发布。下一观察点是真机数据闭环规模与工业场景连续运行指标。