星尘智能|前字节强化学习专家孙鹏加盟,负责机器人强化学习

PromptTree|阅读 0
2026/09/03 08:34
星尘智能孙鹏强化学习具身智能
9月2日星尘智能确认,前字节强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士加入,负责机器人强化学习研发与团队扩充。公司叙事强调AI模型、具身OS与绳驱本体协同,把数字世界已验证的RL逻辑迁回真机反馈闭环。

机器人从展会Demo走向产线与门店,瓶颈常从「会不会动一下」变成「做错一次之后能不能自己改」。9月2日,星尘智能方面确认,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入,将重点负责机器人强化学习方向的技术研发与应用探索,并继续扩充相关团队。

星尘智能是聚焦具身智能与绳驱机器人本体的公司,公开叙事强调「Design for AI」:身体、数据与模型不应被割裂设计,并逐步形成基座模型、前端Agent与强化学习后训练协同的技术闭环。孙鹏的加入,被定位为补齐「真机反馈驱动策略进化」这一环——过去两年行业主要在解决「会不会」,商业化阶段比拼「稳不稳」。

履历与职责要点:

  1. 学术与早期产业:清华大学背景,康奈尔、罗格斯博士后;腾讯AI Lab与Robotics X期间负责智能体中心,参与轮式机器人端到端跟随及《星际争霸》相关智能体
  2. 字节阶段:主导ByteRL等大规模强化学习基础设施,支撑游戏AI训练;并参与大模型强化微调、数学推理智能体等工作
  3. 新职责:负责机器人强化学习技术研发与应用,扩充团队,与具身模型、具身OS、绳驱本体形成协同
  4. 公开表态口径:希望把数字世界已验证的RL积累带回物理世界,让机器人在一次次真实执行中把任务越做越好

所谓机器人强化学习后训练,白话是让策略在真实接触力、摩擦与失败里继续学,而不是只在仿真里刷分;所谓全栈协同,白话是本体、操作系统与模型不能各做各的。数字世界的RL已经被游戏与LLM后训练反复验证;物理世界多了接触不确定性、安全约束与数据获取成本,难度更高,也更决定交付能不能签长单。

放在人才竞争上下文里,行业抢人正从视觉与VLA扩展到能扛分布式RL与真机闭环的人。对客户,团队补齐后要看故障恢复、任务泛化与连续运行是否可合同化;对同行,则是「有没有人能把RL从游戏与LLM后训练搬到物理世界」的对照。需要把边界读清楚:人事变动以公司确认口径为准;具体产品节点仍待后续发布。下一观察点是真机数据闭环规模与工业场景连续运行指标。