AlphaGo靠自己跟自己下,下出了人类没教过的棋。Skild AI想在草坪上重复这件事:只给「进球」,不给盘带说明书。
Skild AI是美国具身智能公司,主张「Any robot, any task, one brain」,此前发布跨本体机器人基础模型S1与Skild Brain。当地时间9月23日前后,团队在技术博客发布物理自博弈(physical self-play)后训练成果,并以足球为主要展示。训练在NVIDIA Isaac Sim中进行:奖励几乎只围绕得分,对手是模型自身近期版本;公开叙述称仿真早期数月连走路都不稳,随后自行学会摔倒起身,并涌现带球突破、护球与抢断等未被逐项奖励的行为。策略再迁移到真实人形机器人,演示与人类对抗中的防守、过人与射门。公司将演示机称为「Messinator」,强调基础模型先学人类数据,再用自博弈突破人类示范天花板。
路线意义在于把RL自博弈从棋牌/电竞拉回高维接触动力学。足球同时考验平衡、接触与策略,适合当试验台;团队称正把方法扩展到日常任务,并计划观察多机器人协作中的新行为。必须冷静的一点是:训练主战场仍在仿真,真机草坪、摩擦与对抗噪声下的成功率、受伤与安全边界尚未被公开评测钉死。对行业,这与「大规模人类视频预训练」形成对照——一条拼数据覆盖,一条拼自我课程难度。下一步看开源代码/模型是否放出、真机指标是否可复现,以及非体育任务是否同样出现「无奖励设计却涌现」的动作。