机器人行业最贵的隐性成本,常常不是硬件报价,而是「换一台本体就重训一遍」——Skild S1把赌注押在「看一遍就会」:不改权重,只给一段示范视频,就能扛住十分钟级的陌生长程任务。若这条路线在更多工厂站得住,技能开发方式可能从采数据变成录视频。
Skild AI是2023年成立的北美具身智能公司,由卡内基梅隆大学机器人研究所教授Deepak Pathak与Abhinav Gupta联合创立,投资方包括软银、英伟达、贝索斯等;2024年走出隐身模式后估值快速抬升,2026年1月C轮融资后公开估值口径逾140亿美元。公司长期强调「Any robot, any task, one brain」——同一套Skild Brain可跑在机械臂、四足、人形等不同本体上,延续自2022年WHIRL等「单次模仿学习」学术路线。
8月26日前后,Skild发布机器人基础模型S1,核心能力是上下文学习(In-Context Learning,ICL):在不改动模型权重、不做后训练微调的前提下,仅观看一段人类示范视频,即可执行煎饼、冲泡咖啡、植物换盆与设备组装等最长约10分钟的未见过长程任务。官方博客称,在分布外(OOD)任务上,视频ICL成功率约66%,而基于语言提示的视觉-语言-动作(VLA)模型约9%;若走传统后训练路线,若要追平单次演示效果,约需380次任务演示;堆到约2000次演示后,传统路线最终约可达86%,但数据与真机成本显著更高。
实验与Scaling叙事:
所谓上下文学习,白话是模型把示范视频当作「临时说明书」塞进上下文,当场照做,而不是把说明书写进权重里再出厂。所谓VLA(视觉-语言-动作),白话是听人话指挥动手——在陌生长程任务上,语言往往不如「让你看我做一遍」信息密度高。所谓OOD任务,白话是训练时没见过的工位、道具与顺序组合,检验泛化而不是背题。
官方演示强调「从录示范到机器人上手」可压缩到约11分钟级(以植物换盆为例),这对工厂试点意味着标定与换线成本可能数量级下降。与上周Generalist Gen 1.5等「具身大脑」进展同向,但Skild更强调跨本体与十分钟级OOD——验收仍要看真实工位节拍、安全急停与失败恢复,而非宣传片里的厨房场景。
产业观察上,若「录一条示范≈六七十分」在工业POC中可复现,机器人软件商业模式可能从「卖license+驻场调参」转向「卖大脑+按技能订阅」。可以把它想成:过去学开车要进驾校刷几十小时,现在给你看一段教练示范就能上路——能开多远,还得看路况与交规。对资本,Skild高估值押的是通用大脑能否成为「机器人时代的安卓」;对买方,应先签可审计的成功率与人工接管率SLA。
需要把边界读清楚。66%与380次等数字来自官方博客与自有实验设置,第三方独立基准仍少;长程任务的安全认证与责任边界未在公开材料中完整披露。下一观察点是制造业客户POC报告、不同本体迁移是否需额外标定工时。