硬件已经能跑能翻,软件还听不懂一句完整的话。千寻智能联合创始人高阳把这个差距说成了时间表,而不是口号。
据路透社9月18日报道,高阳同时是清华大学机器人学助理教授、千寻智能联合创始人兼首席科学家。千寻智能做具身智能,赛道就是给机器人补「大脑」:听指令、做一串动作,而不是只演示单个绝活。
路透社转述的判断:
「GPT-3.0级」是类比,不是某个公开榜单的分数。高阳用它描述一种可用性:人说话,机器尝试做一串合理动作,而不是把每个动作都预先编程。这和Figure同一周公布的「进陌生家庭做家务」不是同一句话——一家在给时间表,一家在给自测成功率。
中国人形机器人这半年的公开叙事,大量停在奔跑、舞蹈和格斗。高阳把竞争重心挪回软件,并主动把家庭场景放在工业和商业服务之后。这个排序和展会观众的期待相反,但和故障成本一致:工厂里任务重复、环境可控;家里物品、光照和指令都在变。路透社的报道也把全行业正在等的东西说成软件突破:硬件炫耀已经不够,缺的是能把技术变成客户愿意持续付费的那一层。
高阳用公司自己的时间线做对照,而不是用别人的展台。成立初期只能倒水、叠一件衣服;现在声称能在较大空间里把流程串起来。这句话可核对的部分是「任务从单点变成序列」,不可核对的部分是序列有多长、失败了怎么办。精细动作被单独拿出来说,是因为旋瓶盖、拿没见过的物体,仍然会让「听懂人话」停在理解层,到不了手上。
这是专家预判,不是产品发布,也没有附带评测协议。2027年年中能不能到,取决于数据、可靠性和谁来定义「合理动作」。可核对的部分是:他承认精细操作和未见任务仍未解决,并给了「先工厂、再简单服务、后家庭」的顺序。下一观察点是千寻是否拿出与这句话对应的任务成功率和场景视频,而不是只重复里程碑年份。