Google DeepMind|Gemini Robotics 2实现全身控制与多机协作

PromptTree|阅读 0
2026/07/31 11:06
Google DeepMindGemini Robotics具身智能VLA
7月30日Google DeepMind发布Gemini Robotics 2,含VLA动作模型、ER具身推理模型与On-Device端侧模型,首次将控制扩展到完整人形全身,并支持多机协作。拧下灯泡成功率约92%,多指任务仍参差;ER 2已在Google AI Studio开放,安全侧同步推出ASIMOV-Agentic基准。

人形机器人会挥手已经不够看了——Google DeepMind要让它们从脚到指尖一起干活。

Google DeepMind是Alphabet旗下前沿人工智能研究机构,近年把Gemini多模态能力向物理世界延伸,形成Gemini Robotics产品线。2025年公司已展示视觉与语言驱动机器人动作的版本;行业共识是:桌面上的抓取演示不难,难的是走进人类生活空间后还能走、蹲、弯腰、换手,并在不确定环境里与人安全共处。

7月30日,DeepMind正式发布Gemini Robotics 2,定位下一代可适应机器人的智能层,重点解锁全身控制、精细灵巧操作与多机器人协作。体系拆成三款模型协同工作,也可按场景独立调用。

三款模型分工:

  1. Gemini Robotics 2:最强视觉—语言—动作模型(VLA,Vision-Language-Action),把视觉与语言输入转成电机控制,可驱动完整人形与双臂机器人,并覆盖多指手与平行夹爪。
  2. Gemini Robotics ER 2:具身推理(Embodied Reasoning)模型,本质是视觉语言模型(VLM),充当高层Agent——与人沟通、理解物理世界、规划可持续数分钟的多步任务,并支持多机组队协作。
  3. Gemini Robotics On-Device 2:端侧高效VLA,面向无网络或低延迟场景;可用数小时数据、通常少于200个样本适配全新双臂本体,即使形态、传感器与自由度差异很大。

相对此前主要控制上半身做桌面操作的版本,Gemini Robotics 2首次把控制范围扩到整个人形。例如指挥Apptronik Apollo 2「把喷壶放进底层绿色箱子」,机器人需行走到桌边取物,再走到货架完成放置。官方展示同一套模型权重可驱动三种本体:Apollo 2搭配SharpaWave手、Apollo 2搭配Inspire手,以及Franka Duo搭配Robotiq夹爪。

灵巧与安全数据:

  1. 多指手:SharpaWave为五指、22自由度,可完成打结、封自封袋等动作;拧下灯泡成功率约92%,拧上灯泡约36%,扎垃圾袋约44%,簸箕操作约32%,自封袋约40%——精细操作仍是短板。
  2. 夹爪:Franka Duo上通用抓取放置约74.2%,工具齐套约78.9%,精密插入约89.6%。
  3. 全身操作示例(Apollo + Inspire手):桌面拾取约68.4%,地面拾取约45.7%,货架拾取约76.3%。
  4. 安全:推出ASIMOV-Agentic基准,衡量具身推理Agent能否拒绝不安全工具调用、判断任务可否安全完成,以及不确定时是否主动请求人工介入;DeepMind称ER 2在安全约束遵循与人类邻近基准上为迄今最安全的机器人模型,可在人靠近时触发安全工具调用并安全停机。

所谓VLA,白话就是「看见图、听懂话,直接输出怎么动」;ER则像给机器人配了一个会做计划的大脑,VLA负责把计划变成关节动作。开放节奏分层:Gemini Robotics ER 2已在Google AI Studio公开展示,并在Gemini Enterprise Agent Platform提供私人预览;VLA与On-Device模型面向早期合作伙伴与受信任测试方。合作伙伴公开致谢名单中包括Apptronik、Boston Dynamics与Agile Robots等。

具身智能的下一道坎,不是再拍一段会跳舞的视频,而是全身协调、多机分工与安全停机能否进真实场景。观察点有三:多指任务成功率能否从演示区间爬到可用区间;端侧适配成本是否真能压到「数小时级」;ASIMOV类安全评测会不会成为行业采购的硬门槛。