谷歌Gemini Robotics 2发布:人形机器人全身控制,物理AGI迈出关键一步

谷歌Gemini Robotics 2发布:人形机器人全身控制,物理AGI迈出关键一步

2026年7月30日,谷歌DeepMind发布新一代机器人AI模型Gemini Robotics 2。这次发布最值得关注的不是某个单项能力,而是一个结构性变化——首次实现对人形机器人的全身控制:从行走、蹲下、伸手到双手操作物件,全部由同一个模型完成,并且能自行规划多步任务、与其他机器人分工协作。

DeepMind机器人业务负责人卡罗琳娜·帕拉达(Carolina Parada)称,这是迈向真正”物理AGI”的关键一步。消息发布当日,谷歌美股盘前一度上涨3%。

一、三款模型,各管一段

这次实际发布的是一个系列,共三款模型,分工清晰:

  • Gemini Robotics 2:视觉-语言-动作(VLA)模型,负责把摄像头画面和自然语言指令转化为电机控制指令
  • Gemini Robotics ER 2:具身推理模型,负责理解环境、与人沟通、规划多步任务,并协调多台机器人完成工作
  • Gemini Robotics On-Device 2:可直接在机器人机载计算机上运行,减少对网络连接的依赖

开放节奏上,Gemini Robotics ER 2即日起通过Gemini API和Google AI Studio向开发者提供,另外两款先向早期合作伙伴开放。

三款模型能力对照

模型 定位 核心能力 开放状态
Gemini Robotics 2 视觉-语言-动作 人形机器人全身动作控制 早期合作伙伴
Gemini Robotics ER 2 具身推理”大脑” 数百步长程任务规划、工具调用、多机分工 Gemini API / AI Studio
Gemini Robotics On-Device 2 端侧部署 机载运行、降低网络依赖 早期合作伙伴

二、ER 2才是真正的”高级大脑”

系列里最亮眼的是Gemini Robotics ER 2。谷歌方面的形容是:可以把它看作机器人的高级大脑,让机器人能够与人类聊天、理解物理世界并规划多步骤任务。

具体能力包括:

  • 支持自然语言下达指令,规划并执行耗时数分钟、包含数百个步骤的长程任务
  • 具备工具调用能力,可访问外部云服务(如Google搜索)来澄清模糊指令
  • 能把冗长任务拆解、分配给多个机器人并行处理,显著提升执行效率

官方演示的任务已经从实验室走向生活场景:整理货架、系袋子、更换灯泡、自动化处理包含数百个步骤的家务劳动。

三、别急着欢呼:92%背后还有多远的路

务实一点看数据。研究人员表示,机器人完成”拧下灯泡”这一任务的成功率达到92%,但更加复杂动作的成功率仍然相对较低

这句话值得反复读。92%听起来很高,可放到真实家庭或工厂场景里,意味着每12次操作就有1次失败。而灯泡还是相对结构化的任务——更复杂的柔性操作、多物体交互、意外扰动下的恢复,成功率会明显下滑。

过去互联网上流行的机器人跑步、跳舞视频,大多依赖预设程序执行单一任务。Gemini Robotics 2的价值在于换了一条路:用统一大模型替代分模块的手工编程。这条路一旦跑通,机器人的能力增长曲线会和大模型对齐,而不是靠工程师一个动作一个动作去调。

四、对国内产业链的三个提示

  • 本体厂商压力上升:当”大脑”由通用模型提供,硬件的差异化必须回到成本、可靠性与量产能力上
  • 具身数据是护城河:模型泛化靠数据,真实场景的操作数据仍然稀缺,这是国内团队的机会窗口
  • 端侧推理成刚需:On-Device 2的出现说明谷歌也认同网络依赖是落地障碍,国产端侧算力方案值得关注

FAQ

Q1:Gemini Robotics 2最大的突破是什么?

首次实现对人形机器人的全身控制——行走、蹲下、伸手到双手操作物件均由同一模型完成,并可自行规划多步任务、与其他机器人分工合作。

Q2:开发者现在能用上吗?

可以用上其中一款。Gemini Robotics ER 2已通过Gemini API和Google AI Studio向开发者开放;Gemini Robotics 2和On-Device 2目前仅向早期合作伙伴开放。

Q3:什么是”物理AGI”?

指AI从数字世界的感知与推理,延伸到物理世界的认知、规划与执行,让机器人能像人一样胜任多种未经专门训练的任务,而不是只执行预设程序。

Q4:现在的成功率能商用吗?

还需要观察。官方披露拧下灯泡任务成功率为92%,但研究人员明确表示更复杂动作的成功率仍然相对较低。结构化、容错率高的场景可以先试点,高精度或高风险场景仍需谨慎。

© 版权声明
THE END
喜欢就支持一下吧
点赞5 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容