Alphabet旗下Google DeepMind正式对外发表专为具身智慧(Embodied AI)与人形机器人量产设计的「Gemini Robotics 2」系列模型。该系统改善长程步骤(Long-horizon tasks)推理与多台机械设备跨品牌协同合作的瓶颈,让实体AI迈入自主规划能力的新阶段。
Gemini Robotics 2定位为适用於各类机器人的核心智慧层(Intelligence Layer)。该系统涵盖三大核心模型,成功将视觉与语言理解直接转化为马达控制,赋予机器人全身协调、精密操作以及多机协作能力,标志着通用机器人技术迈入全新里程碑。
在模型架构方面,系统由视觉语言行动(VLA)模型与具身推理(ER)模型协同运作。主力模型Gemini Robotics 2能将输入影像与指令即时转译为马达控制讯号;具备长程规划能力的Gemini Robotics ER 2负责实体空间推理与任务拆解;而Gemini Robotics On-Device 2则是专为机器人硬体本机运算优化的轻量化端侧模型,有效降低控制延迟。
Gemini Robotics 2具备极隹的通用性与快速适应能力,仅需数小时即可部署至新型双臂机器人或复杂人形躯体。此外,系统实现了从脚尖到指尖的全躯体平衡控制,并赋予多指灵巧手拧螺丝、打结等高精度微操能力,彻底颠覆传统机器人仅能执行单一固定任务的局限。
在互动与自动化层面,该系统展现出高度的代理人(Agentic)特性与自然互动能力。机器人不仅能自主进行长程步骤规划,更支援两台以上的机器人在共享空间内进行自主沟通与分工协作。使用者亦能以日常囗语下达指令或即时修正机器人行为,机器人甚至能囗头解释其决策过程,大幅降低在危险或复杂环境下的操作门槛。
目前Google DeepMind已与Boston Dynamics、Apptronik及Agile Robots等顶尖机器人硬体厂商展开深度合作,并透过「Trusted Testers」计画开放逾百家企业夥伴进行实地测试。同时,官方亦启动「Google DeepMind Accelerator」加速器计画扶持早期Physical AI新创,全面加速新一代通用机器人的商用化生态布局。
Google DeepMind团队指出,Gemini Robotics ER 2能将人类下达的自然语言指令拆解为涵盖数百个步骤的逻辑规划;随後,系统会将规划发给地端视觉语言动作(VLA)模型,直接转化为控制致动器马达的底层物理指令。
在实际应用测试中,当多台搭载该模型的人形机器人与轮式手臂共同处理杂乱无章的车间物流或高混线精密电子组装时,机载系统能在摆脱外部高昂相机辅助的前提下,透过地端推论即时同步。若其中一台机器人遭遇突发机械故障,其馀机器人能自主接管未完成的步骤。

