Alphabet旗下Google DeepMind正式對外發表專為具身智慧(Embodied AI)與人形機器人量產設計的「Gemini Robotics 2」系列模型。該系統改善長程步驟(Long-horizon tasks)推理與多台機械設備跨品牌協同合作的瓶頸,讓實體AI邁入自主規劃能力的新階段。
Gemini Robotics 2定位為適用於各類機器人的核心智慧層(Intelligence Layer)。該系統涵蓋三大核心模型,成功將視覺與語言理解直接轉化為馬達控制,賦予機器人全身協調、精密操作以及多機協作能力,標誌著通用機器人技術邁入全新里程碑。
在模型架構方面,系統由視覺語言行動(VLA)模型與具身推理(ER)模型協同運作。主力模型Gemini Robotics 2能將輸入影像與指令即時轉譯為馬達控制訊號;具備長程規劃能力的Gemini Robotics ER 2負責實體空間推理與任務拆解;而Gemini Robotics On-Device 2則是專為機器人硬體本機運算優化的輕量化端側模型,有效降低控制延遲。
Gemini Robotics 2具備極佳的通用性與快速適應能力,僅需數小時即可部署至新型雙臂機器人或複雜人形軀體。此外,系統實現了從腳尖到指尖的全軀體平衡控制,並賦予多指靈巧手擰螺絲、打結等高精度微操能力,徹底顛覆傳統機器人僅能執行單一固定任務的局限。
在互動與自動化層面,該系統展現出高度的代理人(Agentic)特性與自然互動能力。機器人不僅能自主進行長程步驟規劃,更支援兩台以上的機器人在共享空間內進行自主溝通與分工協作。使用者亦能以日常口語下達指令或即時修正機器人行為,機器人甚至能口頭解釋其決策過程,大幅降低在危險或複雜環境下的操作門檻。
目前Google DeepMind已與Boston Dynamics、Apptronik及Agile Robots等頂尖機器人硬體廠商展開深度合作,並透過「Trusted Testers」計畫開放逾百家企業夥伴進行實地測試。同時,官方亦啟動「Google DeepMind Accelerator」加速器計畫扶持早期Physical AI新創,全面加速新一代通用機器人的商用化生態布局。
Google DeepMind團隊指出,Gemini Robotics ER 2能將人類下達的自然語言指令拆解為涵蓋數百個步驟的邏輯規劃;隨後,系統會將規劃發給地端視覺語言動作(VLA)模型,直接轉化為控制致動器馬達的底層物理指令。
在實際應用測試中,當多台搭載該模型的人形機器人與輪式手臂共同處理雜亂無章的車間物流或高混線精密電子組裝時,機載系統能在擺脫外部高昂相機輔助的前提下,透過地端推論即時同步。若其中一台機器人遭遇突發機械故障,其餘機器人能自主接管未完成的步驟。

