- Gemini Robotics 2 具備全身運動與多步驟推理能力。
- 新模型可在短時間內適應不同機器人設計。
- 機器人能夠理解指令並進行多機器人協作。
- Gemini Robotics On-Device 2 可本地運行,無需雲端連接。
Google 推出了 Gemini Robotics 2,這是一款新型機器人模型,旨在控制整個人形機器人,使其具備行走、彎曲、平衡和操作物體的能力,同時完成複雜的任務。該公司表示,該系統還可以協調多個機器人,並在僅需幾小時的訓練下適應不同的機器人身體。這一發布是在今年早些時候推出的 Gemini Robotics 的基礎上擴展,能力不再僅限於桌面操作,而是涵蓋了全身運動。
Google 還推出了兩個伴隨模型:Gemini Robotics ER 2 用於高級推理,以及 Gemini Robotics On-Device 2,該模型在機器人上本地運行,無需雲端連接。
新型機器人模型的特點
與傳統的編程為重複任務的機器人不同,這些新模型的設計旨在通過推理執行動作,適應不熟悉的環境,並以最少的再訓練執行多步驟的工作。Google 表示,這一視覺-語言-行動模型能夠控制人形機器人以及雙臂機器系統,使其能夠使用雙手或機器抓手執行家庭和工業任務。最大的變化之一是全身控制。早期模型主要集中於上半身運動,而 Gemini Robotics 2 則使人形機器人能夠在房間內行走、蹲下、伸展並與物體互動。
在演示中,Google 的模型控制了 Apptronik 的 Apollo 2 人形機器人,指導其拾起澆水壺、穿越房間並將其放置在較低的架子上。
同一模型檢查點也應用於其他機器人平台,包括 Franka Duo,突顯其在不同機器人實體之間工作的能力。Google 表示,該模型還提高了靈活性。它可以操作 Apollo 2 的五指機器手進行例如綁垃圾袋、封閉 Ziploc 袋和拆卸燈泡等任務。在使用雙指抓手的工業平台上,它可以執行精確的插入任務、工具處理和物體放置。該公司還通過 Google AI Studio 提供其具身推理模型 Gemini Robotics ER 2,並在 Gemini Enterprise Agent Platform
上進行私人預覽。視覺-語言-行動模型和本地模型正向早期接入合作夥伴發佈。
提升機器人的推理能力
更智能的機器人團隊合作 Google 表示,Gemini Robotics ER 2 作為機器人的高級推理引擎,能夠理解口頭指令,將其分解為多個步驟,並監控進度直至任務完成。更新的模型可以執行持續幾分鐘的任務序列,同時做出數百個決策。它還能從失敗的行動中恢復,並適應不斷變化的環境,而不是遵循固定的例程。另一項新能力是多機器人協作。不同類型的機器人現在可以進行通信並分工,完成單一機器難以獨自執行的任務。
對於無法連接互聯網的應用,Google 推出了 Gemini Robotics On-Device 2。該公司表示,該模型在機器硬件上本地運行,並能夠在少於 200 個訓練樣本的情況下,僅需幾小時即可適應全新的雙臂機器人設計。
此外,Google 還推出了 ASIMOV-Agentic,這是一項新的基準,旨在評估機器人的安全性,包括機器人是否拒絕進行不安全的行為、識別不確定性以及在需要時請求人類協助。該公司表示,Gemini Robotics ER 2 也提高了人類接近檢測的能力,使機器人在有人的情況下安全停止。
Gemini Robotics 的進步與未來應用
Google 推出的 Gemini Robotics 2 和相關模型顯示了機器人技術的顯著進步,特別是在全身運動和推理能力方面。這些新模型能夠適應不熟悉的環境,並進行多步驟任務,這對於家庭和工業應用都具有重要意義。此外,機器人之間的協作能力使得複雜任務的執行變得更加高效,這對未來的自動化和智能化發展具有深遠影響。

