- ZEST 使人形機器人能夠學習多種複雜動作如爬行和空翻。
- 該框架不需要示範或明確標籤來識別機器人的接觸點。
- ZEST 的自適應取樣技術能有效提升機器人的學習效率。
- 目前 ZEST 的應用仍限於平坦環境,尚需進一步研究。
研究人員開發了一種新的控制框架,使人形機器人能夠執行靈活的動作,包括爬行、霹靂舞和空翻。這一系統名為零-shot 體現技能轉移(Zero-shot Embodied Skill Transfer,簡稱 ZEST),利用增強學習技術教導機器人從人類動作捕捉、視頻和動畫數據中獲得全身運動。與需要特定任務訓練的方法不同,ZEST 允許機器人在部署之前通過單一訓練階段學習多種動作。
對於 Boston Dynamics 的 Atlas、Unitree 的 G1 及 Boston Dynamics 的 Spot 的測試顯示,這些機器人能夠執行爬行、側手翻、倒立、踢足球等複雜動作,並能適應不同的機器人身體類型。
ZEST 的創新技術
來自 RAI Institute 和 Boston Dynamics 的研究人員開發了 ZEST,這是一種增強學習框架,旨在為腿式機器人提供更靈活的方式,從動作數據中學習複雜的人類動作。該系統旨在減少每種新機器技能通常所需的工程和控制器調整。ZEST 可以從三個不同的來源學習:高保真動作捕捉數據、使用單一攝像頭拍攝的普通視頻和關鍵幀動畫。來自動作捕捉和視頻的人類動作通過運動學重定向轉換為機器人兼容的格式,而動畫則可以提供人類無法執行或更適合非人形機器人的動作。
重要的是,該框架不需要示範來包含明確的標籤,以識別機器人何時或何處應與地面接觸。
其核心技術是一種完全在模擬環境中訓練的增強學習策略,然後轉移到物理硬體上而無需額外的微調。ZEST 使用相對簡單的前饋策略,並僅在部署期間依賴於機器人的自我感知測量。根據團隊發表的研究,該系統避免了通常用於複雜機器人控制管道的幾個組件,包括狀態估計器、長期觀察歷史、未來參考窗口、接觸計劃以及廣泛的任務特定獎勵工程。
自適應取樣的優勢
ZEST 的一個關鍵特徵是自適應取樣。ZEST 不會在每段動作序列中的每個部分上均勻訓練,而是將軌跡分為固定長度的段,並跟蹤機器人在每個段上失敗的頻率。更困難的部分會被更頻繁地取樣,而最低取樣概率則能防止較簡單的技能被遺忘。該系統還使用基於虛擬模型的自動課程,該模型為機器人的基座施加助力。在困難的動態動作中,助力最強,隨著策略的改進而逐漸減少。
研究人員還開發了用於關節(例如腳踝、膝蓋和腰部)中閉環平行連桿致動器的簡化模型。這些近似可以減少模擬複雜性,同時保留重要的致動器動力學。ZEST 還納入了致動器的影響,例如功率限制、馬達飽和、傳輸損失和摩擦,以改善模擬與現實世界的轉移。該方法已在 Boston Dynamics 的 Atlas、Unitree 的 G1 和 Boston Dynamics 的 Spot 四足機器人上進行了測試。
每個獨立策略大約需要 10 小時的訓練,或大約 7,000 次迭代,在單一 NVIDIA L4 GPU 上進行。
未來研究方向
在 Atlas 上,ZEST 再現了包括爬行、前滾翻、側手翻、軍事爬行和霹靂舞等動作。視頻衍生的技能包括舞蹈、踢足球和爬箱,而動畫使 Spot 能夠執行連續的空翻和桶滾。研究人員表示,ZEST 可以簡化從人類運動數據到機器人控制的過程,但目前仍限於平坦、非滑的環境,尚未顯示出對完全未見過動作的泛化能力。未來的研究包括零-shot 和少-shot 適應、持續學習、基於語言或關鍵幀的控制,以及將高級命令轉換為可執行機器人動作的生成系統。
ZEST 如何改變機器人學習方式
ZEST 的開發標誌著機器人學習技術的一次重大進步,特別是在靈活性和適應性方面。透過增強學習,ZEST 能讓機器人從多種數據來源中學習,顯著減少了對傳統工程調整的依賴。這種方法不僅提高了學習效率,還能讓機器人更快地掌握複雜動作,這對於未來的機器人應用場景具有深遠的影響。然而,目前的限制在於環境的要求,未來的研究需要克服這些挑戰,以擴展 ZEST 的應用範圍。

