- BeyondMimic 讓人形機械人無需逐項訓練即可執行高難度動作。
- 該系統可從人類示範中學習並自然切換不同技能。
- 研究顯示,BeyondMimic 生成的動作更接近人類,觀察者偏好度高。
- 此框架開闢了人形機械人學習新技能的可能性,無需重新訓練。
研究人員近日發佈一套名為 BeyondMimic 的新框架,使人形機械人能夠執行敏捷且近似人類的動作,並在多項技能之間流暢切換。該系統讓機械人得以完成側手翻、旋踢、各類運動動作及雜技表演等複雜動作,無須為每項任務進行獨立訓練。BeyondMimic 從人類動作數據中學習,並能將所學動作遷移至新任務及新環境。研究團隊表示,此方法有望解決現有人形機械人控制系統的限制,現有系統往往需要大量微調,或只能產生僵硬、不自然的動作。
BeyondMimic 模型讓人形機械人能夠從人類示範中學習敏捷且近似人類的動作,並將這些技能組合,執行從未明確訓練過的任務。該系統針對人形機械人領域的一項重大挑戰:機械人雖然可以學會走路、跳躍、踢腿等個別動作,但要令其在不同技能之間自然切換,仍然相當困難。現有方法通常需要針對特定動作設計獎勵函數、進行大量調整,或為每項任務分別訓練。BeyondMimic 採用兩階段學習框架來克服這些限制。
兩階段學習框架的運用
在第一階段,研究團隊運用強化學習(RL)訓練機械人追蹤各式各樣的人類動作。關鍵在於,團隊採用單一動作追蹤公式、共享獎勵結構及共通超參數,而毋須為每個動作單獨調整系統。
研究人員使用約 2.5 小時的多樣化人類動作數據訓練該系統,使其學會數百項技能,涵蓋一般行走與跑步、單腳平衡、跳躍、舞蹈動作、武術靈感動作、旋踢及側手翻等。其後,研究團隊將 21 段具代表性的動作片段部署至實體人形機械人上,證明系統能夠可靠地將模擬環境所學遷移至硬件。第二階段引入潛在擴散模型(latent diffusion model),賦予 BeyondMimic 生成及組合動作的能力。
該模型並非單純重播已學會的動作序列,而是學習協調狀態與動作軌跡的底層分佈。研究團隊表示,變分自編碼器(variational autoencoder)首先將這些動作壓縮成更平滑的潛在表徵,隨後擴散模型學習這些表徵的演化方式。
生成與調整技能的能力
研究人員其後在推論階段運用分類器引導(classifier guidance)技術,將擴散模型導向訓練階段未涵蓋的目標,使機械人毋須重新訓練或微調底層策略即可調整既有技能。例如,系統可接收搖桿指令並產生相應的行走或跑步行為;亦可朝指定路標點移動、避開障礙物,或根據稀疏的未來關鍵幀生成完整的過渡動作。在其中一項示範中,機械人從行走流暢地轉入側手翻,隨後回復行走狀態;亦執行了側手翻與行走、跑步交替組合的動作序列。
該方法還能同時結合多項目標,例如將路標點追蹤與避障成本整合,使機械人能夠在繼續朝向目標的同時繞過障礙物;同一框架亦可將搖桿控制與碰撞規避結合運用。實體機械人展示了高度動態的動作,包括空中側手翻、旋踢及翻轉踢腿等。在空中側手翻過程中,機械人的峯值加速度達到 31 m/s²,盆骨角速度最高可達 15.7 rad/s,與文獻中所報導的熟練人類空中動作數值相若。
除敏捷性外,研究人員亦發現系統所生成的行走及跑步動作對人類觀察者而言更為自然。在一項涉及 77 名參與者的研究中,BeyondMimic 所產生的動作在 70.8% 的選擇中被評為比機械人原生控制器更近似人類且更自然,相比之下原生控制器僅獲 29.2% 的偏好。研究團隊表示,核心突破並非單一全新組件,而在於將可擴展的動作追蹤、潛在擴散模型及推論階段引導技術加以整合。
技能獲取與任務的分離
透過將技能獲取與任務規格分離,BeyondMimic 為人形機械人開闢了一條路徑,使其能夠學習大量人類動作庫,並在毋須針對特定任務重新訓練的情況下,重新組合各項技能以應對新情境。
項目 規格/數據 框架名稱 BeyondMimic 學習方式 兩階段(強化學習 + 潛在擴散模型) 訓練數據時長 約 2.5 小時人類動作數據 已學技能數量 數百項 部署至實體機械人嘅動作片段數量 21 段 空中側手翻峯值加速度 31 m/s² 盆骨最大角速度 15.7 rad/s 使用者研究參與者人數 77 人 偏好 BeyondMimic 動作嘅比例 70.8% 偏好原生控制器動作嘅比例 29.2%
BeyondMimic 對機械人技術的影響
BeyondMimic 框架的開發標誌著人形機械人技術的一個重要進步。傳統上,機械人需要為每項技能進行獨立訓練,這不僅耗時,也限制了其靈活性。透過整合強化學習和潛在擴散模型,BeyondMimic 能夠從人類動作中學習,並在不同情境中快速適應,這將大幅提升機械人在現實世界應用中的實用性。此外,生成的動作更自然,這對於未來人形機械人在社會中的角色具有重要意義。

