- DYNA-2 機器人模型基於超過 100 萬小時人類視頻訓練。
- 該模型在高精度製造任務成功率提升至 80%-90%。
- DYNA-2 在不同機器人硬件之間知識轉移能力強。
- 該模型能在無需人類幹預的情況下恢復任務。
Dyna Robotics 最近推出了一款新型機器人基礎模型,該模型基於超過 100 萬小時的人類視頻進行訓練。該公司表示,這一規模可望克服教導機器人處理物理任務時面臨的重大挑戰。這家位於美國加利福尼亞州紅木城的公司表示,其 DYNA-2 世界行動模型完全基於人類自我中心的視頻進行訓練,而非機器人的行動數據。該數據集相當於約 170 年的持續清醒經驗。這一方法旨在讓機器人從人類與物件及其周圍環境的互動中學習物理技能,減少對手動收集的遙控數據的依賴。
Dyna 表示,這可能提供一種更具可擴展性的方式來訓練機器人,以便隨著其能力的擴展而進行調整。
任務成功率大幅提升
根據測試結果,該公司報告指出,DYNA-2 在高精度製造領域的任務成功率從 20% 提升至 80%-90%,僅僅是通過增加預訓練規模。此外,該模型還展示了在靜態機器手臂、人形原型和靈巧機器手之間的知識轉移。Dyna 的模型使用了一種世界建模架構,結合了下一幀和下一行動的預測。該系統不僅僅是學習機器人執行的行動,而是利用人類視頻來發展對物理環境變化及物體對運動反應的理解。
這使得從人類行為中獲得的知識可以在不同的機器人硬件之間轉移。
Dyna 表示,DYNA-2 在預訓練期間未接觸過機器人數據,但可以在僅需幾小時的本地微調後適配到不同的平台。在一次測試中,僅需 13 分鐘的數據就足以讓 DYNA-2 指揮一對五指機器手打開瓶蓋。在 15 個基準任務中,Dyna 表示使用更多人類視頻訓練的模型始終表現更佳。該公司還將 DYNA-2 與其早期的 DYNA-1 模型進行了比較,後者使用的是視覺-語言-行動架構。
在一次零樣本客户部署中,DYNA-2 的質量通過率達到 87%,而 DYNA-1 僅為 46%。
模型韌性與適應性強
Dyna 表示,這一模型在物理幹擾打斷任務時顯示出更好的韌性。在涉及切割食物和清理工作區等活動的測試中,DYNA-2 能夠在無需人類幹預的情況下恢復,而早期模型則需要手動恢復。該公司表示,其視頻共同訓練方法在需要機器人根據指令執行不同物理動作的任務中提高了 133% 的分數。“多年來,通用機器人一直受到數據瓶頸的困擾:手動收集物理遙控數據根本無法擴展到通用智能,”Dyna Robotics 的聯合創始人 Jason Ma 表示。
“行動數據稀缺,但視頻隨處可見,通過 DYNA-2,我們展示了物理直覺不需要在機器手上進行數百萬小時的訓練——它可以直接從人類視頻中學習。”
Dyna Robotics 表示,其基於早期 DYNA-1 模型的機器人已在酒店、餐廳和自助洗衣店中投入使用。該公司認為 DYNA-2 是朝著使機器人能夠學習新物理任務的邁進,無需大量特定於機器人的訓練數據。該公司由 Lindon Gao、York Yang 和前 DeepMind 研究科學家 Jason Ma 創立,並獲得包括 CRV 和 First Round 在內的投資者支持。
DYNA-2 如何改變機器人訓練方式
Dyna Robotics 的 DYNA-2 模型透過人類視頻訓練,顯示出在機器人技術上的重大進步。這種方法不僅解決了傳統數據收集的瓶頸,還使機器人能夠更靈活地適應不同的任務和環境。相比於以往需要大量手動數據的訓練方式,DYNA-2 的成功展示了視頻數據的潛力,為未來機器人技術的發展提供了新的方向,特別是在通用智能的實現上。

