新型機械人模型能從短暫示範中學習物理任務

重點
  • GEN-1.5 能從 3 至 12 秒的示範中學習物理任務。
  • 在提供五分鐘數據後,成功率可提升至 83%。
  • 該模型能處理視頻、語言及傳感器數據,並保持上下文信息。
  • 用戶可通過示範讓機器人自行處理任務,無需詳細指令。

一個全新的機器人基礎模型可以從僅持續 3 到 12 秒的單次示範中學習物理任務,然後在沒有任何梯度更新或微調的情況下嘗試該任務。這款名為 GEN-1.5 的模型由 Generalist AI 開發,旨在直接從物理範例中學習,而不需要工程師為每一項新任務重新訓練模型。該公司表示,模型能夠從短暫的感知動作示範中推斷應該執行的任務,並立即嘗試該任務。在針對 10 項物理任務的測試中,GEN-1.5 在僅提供一個示範的情況下,平均成功率達到 59%。

當提供五分鐘的任務專用數據及 10 次梯度步驟時,其平均成功率提升至 83%。這些任務故意設計得簡單且短暫,內容包括旋開玻璃罐的蓋子、從錢包中取錢、堆疊杯子、清掃垃圾、翻開書籍、拉開鉛筆袋的拉鏈以及取下吸塵器墊片。

模型的多模態能力

GEN-1.5 是一個大型多模態模型,能夠處理視頻、傳感器數據、語言數據及本體感知數據。它能夠在上下文中保持 30 秒的信息,並以 100 Hz 的頻率生成動作軌跡。示範本身作為 Generalist AI 所稱的“物理提示”。這些提示可以來自使用手持夾具的人,或由機器人執行任務時產生。一旦示範被放入模型的上下文窗口,機器人便可在無需訓練階段的情況下嘗試執行該任務。

該公司表示,並未特別訓練 GEN-1.5 以進行上下文學習,也並未添加架構變更、元學習循環或旨在使模型即興發揮的額外目標。這使得報告的結果與傳統的機器人訓練方法有所不同,因為新任務通常需要大量專用數據及重複優化。

機器人自主學習的潛力

GEN-1.5 也能夠結合物理提示。在一次示範中,該模型分別接收了拉開鉛筆袋拉鏈和從中取錢的示範,然後將這兩種行為連接成一個連續的序列,生成了在任一示範中均未出現的中間重新定位和回收動作。該模型還顯示出超越其所見動作的泛化能力。一次在模擬環境中錄製的示範可以用來提示實際機器人,儘管模型的預訓練並未包含任何模擬數據。所產生的行為能夠適應不同的手部及物體位置和大小的變化。

在另一項測試中,一名人員在機器人攝像頭可見的情況下用自己的手示範任務,隨後機器人用自己的手重現該動作。

Generalist AI 亦測試了模型在僅進行少量梯度步驟微調後的反應。GEN-1.5 能夠在一至十步之內適應新任務,使用一至五分鐘的數據,這相當於約 10 到 50 次示範。該模型有時甚至超越了所展示的內容。在學會使用刷子將一個積木掃入碗中後,當面前出現一根香蕉時,它便將其作為即興刷子使用。當給予一個掃帚時,它則發展出不同的策略,利用該工具將積木舉起並倒入碗中。

該公司表示,這些行為指向了一種不同的機器人編程方法。用户不再需要為每一項新任務編寫詳細指令,而是可以最終示範所需內容,讓機器人自行處理物理細節。

GEN-1.5 的創新學習方式

GEN-1.5 的設計顯示出一種全新的機器人學習方法,能夠在極短的時間內從示範中學習,這對於機器人技術的發展具有重要意義。傳統的機器人訓練通常需要大量數據和重複優化,而 GEN-1.5 則能在無需專門訓練的情況下進行任務,顯示出更高的靈活性和適應性。這不僅減少了編程的複雜性,還提升了機器人在多變環境中的應用潛力,可能會改變未來機器人與人類互動的方式。

本文由 The Base Principle 編譯自以下英文報道,內容經翻譯及整理,事實與數據以原文為準。
Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版