MIT 研發新技術 VLASH 提升機械人運動速度與流暢度

重點
  • VLASH 技術使機器人能更快、更平穩地移動。
  • 該系統能在執行動作時同時規劃下一步行動。
  • 研究顯示 VLASH 提升反應速度超過 30 倍。
  • 未來將探索將 VLASH 與生成式人工智能結合的可能性。

麻省理工學院的研究人員開發了一種新技術,名為 VLASH,該技術可幫助機器人更快、更平穩及更高效地移動,通過使其能夠根據未來的位置規劃行動。這種方法使機器人能夠預測其下一個位置,並在動作之間無縫過渡,減少了傳統系統中常見的暫停和抖動。研究人員發現,該技術能將機器人在執行如拾取和放置等任務時的速度加倍,並使機械臂在乒乓球和打地鼠等動態活動中更加靈敏。根據團隊的説法,該技術不需要額外的計算開銷,並可能提升在搜尋與救援和緊急應對中使用的機器的性能。

隨著生成式人工智能系統,特別是視覺-語言-行動(VLA)模型,越來越多地被用作機器人的大腦,這使得機器能夠解讀周圍環境、理解指令並規劃物理行動。然而,VLA 推理的計算需求可能導致延遲,使機器人在應對變化時變得較慢和不流暢。麻省理工學院的研究人員開發了一種名為 VLASH 的新系統,解決了這一問題,該系統使機器人在執行當前動作的同時規劃下一步行動。

VLASH 的運作原理

一個 VLA 模型通常處理由機器人攝像頭捕獲的視覺信息,並將其與描述任務的指令結合,生成機器人要執行的行動片段。一旦這些行動完成,系統將處理新的觀察結果,然後再規劃下一個序列。根據麻省理工學院的説法,這種重複的循環可能在動作之間造成暫停。VLASH 旨在通過預測機器人的未來狀態來消除這種延遲。該系統不僅依賴於機器人當前的位置和環境,還估計在完成當前動作序列後機器人將位於何處,並利用該信息來規劃下一步。

根據研究人員的説法,這一方法有助於防止由於依賴過時觀察結果而造成的不穩定性。雖然機器人在移動過程中其周圍環境可能會改變,但其當前位置和計劃的動作提供了足夠的信息來估計其近期的未來狀態。該技術本身能夠通過消除動作片段之間的延遲,將反應速度提升超過 30 倍。研究人員通過一種名為動作量化的方法進一步提高性能,該方法生成遵循相同軌跡的更大動作片段。儘管動作量化會略微降低精確度,但它允許機器人整體上以兩到三倍的速度完成任務。

技術的實際應用

該團隊還開發了一種訓練增強技術,以確保 VLA 模型能有效利用未來狀態信息。通過重新組織和重用現有的訓練數據,該方法在不增加計算開銷的情況下,將訓練時間縮短了五倍。在模擬中,VLASH 持續生成更快的機器人動作,同時保持操控的準確性。對實體機器人的測試也顯示在拾取與放置、疊放及分類任務中的改進。在一次演示中,使用 VLASH 的機器人在保持 90% 準確率的情況下,以兩倍於基準系統的速度將彩色立方體分類進入箱中,達到最佳傳統方法的表現。

根據麻省理工學院新聞的報導,該系統還能夠處理高度動態的活動,包括乒乓球和打地鼠。研究人員表示,該技術能夠使機器人在快速變化的環境中變得更加靈敏和高效。未來的研究將探索將 VLASH 與生成式人工智能世界模型相結合,這些模型能夠預測實際環境觀察結果,從而潛在地擴展該系統在更複雜機器人應用中的能力。

VLASH 技術對機器人性能的影響

VLASH 技術的開發標誌著機器人運動控制的一個重要進步。傳統的 VLA 模型在處理動作時常常面臨延遲問題,而 VLASH 則通過預測未來狀態來消除這些延遲,提升了機器人的反應速度和流暢度。這對於需要高效反應的應用場景,如搜尋與救援,具有重要意義。此外,該技術的訓練增強方法也顯示出在不增加計算開銷的情況下,能顯著縮短訓練時間,這將有助於推動機器人技術的更廣泛應用。

本文由 The Base Principle 編譯自以下英文報道,內容經翻譯及整理,事實與數據以原文為準。
Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版