研究團隊研發新立體視覺演算法 助人形機器人深度感知更接近人類

研究團隊研發新立體視覺演算法 助人形機器人深度感知更接近人類

27/8/2026 · undefined · undefined
重點
  • 新演算法名為「會聚雙目立體視覺」(CBS),專為人形機械人設計。
  • CBS 同時處理水平與垂直視差,提升三維場景理解能力。
  • 演算法在重複紋理場景中表現優越,深度誤差顯著低於傳統方法。
  • CBS 旨在協助鏡頭運動與視覺處理協同,推動機械人深度感知技術。

加拿大多倫多約克大學的研究團隊近日公佈一種名為「會聚雙目立體視覺」(Convergent Binocular Stereo,CBS)的新演算法,專為配備兩隻前置鏡頭、鏡頭可朝向同一目標會聚的人形機械人設計。傳統立體視覺系統通常假設左右鏡頭保持平行,主要計算水平視差;新演算法則同時處理水平與垂直視差,並將鏡頭運動納入深度感知流程,使機械人能以更接近人類的方式建構三維場景理解。

CBS 演算法首先將兩部鏡頭鎖定於同一個三維點,並確定左右影像之間的幾何關係。系統其後建立一個五層高斯金字塔,在不同解像度下分析影像。在較粗糙的層級中,演算法會偵測並配對 SIFT 特徵點,同時運用極線約束估算水平與垂直視差。Gabor 濾波器隨後用於分析不同方向與尺度下的紋理與邊緣資訊,協助辨識兩幅影像之間對應的像素。視差估算結果會由低解像度逐步精煉至原始解像度,每一階段均縮小搜尋範圍,最終生成的水平與垂直視差圖可轉換為三維資訊與深度估算。

CBS 演算法的運作原理

研究人員表示,CBS 亦能擷取表面傾斜、物體姿態,以及深度與尺寸的感知縮放等資訊,提供更貼近人類的機械人視覺處理方式。系統透過鏡頭會聚與視差分析相結合,使機械人在判斷距離、識別物件方位,以及在複雜環境中導航時,有望較傳統平行立體視覺方法表現更佳。

為測試演算法效能,研究團隊建立名為 CBS-BM 的基準數據集,當中包含 49 個場景,涵蓋一般桌面環境、重複紋理、缺乏特徵的表面,以及高度自遮擋的物件。每個場景同時提供平行影像,以及五至十二對會聚定點影像。實驗結果顯示,CBS 與多個現有立體視覺方法及深度學習系統表現相當;在整個數據集上,其水平視差平均值與深度誤差均低於受測的平行方法。

演算法的優勢與挑戰

CBS 的最大優勢在於處理重複紋理場景——傳統系統在這類環境中往往難以判斷視覺相似的特徵點如何對應。在該子集上,CBS 的平均深度誤差較表現次佳的方法低約 0.8 米,水平視差誤差亦低約 100 像素。然而團隊亦指出,演算法在目標距離較遠時準確度會下降,且依賴精確的鏡頭校準與摩打定位。目前的實作在 AMD Ryzen 7 7700X 處理器上需時約 69 秒運行,仍有相當大的優化空間。

研究人員強調,CBS 並非要取代所有平行立體視覺系統,而是為需要鏡頭運動與視覺處理協同運作的人形機械人提供基礎。透過模擬人類的主動式會聚視覺,新演算法有望推動機械人深度感知技術進一步發展。

項目規格
演算法名稱Convergent Binocular Stereo(CBS)
開發團隊加拿大多倫多約克大學
適用鏡頭配置兩部可會聚於同一目標的前置鏡頭
影像處理流程五層高斯金字塔、SIFT 特徵配對、極線約束、Gabor 濾波器
基準數據集CBS-BM,包含 49 個場景
測試平台AMD Ryzen 7 7700X 處理器
單次運行時間約 69 秒

CBS 演算法對機械人技術的影響

新研發的CBS演算法為人形機械人提供了更接近人類的視覺處理能力,特別是在複雜環境中。透過同時處理水平與垂直視差,這項技術能夠改善機械人在距離判斷和物體識別方面的表現。儘管目前在遠距離準確度上仍有挑戰,但其在重複紋理場景的優越表現顯示出其潛力。這不僅為機械人技術的發展提供了新的方向,也可能促進更高效的自動化應用,尤其是在需要精確深度感知的領域。