- Google 開發的手語翻譯模型可將手勢轉為文字。
- 該模型支援美國手語,並可在 Pixel 11 上使用。
- 手語翻譯涉及計算機視覺和語言翻譯的雙重挑戰。
- 未來可能會推出更多設備和手語的支援。
Google 開發了一個手語翻譯模型,能夠將複雜的身體動作轉換為文字,該模型使用了超過 100,000 小時的數據,涵蓋 50 多種手語。這項技術名為手語轉文字(SL2T),目前正從研究階段轉向消費者設備,首先在 Pixel 11 上支援美國手語(ASL)。該模型為 Gboard 和 Live Transcribe 的新手語轉文字功能提供支持。用户無需打字,可以通過手語進行網絡搜尋、撰寫信息和文檔,或與 Google 的 Gemini 互動。
在 Live Transcribe 中,用户在對話中也可以用手語作出反應。
手語翻譯的技術挑戰
與語音轉錄不同,手語翻譯無法僅僅將一系列聲音映射到單詞。手語是獨立的語言,擁有自己的語法和詞彙。意義也可以通過手部動作、面部表情、頭部位置、手臂和軀幹同時傳達。這使得手語翻譯既是一個計算機視覺問題,也是語言翻譯問題。Google 的 SL2T 設計旨在同時處理這兩方面,通過將簽署者的動作轉換為結構化表示,然後再將其翻譯成文本。
該系統不再發送原始的攝像頭視頻進行翻譯,而是利用 Google 的 MediaPipe Holistic 模型識別簽署者的姿勢地標。這些地標包括代表手部、面部和身體動作的幾何坐標。只有這些坐標會發送到翻譯系統,而原始視頻可以立即丟棄。這種方法旨在減少敏感視覺信息的外洩,同時仍向模型提供有關簽署者手語的資訊。SL2T 然後將這些地標序列直接翻譯為文本,並不依賴於中間的“注釋”,即通常在手語研究中使用的簡化標籤來表示單個手語。
Google 表示,這使模型能夠更好地捕捉如空間關係和非手動信號等元素。
該系統在超過 50 種手語的 100,000 小時數據上進行了訓練,其中約四分之一的數據來自 ASL。Google 表示,跨語言、方言和不同熟練程度進行訓練幫助模型學習手語之間共享的結構。在 FLEURS-ASL 基準測試中,Google 報告了一個零樣本得分為 70 BLEURT,這一結果顯著高於之前報告的結果。該公司還針對可能影響日常使用的實際挑戰對該模型進行了測試。
與聾人社群的合作
該系統旨在進行實時翻譯,而非處理完成的視頻。Google 表示,其開發包括減少延遲、避免在某人未簽署時出現虛假輸出,以及改善左手簽署和單手簽署的性能。單手簽署對於智能手機使用尤為重要,因為用户可能需要用一隻手持手機,另一隻手進行簽署。Google 在整個開發過程中還與聾人用户及組織進行了合作,包括測試、數據收集和評估。該公司表示,這項技術是在聾人專家的意見及代表聾人組織的諮詢委員會的指導下開發的。
初步推出的功能支援在 Gboard 和 Pixel 11 上的 ASL 轉英文翻譯,Google 表示將會有更多設備和手語隨後推出。這項工作最終可能超越翻譯,Google 也指出手語生成和其他應用將是未來的方向。
手語翻譯技術的未來展望
Google 的手語翻譯模型不僅是技術創新,還是對聾人社群需求的回應。透過與聾人用户的合作,這項技術在設計上考慮了實際使用情境,旨在提升交流效率。未來,這項技術可能不僅限於翻譯,還可能擴展到手語生成等應用,進一步促進不同語言和文化之間的理解。

