Google 推出 Gemini 3.5 Transcribe 語音轉文字模型 率先應用於 Gboard Rambler 及 Chrome

Google 今日正式推出 Gemini 3.5 Transcribe,標榜為旗下「至今最精準的語音轉文字模型」,目前已率先應用於多項自家產品之中。與傳統語音辨識系統容易受背景雜音、行業術語及口頭禪幹擾不同,新模型可將原始音訊直接轉化為精確、經過整理並完成格式排版的文字內容。官方指出,此模型「旨在保留自然說話的語氣,從而更準確地理解使用者意圖,並識別自訂詞彙」。

Gemini 3.5 Transcribe 能夠處理即時自我修正的情況,例如「我們星期二見——不對,星期三」,並自動刪除「嗯」、「啊」等語氣助詞及贅字,同時支援自動排版與自然語音編輯功能。在精準度方面,根據 Artificial Analysis 的測試結果,串流模式下平均詞錯誤率(WER)為 4.0%,非串流模式更降至 2.6%。模型在嘈雜的真實環境下表現穩定,能準確辨識郵遞編號、訂單編號等由字母與數字組成的字串。

Gemini 3.5 Transcribe 支援自訂詞彙與多語言辨識

在自訂詞彙方面,模型可識別特定行業術語及特殊拼寫,並依據使用者提供的詞彙表自動調整轉錄結果。語言支援方面,系統能自動偵測並轉錄超過 85 種語言,涵蓋不同地區口音與方言。多說話者辨識功能則可為預錄音訊中最多三位發言者標記時間戳並歸屬對應語句,超過三位說話者的場景目前仍屬實驗性質。

效能層面上,Google 表示 Gemini 3.5 Transcribe 相較 2025 年推出的 Chirp 3 轉錄模型,在各項能力、詞錯誤率及延遲表現上均取得「重大進展」。Artificial Analysis 數據顯示,完成最終轉錄所需的時間較 Chirp 3 縮短 70%。在 FLEURS 基準測試中,針對多個主流語言及地區,串流模式詞錯誤率為 5.50%,非串流模式為 5.04%,多語表現同樣優於前代模型。

語音代理與跨平台整合

新模型另一核心目標是讓使用者「以語音執行任務」。透過函式呼叫功能,Gemini 3.5 Transcribe 可「將影像生成、檔案分析等複雜任務轉交其他 Gemini 模型處理」,相關體驗可見於 macOS 版 Gemini 應用程式中的 Speak to Window 功能。除 macOS 版 Gemini 應用程式及 Android 平台的 Gboard Rambler 之外,Gemini 3.5 Transcribe 亦已內建於 Google Antigravity 提示框的收音麥克風,能在使用者授權下結合螢幕畫面與對話紀錄,

確保在檔案名稱、智能代理思路及當前文件等場景下均能精準轉錄。

該模型預計將於稍後登陸 Chrome 瀏覽器,屆時使用者可於任何網頁欄位以語音輸入,無論撰寫回覆、草擬貼文,或在 Chrome 中以語音向 Gemini 發出指令,操作將更為自然流暢。Gemini 3.5 Transcribe 目前開放兩類用戶使用:開發者可透過 Gemini API(位於 Google AI Studio 及 Google Antigravity)試用公開預覽版;企業用戶則可於 Gemini Enterprise Agent Platform 取得公開預覽版本,並即將登陸 Gemini

Enterprise for Customer Experience。

Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版