Google 官方宣布推出 Gemini 3.5 Transcribe,這是其最新的語音轉文字模型,旨在提供精確及智能的實時轉錄功能。這款模型不同於傳統的語音識別模型,能夠有效處理背景噪音、專業術語及語音流暢度問題,直接將原始音頻轉換為準確且格式化的文本。
Gemini 3.5 Transcribe 的核心功能
根據 Google 的介紹,Gemini 3.5 Transcribe 能夠捕捉用戶的自然語言風格,更好地理解意圖並識別自定義詞彙,從而實現語音執行任務的能力。該模型提供了多項先進功能,包括:
“智能轉錄:無縫處理自我修正,去除填充詞,自動格式化文本。”
此外,Gemini 3.5 Transcribe 還支持多語言識別,自動檢測並轉錄超過 85 種語言,並能準確識別多達三位講者的語音,為預錄音頻提供時間戳。
開發者和企業的應用潛力
該模型可通過 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent Platform 進行訪問,方便開發者在其工作流程中無縫整合。Google 亦指出,該模型在實時流媒體和預錄音頻處理方面提供了兩種不同的 API 服務,分別為:
“實時流媒體:提供連續的雙向流媒體,延遲低於一秒,適用於互動語音應用。”
“預錄音頻處理:轉錄錄製的音頻、會議、通話記錄等,並提供講者歸屬和逐字時間戳。”
這使得開發者可以輕鬆構建語音代理、實時字幕工具或通話後分析管道,提升用戶體驗。
Gemini 3.5 Transcribe 的性能提升
Gemini 3.5 Transcribe 在性能上相較於之前的模型 Chirp 3 有顯著提升,根據人工分析,其平均字錯誤率(WER)在流媒體模式下為 4.0%,非流媒體模式下為 2.6%。該模型在嘈雜的現實環境中表現出色,準確捕捉郵政編碼和訂單 ID 等字母數字實體。
“在 FLEURS 基準測試中,該模型在多種語言和地區的表現均優於 Chirp 3,流媒體模式下的 WER 為 5.50%,非流媒體模式下為 5.04%。”
這些改進使得 Gemini 3.5 Transcribe 成為開發者和企業在語音轉錄領域的一個強大工具。
資料來源:Google 官方公告

