Google 推出 Gemini 3.5 Transcribe 語音轉文字模型

Google 官方宣布推出 Gemini 3.5 Transcribe,這是其最新的語音轉文字模型,旨在提供精確及智能的實時轉錄功能。這款模型不同於傳統的語音識別模型,能夠有效處理背景噪音、專業術語及語音流暢度問題,直接將原始音頻轉換為準確且格式化的文本。

Gemini 3.5 Transcribe 的核心功能

根據 Google 的介紹,Gemini 3.5 Transcribe 能夠捕捉用戶的自然語言風格,更好地理解意圖並識別自定義詞彙,從而實現語音執行任務的能力。該模型提供了多項先進功能,包括:

“智能轉錄:無縫處理自我修正,去除填充詞,自動格式化文本。”

Google

此外,Gemini 3.5 Transcribe 還支持多語言識別,自動檢測並轉錄超過 85 種語言,並能準確識別多達三位講者的語音,為預錄音頻提供時間戳。

開發者和企業的應用潛力

該模型可通過 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent Platform 進行訪問,方便開發者在其工作流程中無縫整合。Google 亦指出,該模型在實時流媒體和預錄音頻處理方面提供了兩種不同的 API 服務,分別為:

“實時流媒體:提供連續的雙向流媒體,延遲低於一秒,適用於互動語音應用。”

Google

“預錄音頻處理:轉錄錄製的音頻、會議、通話記錄等,並提供講者歸屬和逐字時間戳。”

Google

這使得開發者可以輕鬆構建語音代理、實時字幕工具或通話後分析管道,提升用戶體驗。

Gemini 3.5 Transcribe 的性能提升

Gemini 3.5 Transcribe 在性能上相較於之前的模型 Chirp 3 有顯著提升,根據人工分析,其平均字錯誤率(WER)在流媒體模式下為 4.0%,非流媒體模式下為 2.6%。該模型在嘈雜的現實環境中表現出色,準確捕捉郵政編碼和訂單 ID 等字母數字實體。

“在 FLEURS 基準測試中,該模型在多種語言和地區的表現均優於 Chirp 3,流媒體模式下的 WER 為 5.50%,非流媒體模式下為 5.04%。”

Google

這些改進使得 Gemini 3.5 Transcribe 成為開發者和企業在語音轉錄領域的一個強大工具。

資料來源:Google 官方公告

Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版