OpenAI 發佈 GPT-Live 語音交互系統 解決 AI 對話延遲問題

·作者 Henderson·AI
OpenAI 發佈 GPT-Live 語音交互系統 解決 AI 對話延遲問題
重點
  • OpenAI 推出 GPT-Live 語音交互系統,解決對話延遲問題。
  • GPT-Live 採用全雙工架構,能同時接收語音和生成回覆。
  • 系統優化了傳輸層,提升幀傳輸穩定性和速度。
  • GPT-Live 標誌著 AI 語音交互的重大技術進步。

OpenAI 正式推出經過全面重構的語音交互系統 GPT-Live,此係統旨在解決 AI 語音助手長期存在的對話停頓及回合切換生硬等核心痛點。該公司工程師 Justin Uberti 與 Zahan Malkani 在技術博文中詳細披露了這一歷時六個月的底層架構改造。OpenAI 傳統的 AI 語音交互採用回合制模式,依賴「回合檢測器」來判斷用户何時結束發言。

然而,這種機制存在明顯缺陷:檢測過早會打斷用户説話,檢測過晚則造成不自然的沉默等待。

全雙工架構的優勢

GPT-Live 徹底摒棄了這一方案,轉而採用全雙工架構,能夠在接收用户語音的同時生成回覆。系統每秒多次自主決策,應該傾聽、發言、暫停還是允許用户打斷。為實現流暢對話,OpenAI 將系統拆分為兩個獨立層級。音頻流通過專用低延遲快速通道在用户設備與 GPT-Live 模型之間傳輸,而網絡搜索、代碼執行、調用 GPT-5.5 等前沿模型進行深度推理等重負載任務則在異步邊界之外的後台路徑完成。

這意味著即使複雜查詢需要額外數秒處理,語音層仍能保持自然對話,不會出現掉幀、卡頓或連接凍結。

傳輸層的技術創新

在傳輸層優化方面,OpenAI 將原有的 Python asyncio 代碼替換為 Go 語言,為超過 1.5 億周活躍用户實現更穩定的幀傳輸。針對連接建立延遲,團隊開發了名為 WARP(WebRTC Abridged Roundtrip Protocol)的開放規範,配合 Instant Connect 功能,將傳統 WebRTC 需要六次網絡往返的啟動流程壓縮至單個數據包,使用户幾乎可以瞬間發起實時語音會話。

GPT-Live 的推出標誌著 AI 語音交互從「對講機模式」向自然人機對話的跨越。通過分離即時語音與重型計算任務,OpenAI 構建的語音界面在體驗上更接近人際交流,為大規模商用語音 AI 服務樹立了新的技術基準。

GPT-Live 如何改變語音交互體驗

GPT-Live 的推出不僅解決了傳統語音助手的延遲問題,還通過全雙工架構實現了更自然的對話體驗。這一技術進步使得即使在處理複雜查詢時,語音交互也能保持流暢,顯著提升了用戶的互動感受。此外,透過優化傳輸層和開發新協議,OpenAI 為大規模商用語音 AI 服務奠定了新的基準,這將促進更廣泛的應用和發展。

H
關於作者
Henderson