OpenAI 自研推論晶片 Jalapeño 每瓦效能較 Nvidia 系統高出 1.9 倍

重點
  • Jalapeño 每瓦 AI 工作量較對比系統高出 1.5 至 1.9 倍。
  • 針對高度互動工作負載,性能提升達 2.1 至 4.1 倍。
  • 該晶片設計旨在減少部署 AI 模型所需的硬件與電力。
  • OpenAI 預計於 2026 年年底前部署 Jalapeño。

OpenAI 表示,其首款自研推理晶片 Jalapeño 能夠在每瓦功耗下完成更多 AI 工作,同時降低迴應延遲,顯示其硬件設計旨在以更高效率處理日益龐大的模型運算需求。該公司以 GPT-OSS 120B、DeepSeek R1 670B 以及 Kimi K2.5 1T 三款公開模型進行測試。結果顯示,這款晶片在峯值吞吐量下,每瓦 AI 工作量較對比系統高出 1.5 至 1.9 倍,端到端延遲則降低 1.7 至 3.6 倍。

針對高度互動的工作負載,Jalapeño 的性能表現提升達 2.1 至 4.1 倍。

Jalapeño 的性能特點

OpenAI 認為,將高吞吐量與低延遲結合於單一架構,有助減少部署 AI 模型所需的硬件與電力。Jalapeño 額定功率為 700 瓦,但在測試工作負載期間,其持續功耗維持在 550 瓦或以下。該公司透過 SemiAnalysis 提供的公開 InferenceX 基準,將 Jalapeño 與市面上已有的加速器系統進行比較。

Jalapeño 設計的重點之一,在於避免吞吐量與延遲之間的常見取捨。AI 推理在不同階段有著截然不同的需求:處理用家提示(稱為 prefill)通常屬於運算密集型工作;而逐個詞元生成回應(稱為 decode)則更依賴記憶體頻寬。Jalapeño 旨在以同一套架構同時處理這兩個階段。

OpenAI 表示,該晶片將模型狀態(包括生成過程中使用的鍵值快取)放置在更接近處理資源的位置。其網絡互連系統亦整合於架構之中,以減少晶片之間需要傳輸的數據量,藉此縮短通訊延遲,避免運算資源處於等待數據的狀態。這種設計對於 AI 代理(agent)尤為關鍵,因為這類代理往往需要依序執行多個推理步驟,每一步的微小延遲累積起來,將導致整體任務時間大幅延長。

AI 協助設計與優化

OpenAI 在 Jalapeño 開發過程中亦動用其自家 AI 模型。據該公司指出,AI 協助工程師探索不同的實現方案、縮短設計與驗證週期,並優化算術電路。團隊僅耗時九個月便從初步設計推進至流片(tapeout)。其後,OpenAI 利用搭載 GPT-Astra 的 Codex,在兩個月內將三款原本不在生產計劃之列的開放權重模型,在 Jalapeño 上達到高效能表現。

就特定的 GPT-OSS 注意力機制與混合專家(MoE)區塊而言,AI 生成的實現方案運行速度較人類專家所編寫的既有版本快 1.5 至 1.8 倍。不過,OpenAI 強調,這些結果僅適用於個別區塊,而非完整的模型。

未來部署計劃

該公司亦針對 Kimi K2.5 1T 等大型模型進行測試。報告顯示,在該模型上,Jalapeño 每瓦峯值性能較對比系統高出約 1.5 倍,端到端延遲則降低 3.4 倍。OpenAI 計劃於 2026 年年底前,開始在其運算基礎設施中部署 Jalapeño。該公司指出,這款晶片屬於多世代路線圖的第一代,第二代與第三代設計已在開發之中。隨著運算基礎設施持續擴展,以及所支援的模型能力日益增強,長遠目標是令推理過程更快、更節能。

項目規格
晶片名稱Jalapeño
定位OpenAI 首款自研推理晶片
額定功率700 瓦
持續功耗550 瓦或以下
每瓦 AI 工作量提升(峯值吞吐量)1.5 至 1.9 倍
端到端延遲降幅1.7 至 3.6 倍
高度互動工作負載性能提升2.1 至 4.1 倍
測試模型GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T
對比基準SemiAnalysis InferenceX
設計至流片時間9 個月
額外模型優化時間2 個月
AI 生成區塊速度提升1.5 至 1.8 倍
Kimi K2.5 1T 每瓦峯值性能提升約 1.5 倍
Kimi K2.5 1T 端到端延遲降幅3.4 倍
部署時程2026 年年底前

Jalapeño 對 AI 推理的影響

Jalapeño 的推出代表了 OpenAI 在推理硬件領域的一次重要突破。透過提高每瓦功耗下的效能,這款晶片不僅能滿足日益增長的 AI 模型需求,還能降低運行成本。特別是其在吞吐量與延遲之間的平衡設計,顯示出對於高效能計算的重視。隨著 AI 應用的廣泛普及,這樣的技術創新將有助於推動整個行業的發展,並可能改變未來 AI 系統的架構與運作方式。

本文由 The Base Principle 編譯自以下英文報道,內容經翻譯及整理,事實與數據以原文為準。
Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版