中國模型開發者仍依賴 Nvidia 晶片面對軟件轉換挑戰

重點
  • 中國模型開發者仍依賴 Nvidia 晶片進行訓練,面臨軟件轉換挑戰。
  • 轉移到華為的 Ascend 晶片需要大量重寫 CUDA 代碼,增加開發成本。
  • 開源模型的轉移相對容易,私有模型則需更多人力和時間。
  • 國產硬體需支持訓練大模型所需的軟件生態系統,才能具競爭力。

中國的主要模型開發者仍依賴 Nvidia 的晶片來訓練其最先進的模型,儘管北京正在推動用國產半導體取代外國產品。問題不僅在於中國製造的晶片是否能夠處理這些工作負載,還涉及到硬體的更換意味著需要改變圍繞 Nvidia 的 CUDA 平台構建的軟件系統,這對於模型開發者來説是一個昂貴的工程挑戰。華為已經為其 Ascend 晶片開發了自己的替代方案,即神經網絡計算架構(CANN)。

然而,習慣於 CUDA 的開發者可能需要重寫並優化其現有代碼的相當多部分,才能將其訓練工作負載轉移到 Ascend 上。一位參與模型開發的研究人員告訴《南華早報》,其團隊現有的訓練管道依賴於 CUDA,這使得硬體的轉換變得相當不簡單。「CUDA 代碼無法直接在 Ascend 上運行,並且需要大量重寫。」

CUDA 轉移的挑戰

軟件使 Nvidia 仍然佔據優勢。來自上海某大學研究機構的模型開發者詹姆斯·王估計,將其團隊的工作流程轉移到華為的 Ascend 晶片上,可能會使該過程的時間和成本增加至少 50%。這一負擔因模型的開放程度及其支持的軟件生態系統的成熟度而異。一位參與將模型工作負載轉移到 Ascend 的北京工程師告訴《南華早報》,開源模型可以更容易地進行遷移,因為開發者可以利用現有的生態系統支持。

對於 DeepSeek 及其精簡版本,該工程師估計兩至三名開發者可以在大約一個月的額外工作中完成遷移。然而,對於那些底層源代碼不公開的模型,情況就變得相當複雜。據該工程師透露,像 Moonshot AI 的 Kimi K3 這樣的模型,雖然已發布其權重,但尚未公開其源代碼,可能需要約 10 名工程師和超過六個月的額外工作來完成轉換。

國產硬體的發展需求

這一差距凸顯了中國半導體自給自足的推動不僅僅是生產國產晶片。開發者還需要能夠與 Nvidia 在 CUDA 周圍建立的生態系統競爭的軟件工具、庫和優化工作流程。訓練仍然是最大的挑戰。訓練模型需要巨大的計算資源,並涉及在大型集羣上反復運行複雜的工作負載。相比之下,推論使用已訓練的模型從新數據中生成輸出,通常更易於適應不同的硬體。中國的開發者已經展示了一些先進模型能夠在國產硬體上運行。

據報導,DeepSeek-V4 和 Kimi K3 已適配於華為和阿里巴巴的系統,但兩家公司均未披露用於訓練這些模型的晶片。據《資訊》報導,Kimi K3 被報導使用 Nvidia 硬體進行訓練,包括先進的 Blackwell 處理器。該報導還指出,中國開發者在擴大國產替代品的努力中,仍繼續使用 Nvidia 的晶片來訓練先進模型。

有跡象顯示,國產硬體開始扮演更重要的角色。今年六月,美團推出了 LongCat-2.0,這是一個具有 1.6 兆參數的模型,該公司表示其完全在一個 50,000 卡的國產計算集羣上訓練,但未透露晶片供應商。因此,中國面臨的挑戰是超越僅僅建立替代品,國產晶片還必須支持訓練越來越大模型所需的軟件生態系統和開發工作流程,以達到競爭的速度和成本。

中國半導體自給自足的挑戰與機遇

中國在半導體自給自足的推動下,面臨著不僅要生產國產晶片,還需建立與 Nvidia CUDA 生態系統相競爭的軟件工具和優化流程的挑戰。儘管已有一些模型能在國產硬體上運行,但訓練大型模型的需求仍需巨大的計算資源和成熟的生態系統支持。隨著國產硬體逐漸扮演重要角色,開發者需要克服軟件轉換的困難,以提升競爭力。

本文由 The Base Principle 編譯自以下英文報道,內容經翻譯及整理,事實與數據以原文為準。
Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版