字節跳動正在訓練超大規模 AI 模型 參數量可能達 10 萬億

·作者 Henderson
字節跳動正在訓練超大規模 AI 模型 參數量可能達 10 萬億
重點
  • 字節跳動正在訓練一款超大規模AI模型,參數量可能達10萬億。
  • 該模型目前處於預訓練階段,最終參數尚未確定。
  • 參數量雖然重要,但不等同於模型實際表現。
  • 若成功推出,將提升國內大模型競爭力。

據英國《金融時報》報導,字節跳動正致力於訓練一款新的超大規模人工智能模型,其參數量最高可能達到 10 萬億級。如果最終達到這一規模,該模型將明顯超過目前已公開或被外界披露的多數大語言模型,並可能接近 Anthropic 最先進模型 Mythos。

模型訓練進度與預期

根據三名知情人士透露,這款模型目前仍處於早期階段,正在進行預訓練。預訓練通常需要 3 至 6 個月,之後還將進入微調等環節,因此最終版本的具體參數規模目前尚未確定。作為對比,Anthropic 尚未公開模型的具體參數,但業內估計,其先進的 Mythos 5 可能擁有約 8 萬億參數,而 Fable 5 約為 5 萬億參數。若字節跳動最終推出接近 10 萬億參數的模型,其規模將進入當前全球超大模型的第一梯隊。

參數量與實際表現的關係

需要注意的是,參數量雖然決定了模型能夠容納的信息規模和部分能力上限,但並不能直接等同於模型的實際表現。訓練數據質量、訓練方法、推理效率以及算力投入,同樣會影響最終效果。此前,《晚點 LatePost》曾報導,字節跳動內部正在討論訓練一款參數規模超過 5 萬億的模型。

國內大模型競爭升級

作為參照,阿里 Qwen 3.8-Max 的參數量約為 2.4 萬億,而月之暗面的 Kimi K3 約為 2.8 萬億。若此次 10 萬億參數計劃最終落地,將意味著國內大模型在模型規模上的競爭將進一步升級。

字節跳動的AI模型對行業的影響

字節跳動的超大規模AI模型訓練計劃顯示了其在人工智能領域的雄心,尤其是在模型規模的競爭上。隨著參數量的增加,模型的潛在能力和應用範圍也會擴大,這對於提升其市場地位至關重要。然而,參數量並非唯一指標,模型的實際表現還受訓練數據質量和方法等多重因素影響。這一計劃若成功,將進一步推動國內AI技術的發展和競爭。

H
關於作者
Henderson