摩爾線程基於 MTT S5000 完成 MiniMax H3 模型適配並開源多模態生成系統

MiniMax 近日正式開源了多模態生成模型 MiniMax H3。與此同時,摩爾線程宣佈已基於 AI 訓練推理一體智算卡 MTT S5000 及 MUSA 軟件棧,完成對 MiniMax H3 的適配與運行。MiniMax H3 是一套通用型全模態生成系統,能夠統一理解文本、圖像、視頻和音頻構成的多模態上下文,並生成最高 2K 解像度、最長 15 秒、帶有原生立體聲音頻的視頻。

此次開源內容包括模型權重,同時提供本地部署和完整工作流程驗證方案。

MiniMax H3 系統具備多模態生成能力

從架構來看,H3 系統由三個核心模塊組成。其中,H3-Context-IR 負責理解並提煉用户輸入的多模態指令,將其轉換為結構化的上下文中間表示,目前通過 API 提供;H3-Base 根據中間表示生成 768p 解像度的音視頻內容,是此次開源的主要部分;H3-Regenerate-2K 則將 768p 結果與原始上下文一同送回模型,以 2K 解像度重新生成更高畫質視頻,該模塊尚未開源,也通過 API 提供。

在模型設計上,H3-Base 採用 330 億參數的 H3-Omni-Transformer 架構,通過不同模態編碼器將文本、圖像、視頻和音頻統一編碼為多模態序列後進行聯合預測。其下包含 H3-VisualVAE 和 H3-AudioVAE,分別用於視覺和音頻信息壓縮。官方同時提供兩個主要版本,分別面向文生視頻、首尾幀生視頻,以及多圖像、多視頻、多音頻混合輸入等任務,適用於人物與場景保留、動作和嘴型編輯等場景,並支持包括中文、英語、日語、韓語在內的 11 種語言對話。

開發者可利用 MiniMax H3 進行多種應用

為方便開發者部署,官方給出「H3-Base 本地部署」和「完整 2K 工作流程」兩條驗證路徑,支持通過 SGLang、vLLM、diffusers、ComfyUI 等框架進行推理。該模型目前基於 MiniMax H3 Community License 發布,開發者可通過開源平台下載使用。

Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版