重點
- MiniMax H3 是新一代多模態生成模型,強調統一理解多模態上下文。
- 該模型支持文本、圖片、音頻和視頻等多種輸入,能輸出 2K 內容。
- H3 的視頻編輯功能可實現人物動作遷移,提升廣告和電商內容質量。
- H3 在音頻視頻編輯榜單中位列全球第一,開源後使用門檻將降低。
MiniMax 於 7 月 31 日發布了新一代多模態生成模型 MiniMax H3,並宣佈將在近期開放模型權重。與過去專門處理圖片、視頻和聲音的模型不同,H3 更強調對多模態上下文的統一理解,試圖從「完成單項生成任務」進一步轉向通用多模態創作。
多模態生成模型的進步
據瞭解,MiniMax H3 支持文本、圖片、音頻和視頻等多種輸入形式,能夠直接輸出 2K 分辨率的內容,生成的音畫作品最長可達 15 秒。用户可將不同類型的素材放在同一上下文中,由模型統一理解畫面、聲音、文字與創作要求,進而完成連貫的內容生成或編輯。
視頻編輯功能的創新
MiniMax H3 的視頻編輯是此次展示的重點能力。該模型支持 V2V Motion Transfer,即將一段參考視頻中的人物動作和運動軌跡遷移到另一段視頻中,同時盡量保持主體形象與畫面風格。對於廣告、品牌和電商內容,H3 還加強了指令遵循、文字呈現以及品牌信息還原能力,減少生成內容中經常出現的文字錯誤和標識變形。
全球領先的音頻視頻編輯
據瞭解,MiniMax H3 在 Artificial Analysis 音頻視頻編輯榜單中位列全球第一。隨著 H3 後續開源,高質量音畫生成及視頻編輯的使用門檻將進一步降低。
MiniMax H3 如何改變內容創作方式
MiniMax H3 的發布標誌著多模態生成技術的重大進步,特別是在統一理解不同媒介的能力上。這不僅提升了內容創作的效率,還使得創作者能夠在同一上下文中靈活運用多種素材。其視頻編輯功能尤其值得注意,能夠簡化動作遷移過程,為廣告和電商等行業提供了更高質量的內容生成選擇。隨著模型的開源,這將進一步降低高質量內容創作的門檻,推動行業的發展。
H
關於作者
Henderson

