MiniMax H3 發佈:全新多模態生成模型支持 2K 內容輸出及視頻編輯功能

MiniMax 於 7 月 31 日發布了新一代多模態生成模型 MiniMax H3,並宣佈將在近期開放模型權重。與過去專門處理圖片、視頻和聲音的模型不同,H3 更強調對多模態上下文的統一理解,試圖從「完成單項生成任務」進一步轉向通用多模態創作。

據瞭解,MiniMax H3 支持文本、圖片、音頻和視頻等多種輸入形式,能夠直接輸出 2K 分辨率的內容,生成的音畫作品最長可達 15 秒。用户可將不同類型的素材放在同一上下文中,由模型統一理解畫面、聲音、文字與創作要求,進而完成連貫的內容生成或編輯。

MiniMax H3 的視頻編輯功能得到加強

MiniMax H3 的視頻編輯是此次展示的重點能力。該模型支持 V2V Motion Transfer,即將一段參考視頻中的人物動作和運動軌跡遷移到另一段視頻中,同時盡量保持主體形象與畫面風格。對於廣告、品牌和電商內容,H3 還加強了指令遵循、文字呈現以及品牌信息還原能力,減少生成內容中經常出現的文字錯誤和標識變形。

據瞭解,MiniMax H3 在 Artificial Analysis 音頻視頻編輯榜單中位列全球第一。隨著 H3 後續開源,高質量音畫生成及視頻編輯的使用門檻將進一步降低。

Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版