MiniMax H3 文字生成影片 API
根據文字指令生成完整影片場景,可控制主體、鏡頭運動、節奏、構圖、視覺風格、對白和音訊意圖。
直接使用下方的 MiniMax H3 互動式示範。加入參考素材並輸入清晰提示詞,無需建立帳戶即可探索角色一致性、動作轉移、視覺風格和同步音訊。
此生成器嵌入自第三方 Hugging Face Space。上傳檔案的處理方式和生成服務可用性由該 Space 決定,並可能受到即時佇列影響。
發現與免費 MiniMax H3 和多模態影片生成相關的最新AI Agent。無需註冊即可比較實用的影片、音訊、圖片與創意自動化工具。
免費體驗 MiniMax H3,並探索文字生成影片、圖片生成影片及參考引導創作相關AI工具。免費生成帶原生音訊的多模態影片,無需註冊或信用卡。
探索適合 gpt image 2 的免費 AI 工具。線上生成圖片、編輯視覺內容、體驗實用 AI 工作流,無需註冊、無需信用卡。
使用免費AI文生圖工具線上生成高品質圖片,無需註冊、無需信用卡、不限次數,適合廣告、海報、產品圖、縮圖和社群內容。
上傳參考圖,用免費AI圖生圖工具線上改圖和做變體,無需註冊、無需信用卡、不限次數,適合風格轉換、產品視覺和頭像優化。
探索適合 Nano Banana AI 的免費 AI 工具。線上生成圖片、編輯視覺內容、體驗實用 AI 工作流,無需註冊、無需信用卡。
探索適合 Flux AI 圖片生成器 的免費 AI 工具。線上生成圖片、編輯視覺內容、體驗實用 AI 工作流,無需註冊、無需信用卡。
使用免費AI修圖工具線上編輯人像、產品圖、背景和社群圖片,無需註冊、無需信用卡,並可不限次數測試創意效果。
使用免費的AI圖片修改器和圖片編輯器,更換物件、人物、服裝、背景、顏色及廣告場景。無需註冊、無需信用卡,可不限次數創意編輯。
免費使用 MiniMax H3 創作多模態AI影片。無需註冊即可體驗文字生成影片、圖片生成影片或參考引導影片生成與原生立體聲,並可直接存取開源專案。
從免費實驗升級到可整合應用程式的專用 MiniMax H3 API 工作流程。選擇與輸入類型相符的端點,將影片生成串接至產品、Agent、行銷活動或自動化媒體管線。
根據文字指令生成完整影片場景,可控制主體、鏡頭運動、節奏、構圖、視覺風格、對白和音訊意圖。
讓來源圖片動起來,或用首尾影格引導生成,同時保留視覺識別、版面、產品、角色和創意方向。
使用圖片、影片和音訊混合參考,將外觀、動作、節奏、聲音或風格轉移到新的多模態影片結果中。
觀看 MiniMax-H3 GitHub 程式庫發布的可重現範例。三段影片展示 H3-Base 如何處理文字提示、圖片引導和混合參考輸入,並生成影音同步的結果。
透過文字提示控制場景、動作、鏡頭語言、時間節奏和聲音,讓生成短片呈現為統一設計的影音序列。
以來源圖片或首尾影格設定錨定視覺構圖,由 MiniMax H3 建立動作、轉場和搭配音訊。
使用混合視覺與音訊參考來引導身分、動作、風格、節奏和聲音,實現控制力更強的多模態生成工作流程。
MiniMax H3 在一個影片模型中統一視覺理解、動作生成和原生音訊。探索適用於創意製作的實用能力,並依專案選擇免費示範、開源 H3-Base 或 API 工作流程。
支援文字、圖片、影片和音訊參考
結合自然語言提示和多模態參考引導生成,不再只依賴文字。H3 能夠同時理解外觀、動作、風格、時間和聲音線索。
原生 32 kHz 立體聲音訊
將畫面與音訊作為連貫整體生成,包括對白、環境音、音效和音樂意圖,無需把聲音當作獨立的後製步驟。
生成4至15秒影片
以24 FPS生成4至15秒短片,支援橫向、方形、直向和超寬比例,適用於社群媒體、廣告、產品展示和故事創作。
精準動作與提示詞遵循
使用詳細指令和參考引導的動作轉移,控制行為、鏡頭運動、轉場、場景變化、物件行為和構圖。
清晰文字與品牌一致視覺
建立廣告、介面概念、包裝展示、標題卡、電商內容和品牌場景,提升文字呈現和視覺識別的一致性。
開源 H3-Base 檢查點
下載 FL2VA 和 Ref2VA H3-Base 檢查點,並連接 SGLang、vLLM、Diffusers 和 ComfyUI 等受支援的執行環境進行自主部署。
當影片不只是需要一般動態效果時,可以使用 MiniMax H3。其多模態控制能力可在商業、創意、教育和娛樂工作流程中維持可重複使用的視覺識別、聲音、節奏與導演意圖。
將行銷創意、產品圖片、品牌參考和音訊方向轉換為短宣傳片,並控制畫面構圖、文字、轉場和氛圍。
讓產品攝影動起來,展示材質和動作,製作發布預告,或根據現有素材探索精緻的商店視覺。
創作包含角色、對白、鏡頭運動、環境和同步聲音的短篇敘事片段,並用參考素材引導一致性。
在正式製作前,為過場動畫、合作遊戲片頭、角色動畫、介面片段和世界觀創意製作原型。
將大綱、圖表、插畫風格或旁白概念轉換為結合視覺說明和原生音訊的精簡教育影片。
為社群動態、音樂宣傳、創作者頻道和行銷活動快速測試製作直向、方形或橫向內容。
MiniMax 發布了 H3-Base 模型程式碼以及 BF16 格式的 FL2VA 和 Ref2VA 檢查點,可部署在本機或私有基礎設施中。按照官方程式庫準備合適的多GPU硬體,並為所需生成模式選擇受支援的推論框架。
在準備基礎設施前,請查看授權條款、安裝要求、模型變體、支援的執行環境和最新上游說明。
使用 Hugging Face CLI 取得 model_index.json,以及用於文字或影格引導和混合參考生成的 BF16 H3-Base 檢查點。
使用 SGLang 或 vLLM 部署,或參考現有的 Diffusers 和 ComfyUI 整合。官方 SGLang 範例使用張量平行多GPU服務。
在推論服務外圍加入上傳驗證、工作佇列、儲存、內容審核、進度回報和交付;若基礎設施不適合自建,也可使用託管 API。

git clone https://github.com/MiniMax-AI/MiniMax-H3.git
cd MiniMax-H3
hf download MiniMaxAI/MiniMax-H3 \
--include "model_index.json" "FL2VA/*" "Ref2VA/*" \
--local-dir MiniMax-H3開源範圍說明:H3-Base 檢查點已經提供。託管版 Context-IR 預處理模型和 Regenerate-2K 模組目前未包含在開源版本中,因此本機結果與完整託管管線並不完全相同。
閱讀官方部署指南從嵌入式參考生成影片示範開始,持續最佳化提示詞和參考素材,直到動作、主體、風格和音訊方向符合創意。
加入參考素材
撰寫精準的影片提示詞
生成、檢查並最佳化