MiniMax H3 文生视频 API
根据文字指令生成完整视频场景,可控制主体、镜头运动、节奏、构图、视觉风格、对白和音频意图。
直接使用下方的 MiniMax H3 交互式演示。添加参考素材并输入清晰提示词,无需创建账户即可探索角色一致性、动作迁移、视觉风格和同步音频。
此生成器嵌入自第三方 Hugging Face Space。上传文件的处理方式和生成服务可用性由该 Space 决定,并可能受到实时队列影响。
发现与免费 MiniMax H3 和多模态视频生成相关的最新AI Agent。无需注册即可比较实用的视频、音频、图片与创意自动化工具。
免费体验 MiniMax H3,并探索文生视频、图生视频及参考引导创作相关AI工具。免费生成带原生音频的多模态视频,无需注册或信用卡。
使用 GPT Image 2 在线生成和编辑 AI 图片。免费体验、无需注册,适合社媒内容、广告、产品图和创意设计。
使用免费的AI文生图工具在线生成高质量图片,无需注册、无需信用卡、不限次数,适合广告、海报、产品图、缩略图和社媒内容。
上传参考图,用免费的AI图生图工具在线改图和做变体,无需注册、无需信用卡、不限次数,适合风格转换、产品视觉和头像优化。
免费使用 Nano Banana AI 生成和编辑图片。支持文本提示词和参考图,无需注册、无需信用卡。
使用免费的 Flux AI 图片生成器,通过文本提示词在线创建清晰视觉内容,适合创作者和营销场景。
使用免费AI修图工具在线编辑人像、产品图、背景和社媒图片,无需注册、无需信用卡,并可不限次数测试创意效果。
使用免费的AI图片修改器和图片编辑器,更换物体、人物、服装、背景、颜色及广告场景。无需注册、无需信用卡,可不限次数创意编辑。
免费使用 MiniMax H3 创作多模态AI视频。无需注册即可体验文生视频、图生视频或参考引导视频生成与原生立体声,并可直接访问开源项目。
从免费实验升级到可接入应用的专用 MiniMax H3 API 工作流。选择与输入类型匹配的端点,将视频生成连接到产品、Agent、营销活动或自动化媒体管线。
根据文字指令生成完整视频场景,可控制主体、镜头运动、节奏、构图、视觉风格、对白和音频意图。
让源图片动起来,或用首尾帧引导生成,同时保留视觉身份、版式、产品、角色和创意方向。
使用图片、视频和音频混合参考,将外观、动作、节奏、声音或风格迁移到新的多模态视频结果中。
观看 MiniMax-H3 GitHub 仓库发布的可复现示例。三段视频展示 H3-Base 如何处理文字提示、图片引导和混合参考输入,并生成视听同步的结果。
通过文字提示控制场景、动作、镜头语言、时间节奏和声音,让生成短片呈现为统一设计的视听序列。
以源图片或首尾帧设置锚定视觉构图,由 MiniMax H3 创建动作、转场和配套音频。
使用混合视觉与音频参考来引导身份、动作、风格、节奏和声音,实现控制力更强的多模态生成工作流。
MiniMax H3 在一个视频模型中统一视觉理解、动作生成和原生音频。探索适用于创意制作的实用能力,并根据项目选择免费演示、开源 H3-Base 或 API 工作流。
支持文字、图片、视频和音频参考
结合自然语言提示和多模态参考引导生成,不再只依赖文字。H3 能够同时理解外观、动作、风格、时间和声音线索。
原生 32 kHz 立体声音频
将画面与音频作为连贯整体生成,包括对白、环境声、音效和音乐意图,无需把声音当作单独的后期步骤。
生成4至15秒视频
以24 FPS生成4至15秒短片,支持横屏、方形、竖屏和超宽比例,适用于社交媒体、广告、产品展示和故事创作。
精准运动与提示词遵循
使用详细指令和参考引导的动作迁移,控制行为、镜头运动、转场、场景变化、物体行为和构图。
清晰文字与品牌一致视觉
创建广告、界面概念、包装展示、标题卡、电商内容和品牌场景,提升文字呈现和视觉身份的一致性。
开源 H3-Base 检查点
下载 FL2VA 和 Ref2VA H3-Base 检查点,并连接 SGLang、vLLM、Diffusers 和 ComfyUI 等受支持的运行时进行自主部署。
当视频不只是需要普通动态效果时,可以使用 MiniMax H3。其多模态控制能力可在商业、创意、教育和娱乐工作流中保持可复用的视觉身份、声音、节奏与导演意图。
将营销创意、产品图片、品牌参考和音频方向转化为短宣传片,并控制画面构图、文字、转场和氛围。
让产品摄影动起来,展示材质和动作,制作发布预告,或基于现有素材探索精致的店铺视觉。
创作包含角色、对白、镜头运动、环境和同步声音的短叙事片段,并用参考素材引导一致性。
在正式制作前,为过场动画、合作游戏片头、角色动画、界面片段和世界观创意制作原型。
将大纲、图表、插画风格或解说概念转化为结合视觉说明和原生音频的简洁教育视频。
为社交信息流、音乐推广、创作者频道和营销活动快速测试制作竖屏、方形或横屏内容。
MiniMax 发布了 H3-Base 模型代码以及 BF16 格式的 FL2VA 和 Ref2VA 检查点,可部署在本地或私有基础设施中。按照官方仓库准备合适的多GPU硬件,并为所需生成模式选择受支持的推理框架。
在准备基础设施前,请查看许可证、安装要求、模型变体、支持的运行时和最新上游说明。
使用 Hugging Face CLI 获取 model_index.json,以及用于文字或帧引导和混合参考生成的 BF16 H3-Base 检查点。
使用 SGLang 或 vLLM 部署,或参考现有的 Diffusers 和 ComfyUI 集成。官方 SGLang 示例使用张量并行多GPU服务。
在推理服务外围添加上传验证、任务队列、存储、内容审核、进度报告和交付;如果基础设施不适合自建,也可使用托管 API。

git clone https://github.com/MiniMax-AI/MiniMax-H3.git
cd MiniMax-H3
hf download MiniMaxAI/MiniMax-H3 \
--include "model_index.json" "FL2VA/*" "Ref2VA/*" \
--local-dir MiniMax-H3开源范围说明:H3-Base 检查点已经提供。托管版 Context-IR 预处理模型和 Regenerate-2K 模块目前未包含在开源版本中,因此本地结果与完整托管管线并不完全相同。
阅读官方部署指南从嵌入式参考生成视频演示开始,持续优化提示词和参考素材,直到动作、主体、风格和音频方向符合创意。
添加参考素材
编写精准的视频提示词
生成、检查并优化