MiniMax H3 API tạo video từ văn bản
Tạo cảnh video hoàn chỉnh từ chỉ dẫn bằng văn bản, bao gồm chủ thể, chuyển động máy quay, nhịp độ, bố cục, phong cách hình ảnh, lời thoại và định hướng âm thanh.
Sử dụng bản demo MiniMax H3 tương tác ngay bên dưới. Thêm nội dung tham chiếu và prompt rõ ràng để khám phá độ nhất quán của nhân vật, chuyển giao chuyển động, phong cách hình ảnh và âm thanh đồng bộ mà không cần tạo tài khoản.
Trình tạo được nhúng từ một Hugging Face Space của bên thứ ba. Việc xử lý tệp tải lên và khả năng tạo video tuân theo quy định của Space đó và có thể phụ thuộc vào hàng đợi hiện tại.
Khám phá các AI Agent mới nhất liên quan đến MiniMax H3 miễn phí và tạo video đa phương thức. So sánh công cụ video, âm thanh, hình ảnh và tự động hóa sáng tạo thiết thực mà không cần đăng ký.
Thử MiniMax H3 miễn phí và khám phá các công cụ AI liên quan để tạo video từ văn bản, hình ảnh và nội dung tham chiếu. Tạo video đa phương thức với âm thanh tích hợp hoàn toàn miễn phí, không cần đăng ký hoặc thẻ tín dụng.
Khám phá công cụ AI miễn phí cho gpt image 2. Tạo ảnh, chỉnh sửa hình ảnh và thử quy trình AI trực tuyến không cần đăng ký và không cần thẻ tín dụng.
Tạo ảnh AI chất lượng cao từ văn bản online miễn phí, không đăng ký, không cần thẻ tín dụng và thử không giới hạn cho quảng cáo, bài đăng, sản phẩm và ý tưởng.
Biến đổi ảnh tham chiếu online miễn phí, không đăng ký, không cần thẻ tín dụng và chỉnh sửa không giới hạn cho phong cách, biến thể, sản phẩm và chân dung.
Khám phá công cụ AI miễn phí cho Nano Banana AI. Tạo ảnh, chỉnh sửa hình ảnh và thử quy trình AI trực tuyến không cần đăng ký và không cần thẻ tín dụng.
Khám phá công cụ AI miễn phí cho trình tạo ảnh Flux AI. Tạo ảnh, chỉnh sửa hình ảnh và thử quy trình AI trực tuyến không cần đăng ký và không cần thẻ tín dụng.
Chỉnh chân dung, ảnh sản phẩm, nền và đồ họa mạng xã hội online bằng trình chỉnh ảnh AI miễn phí, không đăng ký, không cần thẻ tín dụng và thử nghiệm sáng tạo không giới hạn.
Thay đổi vật thể, người, trang phục, nền, màu sắc và cảnh quảng cáo bằng trình thay đổi hình ảnh kiêm trình chỉnh ảnh AI miễn phí. Không đăng ký, không cần thẻ tín dụng và chỉnh sửa sáng tạo không giới hạn.
Tạo video AI đa phương thức bằng MiniMax H3 miễn phí. Thử tạo video từ văn bản, hình ảnh hoặc nội dung tham chiếu với âm thanh stereo tích hợp, không cần đăng ký và truy cập trực tiếp dự án mã nguồn mở.
Chuyển từ thử nghiệm miễn phí sang quy trình sẵn sàng tích hợp ứng dụng với các MiniMax H3 API chuyên dụng. Chọn endpoint phù hợp với loại dữ liệu đầu vào và kết nối tạo video vào sản phẩm, agent, chiến dịch hoặc dây chuyền truyền thông tự động.
Tạo cảnh video hoàn chỉnh từ chỉ dẫn bằng văn bản, bao gồm chủ thể, chuyển động máy quay, nhịp độ, bố cục, phong cách hình ảnh, lời thoại và định hướng âm thanh.
Làm chuyển động cho ảnh nguồn hoặc định hướng khung hình mở đầu và kết thúc trong khi giữ nguyên nhận diện hình ảnh, bố cục, sản phẩm, nhân vật và định hướng sáng tạo.
Kết hợp hình ảnh, video và âm thanh tham chiếu để chuyển giao diện mạo, chuyển động, nhịp điệu, âm thanh hoặc phong cách vào một video đa phương thức mới.
Xem các ví dụ có thể tái tạo được công bố trong kho MiniMax-H3 trên GitHub. Ba clip cho thấy H3-Base xử lý prompt văn bản, hướng dẫn bằng hình ảnh và đầu vào tham chiếu hỗn hợp trong khi tạo đầu ra hình ảnh và âm thanh đồng bộ.
Prompt bằng văn bản điều khiển cảnh, hành động, ngôn ngữ máy quay, thời gian và âm thanh để clip tạo ra có cảm giác như một chuỗi nghe nhìn được thiết kế thống nhất.
Ảnh nguồn hoặc thiết lập khung hình đầu và cuối giữ vững bố cục hình ảnh, trong khi MiniMax H3 tạo chuyển động, chuyển cảnh và âm thanh đi kèm.
Nội dung tham chiếu hỗn hợp gồm hình ảnh và âm thanh định hướng nhận diện, chuyển động, phong cách, nhịp điệu và âm thanh để kiểm soát quy trình tạo đa phương thức tốt hơn.
MiniMax H3 hợp nhất khả năng hiểu hình ảnh, tạo chuyển động và âm thanh tích hợp trong một mô hình video. Khám phá các năng lực phục vụ sản xuất sáng tạo, sau đó chọn bản demo miễn phí, H3-Base mã nguồn mở hoặc quy trình API phù hợp với dự án.
Tham chiếu bằng văn bản, hình ảnh, video và âm thanh
Điều khiển quá trình tạo bằng prompt ngôn ngữ tự nhiên và nội dung tham chiếu đa phương thức thay vì chỉ dựa vào văn bản. H3 có thể diễn giải đồng thời diện mạo, chuyển động, phong cách, thời gian và tín hiệu âm thanh.
Âm thanh stereo 32 kHz tích hợp
Tạo hình ảnh và âm thanh như một kết quả thống nhất, gồm lời thoại, không khí, hiệu ứng âm thanh và định hướng âm nhạc, thay vì xem phần âm thanh là một bước tách biệt về sau.
Tạo video dài từ 4 đến 15 giây
Tạo clip ngắn từ 4 đến 15 giây ở tốc độ 24 FPS với tỷ lệ ngang, vuông, dọc và siêu rộng cho mạng xã hội, quảng cáo, sản phẩm và kể chuyện.
Chuyển động chính xác và bám sát prompt
Kiểm soát hành động, chuyển động máy quay, chuyển cảnh, thay đổi bối cảnh, hành vi vật thể và bố cục bằng hướng dẫn chi tiết cùng khả năng chuyển giao chuyển động từ nội dung tham chiếu.
Văn bản dễ đọc và hình ảnh nhất quán với thương hiệu
Tạo quảng cáo, ý tưởng giao diện, cảnh bao bì, thẻ tiêu đề, nội dung thương mại điện tử và bối cảnh thương hiệu cần độ nhất quán cao hơn về chữ viết và nhận diện hình ảnh.
Checkpoint H3-Base mã nguồn mở
Tải xuống checkpoint FL2VA và Ref2VA của H3-Base rồi kết nối với các runtime được hỗ trợ gồm SGLang, vLLM, Diffusers và ComfyUI để tự triển khai.
Sử dụng MiniMax H3 khi video cần nhiều hơn chuyển động chung chung. Khả năng điều khiển đa phương thức hỗ trợ duy trì ổn định nhận diện hình ảnh, âm thanh, nhịp độ và định hướng trong các quy trình thương mại, sáng tạo, giáo dục và giải trí.
Biến ý tưởng chiến dịch, ảnh sản phẩm, nội dung tham chiếu thương hiệu và định hướng âm thanh thành clip quảng bá ngắn với khung hình, văn bản, chuyển cảnh và không khí được kiểm soát.
Làm chuyển động cho ảnh sản phẩm, thể hiện chất liệu và chuyển động, tạo teaser ra mắt hoặc thử nghiệm hình ảnh gian hàng chỉn chu từ tài sản sẵn có.
Tạo các đoạn truyện ngắn có nhân vật, lời thoại, chuyển động máy quay, môi trường và âm thanh đồng bộ, đồng thời dùng nội dung tham chiếu để giữ tính nhất quán.
Tạo nguyên mẫu cảnh cắt, phần mở đầu trò chơi hợp tác, hoạt ảnh nhân vật, khoảnh khắc giao diện và ý tưởng xây dựng thế giới trước khi sản xuất đầy đủ.
Biến dàn ý, sơ đồ, phong cách minh họa hoặc khái niệm thuyết minh thành video giáo dục ngắn gọn, kết hợp giải thích trực quan với âm thanh tích hợp.
Sản xuất nội dung dọc, vuông hoặc ngang cho bảng tin mạng xã hội, quảng bá âm nhạc, kênh nhà sáng tạo và thử nghiệm nhanh chiến dịch theo nhiều hướng sáng tạo.
MiniMax công bố mã mô hình H3-Base cùng các checkpoint BF16 FL2VA và Ref2VA cho hạ tầng cục bộ hoặc riêng tư. Làm theo kho chính thức, chuẩn bị phần cứng đa GPU phù hợp và chọn framework suy luận được hỗ trợ cho chế độ tạo mong muốn.
Xem giấy phép, yêu cầu cài đặt, biến thể mô hình, runtime được hỗ trợ và hướng dẫn mới nhất từ dự án gốc trước khi cấp phát hạ tầng.
Dùng công cụ dòng lệnh Hugging Face để lấy model_index.json cùng các checkpoint BF16 H3-Base cho quá trình tạo từ văn bản, khung hình hoặc nội dung tham chiếu hỗn hợp.
Triển khai bằng SGLang hoặc vLLM, hay làm theo các tích hợp Diffusers và ComfyUI hiện có. Ví dụ SGLang chính thức sử dụng phục vụ song song trên nhiều GPU.
Bổ sung kiểm tra tệp tải lên, hàng đợi tác vụ, lưu trữ, kiểm duyệt, báo cáo tiến độ và phân phối kết quả quanh dịch vụ suy luận; hoặc dùng API được lưu trữ khi hạ tầng tự quản không phù hợp.

git clone https://github.com/MiniMax-AI/MiniMax-H3.git
cd MiniMax-H3
hf download MiniMaxAI/MiniMax-H3 \
--include "model_index.json" "FL2VA/*" "Ref2VA/*" \
--local-dir MiniMax-H3Phạm vi mã nguồn mở: các checkpoint H3-Base đã được cung cấp. Mô hình tiền xử lý Context-IR được lưu trữ trên hệ thống và mô-đun Regenerate-2K hiện chưa nằm trong bản phát hành mã nguồn mở, vì vậy kết quả cục bộ không hoàn toàn giống quy trình đầy đủ được lưu trữ.
Đọc hướng dẫn triển khai chính thứcBắt đầu với bản demo tạo video từ nội dung tham chiếu được nhúng, sau đó tinh chỉnh prompt và tài liệu tham chiếu cho đến khi chuyển động, chủ thể, phong cách và định hướng âm thanh khớp với ý tưởng.
Thêm nội dung tham chiếu
Viết prompt video chính xác
Tạo, xem lại và tinh chỉnh