MiniMax vừa công bố H3, thế hệ thứ ba trong dòng mô hình video của họ, với điểm nhấn là trọng số mở và hỗ trợ ngay từ ngày đầu trên ComfyUI. Đây là một mô hình video mạnh mẽ hiện nay, có thể tạo video kèm âm thanh stereo tự nhiên ở độ phân giải lên tới 2K, kéo dài tối đa 15 giây mỗi clip.
Điểm đặc biệt của MiniMax H3
Khác với các mô hình video trước đây thường chỉ nhận một loại dữ liệu, H3 là mô hình omni-modal: nó có thể tiếp nhận đồng thời văn bản, hình ảnh, video và âm thanh, rồi phân tích mối quan hệ giữa chúng theo đúng prompt. Ví dụ, bạn có thể đưa vào một bức ảnh nhân vật, một đoạn video tham chiếu về chuyển động, một file audio giọng nói, rồi yêu cầu mô hình tạo ra một đoạn phim ngắn có nhân vật đó nói lời thoại theo đúng giọng, với chuyển động camera y hệt video mẫu.
Âm thanh trong H3 được tạo ra cùng lúc với video, không phải là bước ghép hậu kỳ. Điều này giúp âm thanh đồng bộ với hình ảnh một cách tự nhiên, từ tiếng gió, tiếng bước chân đến giọng nói. Đây là năng lực mà MiniMax xem là thế mạnh hàng đầu của H3: mô hình hiểu được ngữ cảnh đa phương thức và kết hợp chúng thành một sản phẩm hoàn chỉnh.
Vì sao điều này quan trọng với người dùng?
Trước đây, việc tạo video có lời thoại và âm thanh chất lượng cao thường phải qua nhiều bước: tạo hình ảnh, dựng chuyển động, rồi chèn âm thanh bằng công cụ khác. Với H3, mọi thứ gói gọn trong một mô hình duy nhất. Người làm phim, nhà sáng tạo nội dung hay thậm chí sinh viên có thể tạo video hoàn chỉnh với lời thoại và hiệu ứng âm thanh chỉ bằng một câu lệnh, chạy ngay trên máy tính có GPU tầm trung như NVIDIA RTX 3060.
Một tính năng đáng chú ý khác là chuyển động tham chiếu: bạn có thể lấy chuyển động từ một video tham chiếu, áp lên một nhân vật khác trong bối cảnh mới. Điều này mở ra khả năng chỉnh sửa và lặp lại nhanh chóng, rất hữu ích cho quy trình làm phim hoạt hình hay hiệu ứng hình ảnh.
Việc MiniMax công bố H3 với trọng số mở cho phép người dùng tự vận hành mô hình ngay trên phần cứng của mình.
Hãy theo dõi các bản cập nhật tiếp theo từ MiniMax trên công nghệ và AI.





