MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio
MarkTechPost Asif Razzaq
MiniMax released MiniMax H3, a multimodal video generation model that unifies text, image, video, and audio inputs into a single system rather than separate specialist models. The model generates 2K video clips lasting 4-15 seconds with native stereo audio at an estimated cost of $0.13 per second ($1.95 for a 15-second clip). The unification allows users to specify complex creative operations like referencing camera movement from one video and character actions from another using natural language, replacing traditional split pipelines across advertising, e-commerce, and film production workflows.
Why it matters
MiniMax releases MiniMax H3, a general-purpose multimodal generation model. MiniMax H3 is not a text-to-video model with add-ons. MiniMax describes it as a general-purpose multimodal generation model that reads text, images, video, and audio as one unified context and returns video with native stereo sound. The mains specs include: 2K output, 4–15 seconds, integer durations […] The post MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio appeared first on MarkTechPost.