最近,AI 视频社区 Reddit (r/aivideo) 上公开了利用新型多模态 AI 视频生成模型“MiniMax H3 (MiniMax H3)”制作的故事动画短片《Alicia of the Stars - First show》,引发了热烈反响。与以往的 AI 生成视频不同,该视频大幅减少了单独的音响合成和字幕结合等繁琐工序,仅凭一个全模态模型便能一次性生成高清视频与立体背景音频,证明了高度化 AI 讲故事的可能性。该视频中运用的“MiniMax H3”是由海螺AI (Hailuo AI) 与 MiniMax 共同开发并官方发布的开放权重(Open-weights)形态的通用全模态生成模型。它旨在改善以往 AI 模型通过文本提示词输出无声视频,而声音和人声必须通过其他音频生成程序进行手动对齐的缺点。在预训练阶段,它就经过优化,能在单一神经网络内综合分析文本、图像、音频、视频等多重上下文,从而毫无压力地接受复杂的的多模态指令。MiniMax H3 具备单次运算即可同时生成长达 15 秒(最少 4 秒)的视频和高品质 32kHz 原生立体声音效的独家模型性能。它通用支持 16:9、1:1、9:16 等多种宽高比,从 24FPS 的固定帧率和默认垂直 768 像素规格出发,最高可渲染至 2K 高分辨率品质。其最大特点是支持包括韩语在内的英语、中文、日语、法语等共 11 种主要语言的自然对话发音。此外,该权重模型已在 Hugging Face 完全公开,拥有高性能硬件的任何人都可以本地免费使用,同时它也以官方云端 WebApp 及第三方无服务器 API 的形式,根据使用量定价政策提供多样化的使用选择。如果在 AI 视频与图像制作服务 5HOW.ME 编辑器中接入这些 MiniMax H3 功能,创作者的创作便利性将获得飞跃式的提升。无需受到个人电脑沉重运算性能或高性能 GPU 硬件的限制,只需在浏览器环境中点击几下,就能无缝完成结合了人物台词与立体背景音的 15 秒动画。视频渲染完成后,为了对齐画面而必须增加音轨并进行编辑的传统漫长工序实际上被一次性整合,预计将为大量生产高品质短篇故事或短视频动画的用户带来极致的制作生产力。
出处
- Reddit - Alicia of the Stars - First show
- MiniMaxAI/MiniMax-H3 - Hugging Face
- How To Use MiniMax H3 in ComfyUI: Best FREE AI Video Model of 2026!
本文由 AI 撰写并经编辑审校。