统一多模态上下文
在同一个上下文中组合文本、图像、视频和音频参考,再描述每个元素应如何影响最终结果。
打破任务和模态的边界
将文本、图像、视频和声音放入同一个上下文。MiniMax H3 能理解复杂创作指令,生成最高 2K、最长 15 秒并带原生双声道的视频。
这些样片包含双声道音频,可通过播放器控制栏开启声音。
H3 模型能力
H3 面向跨模态关系理解而设计,把自然语言中的完整创作意图转化为精准、可控的内容生成与编辑。
在同一个上下文中组合文本、图像、视频和音频参考,再描述每个元素应如何影响最终结果。
联合生成画面与同步的双声道音频,覆盖人声、音效和音乐。
可输出最长 15 秒、最高 2K 分辨率的细腻视频。
直接用自然语言表达复杂创作目标,无需在多个定义狭窄的生成任务之间切换。
在涉及文字与品牌信息的场景中,实现精准、可控的内容生成与编辑。
以输入视频为动作参考,同时通过其他素材控制主体、风格、镜头语言和声音。
生成示例
四项系统级选择帮助 H3 统一理解与生成,并实现高效的高分辨率输出。
语言负责连接并解释上下文元素与目标输出之间的关系,为 H3 的通用指令理解奠定基础。
重新设计的 tokenizer 提升重建质量与易学性,高压缩率缩短序列长度,并支撑原生 2K 生成。
以通用和高效为目标,让架构服务于任务的统一与泛化。
H3 复用基模和原始多模态上下文重新生成高分辨率细节,而不是依赖独立超分模块。
MiniMax 展示了 H3 在创意与产品团队真实内容生产场景中的应用。
MiniMax H3 是一款通用全模态生成模型。它能统一理解由文本、图像、视频和声音组成的上下文,并生成带原生双声道的视频。
H3 可以在同一个上下文中组合文本、图像、视频和音频参考,并用自然语言描述这些参考与目标输出之间的关系。
根据 MiniMax 官方发布信息,H3 最高支持 2K 分辨率和最长 15 秒输出。
可以。H3 对视频和音频进行联合建模,音频输出采用原生双声道,可包含人声、音效和音乐。
V2V 动作迁移使用输入视频引导新视频中的运动表现。H3 还能将该动作参考与图像、音频和自然语言指令组合使用。
MiniMax 重点介绍了广告、品牌、电商、产品设计、UI/UX 和游戏,并展示了电影片头、动态海报等案例。