logo

打破任务和模态的边界

MiniMax H3:统一理解文本、图像、视频与声音

将文本、图像、视频和声音放入同一个上下文。MiniMax H3 能理解复杂创作指令,生成最高 2K、最长 15 秒并带原生双声道的视频。

最高 2K最长 15 秒原生双声道全模态上下文
探索 MiniMax H3

这些样片包含双声道音频,可通过播放器控制栏开启声音。

H3 模型能力

从分散工具走向统一创作系统

H3 面向跨模态关系理解而设计,把自然语言中的完整创作意图转化为精准、可控的内容生成与编辑。

01

统一多模态上下文

在同一个上下文中组合文本、图像、视频和音频参考,再描述每个元素应如何影响最终结果。

02

原生双声道

联合生成画面与同步的双声道音频,覆盖人声、音效和音乐。

03

最长 15 秒、最高 2K

可输出最长 15 秒、最高 2K 分辨率的细腻视频。

04

精准指令遵循

直接用自然语言表达复杂创作目标,无需在多个定义狭窄的生成任务之间切换。

05

文字与品牌呈现

在涉及文字与品牌信息的场景中,实现精准、可控的内容生成与编辑。

06

V2V 动作迁移

以输入视频为动作参考,同时通过其他素材控制主体、风格、镜头语言和声音。

生成示例

MiniMax H3 生成示例

H3 背后的核心技术

四项系统级选择帮助 H3 统一理解与生成,并实现高效的高分辨率输出。

01

Contextual Omni Representation

语言负责连接并解释上下文元素与目标输出之间的关系,为 H3 的通用指令理解奠定基础。

02

H3-VAE

重新设计的 tokenizer 提升重建质量与易学性,高压缩率缩短序列长度,并支撑原生 2K 生成。

03

H3-Omni Transformer

以通用和高效为目标,让架构服务于任务的统一与泛化。

04

In-context Regeneration

H3 复用基模和原始多模态上下文重新生成高分辨率细节,而不是依赖独立超分模块。

面向真实内容生产场景

MiniMax 展示了 H3 在创意与产品团队真实内容生产场景中的应用。

广告品牌内容电商产品设计UI / UX游戏

MiniMax H3 常见问题

  • MiniMax H3 是什么?

    MiniMax H3 是一款通用全模态生成模型。它能统一理解由文本、图像、视频和声音组成的上下文,并生成带原生双声道的视频。

  • MiniMax H3 能理解哪些输入?

    H3 可以在同一个上下文中组合文本、图像、视频和音频参考,并用自然语言描述这些参考与目标输出之间的关系。

  • MiniMax H3 支持什么分辨率和时长?

    根据 MiniMax 官方发布信息,H3 最高支持 2K 分辨率和最长 15 秒输出。

  • MiniMax H3 能生成音频吗?

    可以。H3 对视频和音频进行联合建模,音频输出采用原生双声道,可包含人声、音效和音乐。

  • MiniMax H3 的 V2V 动作迁移是什么?

    V2V 动作迁移使用输入视频引导新视频中的运动表现。H3 还能将该动作参考与图像、音频和自然语言指令组合使用。

  • MiniMax H3 面向哪些使用场景?

    MiniMax 重点介绍了广告、品牌、电商、产品设计、UI/UX 和游戏,并展示了电影片头、动态海报等案例。

从一句指令走向完整的视听创意

探索以 MiniMax H3 全模态理解与生成为核心的统一创作工作流。

探索 MiniMax H3
MiniMax H3 — 原生双声道与 2K 全模态 AI 视频模型 | HeadSwap