logo

タスクとモダリティの境界を越える

MiniMax H3:テキスト・画像・動画・音声を一つのモデルで

テキスト、画像、動画、音声を一つのコンテキストへ。MiniMax H3は複雑な創作指示を理解し、ネイティブステレオ音声付きで最大2K・最長15秒の動画を生成します。

最大2K最長15秒ネイティブステレオオムニモーダル文脈
MiniMax H3を詳しく見る

サンプルにはステレオ音声が含まれています。プレーヤーの操作でお聴きください。

H3のモデル能力

個別ツールから統合クリエイティブシステムへ

H3はモダリティ間の関係を理解し、自然言語の創作意図を精密で制御可能なコンテンツ生成・編集へ変換します。

01

統合マルチモーダル文脈

テキスト、画像、動画、音声を一つの文脈で参照し、各要素が結果にどう影響するかを言葉で指定できます。

02

ネイティブステレオ音声

映像と同期したステレオ音声を同時生成し、声、効果音、音楽を扱います。

03

最長15秒・最大2K

最長15秒・最大2K解像度の精細な動画を生成できます。

04

高精度な指示追従

細分化された生成タスクを切り替えず、複雑な創作目標を自然言語で表現できます。

05

文字とブランド表現

文字やブランド情報を含むシーンで、精密かつ制御可能なコンテンツ生成と編集を行えます。

06

V2Vモーション転写

入力動画を動きの参照にし、ほかの素材で被写体、スタイル、カメラ表現、音を導きます。

生成サンプル

MiniMax H3 生成サンプル

H3を支えるテクノロジー

4つのシステム設計により、理解と生成を統合しながら効率的な高解像度出力を実現します。

01

Contextual Omni Representation

言語が文脈内の要素と出力目標の関係を結び付けて説明し、汎用的な指示理解の基盤となります。

02

H3-VAE

再設計されたtokenizerが再構成と学習性を高め、高い圧縮率で系列長を抑えながらネイティブ2K生成を支えます。

03

H3-Omni Transformer

タスクの統一と汎化を支えるために設計された、汎用的で効率的なアーキテクチャです。

04

In-context Regeneration

専用アップスケーラーに頼らず、基盤モデルと元のマルチモーダル文脈を再利用して高解像度の細部を再生成します。

実際のコンテンツ制作を想定

MiniMaxは、クリエイティブとプロダクトの各チームにおける実際のコンテンツ制作シーンをH3の用途として紹介しています。

広告ブランドコンテンツEコマースプロダクトデザインUI / UXゲーム

MiniMax H3 よくある質問

  • MiniMax H3とは?

    MiniMax H3は汎用オムニモーダル生成モデルです。テキスト、画像、動画、音声からなる統合コンテキストを理解し、ネイティブステレオ音声付きの動画を生成します。

  • MiniMax H3はどのような入力を理解できますか?

    H3はテキスト、画像、動画、音声の参照を一つの文脈にまとめられます。自然言語で参照素材と出力目標の関係を説明します。

  • MiniMax H3が対応する解像度と長さは?

    MiniMaxの公式発表によると、H3は最大2K解像度、最長15秒の出力に対応します。

  • MiniMax H3は音声も生成しますか?

    はい。H3は動画と音声を統合的にモデル化し、ネイティブステレオで音声を生成します。声、効果音、音楽を含めることができます。

  • MiniMax H3のV2Vモーション転写とは?

    入力動画の動きを新しい生成動画のガイドとして使う機能です。H3はその動きの参照を画像、音声、自然言語の指示と組み合わせられます。

  • MiniMax H3はどのような用途向けですか?

    MiniMaxは広告、ブランド、Eコマース、プロダクトデザイン、UI/UX、ゲームを挙げ、映画のオープニングやダイナミックポスターなどの例を紹介しています。

一つの指示から完成した映像と音のアイデアへ

MiniMax H3のマルチモーダル理解と生成を中心とした統合クリエイティブワークフローをご覧ください。

MiniMax H3を詳しく見る
MiniMax H3 — ネイティブステレオと2K対応のオムニモーダルAI動画 | HeadSwap