統合マルチモーダル文脈
テキスト、画像、動画、音声を一つの文脈で参照し、各要素が結果にどう影響するかを言葉で指定できます。
タスクとモダリティの境界を越える
テキスト、画像、動画、音声を一つのコンテキストへ。MiniMax H3は複雑な創作指示を理解し、ネイティブステレオ音声付きで最大2K・最長15秒の動画を生成します。
サンプルにはステレオ音声が含まれています。プレーヤーの操作でお聴きください。
H3のモデル能力
H3はモダリティ間の関係を理解し、自然言語の創作意図を精密で制御可能なコンテンツ生成・編集へ変換します。
テキスト、画像、動画、音声を一つの文脈で参照し、各要素が結果にどう影響するかを言葉で指定できます。
映像と同期したステレオ音声を同時生成し、声、効果音、音楽を扱います。
最長15秒・最大2K解像度の精細な動画を生成できます。
細分化された生成タスクを切り替えず、複雑な創作目標を自然言語で表現できます。
文字やブランド情報を含むシーンで、精密かつ制御可能なコンテンツ生成と編集を行えます。
入力動画を動きの参照にし、ほかの素材で被写体、スタイル、カメラ表現、音を導きます。
生成サンプル
4つのシステム設計により、理解と生成を統合しながら効率的な高解像度出力を実現します。
言語が文脈内の要素と出力目標の関係を結び付けて説明し、汎用的な指示理解の基盤となります。
再設計されたtokenizerが再構成と学習性を高め、高い圧縮率で系列長を抑えながらネイティブ2K生成を支えます。
タスクの統一と汎化を支えるために設計された、汎用的で効率的なアーキテクチャです。
専用アップスケーラーに頼らず、基盤モデルと元のマルチモーダル文脈を再利用して高解像度の細部を再生成します。
MiniMaxは、クリエイティブとプロダクトの各チームにおける実際のコンテンツ制作シーンをH3の用途として紹介しています。
MiniMax H3は汎用オムニモーダル生成モデルです。テキスト、画像、動画、音声からなる統合コンテキストを理解し、ネイティブステレオ音声付きの動画を生成します。
H3はテキスト、画像、動画、音声の参照を一つの文脈にまとめられます。自然言語で参照素材と出力目標の関係を説明します。
MiniMaxの公式発表によると、H3は最大2K解像度、最長15秒の出力に対応します。
はい。H3は動画と音声を統合的にモデル化し、ネイティブステレオで音声を生成します。声、効果音、音楽を含めることができます。
入力動画の動きを新しい生成動画のガイドとして使う機能です。H3はその動きの参照を画像、音声、自然言語の指示と組み合わせられます。
MiniMaxは広告、ブランド、Eコマース、プロダクトデザイン、UI/UX、ゲームを挙げ、映画のオープニングやダイナミックポスターなどの例を紹介しています。