映像と音声の同期
映像、動作、会話、音を一つのシーンとして設計
MiniMax H3の公式資料では、音を後処理として分離せず、映像と音声を同時に生成します。明確なプロンプトで、画面内の動き、カメラ、会話、物理音、環境音、音楽を同じ時間軸上に配置できます。
MiniMax H3の映像・音声ワークフローとプロンプト構成を学び、同じ画面で動画案を実用的な制作ブリーフへ整理できます。
画像または動画を設定し、このページ内で生成結果を確認できます。
クリップを開いて完全なプロンプトを確認し、MiniMax H3生成ツールへ入力できます。
16:9 · 10s · 720p
MiniMax H3
シーンを説明するか画像を追加し、利用可能な動画設定を選んで、MiniMax H3ワークフローで生成と改善を進めます。
プロンプトギャラリー
マウスを重ねると動きを再生します。カードを開くと完全なプロンプトと動画設定を確認し、上の生成ツールへ送れます。
これらの例は、カメラワーク、被写体の一貫性、商品表現、会話、音を意識したシーン向けのMiniMax H3プロンプト構成を示します。
モデル概要
MiniMax H3は、テキスト、画像、動画、音声をまとめて理解し、同期したステレオ音声付き動画を生成する汎用マルチモーダル生成システムです。公式資料では、開始フレーム、終了フレーム、開始・終了フレーム、完全な参照素材を使うワークフローと、高解像度2K出力のための再生成工程が説明されています。
4~15秒
公式の出力時間
24 FPS
公式フレームレート
32 kHz
ネイティブステレオ音声
最大2K
H3 Regenerate-2K使用時
映像と音声の同期
MiniMax H3の公式資料では、音を後処理として分離せず、映像と音声を同時に生成します。明確なプロンプトで、画面内の動き、カメラ、会話、物理音、環境音、音楽を同じ時間軸上に配置できます。
柔軟な参照制御
H3 Base FL2VAはテキストからの動画生成に加え、任意の開始・終了画像を使えます。H3 Base Ref2VAは画像、動画クリップ、音声の参照まで拡張され、素早い試作にも精密な制作指示にも対応します。
文脈対応2Kワークフロー
公式ワークフローには768pの基本出力と、元のマルチモーダル文脈を再利用するH3 Regenerate-2K工程があります。生成後に推測で補うのではなく、元の指示から細部を回復する考え方です。
ワークフロー
開始画面と演出指示から生成、確認、改善まで、明確なMiniMax H3プロンプト手順に沿って進めます。
MiniMax H3に文章を入力するか、画像を1枚アップロードします。動きを加える前に、被写体、環境、構図、開始状態を説明します。
出来事の順番とカメラの動きを明確にし、維持すべき要素を指定します。早く始めたい場合はギャラリーのプロンプト構成を参考にできます。
MiniMax H3で生成し、履歴パネルで結果を確認します。動きの強さ、長さ、構図など、一度に一つの要素を調整します。
用途
商品ブリーフからヒーローショット、ローンチ動画、短いキャンペーン案を作ります。
指定画像を安定した視覚アンカーとして使い、自然な動きと終点を定義します。
制作前にカメラ、人物の動き、場面のリズム、音の意図を確認します。
会話、環境音、効果音、音楽を同じ時間軸の連動した層として記述します。
人物、場所、動作素材、音の方向性を、より明確な制作指示にまとめます。
読みやすい一つの動作、被写体の一貫性、明確な終わりを持つ9:16シーンを設計します。
モデル比較
MiniMax H3の公式ワークフローを機能ガイドとして使い、ImageMakeワークスペースでプロンプトと利用可能な設定を整えます。
| モデル比較 | MiniMax H3の機能 | ImageMake MiniMax H3ワークスペース |
|---|---|---|
| このページでの利用 | ページのデフォルトモデルに設定 | テキストまたは画像から開始可能 |
| 入力 | テキスト、開始・終了フレーム、資料で説明される画像・動画・音声参照 | テキストプロンプトと任意の画像1枚 |
| 時間と出力 | 公式資料では4~15秒、24 FPS、別工程のRegenerate-2K | ページで選べる時間と解像度から開始 |
| 音声 | 同期した32 kHzステレオ音声を説明 | 会話、環境音、効果音、音楽をプロンプトに記述 |
ImageMake料金
以下のプランでは、MiniMax H3ワークスペースで動画を制作、確認、改善するためのImageMakeクレジットを利用できます。
ImageMakeの始め方に最適
画像クリエイターに最も人気
ImageMakeで画像を作成するパワーユーザー向け
よくある質問
はい。MiniMax H3がこのページのデフォルトモデルです。同じワークスペースでプロンプトを準備し、利用可能な設定を選んで動画制作を始められます。
テキスト、画像、動画、音声をまとめて理解し、同期ステレオ音声付き動画を生成するマルチモーダル映像・音声生成モデルです。
公式資料では可能とされています。ネイティブ32 kHzステレオ音声と、会話、物理音、環境音、音楽を連動させるプロンプトが説明されています。
公式モデルカードでは4~15秒、24 FPSと記載されています。
はい。FL2VAワークフローは、開始フレーム、終了フレーム、またはその両方を任意の画像アンカーとして使用できます。
基本出力と元の文脈をH3へ再入力し、文脈に沿った2Kディテールを再生成する高解像度工程です。
動き、カメラ指示、被写体の一貫性、商品表現、会話、音を意識したシーン向けのMiniMax H3プロンプト例を確認できます。
互換性のある設定とプロンプトがMiniMax H3生成フォームに入力されます。自動生成は行われないため、確認・編集してから生成できます。
制作を始める
MiniMax H3プロンプトの型を選び、シーンの方向性を整えて、ブリーフを生成可能な動画プロンプトへ変換しましょう。
MiniMax H3を試す