
Hailuo 3 プロンプトガイド:MiniMax H3(H3 Max対応)のプロンプトの書き方

MiniMax H3 が実際に応答するプロンプト形式。ショット構造、カメラワーク、台詞タグ、サウンドフィールド、そしてプロンプト拡張に任せるべき判断の分かれ目まで解説します。
Hailuo 3 のプロンプトが失敗する理由は、たいてい単純です。指示ではなく「キャプション」を書いているから。「雨の中を歩く女性、シネマティック」では、モデルにタイミングもフレーミングも声の作りようがありません。MiniMax H3 はキャプションというより絵コンテに近いプロンプト構造を前提に作られていて、その構造が一度見えると、出力の差は歴然です。
このガイドでは、モデルが実際に応答する形式を解説します。ショット、カメラワーク、台詞タグ、サウンドフィールド。テキストから動画と画像から動画の、コピーして使える例つき。内容はすべて H3 と、Epochal で動いている高速版の H3 Max の両方にそのまま当てはまります。
前提:何に向けてプロンプトを書くのか
Hailuo 3 は MiniMax の現行動画モデルです。音声同期つきのクリップを生成します。映像、環境音、音楽、台詞がワンパスで一緒に出てきて、あとで別トラックをつなぐ必要がありません。前世代の Hailuo 2.3 は無音の動画を作るモデルでしたが、H3 はサウンドを同じプロンプトの一部として扱います。
H3 Max は同じファミリーの速度最適化版です。プロンプト形式は同じで、生成は速く、解像度の選択肢は少なめ。プロンプトのアイデアを反復している段階なら Max のほうが速く回せますし、以下の書き方はそのまま転用できます。
Epochal では、H3 Max はテキストプロンプトまたは画像(最初のフレーム、または最初と最後のフレームのペア)から、480p・768p・1080p の 5〜15 秒クリップを生成します。以下の例はこのキャンバスを前提にしています。
3 つのフィールド
H3 のプロンプト形式には、ラベル付きのフィールドが 3 つあります。2 つは省略可能ですが、3 つ全部を知っていると 1 つ目の書き方が変わります。
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...- integrated_multimodal_description はプロンプトの本体です。タイムライン上の見えるもの・聞こえるものすべてをカバーします。ショット、カメラワーク、アクション、台詞。
- overall_soundscape はクリップ全体の背景音です。雨、交通音、部屋の残響、足音。台詞と音楽は絶対にここには書きません。
- non_diegetic_music は劇伴、つまり観客だけが聞く音楽です。劇中の登場人物が聞こえ得る音(ラジオ、路上のミュージシャン、着信音)は、1 つ目のフィールドに書きます。
映像部分の書き方:ショットとカメラワーク
スタイルとフレーミングから始めて、何が起きるかを描写します。その形で書いたプロンプトの全文と、実際に出たクリップです(MiniMax H3 で生成、2026 年 9 月)。
integrated_multimodal_description: [Shot 1] An extreme close-up macro shot of a whole pomegranate carved from transparent ruby-red crystal glass, centered on a wooden cutting board, studio backlight scattering refractions and internal reflections through the seeds. A polished steel cleaver enters the frame and presses down in one slow, clean cut. The glass splits with a fine network of cracks before the two halves separate and rock gently on the board.
overall_soundscape: Quiet room tone; the only sound is the blade's crisp contact and a bright, crystalline crunch as the glass pomegranate splits, with tiny shards scattering across the wood.
non_diegetic_music: N/Aこの例で仕事をしているのは、3 つの要素です。
スタイル指定がレンダリングを決める。 実写、シネマティック、2D アニメ、3D CG、クレイアニメ、水彩、ヴィンテージフィルム。1 つ選んで先頭に置きます。この例では「極端なクローズアップのマクロ撮影」という素材の言葉(「透明なルビー色のクリスタルガラス」)が、どんな「シネマティック」よりも効いています。同じプロンプトに「photorealistic」と「watercolor」を混ぜると、モデルは平均を取ります。たいてい悪いほうに。
カメラワークは形容詞ではなく文で書く。 H3 は具体的な動きの語彙を理解します。Zoom In、Zoom Out、Push In(プッシュイン)、Pull Out、Pan Left/Right(パン)、Truck Left/Right、Tilt Up/Down(ティルト)、Pedestal Up/Down、Arc Shot、Tracking Shot、Static Shot、POV、Roll。振幅を表す「with small amplitude」や速度を表す「at fast speed」を付け加えることもできます。「カメラがゆっくりプッシュインする」と書くほうが「シネマティックなカメラワーク」より常に上手くいきます。モデルはプッシュインを実行できても、雰囲気を実行できないからです。
サウンドには専用フィールドがある。 パリッという音がどこに書かれているかに注目してください。overall_soundscape です。音楽フィールドでもなく、説明文の中の散文でもありません。登場人物が聞こえ得る音は説明文へ、シーンの物理的な音はサウンドスケープフィールドが本拠地です。non_diegetic_music: N/A にすれば劇伴なしになり、ガラスの割れる音と競合するものがなくなります。
複数ショットにはタイムスタンプが必要。 最初のショットはゼロ秒から始まります。カットはこう書きます。
[Shot 2] At 00:05.000, the camera cuts to a close-up of the split halves rocking on the board.カット時刻はクリップの長さの中に収まっている必要があります。5 秒の Max クリップで 00:09.000 のショットは、単純に永遠に来ません。そして、新しいショットが本当に新しい何か(新しい被写体、場所、状態)を運ぶときだけカットします。同じ瞬間の別アングルが欲しいだけなら、カットではなくカメラを動かしてください。
台詞:<d> タグ
H3 は音声を生成するので、台詞はタグ付きでプロンプトに書き込みます。要点は次のとおりです。
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>(S1)、(S2)は話者 ID で、登場人物が最初に話した順に振られます。初出時に声を描写します。年齢、声の高さ、話す速さ、アクセント。<d>の中のテキストは逐語で発話されます。言い換えず、言語タグも正直に。日本語の台詞なら<d>[Japanese]…</d>です。- ナレーターが画面外にいるボイスオーバーは、その旨と「話者の唇は閉じたまま」を明示します。書かないと、モデルは画面外の台詞にリップシンクさせようとします。
An older man in a wool coat says in an off-screen voiceover: <d>[English] Nobody remembered the lighthouse that winter.</d> while his lips remain completely closed.- 画面内のテキスト(ネオンサイン、スマホの画面)は説明文の中でダブルクォートで囲みます。
A red neon sign reading "OPEN" hums above the doorway.
サウンドフィールド:要点だけ
それぞれ 1〜3 文。具体が抽象に勝ります。
overall_soundscape: Steady rain taps against the café windows; low room ambience continues underneath.
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that swell before fading out.音楽フィールドにムードの言葉を書かないこと。「メランコリック」は再生できません。「スローなテンポのまばらなピアノと、スウェルして消えていく持続する低弦」なら再生できます。両フィールドとも N/A が使え、シーン音以外を消したクリップになります。
画像から動画:フレームへのアンカー
I2V は Hailuo 3 の本領が発揮されるところで、プロンプトの書き方が変わります。画像はタイムライン上の 1 フレームであり、テキストプロンプトはそれと矛盾しないようにします。
- 最初のフレームのみ。 画像の「後」に起きることを描写します。画像が 0 秒を固定し、プロンプトはそこから前へ展開します。
- 最初と最後のフレーム。 2 枚の間の連続的な経路を、できれば 1 ショットで描写します。モデルの仕事は遷移なので、架橋させる変化は 1 つ、明確なものにします(潮が満ちる、ドアが開く、スケッチが描かれていく)。
- カメラの規律: I2V プロンプトのカメラ移動は 1 回まで。1 枚の静止画にパン、ズーム、カットを積むと、アンカーと衝突します。
最初と最後のフレームの作業では、完全な構造化形式が説明文の上に、どの画像がどのタイムスタンプに位置するかを示すアラインメント行を追加します。これはモデル自身のプロンプトエクスパンダーが出力する形式です。手書きの I2V プロンプトは、説明文が最初のフレームから最後のフレームに向かって明確に語っていれば、この行がなくても問題なく動きます。
実際の最初のフレームからの I2V の例です。港湾の桟橋のアンカー画像 1 枚、固定カメラ、5 秒で運ぶ変化 1 つ(MiniMax H3 で生成、2026 年 9 月)。
[Shot 1] A static shot of the harbor pier from the first frame. Over the next five seconds, the last orange band of sunset fades from the water while a small fishing boat crosses slowly from left to right, its lamp the first light to switch on. The camera stays still.
overall_soundscape: Gentle water lapping against the pier pilings; a distant gull call near the end.このプロンプトが要求しているものの少なさに注目してください。フレームを固定し、光をフェードさせ、ボートを 1 隻動かす。構図はアンカー画像が担い、プロンプトが指示するのは変化だけです。
自分で書くか、オプティマイザーに任せるか
ここが私たちのワークベンチでの実践的な分かれ目です。Epochal の H3 Max には、プロンプト拡張の設定が 3 段階あります。
- Off。 入力したテキストがそのままモデルに渡ります。上の構造化形式で書いていて、カメラワーク・台詞タグ・サウンドフィールドを一字一句尊重してほしいときに使います。
- Balanced(デフォルト)。ギャップを埋め、構造を整える軽い書き直し。「暗い厨房でシェフがフランベする、カメラがゆっくり周回」のような自然文のドラフトに向いています。
- Quality。 種となるアイデアから、より充実した構造化プロンプトを組み立てる重めのパスです。意図は明確だが、ショットとサウンドスケープを自分で書く根気はないときに。
現実的なワークフローはこうです。Balanced でドラフトし、拡張が何を追加したかを確認して、Off に切り替えて拡張後のプロンプトを手で編集する。モデル自身の編集から形式を学べるので、ドキュメントを読むより速いです。この記事も含めて。
その分かれ目を自分で確かめられるように、同じ自然文ドラフトを Epochal で 2 回実行した結果を示します(MiniMax H3 Max、5 秒、480p)。1 回目は拡張オフ、2 回目は Balanced です。
someone films a tiny glowing creature standing on their kitchen table at dusk, one-handed phone footage拡張オフ。 文は書かれたとおりそのままモデルに渡ります。
Balanced。 同じ文を拡張パスが通した後。ショット構造とサウンドが補われています。
両方を見比べて、拡張パスが同じ 1 行のアイデアの上に静かにどれだけ積み上げるかを確かめてください。
よくある失敗
- 指示ではなくキャプション。「走る犬、シネマティック、4K」では、フレーミングもアクションの弧もカメラもタイミングも得られません。
- クリップ長の外にあるカットのタイムスタンプ。5 秒クリップの 00:09.000 はただの死に重りです。
- 登場人物が聞こえ得る音楽を
non_diegetic_musicに置く。置くべきは説明文です。 - 台詞を普通の散文で書く。モデルがセリフとナレーションを区別できません。
- 1 つの I2V アンカーに 3 つ積んだカメラ移動。
- 抽象的なスタイルの積み重ね。「シネマティック、感情的、壮大、傑作」はスタイルではありません。「ヴィンテージ 16mm フィルム」はスタイルです。
FAQ
Hailuo 3 は <d> のような台詞タグを理解しますか?
はい。モデルが学習している形式の一部です。「he says:」に続けて引用符で台詞を書いても、たいていは発話してくれますが、タグ版のほうが言語の扱いと逐語性については信頼できます。
すべてのプロンプトで 3 フィールド形式が必要ですか? いいえ。普通の自然文描写でも十分良いクリップが出ます。プロンプト拡張が On ならなおさらです。3 フィールドが効いてくるのは、監督するときです。サウンドデザイン、音楽、複数ショット構造。
H3 Max の最長クリップは? 15 秒です。Epochal も Max の公式設定も同じです。タイムスタンプでこの窓の中にカットを置きます。
プロンプトの長さに上限はありますか? 公式 API はプロンプトを 7,000 文字までに制限しています。15 秒のクリップがレンダリングできる量をはるかに超えています。焦点の絞られた 100〜300 語のプロンプトは、ほぼ常に 2,000 語のものより上手くいきます。
他の言語でプロンプトを書けますか?
モデルは複数言語を扱い、<d>[Language] タグが話される台詞の言語を制御します。プロンプト本文自体は英語が最も安全なデフォルトです。カメラの語彙(Pan、Tilt、Tracking Shot)は英語で定義されています。
H3 と H3 Max でプロンプトの書き方は違いますか? 形式は同一です。Max は解像度の余地の一部を生成速度と引き換えにしています。反復している段階では、Max に向けて書くことになります。
クリップが無音で出てきたのはなぜですか?
たいていは、プロンプトが映像しか描写していません。H3 はプロンプトが聞くべきものを与えたときにだけ音声を生成します。overall_soundscape の行を追加するか、説明文の中に環境音のディテールを入れてください。
Hailuo 3 は無料で使える? 無制限に無料で使えるプラットフォームはありません。MiniMax 公式の Hailuo AI アプリは新規アカウントに少額の毎日クレジットを付与し、サードパーティサイトのトライアルクレジットもすぐに使い切ります。Epochal では生成前に毎回コストが表示され、新規アカウントには少額のクレジット特典と毎日チェックインがあります。プロンプトの試行には 5 秒・480p 設定が一番安く済みます。
Hailuo 3 のリリース日は? MiniMax は 2026 年 7 月 31 日に H3 をリリースし、高速版の H3 Max は 2026 年 9 月に続きました。どちらも本ガイドで解説しているプロンプト形式は共通です。
試してみる
上の例を 1 つ選んで Epochal の MiniMax H3 Max に貼り付け、拡張オフで 1 回実行して、生の形式が何をするか確かめてください。静止画から始める場合も、同じアンカーのルールが適用されます。どのワークフローがどの入力に合うかは、画像から動画ツール特集で解説しています。
Meta Title: Hailuo 3 Prompt Guide: MiniMax H3 Prompt Format (2026)
Meta Description: How to write MiniMax H3 / Hailuo 3 prompts: shot structure, camera move vocabulary, dialogue tags, sound fields, and image-to-video prompting that works.
Slug: hailuo-3-prompt-guide
Primary Keyword: hailuo 3 prompt guide
Secondary Keywords: minimax h3 prompt, minimax h3 prompt guide, hailuo 3 prompts, hailuo h3 prompting
Suggested Internal Links:
/models/minimax-h3-max: the model this guide prompts for (hero + CTA)/models/hailuo-2-3: predecessor context/blog/best-image-to-video-ai-tools-2026: I2V readers
他の投稿

Grokは動画を生成できる?Grok Imagineの使い方【2026年】
Grok Imagineの動画生成を解説。テキストと静止画の使い分け、モード、制限、プロンプト構成、必要クレジットを確認できます。

HappyHorse 1.0 AI動画ガイド:テキスト動画生成と画像動画生成
HappyHorse 1.0はテキスト動画生成と画像動画生成に対応。企画検証、初期フレームのアニメーション、短尺映像制作のためのプロンプトと設定を解説します。

自分のパソコンでローカルAI動画生成を動かす方法
AI動画生成をローカル環境で動かすための実践ガイド。セットアップツール、ハードウェア要件、プライバシーのメリット、そしてクラウドツールが時間を節約できるケースまでを解説します。