
Hailuo 3 Prompt 指南:MiniMax H3(與 H3 Max)提示詞怎麼寫

MiniMax H3 實際回應的 prompt 格式:鏡頭結構、運鏡詞彙、對白標籤、音場欄位,以及什麼時候該交給 prompt optimizer 處理。
大多數 Hailuo 3 prompt 失敗的原因很無聊:大家寫的是圖說,不是導戲的指令。「一個女人在雨中走路,電影感」這種句子,幾乎沒給模型任何可以抓時間、抓構圖、配音的東西。MiniMax H3 的設計前提,就是一段更像分鏡腳本、而不是圖說的 prompt 結構——一旦看懂這個結構,輸出的差距立刻看得出來。
這篇指南講的是模型真正回應的格式:鏡頭、運鏡、對白標籤、音場欄位,附上文字生影片和圖片生影片的範例,可以直接複製。所有內容同時適用 H3 和我們在 Epochal 上跑的高速版 H3 Max。
先搞清楚:你在對什麼下 prompt
Hailuo 3 是 MiniMax 現在的影片模型。它生成影音同步的片段:畫面、環境音、音樂、口說對白一次出齊,不是事後再自己拼接的軌道。前一代 Hailuo 2.3 做的是無聲影片;H3 把聲音視為同一份 prompt 的一部分。
H3 Max 是同家族的速度優先版本。prompt 格式相同,生成更快,解析度選項較少。還在反覆試 prompt 階段,Max 回饋得更快;下面的寫法原封不動通用。
在 Epochal 上,H3 Max 以文字 prompt 或圖片(起始影格,或起始+結尾影格一組)生成 480p、768p、1080p 的 5 到 15 秒片段。以下範例都假設這個畫布。
三個欄位
H3 的 prompt 格式有三個帶標籤的欄位。兩個可省略,但三個都看懂,第一個欄位的寫法就會不一樣:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...- integrated_multimodal_description 是 prompt 的本體。時間軸上所有看得到、聽得到的東西都歸它管:鏡頭、運鏡、動作、對白。
- overall_soundscape 是整段影片的背景聲音:雨聲、車流、房間底噪、腳步聲。對白和音樂絕對不寫這裡。
- non_diegetic_music 是配樂——只有觀眾聽得到的音樂。如果劇中角色可能聽得到(收音機、街頭藝人、手機鈴聲),就該寫進第一個欄位。
影像部分怎麼寫:鏡頭與運鏡
先用風格和構圖開場,再描述發生什麼事。下面是一則完整格式的 prompt,以及它實際生成的片段(用 MiniMax H3 生成,2026 年 9 月):
integrated_multimodal_description: [Shot 1] An extreme close-up macro shot of a whole pomegranate carved from transparent ruby-red crystal glass, centered on a wooden cutting board, studio backlight scattering refractions and internal reflections through the seeds. A polished steel cleaver enters the frame and presses down in one slow, clean cut. The glass splits with a fine network of cracks before the two halves separate and rock gently on the board.
overall_soundscape: Quiet room tone; the only sound is the blade's crisp contact and a bright, crystalline crunch as the glass pomegranate splits, with tiny shards scattering across the wood.
non_diegetic_music: N/A這個例子裡真正在做事的是三件事。
風格詞決定渲染方式。 實拍、電影感、2D 動畫、3D CG、黏土動畫、水彩、復古底片。挑一個放在最前面。這個例子裡,「極端特寫微距」加上材質詞(「透明紅寶石色水晶玻璃」)比任何「電影感」都有用。同一個 prompt 混用「photorealistic」和「watercolor」,模型會把兩者平均——通常平均得很難看。
運鏡要寫成句子,不是形容詞。 H3 認得一組具體的運鏡詞彙:Zoom In、Zoom Out、Push In(推鏡)、Pull Out、Pan Left/Right(橫搖)、Truck Left/Right、Tilt Up/Down(俯仰)、Pedestal Up/Down、Arc Shot、Tracking Shot(追蹤鏡頭)、Static Shot、POV、Roll。還可以加幅度(「with small amplitude」)和速度(「at fast speed」)。寫「鏡頭緩慢推鏡」永遠勝過「電影感運鏡」,因為模型執行得了推鏡,執行不了氛圍。
聲音有自己的欄位。 注意那聲清脆的碎裂寫在哪:overall_soundscape,不是音樂欄位,也不是描述裡的散文。角色可能聽得到的聲音寫進描述;場景本身的物理聲響,音場欄位才是它的家。non_diegetic_music: N/A 讓片段不帶配樂,就沒有東西會蓋過玻璃碎裂的聲音。
多鏡頭需要時間戳。 第一顆鏡頭從零秒開始。剪接(切換)長這樣:
[Shot 2] At 00:05.000, the camera cuts to a close-up of the split halves rocking on the board.切換時間點必須落在片段長度之內。在 5 秒的 Max 片段裡,00:09.000 的鏡頭永遠不會發生。而且,只有當新鏡頭真的帶來新東西(新主體、新場景、新狀態)時才切。如果只是想換個角度看同一瞬間,動鏡頭就好,不要切。
對白:<d> 標籤
H3 會生成音訊,所以對白要用標籤寫進 prompt。重點如下:
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>(S1)、(S2)是說話者 ID,按角色開口順序編號。第一次出現時描述聲音:年齡、音高、語速、口音。<d>裡的文字會逐字唸出。不要改寫,語言標籤也要誠實:日文台詞就用<d>[Japanese]…</d>。- 旁白(說話者不在畫面上)要寫明這一點,並加上說話者的嘴唇保持閉合,否則模型會試著幫畫外音做嘴型同步:
An older man in a wool coat says in an off-screen voiceover: <d>[English] Nobody remembered the lighthouse that winter.</d> while his lips remain completely closed.- 畫面中的文字(霓虹招牌、手機螢幕)用雙引號寫在描述裡:
A red neon sign reading "OPEN" hums above the doorway.
音場欄位,講重點
各寫一到三句。具體勝過抽象:
overall_soundscape: Steady rain taps against the café windows; low room ambience continues underneath.
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that swell before fading out.音樂欄位別寫情緒詞。「憂鬱」無法演奏;「慢板稀疏的鋼琴,配持續低音弦樂漸強後淡出」可以。兩個欄位都接受 N/A,想要除了場景聲之外全靜音就用它。
圖片生影片:錨定影格
I2V 是 Hailuo 3 真正展現價值的地方,prompt 寫法也跟著變。你的圖片是時間軸上的一格影格,文字 prompt 必須和它一致:
- 只給起始影格。 描述圖片「之後」發生的事。圖片錨定第零秒;prompt 從那裡往前發展。
- 起始+結尾影格。 描述兩者之間連續的路徑,最好寫成一顆鏡頭。模型的工作是過渡,所以給它一個明確的變化去搭橋(潮水漲上來、門打開、素描被畫完)。
- 運鏡紀律: 一則 I2V prompt 只用一次運鏡。在一張靜態圖上堆橫搖、變焦加剪接,是跟錨點作對。
做首尾影格時,完整結構化格式會在描述上方加一列對齊行,說明哪張圖位於哪個時間戳。這是模型自己的 prompt expander 產出的格式。手寫 I2V prompt 沒有那一列也完全可用,只要你的描述清楚從起始影格敘事到結尾影格。
以下是一則實際的起始影格 I2V:一張港口棧橋的錨定圖、一台固定攝影機、一個跨越五秒的變化(用 MiniMax H3 生成,2026 年 9 月):
[Shot 1] A static shot of the harbor pier from the first frame. Over the next five seconds, the last orange band of sunset fades from the water while a small fishing boat crosses slowly from left to right, its lamp the first light to switch on. The camera stays still.
overall_soundscape: Gentle water lapping against the pier pilings; a distant gull call near the end.注意這則 prompt 要求得多麼少:固定畫面、讓光淡出、讓一艘船駛過。構圖交給錨定圖,prompt 只指揮變化。
自己寫,還是交給 optimizer
這是我們工作台上最實際的分岔點。Epochal 的 H3 Max 有三段 prompt 擴充設定:
- Off。 你打的字原封不動交給模型。已經照上面的結構化格式寫好、想讓運鏡、對白標籤、音場欄位一字不動被尊重時用這個。
- Balanced(預設)。輕度改寫,補洞、整理結構。適合「主廚在昏暗廚房裡甩鍋火焰,鏡頭緩慢環繞」這類自然語言草稿。
- Quality。 較重的處理,從你的種子想法長出更完整的結構化 prompt。意圖很明確、但沒耐性自己寫鏡頭和音場的時候用。
合理的流程是:先用 Balanced 起草,看看擴充加了什麼,再切到 Off 手動編輯擴充後的 prompt。你會從模型自己的編輯裡學會這個格式——比讀文件快,包括這篇。
想親眼看看這個分岔,同一句自然語言草稿在 Epochal 上跑了兩次(MiniMax H3 Max,5 秒,480p),第一次擴充關閉,第二次 Balanced:
someone films a tiny glowing creature standing on their kitchen table at dusk, one-handed phone footage擴充關閉。 句子原樣送到模型:
Balanced。 同一句話經過擴充處理之後,補上了鏡頭結構和聲音:
兩段都看完,再體會一下擴充處理在同一句話之上悄悄加了多少東西。
常見錯誤
- 寫圖說不寫指令。「一隻狗在跑,電影感,4K」給不了你構圖、動作弧線、鏡頭,也沒有任何時間依據。
- 剪接時間戳超出片段長度。5 秒片段裡的 00:09.000 是純粹的死重。
- 角色聽得到的音樂放進
non_diegetic_music。該放的是描述裡。 - 對白寫成普通散文,模型分不清台詞和旁白。
- 一個 I2V 錨點疊三種運鏡。
- 抽象風格堆疊。「電影感、感性、史詩、傑作」不是風格;「復古 16mm 底片」才是。
FAQ
Hailuo 3 認得 <d> 這種對白標籤嗎?
認得,這是模型訓練格式的一部分。你也可以只寫「he says:」加引號中的台詞,模型通常照樣會唸;但標籤版本在語言控制和逐字保持上更可靠。
每則 prompt 都需要三欄位格式嗎? 不用。單純的自然語言描述就能出很好的片段,prompt 擴充開著時更是如此。三欄位真正發揮作用是在你「導演」的時候:聲音設計、音樂、多鏡頭結構。
H3 Max 最長的片段是幾秒? 15 秒,Epochal 和 Max 的官方設定都一樣。用時間戳把切換放進這個區間。
prompt 長度有上限嗎? 官方 API 上限 7,000 字元,遠超過 15 秒片段能呈現的量。聚焦的 100 到 300 字 prompt 幾乎永遠勝過 2,000 字的。
可以用其他語言寫 prompt 嗎?
模型支援多種語言,<d>[Language] 標籤控制口說對白的語言。prompt 本文本身,英文是最穩的預設——運鏡詞彙(Pan、Tilt、Tracking Shot)本來就是用英文定義的。
H3 和 H3 Max 的 prompt 寫法有差嗎? 格式完全相同。Max 拿部分解析度餘裕換生成速度,所以反覆試 prompt 的階段就對著 Max 寫。
我的片段為什麼沒有聲音?
通常是 prompt 只描述了畫面。H3 是在 prompt 給了它可聽的內容時才生成音訊。加一行 overall_soundscape,或在描述裡補環境音細節。
Hailuo 3 免費嗎? 沒有任何平台能無限量免費使用。MiniMax 官方的 Hailuo AI App 給新帳號少量每日額度,第三方平台提供的試用額度也很快用完。在 Epochal 上,每次生成前都會顯示積分成本,新帳號有小型贈送額度加每日簽到。想測 prompt 的話,5 秒 480p 是最省的迭代檔位。
Hailuo 3 什麼時候發布的? MiniMax 於 2026 年 7 月 31 日推出 H3,提速版 H3 Max 於 2026 年 9 月跟進。兩者都使用本指南介紹的 prompt 格式。
動手試
從上面的範例挑一則,貼進 Epochal 的 MiniMax H3 Max,擴充關閉跑一次,看看原始格式能做出什麼。如果是從靜態圖出發,同樣的錨定規則照用。哪些工作流適合哪種輸入,可以看我們的圖片生影片工具整理。
Meta Title: Hailuo 3 Prompt Guide: MiniMax H3 Prompt Format (2026)
Meta Description: How to write MiniMax H3 / Hailuo 3 prompts: shot structure, camera move vocabulary, dialogue tags, sound fields, and image-to-video prompting that works.
Slug: hailuo-3-prompt-guide
Primary Keyword: hailuo 3 prompt guide
Secondary Keywords: minimax h3 prompt, minimax h3 prompt guide, hailuo 3 prompts, hailuo h3 prompting
Suggested Internal Links:
/models/minimax-h3-max: the model this guide prompts for (hero + CTA)/models/hailuo-2-3: predecessor context/blog/best-image-to-video-ai-tools-2026: I2V readers
更多文章

2026 年最佳影像轉影片 AI 工具:哪一款最能保存您的畫面?
2026 年最佳影像到影片 AI 工具的實用指南,比較了 Kling 3.0、Veo 3.1、Seedance 2.0、Wan 2.7 和 Grok Imagine Video 的幀保存、運動品質、速度和工作流程配合。

HappyHorse 1.0 AI 影片:文生影片、圖生影片與短片創作指南
HappyHorse 1.0 支援文生影片與圖生影片,適合創意打樣、首幀動畫、廣告測試與短片鏡頭迭代。本指南整理提示詞、參數與工作流。

Nano Banana 2 與 Nano Banana Pro 比較:差異與選擇
比較 Nano Banana 2 與 Pro 的速度、準確性、文字生成、參考影像、解析度、畫面比例,以及在 Epochal 的積分成本。