
Guida ai prompt di Hailuo 3: come scrivere prompt per MiniMax H3 (e H3 Max)

Il formato di prompt a cui MiniMax H3 risponde davvero: struttura delle inquadrature, movimenti di camera, tag di dialogo, campi sonori e quando lasciare lavorare l'ottimizzatore di prompt.
La maggior parte dei prompt per Hailuo 3 fallisce per un motivo banale: la gente scrive didascalie invece di direzioni di regia. «Una donna che cammina sotto la pioggia, cinematic» non dà al modello quasi nulla da sincronizzare, inquadrare o dare voce. MiniMax H3 è costruito attorno a una struttura di prompt che si legge più come una sceneggiatura che come una didascalia, e una volta vista la struttura, la differenza nell'output è immediata.
Questa guida copre il formato a cui il modello risponde davvero: inquadrature, movimenti di camera, tag di dialogo e campi sonori. Con esempi pronti da copiare e incollare per text-to-video e image-to-video. Tutto qui vale sia per H3 sia per la variante più veloce H3 Max, quella che usiamo su Epochal.
Contesto rapido: a cosa stai dando istruzioni
Hailuo 3 è l'attuale modello video di MiniMax. Genera clip con audio sincronizzato: immagine, ambiente, musica e dialoghi parlati escono in un'unica passata, non come tracce separate da montare dopo. Hailuo 2.3, la generazione precedente, produceva video muto; H3 tratta il suono come parte dello stesso prompt.
H3 Max è la versione della stessa famiglia ottimizzata per la velocità. Stesso formato di prompt, generazione più rapida, scala di risoluzioni più corta. Se stai iterando su idee di prompt, Max ti arriva prima; le tecniche di prompt qui sotto si trasferiscono una a una.
Su Epochal, H3 Max genera clip da 5 a 15 secondi a 480p, 768p o 1080p, da un prompt di testo o da un'immagine (primo fotogramma, o primo e ultimo fotogramma insieme). Questa è la tela che gli esempi qui sotto presuppongono.
I tre campi
Il formato di prompt di H3 ha tre campi etichettati. Due sono facoltativi, ma conoscerli tutti e tre cambia come scrivi il primo:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...- integrated_multimodal_description è il corpo del prompt. Copre tutto ciò che è visibile e udibile sulla timeline: inquadrature, movimenti di camera, azioni, dialoghi.
- overall_soundscape è il suono di fondo dell'intera clip: pioggia, traffico, tono di stanza, passi. I dialoghi e la musica non vanno mai qui.
- non_diegetic_music è la colonna sonora, musica che sente solo il pubblico. Se un personaggio nella scena potrebbe sentirla (una radio, un busker, una suoneria), va nel primo campo.
Scrivere la parte visiva: inquadrature e movimenti di camera
Apri con stile e inquadratura, poi descrivi cosa succede. Ecco un prompt completo in quella forma, e la clip che ha prodotto (generata con MiniMax H3, settembre 2026):
integrated_multimodal_description: [Shot 1] An extreme close-up macro shot of a whole pomegranate carved from transparent ruby-red crystal glass, centered on a wooden cutting board, studio backlight scattering refractions and internal reflections through the seeds. A polished steel cleaver enters the frame and presses down in one slow, clean cut. The glass splits with a fine network of cracks before the two halves separate and rock gently on the board.
overall_soundscape: Quiet room tone; the only sound is the blade's crisp contact and a bright, crystalline crunch as the glass pomegranate splits, with tiny shards scattering across the wood.
non_diegetic_music: N/ATre cose fanno il lavoro in quell'esempio:
Le parole di stile impostano il render. Azione reale, cinematic, animazione 2D, CG 3D, claymation, acquerello, pellicola vintage. Scegline una e mettila all'inizio. Qui, «extreme close-up macro» più le parole di materiale («transparent ruby-red crystal glass») ottengono più di qualsiasi «cinematic». Mescolare «photorealistic» e «watercolor» nello stesso prompt fa sì che il modello ne calcoli la media, di solito male.
I movimenti di camera sono frasi, non aggettivi. H3 capisce un vocabolario di movimento specifico: Zoom In, Zoom Out, Push In (avvicinamento), Pull Out, Pan Left/Right (panoramica), Truck Left/Right, Tilt Up/Down (tilt), Pedestal Up/Down, Arc Shot, Tracking Shot (carrello), Static Shot, POV, Roll. Puoi aggiungere l'ampiezza («with small amplitude») e la velocità («at fast speed»). Scrivere «the camera slowly pushes in» batte «cinematic camera work» ogni volta, perché il modello può eseguire un push in; un'atmosfera non può eseguirla.
Il suono è un campo a sé. Nota dove vive lo scricchiolio: in overall_soundscape, non nel campo musica e non come prosa dentro la descrizione. Se un personaggio potrebbe sentire il suono, appartiene alla descrizione; se è il suono fisico della scena, il campo soundscape è la sua casa. non_diegetic_music: N/A tiene la clip priva di colonna sonora, così nulla compete con lo scoppio del vetro.
Inquadrature multiple richiedono timestamp. La prima inquadratura parte da zero. Un taglio appare così:
[Shot 2] At 00:05.000, the camera cuts to a close-up of the split halves rocking on the board.L'orario del taglio deve cadere dentro la durata della clip. Su una clip Max da 5 secondi, un'inquadratura a 00:09.000 semplicemente non accade mai. E taglia solo quando la nuova inquadratura porta qualcosa di genuinamente nuovo (un soggetto, un luogo, uno stato). Se vuoi solo un'altra angolazione dello stesso momento, muovi la camera invece di tagliare.
Il dialogo: il tag <d>
Siccome H3 genera l'audio, i dialoghi si scrivono nel prompt con un tag. Le basi:
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>(S1),(S2)sono ID parlante, assegnati nell'ordine in cui i personaggi parlano per la prima volta. Descrivi la voce alla prima menzione: età, tono, ritmo, accento.- Il testo dentro
<d>viene pronunciato alla lettera. Non parafrasarlo e mantieni onesto il tag della lingua:<d>[Japanese]…</d>per una battuta in giapponese. - Per il voiceover, dove il narratore resta fuori campo, dillo e aggiungi che le labbra di chi parla restano chiuse, altrimenti il modello tenterà di sincronizzare le labbra su una battuta fuori campo:
An older man in a wool coat says in an off-screen voiceover: <d>[English] Nobody remembered the lighthouse that winter.</d> while his lips remain completely closed.- Il testo a schermo (un'insegna al neon, lo schermo di un telefono) va tra virgolette doppie dentro la descrizione:
A red neon sign reading "OPEN" hums above the doorway.
I campi sonori, in breve
Da una a tre frasi ciascuno. Il concreto batte l'astratto:
overall_soundscape: Steady rain taps against the café windows; low room ambience continues underneath.
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that swell before fading out.Evita le parole d'atmosfera nel campo musica. «Melancholy» non è riproducibile; «sparse piano at a slow tempo with sustained low strings» lo è. Entrambi i campi accettano N/A se vuoi la clip muta a parte il suono della scena.
Image-to-video: ancorarsi a un fotogramma
I2V è dove Hailuo 3 dà il meglio di sé, e il modo di scrivere prompt cambia. La tua immagine è un fotogramma sulla timeline, e il prompt di testo deve essere d'accordo con essa:
- Solo primo fotogramma. Descrivi cosa accade dopo l'immagine. L'immagine ancora il secondo zero; il tuo prompt si sviluppa in avanti da lei.
- Primo e ultimo fotogramma. Descrivi il percorso continuo tra i due, idealmente come un'unica inquadratura. Il compito del modello è la transizione, quindi dagli un solo cambiamento chiaro da colmare (la marea entra, la porta si apre, lo schizzo viene dipinto).
- Disciplina di camera: un movimento di camera per prompt I2V. Impilare una panoramica, uno zoom e un taglio su una singola immagine fissa lotta contro l'ancora.
Per il lavoro primo/ultimo fotogramma, il formato strutturato completo aggiunge una riga di allineamento sopra la descrizione che indica quale immagine si trova a quale timestamp. È il formato che l'espansore di prompt del modello stesso emette. I prompt I2V scritti a mano funzionano benissimo senza, purché la tua descrizione narri chiaramente dal primo fotogramma verso l'ultimo.
Ecco un'esecuzione I2V con primo fotogramma in pratica: una singola immagine ancora di un molo portuale, una camera fissa, e un solo cambiamento da portare avanti per cinque secondi (generata con MiniMax H3, settembre 2026):
[Shot 1] A static shot of the harbor pier from the first frame. Over the next five seconds, the last orange band of sunset fades from the water while a small fishing boat crosses slowly from left to right, its lamp the first light to switch on. The camera stays still.
overall_soundscape: Gentle water lapping against the pier pilings; a distant gull call near the end.Nota quanto poco chiede il prompt: tenere fermo l'inquadratura, lasciare spegnersi la luce, muovere una barca. L'immagine ancora fa la composizione; il prompt dirige solo ciò che cambia.
Scrivilo tu, o lascialo all'ottimizzatore
Questa è la diramazione pratica sul nostro workbench. H3 Max su Epochal ha un'impostazione di espansione del prompt con tre posizioni:
- Off. Il modello riceve esattamente quello che hai digitato. Usala quando hai scritto nel formato strutturato qui sopra e vuoi che i tuoi movimenti di camera, tag di dialogo e campi sonori siano rispettati parola per parola.
- Balanced (predefinito). Una riscrittura leggera che riempie le lacune e sistema la struttura. Buona per bozze in linguaggio naturale come «a chef flambés a pan in a dark kitchen, camera slowly circles».
- Quality. Una passata più pesante che costruisce un prompt strutturato più completo a partire dalla tua idea di partenza. Perfetta quando l'intento è chiaro ma manca la pazienza di scrivere inquadrature e paesaggi sonori da soli.
Un flusso di lavoro ragionevole: scrivi in Balanced, guarda cosa ha aggiunto l'espansione, poi passa a Off e modifica a mano il prompt espanso. Finisci per imparare il formato dalle modifiche stesse del modello, il che va più veloce che leggere la documentazione, questa inclusa.
Per vedere la diramazione di persona, ecco la stessa bozza in linguaggio naturale eseguita due volte su Epochal (MiniMax H3 Max, 5 secondi, 480p), prima con l'espansione spenta, poi su Balanced:
someone films a tiny glowing creature standing on their kitchen table at dusk, one-handed phone footageEspansione spenta. La frase arriva al modello così com'è scritta:
Balanced. La stessa frase dopo che la passata di espansione ha integrato struttura delle inquadrature e suono:
Guarda entrambe e nota quanto la passata di espansione aggiunge in silenzio alla stessa idea di una riga.
Errori comuni
- Didascalie invece di direzioni. «A dog running, cinematic, 4K» non dà inquadratura, né arco d'azione, né camera, né nulla da sincronizzare.
- Timestamp di taglio fuori dalla durata della clip. Un'inquadratura a 00:09.000 su una clip da 5 secondi è peso morto.
- Musica che i personaggi potrebbero sentire piazzata in
non_diegetic_music. Va nella descrizione. - Dialoghi scritti come prosa normale, così il modello non distingue la parlata dalla narrazione.
- Tre movimenti di camera impilati su un'unica ancora I2V.
- Impilamento di stili astratti. «Cinematic, emotional, epic, masterpiece» non è uno stile; «vintage 16mm film» lo è.
FAQ
Hailuo 3 capisce i tag di dialogo come <d>?
Sì, fanno parte del formato su cui il modello è stato addestrato. Puoi anche scrivere semplicemente «he says:» seguito dalla battuta tra virgolette e il modello di solito la doppiarà; la versione con tag è più affidabile sulla lingua e nel mantenere la battuta alla lettera.
Serve il formato a tre campi per ogni prompt? No. Una semplice descrizione in linguaggio naturale produce clip perfettamente buoni, soprattutto con l'espansione del prompt attiva. I tre campi contano quando dirigi: sound design, musica o struttura multi-inquadratura.
Qual è la clip H3 Max più lunga? 15 secondi, sia su Epochal sia nelle impostazioni ufficiali di H3 per Max. Usa i timestamp per collocare i tagli in quella finestra.
La lunghezza del prompt ha un limite? L'API ufficiale limita i prompt a 7.000 caratteri, molto più di quanto una clip da 15 secondi possa renderizzare. Un prompt mirato da 100 a 300 parole batte quasi sempre uno da 2.000 parole.
Posso scrivere prompt in altre lingue?
Il modello gestisce più lingue, e il tag <d>[Language] controlla la lingua dei dialoghi parlati. Per il testo del prompt stesso, l'inglese è l'impostazione predefinita più sicura. È la lingua in cui il vocabolario di camera (Pan, Tilt, Tracking Shot) è stato definito.
H3 o H3 Max: cambia il prompting? Il formato è identico. Max scambia un po' di margine di risoluzione con la velocità di generazione, quindi è quello a cui scrivere prompt quando iteri.
Perché la mia clip è uscita muta?
Di solito il prompt descriveva solo l'immagine. H3 genera audio quando il prompt gli dà qualcosa da sentire. Aggiungi una riga overall_soundscape o dettagli ambientali dentro la descrizione.
Hailuo 3 è gratuito? Non in quantità illimitate, da nessuna parte. L'app ufficiale Hailuo AI di MiniMax assegna un piccolo credito giornaliero ai nuovi account, e i crediti di prova dei siti di terze parti finiscono in fretta. Su Epochal ogni generazione mostra il suo costo prima dell'esecuzione, e i nuovi account partono con un piccolo credito di benvenuto più il check-in giornaliero. Per testare i prompt, l'impostazione di 5 secondi a 480p è la più economica.
Quando è uscito Hailuo 3? MiniMax ha lanciato H3 il 31 luglio 2026, e la variante ottimizzata per la velocità, H3 Max, è seguita a settembre 2026. Entrambi usano il formato di prompt descritto in questa guida.
Provalo
Prendi uno degli esempi qui sopra, incollalo in MiniMax H3 Max su Epochal ed eseguilo una volta con l'espansione spenta per vedere cosa fa il formato grezzo. Se lavori da immagini fisse, valgono le stesse regole di ancoraggio. La nostra raccolta di strumenti image-to-video copre quali flussi di lavoro si adattano a quali input.
Meta Title: Hailuo 3 Prompt Guide: MiniMax H3 Prompt Format (2026)
Meta Description: How to write MiniMax H3 / Hailuo 3 prompts: shot structure, camera move vocabulary, dialogue tags, sound fields, and image-to-video prompting that works.
Slug: hailuo-3-prompt-guide
Primary Keyword: hailuo 3 prompt guide
Secondary Keywords: minimax h3 prompt, minimax h3 prompt guide, hailuo 3 prompts, hailuo h3 prompting
Suggested Internal Links:
/models/minimax-h3-max: the model this guide prompts for (hero + CTA)/models/hailuo-2-3: predecessor context/blog/best-image-to-video-ai-tools-2026: I2V readers
Altri post

Grok può generare video? Guida a Grok Imagine 2026
Sì. Grok Imagine crea video da testo o immagini fisse. Scopri modalità, limiti, struttura dei prompt, costi e workflow più adatto.

Generatori di video AI open source nel 2026: modelli, limiti e compromessi
Una guida pratica ai modelli open source di generazione video con intelligenza artificiale, ai loro requisiti hardware, alle restrizioni di licenza e al confronto con gli strumenti cloud.

I migliori generatori video AI del 2026: Veo 3.1, Kling 3.0, Seedance 2.0 e altri, testati
Un confronto pratico tra i migliori generatori video AI disponibili nel 2026: qualità dell'output, generazione audio, controllo dei prompt, velocità e quale modello si adatta a ogni workflow.