
Guide des prompts Hailuo 3 : comment écrire des prompts pour MiniMax H3 (et H3 Max)

Le format de prompt auquel MiniMax H3 répond vraiment : structure des plans, mouvements de caméra, balises de dialogue, champs sonores, et quand laisser l'optimiseur de prompts faire le travail.
La plupart des prompts Hailuo 3 échouent pour une raison banale : les gens écrivent des légendes au lieu d'instructions de tournage. « Une femme qui marche sous la pluie, cinematic » ne donne presque rien au modèle à chronométrer, cadrer ou faire parler. MiniMax H3 repose sur une structure de prompt qui se lit davantage comme un script de tournage que comme une légende, et une fois la structure repérée, la différence dans le résultat est immédiate.
Ce guide couvre le format auquel le modèle répond réellement : plans, mouvements de caméra, balises de dialogue et champs sonores. Exemples à copier-coller inclus pour le texte vers vidéo et l'image vers vidéo. Tout ce qui suit s'applique aussi bien à H3 qu'à la variante plus rapide H3 Max, celle que nous utilisons sur Epochal.
Contexte rapide : à quoi vous donnez des instructions
Hailuo 3 est le modèle vidéo actuel de MiniMax. Il génère des clips avec audio synchronisé : image, ambiance, musique et dialogues parlés sortent en une seule passe, pas en pistes séparées à monter ensuite. Hailuo 2.3, la génération précédente, produisait de la vidéo muette ; H3 traite le son comme une partie du même prompt.
H3 Max est la version de la même famille optimisée pour la vitesse. Même format de prompt, génération plus rapide, échelle de résolutions plus courte. Si vous itérez sur des idées de prompts, Max vous y amène plus vite ; les techniques de prompt ci-dessous se transfèrent à l'identique.
Sur Epochal, H3 Max génère des clips de 5 à 15 secondes en 480p, 768p ou 1080p, à partir d'un prompt texte ou d'une image (première frame, ou première et dernière frame ensemble). C'est le canevas que supposent les exemples ci-dessous.
Les trois champs
Le format de prompt de H3 comporte trois champs nommés. Deux sont optionnels, mais les connaître tous les trois change la façon dont vous écrivez le premier :
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...- integrated_multimodal_description est le corps du prompt. Il couvre tout ce qui est visible et audible sur la timeline : plans, mouvements de caméra, actions, dialogues.
- overall_soundscape est le fond sonore de tout le clip : pluie, trafic, tonalité de pièce, pas. Les dialogues et la musique ne vont jamais ici.
- non_diegetic_music désigne la musique de score, celle que seul le public entend. Si un personnage de la scène peut l'entendre (une radio, un musicien de rue, une sonnerie), elle va dans le premier champ.
Écrire la partie visuelle : plans et mouvements de caméra
Commencez par le style et le cadrage, puis décrivez ce qui se passe. Voici un prompt complet sous cette forme, et le clip qu'il a produit (généré avec MiniMax H3, septembre 2026) :
integrated_multimodal_description: [Shot 1] An extreme close-up macro shot of a whole pomegranate carved from transparent ruby-red crystal glass, centered on a wooden cutting board, studio backlight scattering refractions and internal reflections through the seeds. A polished steel cleaver enters the frame and presses down in one slow, clean cut. The glass splits with a fine network of cracks before the two halves separate and rock gently on the board.
overall_soundscape: Quiet room tone; the only sound is the blade's crisp contact and a bright, crystalline crunch as the glass pomegranate splits, with tiny shards scattering across the wood.
non_diegetic_music: N/ATrois choses travaillent dans cet exemple :
Les mots de style définissent le rendu. Prise de vue réelle, cinematic, animation 2D, 3D CG, claymation, aquarelle, pellicule vintage. Choisissez-en un et placez-le au début. Ici, « extreme close-up macro » plus les mots de matière (« transparent ruby-red crystal glass ») font plus que n'importe quel « cinematic ». Mélanger « photorealistic » et « watercolor » dans le même prompt pousse le modèle à en faire la moyenne, généralement mal.
Les mouvements de caméra sont des phrases, pas des adjectifs. H3 comprend un vocabulaire de mouvement précis : Zoom In, Zoom Out, Push In (avancée), Pull Out, Pan Left/Right (panoramique), Truck Left/Right, Tilt Up/Down (bascule), Pedestal Up/Down, Arc Shot, Tracking Shot (travelling), Static Shot, POV, Roll. Vous pouvez ajouter l'amplitude (« with small amplitude ») et la vitesse (« at fast speed »). Écrire « the camera slowly pushes in » bat « cinematic camera work » à chaque fois, parce que le modèle peut exécuter un push in ; il ne peut pas exécuter une ambiance.
Le son est un champ à part entière. Notez où vit le craquement : dans overall_soundscape, ni dans le champ musique ni en prose dans la description. Si un personnage peut entendre le son, il va dans la description ; s'il constitue le son physique de la scène, le champ soundscape est sa maison. non_diegetic_music: N/A garde le clip sans musique, pour que rien ne concurrence l'éclatement du verre.
Plusieurs plans exigent des timestamps. Le premier plan commence à zéro. Une coupe ressemble à ceci :
[Shot 2] At 00:05.000, the camera cuts to a close-up of the split halves rocking on the board.L'heure de la coupe doit tomber dans la durée de votre clip. Sur un clip Max de 5 secondes, un plan à 00:09.000 n'arrive tout simplement jamais. Et ne coupez que lorsque le nouveau plan apporte quelque chose de vraiment nouveau (un sujet, un lieu, un état). Si vous voulez juste un autre angle sur le même moment, bougez la caméra au lieu de couper.
Le dialogue : la balise <d>
Puisque H3 génère l'audio, les dialogues s'écrivent dans le prompt avec une balise. L'essentiel :
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>(S1),(S2)sont des identifiants de locuteur, attribués dans l'ordre où les personnages parlent pour la première fois. Décrivez la voix à la première mention : âge, hauteur, débit, accent.- Le texte dans
<d>est dit mot pour mot. Ne le reformulez pas et restez honnête avec la balise de langue :<d>[Japanese]…</d>pour une réplique en japonais. - Pour la voix off, où le narrateur reste hors champ, dites-le et précisez que les lèvres du locuteur restent fermées, sinon le modèle tentera de synchroniser les lèvres sur une réplique hors champ :
An older man in a wool coat says in an off-screen voiceover: <d>[English] Nobody remembered the lighthouse that winter.</d> while his lips remain completely closed.- Le texte à l'écran (une enseigne néon, un écran de téléphone) va entre guillemets doubles dans la description :
A red neon sign reading "OPEN" hums above the doorway.
Les champs sonores, rapidement
Une à trois phrases chacun. Le concret bat l'abstrait :
overall_soundscape: Steady rain taps against the café windows; low room ambience continues underneath.
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that swell before fading out.Évitez les mots d'ambiance dans le champ musique. « Melancholy » n'est pas jouable ; « sparse piano at a slow tempo with sustained low strings » l'est. Les deux champs acceptent N/A si vous voulez le clip silencieux hors son de scène.
Image vers vidéo : s'ancrer sur une frame
L'I2V, c'est là où Hailuo 3 fait la différence, et la manière d'écrire les prompts change. Votre image est une frame de la timeline, et le prompt texte doit s'accorder avec elle :
- Première frame seulement. Décrivez ce qui se passe après l'image. L'image ancre la seconde zéro ; votre prompt se développe à partir d'elle.
- Première et dernière frame. Décrivez le chemin continu entre les deux, idéalement en un seul plan. Le travail du modèle, c'est la transition, alors donnez-lui un seul changement clair à combler (la marée monte, la porte s'ouvre, le croquis se peint).
- Discipline de caméra : un mouvement de caméra par prompt I2V. Empiler un panoramique, un zoom et une coupe sur une seule image fixe se bat contre l'ancre.
Pour le travail première/dernière frame, le format structuré complet ajoute une ligne d'alignement au-dessus de la description indiquant quelle image se situe à quel timestamp. C'est le format que l'expandeur de prompts du modèle émet lui-même. Les prompts I2V écrits à la main fonctionnent très bien sans, tant que votre description narre clairement de la première frame vers la dernière.
Voici une exécution I2V première frame en pratique : une seule image d'ancrage d'une jetée portuaire, une caméra fixe, et un seul changement à porter sur cinq secondes (généré avec MiniMax H3, septembre 2026) :
[Shot 1] A static shot of the harbor pier from the first frame. Over the next five seconds, the last orange band of sunset fades from the water while a small fishing boat crosses slowly from left to right, its lamp the first light to switch on. The camera stays still.
overall_soundscape: Gentle water lapping against the pier pilings; a distant gull call near the end.Notez à quel point le prompt demande peu : garder le cadre fixe, laisser la lumière s'éteindre, déplacer un bateau. L'image d'ancrage fait la composition ; le prompt ne dirige que ce qui change.
L'écrire vous-même, ou laisser faire l'optimiseur
C'est la bifurcation pratique de notre atelier. H3 Max sur Epochal propose un réglage d'expansion de prompt à trois positions :
- Off. Le modèle reçoit exactement ce que vous avez tapé. À utiliser quand vous avez écrit dans le format structuré ci-dessus et voulez que vos mouvements de caméra, balises de dialogue et champs sonores soient respectés mot pour mot.
- Balanced (par défaut). Une réécriture légère qui comble les manques et range la structure. Bien pour les brouillons en langage naturel comme « a chef flambés a pan in a dark kitchen, camera slowly circles ».
- Quality. Une passe plus lourde qui construit un prompt structuré plus complet à partir de votre idée de départ. Idéal quand l'intention est claire mais pas la patience d'écrire plans et paysages sonores soi-même.
Un flux de travail raisonnable : rédiger en Balanced, regarder ce que l'expansion a ajouté, puis passer en Off et retoucher à la main le prompt étendu. Vous finissez par apprendre le format à partir des propres retouches du modèle, ce qui va plus vite que lire la documentation, celle-ci comprise.
Pour voir la bifurcation vous-même, voici le même brouillon en langage naturel exécuté deux fois sur Epochal (MiniMax H3 Max, 5 secondes, 480p), d'abord expansion désactivée, puis Balanced :
someone films a tiny glowing creature standing on their kitchen table at dusk, one-handed phone footageExpansion désactivée. La phrase parvient au modèle telle quelle :
Balanced. La même phrase après que la passe d'expansion a complété structure des plans et son :
Regardez les deux et remarquez tout ce que la passe d'expansion ajoute discrètement à la même idée d'une ligne.
Erreurs courantes
- Des légendes au lieu d'instructions. « A dog running, cinematic, 4K » ne donne ni cadrage, ni arc d'action, ni caméra, ni rien à chronométrer.
- Des timestamps de coupe hors de la durée du clip. Un plan à 00:09.000 sur un clip de 5 secondes est du poids mort.
- De la musique que les personnages pourraient entendre placée dans
non_diegetic_music. Elle va dans la description. - Des dialogues écrits en prose ordinaire, si bien que le modèle ne distingue pas la parole de la narration.
- Trois mouvements de caméra empilés sur une seule ancre I2V.
- L'empilement de styles abstraits. « Cinematic, emotional, epic, masterpiece » n'est pas un style ; « vintage 16mm film » l'est.
FAQ
Hailuo 3 comprend-il les balises de dialogue comme <d> ?
Oui, elles font partie du format sur lequel le modèle a été entraîné. Vous pouvez aussi écrire simplement « he says: » suivi de la réplique entre guillemets et le modèle la dit généralement ; la version avec balise est plus fiable pour la langue et pour garder la réplique mot pour mot.
Faut-il le format à trois champs pour chaque prompt ? Non. Une description simple en langage naturel produit des clips tout à fait corrects, surtout avec l'expansion de prompt activée. Les trois champs comptent quand vous dirigez : design sonore, musique ou structure multi-plans.
Quel est le clip H3 Max le plus long ? 15 secondes, aussi bien sur Epochal que dans les réglages officiels de H3 pour Max. Utilisez des timestamps pour placer les coupes dans cette fenêtre.
La longueur du prompt est-elle limitée ? L'API officielle plafonne les prompts à 7 000 caractères, bien plus qu'un clip de 15 secondes ne peut en rendre. Un prompt ciblé de 100 à 300 mots bat presque toujours un prompt de 2 000 mots.
Peut-on écrire des prompts dans d'autres langues ?
Le modèle gère plusieurs langues, et la balise <d>[Language] contrôle la langue des dialogues parlés. Pour le texte du prompt lui-même, l'anglais est la valeur par défaut la plus sûre. C'est dans cette langue que le vocabulaire de caméra (Pan, Tilt, Tracking Shot) a été défini.
H3 ou H3 Max : le prompt change-t-il ? Le format est identique. Max échange une partie de la réserve de résolution contre la vitesse de génération, c'est donc celui sur lequel vous écrivez vos prompts quand vous itérez.
Pourquoi mon clip est-il sorti muet ?
En général, le prompt ne décrivait que le visuel. H3 génère l'audio quand le prompt lui donne quelque chose à entendre. Ajoutez une ligne overall_soundscape ou des détails d'ambiance dans la description.
Hailuo 3 est-il gratuit ? Pas en quantité illimitée, nulle part. L'application officielle Hailuo AI de MiniMax offre un petit crédit quotidien aux nouveaux comptes, et les crédits d'essai des sites tiers s'épuisent vite. Sur Epochal, chaque génération affiche son coût avant exécution, et les nouveaux comptes démarrent avec un petit crédit de bienvenue plus le check-in quotidien. Pour tester des prompts, le réglage 5 secondes en 480p est le plus économique.
Quand Hailuo 3 est-il sorti ? MiniMax a lancé H3 le 31 juillet 2026, et la variante optimisée pour la vitesse, H3 Max, a suivi en septembre 2026. Les deux utilisent le format de prompt décrit dans ce guide.
Essayez
Prenez l'un des exemples ci-dessus, collez-le dans MiniMax H3 Max sur Epochal et lancez-le une fois avec l'expansion désactivée pour voir ce que fait le format brut. Si vous travaillez à partir d'images fixes, les mêmes règles d'ancrage s'appliquent. Notre sélection d'outils image vers vidéo couvre quels flux de travail conviennent à quelles entrées.
Meta Title: Hailuo 3 Prompt Guide: MiniMax H3 Prompt Format (2026)
Meta Description: How to write MiniMax H3 / Hailuo 3 prompts: shot structure, camera move vocabulary, dialogue tags, sound fields, and image-to-video prompting that works.
Slug: hailuo-3-prompt-guide
Primary Keyword: hailuo 3 prompt guide
Secondary Keywords: minimax h3 prompt, minimax h3 prompt guide, hailuo 3 prompts, hailuo h3 prompting
Suggested Internal Links:
/models/minimax-h3-max: the model this guide prompts for (hero + CTA)/models/hailuo-2-3: predecessor context/blog/best-image-to-video-ai-tools-2026: I2V readers
Table des matières
<d>Les champs sonores, rapidementImage vers vidéo : s'ancrer sur une frameL'écrire vous-même, ou laisser faire l'optimiseurErreurs courantesFAQEssayezPlus de messages

Veo 3.1 vs Sora 2 : quel modèle vidéo IA convient à votre workflow ?
Comparaison entre Google Veo 3.1 et OpenAI Sora 2 sur la qualité, la vitesse, l'audio, le coût et les workflows pratiques. Découvrez quel modèle correspond à votre cas d'usage.

Les nouveautés chez Epochal — Juin 2026
Une nouvelle mise en page avec barre latérale, des crédits de connexion quotidienne, l'outil AI Product Video Generator et une expérience de lecture de blog plus rapide. Voici tout ce que nous avons lancé ce mois-ci.

Meilleurs outils d'IA d'image en vidéo en 2026 : lequel préserve le mieux votre image ?
Un guide pratique des meilleurs outils d'IA d'image en vidéo en 2026, comparant Kling 3.0, Veo 3.1, Seedance 2.0, Wan 2.7 et Grok Imagine Video pour la préservation des images, la qualité du mouvement, la vitesse et l'ajustement du flux de travail.