
Guía de prompts de Hailuo 3: cómo escribir prompts para MiniMax H3 (y H3 Max)

El formato de prompt al que realmente responde MiniMax H3: estructura de planos, movimientos de cámara, etiquetas de diálogo, campos de sonido y cuándo dejar que el optimizador de prompts haga el trabajo.
La mayoría de los prompts de Hailuo 3 fracasan por una razón aburrida: la gente escribe descripciones en lugar de instrucciones de rodaje. «Una mujer caminando bajo la lluvia, cinematic» no le da al modelo casi nada que cronometrar, encuadrar o poner voz. MiniMax H3 está construido sobre una estructura de prompt que se lee más como un guion técnico que como una descripción, y una vez que ves la estructura, la diferencia en el resultado es inmediata.
Esta guía cubre el formato al que el modelo realmente responde: planos, movimientos de cámara, etiquetas de diálogo y los campos de sonido. Con ejemplos listos para copiar y pegar en texto a video e imagen a video. Todo lo que hay aquí aplica tanto a H3 como a la variante más rápida H3 Max, que es la que usamos en Epochal.
Contexto rápido: a qué le estás dando instrucciones
Hailuo 3 es el modelo de video actual de MiniMax. Genera clips con audio sincronizado: imagen, ambiente, música y diálogo hablado salen en una sola pasada, no como pistas separadas que empalmas después. Hailuo 2.3, la generación anterior, hacía video mudo; H3 trata el sonido como parte del mismo prompt.
H3 Max es la versión ajustada a velocidad de la misma familia. Mismo formato de prompt, generación más rápida, menos opciones de resolución. Si estás iterando ideas de prompts, Max te lleva allí más rápido; las técnicas de prompt de abajo se transfieren una a una.
En Epochal, H3 Max genera clips de 5 a 15 segundos a 480p, 768p o 1080p, a partir de un prompt de texto o de una imagen (primer fotograma, o primer y último fotograma juntos). Ese es el lienzo que asumen los ejemplos de abajo.
Los tres campos
El formato de prompt de H3 tiene tres campos etiquetados. Dos son opcionales, pero conocer los tres cambia cómo escribes el primero:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...- integrated_multimodal_description es el cuerpo del prompt. Cubre todo lo visible y audible en la línea de tiempo: planos, movimientos de cámara, acciones, diálogos.
- overall_soundscape es el sonido de fondo de todo el clip: lluvia, tráfico, sonido de sala, pasos. Los diálogos y la música nunca van aquí.
- non_diegetic_music es música de banda sonora, la que solo escucha el público. Si un personaje de la escena podría oírla (una radio, un músico callejero, un tono de llamada), pertenece al primer campo.
Escribir la parte visual: planos y movimientos de cámara
Abre con estilo y encuadre, y luego describe lo que sucede. Aquí tienes un prompt completo con esa forma, y el clip que produjo (generado con MiniMax H3, septiembre de 2026):
integrated_multimodal_description: [Shot 1] An extreme close-up macro shot of a whole pomegranate carved from transparent ruby-red crystal glass, centered on a wooden cutting board, studio backlight scattering refractions and internal reflections through the seeds. A polished steel cleaver enters the frame and presses down in one slow, clean cut. The glass splits with a fine network of cracks before the two halves separate and rock gently on the board.
overall_soundscape: Quiet room tone; the only sound is the blade's crisp contact and a bright, crystalline crunch as the glass pomegranate splits, with tiny shards scattering across the wood.
non_diegetic_music: N/ATres cosas hacen el trabajo en ese ejemplo:
Las palabras de estilo definen el render. Acción real, cinematic, animación 2D, CG 3D, claymation, acuarela, película vintage. Elige una y ponla al principio. Aquí, «extreme close-up macro» más las palabras de material («transparent ruby-red crystal glass») logran más que cualquier «cinematic». Mezclar «photorealistic» con «watercolor» en el mismo prompt hace que el modelo las promedie, normalmente con mal resultado.
Los movimientos de cámara son frases, no adjetivos. H3 entiende un vocabulario específico de movimiento: Zoom In, Zoom Out, Push In (acercamiento), Pull Out, Pan Left/Right (paneo), Truck Left/Right, Tilt Up/Down (inclinación), Pedestal Up/Down, Arc Shot, Tracking Shot (travelling), Static Shot, POV, Roll. Puedes añadir amplitud («with small amplitude») y velocidad («at fast speed»). Escribir «the camera slowly pushes in» le gana a «cinematic camera work» siempre, porque el modelo puede ejecutar un push in; una vibra no puede ejecutarla.
El sonido es un campo propio. Fíjate dónde vive el crujido: en overall_soundscape, no en el campo de música ni como prosa dentro de la descripción. Si un personaje podría oír el sonido, pertenece a la descripción; si es el sonido físico de la escena, el campo de paisaje sonoro es su hogar. non_diegetic_music: N/A mantiene el clip libre de banda sonora, para que nada compita con el crujido del vidrio.
Varios planos necesitan marcas de tiempo. El primer plano empieza en cero. Un corte se ve así:
[Shot 2] At 00:05.000, the camera cuts to a close-up of the split halves rocking on the board.La hora del corte tiene que caer dentro de la duración del clip. En un clip Max de 5 segundos, un plano a las 00:09.000 sencillamente nunca ocurre. Y corta solo cuando el nuevo plano aporte algo genuinamente nuevo (un sujeto, un lugar, un estado). Si solo quieres otro ángulo del mismo momento, mueve la cámara en lugar de cortar.
Diálogo: la etiqueta <d>
Como H3 genera audio, los diálogos se escriben en el prompt con una etiqueta. Lo esencial:
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>(S1),(S2)son identificadores de hablante, asignados en el orden en que los personajes hablan por primera vez. Describe la voz en la primera mención: edad, tono, ritmo, acento.- El texto dentro de
<d>se dice textualmente. No lo parafrasees y mantén honesta la etiqueta de idioma:<d>[Japanese]…</d>para una línea en japonés. - Para voz en off, donde el narrador no aparece en pantalla, dilo y añade que los labios del hablante permanecen cerrados, de lo contrario el modelo intentará sincronizar los labios con una línea fuera de pantalla:
An older man in a wool coat says in an off-screen voiceover: <d>[English] Nobody remembered the lighthouse that winter.</d> while his lips remain completely closed.- El texto en pantalla (un letrero de neón, la pantalla de un teléfono) va entre comillas dobles dentro de la descripción:
A red neon sign reading "OPEN" hums above the doorway.
Los campos de sonido, en breve
De una a tres frases cada uno. Lo concreto le gana a lo abstracto:
overall_soundscape: Steady rain taps against the café windows; low room ambience continues underneath.
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that swell before fading out.Evita las palabras de ánimo en el campo de música. «Melancholy» no se puede reproducir; «sparse piano at a slow tempo with sustained low strings» sí. Ambos campos aceptan N/A si quieres el clip en silencio, salvo por el sonido de la escena.
Imagen a video: anclar a un fotograma
I2V es donde Hailuo 3 demuestra su valor, y la forma de escribir prompts cambia. Tu imagen es un fotograma de la línea de tiempo, y el prompt de texto debe estar de acuerdo con ella:
- Solo primer fotograma. Describe lo que ocurre después de la imagen. La imagen ancla el segundo cero; tu prompt se desarrolla hacia adelante desde ella.
- Primer y último fotograma. Describe el camino continuo entre ambos, idealmente como un solo plano. El trabajo del modelo es la transición, así que dale un solo cambio claro que puentear (la marea sube, la puerta se abre, el boceto se pinta).
- Disciplina de cámara: un movimiento de cámara por prompt de I2V. Amontonar un paneo, un zoom y un corte sobre una sola imagen fija pelea contra el ancla.
Para trabajo con primer y último fotograma, el formato estructurado completo añade una línea de alineación sobre la descripción que indica qué imagen está en qué marca de tiempo. Ese es el formato que emite el propio expansor de prompts del modelo. Los prompts de I2V escritos a mano funcionan bien sin ella, siempre que tu descripción narre claramente del primer fotograma hacia el último.
Aquí tienes una ejecución de I2V con primer fotograma en la práctica: una sola imagen ancla de un muelle de puerto, una cámara estática y un cambio que sostener a lo largo de cinco segundos (generado con MiniMax H3, septiembre de 2026):
[Shot 1] A static shot of the harbor pier from the first frame. Over the next five seconds, the last orange band of sunset fades from the water while a small fishing boat crosses slowly from left to right, its lamp the first light to switch on. The camera stays still.
overall_soundscape: Gentle water lapping against the pier pilings; a distant gull call near the end.Fíjate en lo poco que pide el prompt: mantener el encuadre quieto, dejar que la luz se apague, mover un bote. La imagen ancla hace la composición; el prompt solo dirige lo que cambia.
Escríbelo tú, o deja que lo haga el optimizador
Esta es la bifurcación práctica en nuestro banco de trabajo. H3 Max en Epochal tiene un ajuste de expansión de prompts con tres posiciones:
- Off. El modelo recibe exactamente lo que escribiste. Úsalo cuando hayas escrito en el formato estructurado de arriba y quieras que tus movimientos de cámara, etiquetas de diálogo y campos de sonido se respeten palabra por palabra.
- Balanced (predeterminado). Una reescritura ligera que rellena huecos y ordena la estructura. Buena para borradores en lenguaje natural como «a chef flambés a pan in a dark kitchen, camera slowly circles».
- Quality. Una pasada más profunda que construye un prompt estructurado más completo a partir de tu idea semilla. Ideal cuando tienes una intención clara pero no la paciencia de escribir planos y paisajes sonoros tú mismo.
Un flujo de trabajo razonable: redacta en Balanced, mira qué añadió la expansión y luego cambia a Off y edita a mano el prompt expandido. Terminas aprendiendo el formato de las propias ediciones del modelo, lo cual es más rápido que leer documentación, esta incluida.
Para que veas la bifurcación tú mismo, aquí está el mismo borrador en lenguaje natural ejecutado dos veces en Epochal (MiniMax H3 Max, 5 segundos, 480p), primero con la expansión desactivada y luego en Balanced:
someone films a tiny glowing creature standing on their kitchen table at dusk, one-handed phone footageExpansión desactivada. La frase llega al modelo tal cual está escrita:
Balanced. La misma frase después de que la pasada de expansión rellena la estructura de planos y el sonido:
Mira ambos y nota cuánto añade silenciosamente la pasada de expansión sobre la misma idea de una línea.
Errores comunes
- Descripciones en lugar de instrucciones. «A dog running, cinematic, 4K» no te da encuadre, ni arco de acción, ni cámara, ni nada que cronometrar.
- Marcas de tiempo de corte fuera de la duración del clip. Un plano a las 00:09.000 en un clip de 5 segundos es peso muerto.
- Música que los personajes podrían oír colocada en
non_diegetic_music. Pertenece a la descripción. - Diálogos escritos como prosa normal, así el modelo no distingue el habla de la narración.
- Tres movimientos de cámara apilados sobre un ancla de I2V.
- Apilamiento de estilos abstractos. «Cinematic, emotional, epic, masterpiece» no es un estilo; «vintage 16mm film» sí lo es.
FAQ
¿Entiende Hailuo 3 etiquetas de diálogo como <d>?
Sí, forman parte del formato con el que se entrenó el modelo. También puedes escribir simplemente «he says:» seguido de la frase entre comillas y el modelo normalmente la pondrá voz; la versión con etiqueta es más fiable con el idioma y en mantener la frase textual.
¿Necesito el formato de tres campos para cada prompt? No. Una descripción sencilla en lenguaje natural produce clips perfectamente buenos, especialmente con la expansión de prompts activada. Los tres campos importan cuando diriges: diseño de sonido, música o estructura de varios planos.
¿Cuál es el clip más largo de H3 Max? 15 segundos, tanto en Epochal como en la configuración oficial de H3 para Max. Usa marcas de tiempo para colocar cortes dentro de esa ventana.
¿Tiene límite la longitud del prompt? La API oficial limita los prompts a 7.000 caracteres, mucho más de lo que un clip de 15 segundos puede renderizar. Un prompt enfocado de 100 a 300 palabras casi siempre supera a uno de 2.000.
¿Puedo escribir prompts en otros idiomas?
El modelo maneja varios idiomas, y la etiqueta <d>[Language] controla el idioma del diálogo hablado. Para el texto del prompt en sí, el inglés es el valor predeterminado más seguro. Es el idioma en el que se definió el vocabulario de cámara (Pan, Tilt, Tracking Shot).
H3 o H3 Max: ¿cambia la forma de escribir prompts? El formato es idéntico. Max sacrifica parte del margen de resolución a cambio de velocidad de generación, así que es contra el que escribes prompts cuando iteras.
¿Por qué salió mi clip sin sonido?
Normalmente el prompt describía solo lo visual. H3 genera audio cuando el prompt le da algo que oír. Añade una línea overall_soundscape o detalles ambientales dentro de la descripción.
¿Hailuo 3 es gratis? No en cantidades ilimitadas en ningún sitio. La app oficial de MiniMax, Hailuo AI, da a las cuentas nuevas un pequeño crédito diario, y los créditos de prueba de sitios terceros se agotan rápido. En Epochal, cada generación muestra su coste antes de ejecutarse, y las cuentas nuevas empiezan con un pequeño regalo de créditos más el check-in diario. Para probar prompts, la configuración de 5 segundos a 480p es la opción más barata.
¿Cuándo se lanzó Hailuo 3? MiniMax lanzó H3 el 31 de julio de 2026, y la variante optimizada para velocidad, H3 Max, llegó en septiembre de 2026. Ambas usan el formato de prompt descrito en esta guía.
Pruébalo
Toma uno de los ejemplos de arriba, pégalo en MiniMax H3 Max en Epochal y ejecútalo una vez con la expansión desactivada para ver qué hace el formato en bruto. Si trabajas a partir de imágenes fijas, se aplican las mismas reglas de anclaje. Nuestra selección de herramientas de imagen a video cubre qué flujos de trabajo convienen a qué entradas.
Meta Title: Hailuo 3 Prompt Guide: MiniMax H3 Prompt Format (2026)
Meta Description: How to write MiniMax H3 / Hailuo 3 prompts: shot structure, camera move vocabulary, dialogue tags, sound fields, and image-to-video prompting that works.
Slug: hailuo-3-prompt-guide
Primary Keyword: hailuo 3 prompt guide
Secondary Keywords: minimax h3 prompt, minimax h3 prompt guide, hailuo 3 prompts, hailuo h3 prompting
Suggested Internal Links:
/models/minimax-h3-max: the model this guide prompts for (hero + CTA)/models/hailuo-2-3: predecessor context/blog/best-image-to-video-ai-tools-2026: I2V readers
Tabla de contenido
Más publicaciones

¿Qué es FLUX 3? Modelo multimodal vs generadores de imágenes
FLUX 3 es el modelo multimodal de Black Forest Labs para imagen, vídeo con audio nativo y más. Mira cómo se diferencia de los generadores de imágenes actuales.

Mejores generadores de vídeo con IA en 2026: Veo 3.1, Kling 3.0, Seedance 2.0 y más, probados
Una comparativa práctica de los mejores generadores de vídeo con IA disponibles en 2026: calidad de salida, generación de audio, control de prompts, velocidad y qué modelo se adapta mejor a cada flujo de trabajo.

Nano Banana 2 vs Nano Banana Pro: diferencias clave
Compara Nano Banana 2 y Pro en velocidad, precisión, texto, imágenes de referencia, resolución, formatos y coste en créditos dentro de Epochal.