
Guia de prompts do Hailuo 3: como escrever prompts para o MiniMax H3 (e H3 Max)

O formato de prompt ao qual o MiniMax H3 realmente responde: estrutura de planos, movimentos de câmera, tags de diálogo, campos de som e quando deixar o otimizador de prompts fazer o trabalho.
A maioria dos prompts do Hailuo 3 falha por um motivo banal: as pessoas escrevem legendas em vez de direções. "Uma mulher andando na chuva, cinematic" não dá ao modelo quase nada para cronometrar, enquadrar ou dar voz. O MiniMax H3 é construído em torno de uma estrutura de prompt que se lê mais como um roteiro de filmagem do que como legenda, e depois que você enxerga a estrutura, a diferença no resultado é imediata.
Este guia cobre o formato ao qual o modelo realmente responde: planos, movimentos de câmera, tags de diálogo e os campos de som. Com exemplos prontos para copiar e colar em text-to-video e image-to-video. Tudo aqui vale tanto para o H3 quanto para a variante mais rápida H3 Max, que é a que rodamos na Epochal.
Contexto rápido: para o que você está escrevendo o prompt
O Hailuo 3 é o modelo de vídeo atual da MiniMax. Ele gera clipes com áudio sincronizado: imagem, ambiência, música e fala saem numa passada só, não como trilhas separadas para emendar depois. O Hailuo 2.3, geração anterior, fazia vídeo mudo; o H3 trata o som como parte do mesmo prompt.
O H3 Max é a versão da mesma família ajustada para velocidade. Mesmo formato de prompt, geração mais rápida, escada de resoluções mais curta. Se você está iterando ideias de prompt, o Max chega lá mais rápido; as técnicas de prompt abaixo transferem de um pra um.
Na Epochal, o H3 Max roda clipes de 5 a 15 segundos em 480p, 768p ou 1080p, a partir de um prompt de texto ou de uma imagem (primeiro quadro, ou primeiro e último quadro juntos). Essa é a tela que os exemplos abaixo assumem.
Os três campos
O formato de prompt do H3 tem três campos rotulados. Dois são opcionais, mas conhecer os três muda como você escreve o primeiro:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...- integrated_multimodal_description é o corpo do prompt. Cobre tudo que é visível e audível na linha do tempo: planos, movimentos de câmera, ações, diálogos.
- overall_soundscape é o som de fundo do clipe inteiro: chuva, trânsito, tom de ambiente, passos. Diálogo e música nunca vão aqui.
- non_diegetic_music é trilha, música que só a plateia ouve. Se um personagem da cena poderia ouvi-la (um rádio, um músico de rua, um toque de celular), ela pertence ao primeiro campo.
Escrevendo a parte visual: planos e movimentos de câmera
Abra com estilo e enquadramento, depois descreva o que acontece. Aqui está um prompt completo nessa forma, e o clipe que ele produziu (gerado com MiniMax H3, setembro de 2026):
integrated_multimodal_description: [Shot 1] An extreme close-up macro shot of a whole pomegranate carved from transparent ruby-red crystal glass, centered on a wooden cutting board, studio backlight scattering refractions and internal reflections through the seeds. A polished steel cleaver enters the frame and presses down in one slow, clean cut. The glass splits with a fine network of cracks before the two halves separate and rock gently on the board.
overall_soundscape: Quiet room tone; the only sound is the blade's crisp contact and a bright, crystalline crunch as the glass pomegranate splits, with tiny shards scattering across the wood.
non_diegetic_music: N/ATrês coisas fazem o trabalho nesse exemplo:
Palavras de estilo definem o render. Ação ao vivo, cinematic, animação 2D, CG 3D, claymation, aquarela, filme vintage. Escolha uma e coloque na frente. Aqui, "extreme close-up macro" mais as palavras de material ("transparent ruby-red crystal glass") rendem mais do que qualquer "cinematic" renderizaria. Misturar "photorealistic" com "watercolor" no mesmo prompt faz o modelo tirar a média, geralmente mal.
Movimentos de câmera são frases, não adjetivos. O H3 entende um vocabulário específico de movimento: Zoom In, Zoom Out, Push In (aproximação), Pull Out, Pan Left/Right (panorâmica), Truck Left/Right, Tilt Up/Down (inclinação), Pedestal Up/Down, Arc Shot, Tracking Shot (traveling), Static Shot, POV, Roll. Você pode acrescentar amplitude ("with small amplitude") e velocidade ("at fast speed"). Escrever "the camera slowly pushes in" ganha de "cinematic camera work" sempre, porque o modelo executa um push in; uma vibe ele não executa.
O som tem campo próprio. Repare onde mora o estalo: no overall_soundscape, não no campo de música e nem como prosa dentro da descrição. Se um personagem poderia ouvir o som, ele pertence à descrição; se é o som físico da cena, o campo de paisagem sonora é a casa dele. non_diegetic_music: N/A mantém o clipe sem trilha, para nada competir com o estalo do vidro.
Vários planos precisam de timestamps. O primeiro plano começa no zero. Um corte fica assim:
[Shot 2] At 00:05.000, the camera cuts to a close-up of the split halves rocking on the board.A hora do corte precisa cair dentro da duração do seu clipe. Num clipe Max de 5 segundos, um plano às 00:09.000 simplesmente nunca acontece. E só corte quando o novo plano trouxer algo genuinamente novo (um sujeito, um lugar, um estado). Se você só quer outro ângulo do mesmo momento, mova a câmera em vez de cortar.
Diálogo: a tag <d>
Como o H3 gera áudio, o diálogo entra no prompt com uma tag. O essencial:
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>(S1),(S2)são IDs de falante, atribuídos na ordem em que os personagens falam pela primeira vez. Descreva a voz na primeira menção: idade, tom, ritmo, sotaque.- O texto dentro de
<d>é falado literalmente. Não parafraseie e seja honesto com a tag de idioma:<d>[Japanese]…</d>para uma fala em japonês. - Para narração em off, em que o narrador fica fora da tela, diga isso e acrescente que os lábios de quem fala permanecem fechados, senão o modelo vai tentar sincronizar os lábios com uma fala fora da tela:
An older man in a wool coat says in an off-screen voiceover: <d>[English] Nobody remembered the lighthouse that winter.</d> while his lips remain completely closed.- Texto na tela (um letreiro de neon, a tela de um celular) vai entre aspas duplas dentro da descrição:
A red neon sign reading "OPEN" hums above the doorway.
Os campos de som, rapidinho
De uma a três frases cada. Concreto vence abstrato:
overall_soundscape: Steady rain taps against the café windows; low room ambience continues underneath.
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that swell before fading out.Evite palavras de clima no campo de música. "Melancholy" não é tocável; "sparse piano at a slow tempo with sustained low strings" é. Ambos os campos aceitam N/A se você quiser o clipe mudo, exceto pelo som da cena.
Image-to-video: ancorando num quadro
O I2V é onde o Hailuo 3 mostra pra que veio, e a forma de escrever prompts muda. Sua imagem é um quadro na linha do tempo, e o prompt de texto precisa estar de acordo com ela:
- Só o primeiro quadro. Descreva o que acontece depois da imagem. A imagem ancora o segundo zero; seu prompt se desenvolve a partir dela.
- Primeiro e último quadro. Descreva o caminho contínuo entre os dois, idealmente como um plano só. O trabalho do modelo é a transição, então dê a ele uma única mudança clara para atravessar (a maré sobe, a porta se abre, o esboço é pintado).
- Disciplina de câmera: um movimento de câmera por prompt de I2V. Empilhar panorâmica, zoom e corte numa única imagem parada briga com a âncora.
Para trabalho de primeiro/último quadro, o formato estruturado completo acrescenta uma linha de alinhamento acima da descrição dizendo qual imagem fica em qual timestamp. Esse é o formato que o próprio expansor de prompts do modelo emite. Prompts de I2V escritos à mão funcionam bem sem ela, contanto que sua descrição narre claramente do primeiro quadro até o último.
Aqui está uma execução de I2V com primeiro quadro na prática: uma única imagem de âncora de um píer de porto, câmera estática, e uma mudança para carregar por cinco segundos (gerado com MiniMax H3, setembro de 2026):
[Shot 1] A static shot of the harbor pier from the first frame. Over the next five seconds, the last orange band of sunset fades from the water while a small fishing boat crosses slowly from left to right, its lamp the first light to switch on. The camera stays still.
overall_soundscape: Gentle water lapping against the pier pilings; a distant gull call near the end.Note o quanto o prompt pede pouco: segurar o quadro parado, deixar a luz apagar, mover um barco. A imagem de âncora faz a composição; o prompt só dirige o que muda.
Escreva você, ou deixe com o otimizador
Essa é a encruzilhada prática no nosso workbench. O H3 Max na Epochal tem uma configuração de expansão de prompt com três posições:
- Off. O modelo recebe exatamente o que você digitou. Use quando você escreveu no formato estruturado acima e quer que seus movimentos de câmera, tags de diálogo e campos de som sejam respeitados palavra por palavra.
- Balanced (padrão). Uma reescrita leve que preenche lacunas e arruma a estrutura. Boa para rascunhos em linguagem natural como "a chef flambés a pan in a dark kitchen, camera slowly circles".
- Quality. Uma passada mais pesada que constrói um prompt estruturado mais completo a partir da sua ideia-semente. Melhor quando a intenção está clara, mas falta paciência para escrever planos e paisagens sonoras você mesmo.
Um fluxo de trabalho razoável: rascunhe no Balanced, veja o que a expansão acrescentou, depois troque para Off e edite à mão o prompt expandido. Você acaba aprendendo o formato com as próprias edições do modelo, o que é mais rápido do que ler documentação, esta incluída.
Para ver a encruzilhada com seus olhos, aqui está o mesmo rascunho em linguagem natural rodado duas vezes na Epochal (MiniMax H3 Max, 5 segundos, 480p), primeiro com expansão desligada, depois no Balanced:
someone films a tiny glowing creature standing on their kitchen table at dusk, one-handed phone footageExpansão desligada. A frase vai para o modelo do jeito que foi escrita:
Balanced. A mesma frase depois que a passada de expansão preenche estrutura de planos e som:
Assista aos dois e repare o quanto a passada de expansão acrescenta em silêncio por cima da mesma ideia de uma linha.
Erros comuns
- Legendas em vez de direções. "A dog running, cinematic, 4K" não dá enquadramento, nem arco de ação, nem câmera, nem nada para cronometrar.
- Timestamps de corte fora do comprimento do clipe. Um plano às 00:09.000 num clipe de 5 segundos é peso morto.
- Música que os personagens poderiam ouvir colocada em
non_diegetic_music. Ela pertence à descrição. - Diálogo escrito como prosa comum, aí o modelo não distingue fala de narração.
- Três movimentos de câmera empilhados numa única âncora de I2V.
- Acúmulo de estilos abstratos. "Cinematic, emotional, epic, masterpiece" não é um estilo; "vintage 16mm film" é.
FAQ
O Hailuo 3 entende tags de diálogo como <d>?
Sim, fazem parte do formato com o qual o modelo foi treinado. Você também pode escrever só "he says:" seguido da frase entre aspas e o modelo geralmente dá voz a ela; a versão com tag é mais confiável quanto ao idioma e quanto a manter a frase literal.
Preciso do formato de três campos em todo prompt? Não. Uma descrição simples em linguagem natural produz clipes perfeitamente bons, principalmente com a expansão de prompt ligada. Os três campos importam quando você está dirigindo: design de som, música ou estrutura de vários planos.
Qual o clipe mais longo do H3 Max? 15 segundos, tanto na Epochal quanto nas configurações oficiais do H3 para Max. Use timestamps para posicionar cortes dentro dessa janela.
O comprimento do prompt tem limite? A API oficial limita prompts a 7.000 caracteres, muito mais do que um clipe de 15 segundos consegue renderizar. Um prompt focado de 100 a 300 palavras quase sempre ganha de um de 2.000 palavras.
Posso escrever prompts em outros idiomas?
O modelo lida com vários idiomas, e a tag <d>[Language] controla o idioma do diálogo falado. Para o texto do prompt em si, inglês é o padrão mais seguro. É no inglês que o vocabulário de câmera (Pan, Tilt, Tracking Shot) foi definido.
H3 ou H3 Max: o prompting muda? O formato é idêntico. O Max troca um pouco de folga de resolução por velocidade de geração, então é nele que você escreve prompts quando está iterando.
Por que meu clipe saiu mudo?
Normalmente o prompt descrevia só o visual. O H3 gera áudio quando o prompt dá algo para ele ouvir. Adicione uma linha overall_soundscape ou detalhes de ambiência dentro da descrição.
Hailuo 3 é grátis? Não em quantidade ilimitada, em lugar nenhum. O app oficial da MiniMax, o Hailuo AI, dá às contas novas um pequeno crédito diário, e os créditos de teste em sites de terceiros acabam rápido. Na Epochal, cada geração mostra o custo antes de rodar, e contas novas começam com um pequeno crédito de boas-vindas mais o check-in diário. Para testar prompts, a configuração de 5 segundos em 480p é a mais barata.
Quando o Hailuo 3 foi lançado? A MiniMax lançou o H3 em 31 de julho de 2026, e a variante otimizada para velocidade, o H3 Max, veio em setembro de 2026. Ambos usam o formato de prompt descrito neste guia.
Experimente
Pegue um dos exemplos acima, cole no MiniMax H3 Max na Epochal e rode uma vez com a expansão desligada para ver o que o formato cru faz. Se você trabalha a partir de imagens fixas, as mesmas regras de ancoragem valem. Nosso levantamento de ferramentas de image-to-video cobre quais fluxos de trabalho servem para quais entradas.
Meta Title: Hailuo 3 Prompt Guide: MiniMax H3 Prompt Format (2026)
Meta Description: How to write MiniMax H3 / Hailuo 3 prompts: shot structure, camera move vocabulary, dialogue tags, sound fields, and image-to-video prompting that works.
Slug: hailuo-3-prompt-guide
Primary Keyword: hailuo 3 prompt guide
Secondary Keywords: minimax h3 prompt, minimax h3 prompt guide, hailuo 3 prompts, hailuo h3 prompting
Suggested Internal Links:
/models/minimax-h3-max: the model this guide prompts for (hero + CTA)/models/hailuo-2-3: predecessor context/blog/best-image-to-video-ai-tools-2026: I2V readers
Mais postagens

Como Criar um Vídeo de Produto com IA em 2026
Um guia prático para criar vídeos de produto com IA: três abordagens, exemplos de prompts, escolha de modelos e casos de uso reais para anúncios, e-commerce e redes sociais.

Grok pode gerar vídeos? Como funciona Grok Imagine em 2026
Sim. Grok Imagine cria vídeos a partir de texto ou imagem estática. Conheça os modos, limites, prompts, custos e o fluxo de trabalho ideal.

O Kling 3.0 é grátis? Custos reais e uma alternativa gratuita
Não, o Kling 3.0 não é grátis em lugar nenhum. Veja o que os testes realmente oferecem (cerca de 1-3 clipes) e como gerar vídeo com IA grátis sem cartão de crédito.