
Przewodnik po promptach Hailuo 3: jak pisać prompty dla MiniMax H3 (i H3 Max)

Format promptów, na który MiniMax H3 naprawdę reaguje: struktura ujęć, ruchy kamery, tagi dialogów, pola dźwięku oraz kiedy pozwolić pracować optymalizatorowi promptów.
Większość promptów dla Hailuo 3 zawodzi z nudnego powodu: ludzie piszą podpisy zamiast instrukcji dla reżysera. „Kobieta idąca w deszczu, cinematic" nie daje modelowi prawie nic do wyczucia czasu, kadru ani głosu. MiniMax H3 jest zbudowany wokół struktury promptu, która czyta się bardziej jak scenariusz zdjęciowy niż podpis, a gdy już zobaczysz tę strukturę, różnica w wynikach jest natychmiastowa.
Ten przewodnik opisuje format, na który model naprawdę reaguje: ujęcia, ruchy kamery, tagi dialogów i pola dźwięku. Z przykładami do skopiowania dla text-to-video i image-to-video. Wszystko tutaj dotyczy zarówno H3, jak i szybszej wersji H3 Max, którą uruchamiamy na Epochal.
Krótki kontekst: czemu dajesz instrukcje
Hailuo 3 to aktualny model wideo MiniMaxa. Generuje klipy ze zsynchronizowanym dźwiękiem: obraz, otoczenie, muzyka i mówione dialogi powstają w jednym przebiegu, a nie jako osobne ścieżki do sklejenia później. Hailuo 2.3, poprzednia generacja, robiło ciche wideo; H3 traktuje dźwięk jako część tego samego promptu.
H3 Max to wersja tej samej rodziny dostrojona do szybkości. Ten sam format promptów, szybsza generacja, krótsza drabinka rozdzielczości. Jeśli iterujesz nad pomysłami na prompty, Max doprowadza cię tam szybciej; techniki promptowania poniżej działają identycznie.
Na Epochal H3 Max generuje klipy od 5 do 15 sekund w 480p, 768p lub 1080p, z promptu tekstowego albo z obrazu (pierwsza klatka, albo pierwsza i ostatnia klatka razem). Takie płótno zakładają poniższe przykłady.
Trzy pola
Format promptu H3 ma trzy nazwane pola. Dwa są opcjonalne, ale znajomość wszystkich trzech zmienia sposób pisania pierwszego:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...- integrated_multimodal_description to treść promptu. Obejmuje wszystko widzialne i słyszalne na osi czasu: ujęcia, ruchy kamery, akcje, dialogi.
- overall_soundscape to dźwięk tła całego klipu: deszcz, ruch uliczny, pogłos pomieszczenia, kroki. Dialogi i muzyka nigdy nie trafiają tutaj.
- non_diegetic_music to muzyka filmowa, którą słyszy tylko widz. Jeśli postać w scenie mogłaby ją usłyszeć (radio, busker, dzwonek telefonu), należy do pierwszego pola.
Pisanie części wizualnej: ujęcia i ruchy kamery
Zacznij od stylu i kadru, potem opisz, co się dzieje. Oto pełny prompt w tym kształcie oraz klip, który wygenerował (wygenerowano z MiniMax H3, wrzesień 2026):
integrated_multimodal_description: [Shot 1] An extreme close-up macro shot of a whole pomegranate carved from transparent ruby-red crystal glass, centered on a wooden cutting board, studio backlight scattering refractions and internal reflections through the seeds. A polished steel cleaver enters the frame and presses down in one slow, clean cut. The glass splits with a fine network of cracks before the two halves separate and rock gently on the board.
overall_soundscape: Quiet room tone; the only sound is the blade's crisp contact and a bright, crystalline crunch as the glass pomegranate splits, with tiny shards scattering across the wood.
non_diegetic_music: N/ATrzy rzeczy pracują w tym przykładzie:
Słowa stylu ustawiają render. Akcja live, cinematic, animacja 2D, CG 3D, claymation, akwarela, vintage film. Wybierz jedno i postaw na początku. Tutaj „extreme close-up macro" plus słowa materiału („transparent ruby-red crystal glass") dają więcej niż jakiekolwiek „cinematic". Zmieszanie „photorealistic" z „watercolor" w jednym prompcie każe modelowi je uśrednić, zwykle źle.
Ruchy kamery to zdania, nie przymiotniki. H3 rozumie konkretne słownictwo ruchu: Zoom In, Zoom Out, Push In (najazd), Pull Out, Pan Left/Right (panorama), Truck Left/Right, Tilt Up/Down (pochylenie), Pedestal Up/Down, Arc Shot, Tracking Shot (jazda), Static Shot, POV, Roll. Możesz dopisać amplitudę („with small amplitude") i tempo („at fast speed"). Napisanie „the camera slowly pushes in" wygrywa z „cinematic camera work" za każdym razem, bo model potrafi wykonać najazd; nastroju wykonać nie potrafi.
Dźwięk ma własne pole. Zwróć uwagę, gdzie mieszka trzask: w overall_soundscape, nie w polu muzyki i nie jako proza w opisie. Jeśli postać mogłaby usłyszeć dźwięk, należy do opisu; jeśli to fizyczny dźwięk sceny, jego domem jest pole soundscape. non_diegetic_music: N/A trzyma klip wolny od muzyki, więc nic nie konkuruje z trzaskiem pękającego szkła.
Wiele ujęć wymaga znaczników czasu. Pierwsze ujęcie startuje od zera. Cięcie wygląda tak:
[Shot 2] At 00:05.000, the camera cuts to a close-up of the split halves rocking on the board.Czas cięcia musi wpaść w długość klipu. W 5-sekundowym klipie Max ujęcie o 00:09.000 po prostu nigdy nie następuje. I tnij tylko wtedy, gdy nowe ujęcie wnosi coś naprawdę nowego (postać, miejsce, stan). Jeśli chcesz tylko innego kąta tego samego momentu, porusz kamerą zamiast ciąć.
Dialog: tag <d>
Ponieważ H3 generuje dźwięk, dialogi wpisuje się do promptu tagiem. Podstawy:
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>(S1),(S2)to identyfikatory mówiących, nadawane w kolejności pierwszej wypowiedzi postaci. Opisz głos przy pierwszym wspomnieniu: wiek, tonacja, tempo, akcent.- Tekst wewnątrz
<d>jest wypowiadany dosłownie. Nie parafrazuj go i trzymaj się uczciwie tagu języka:<d>[Japanese]…</d>dla kwestii po japońsku. - Przy lektorze, gdy narrator pozostaje poza kadrem, powiedz to i dodaj, że usta mówiącego pozostają zamknięte, inaczej model spróbuje zsynchronizować usta z kwestią poza kadrem:
An older man in a wool coat says in an off-screen voiceover: <d>[English] Nobody remembered the lighthouse that winter.</d> while his lips remain completely closed.- Tekst na ekranie (neon, ekran telefonu) trafia w cudzysłów podwójny wewnątrz opisu:
A red neon sign reading "OPEN" hums above the doorway.
Pola dźwięku, krótko
Od jednego do trzech zdań każde. Konkret bije abstrakcję:
overall_soundscape: Steady rain taps against the café windows; low room ambience continues underneath.
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that swell before fading out.Unikaj słów nastroju w polu muzyki. „Melancholy" nie jest zagrane; „sparse piano at a slow tempo with sustained low strings" jest. Oba pola przyjmują N/A, jeśli chcesz klip cichy poza dźwiękiem sceny.
Image-to-video: zakotwiczenie w klatce
I2V to teren, na którym Hailuo 3 pokazuje klasę, a sposób pisania promptów się zmienia. Twój obraz to klatka na osi czasu, a prompt tekstowy powinien być z nią zgodny:
- Tylko pierwsza klatka. Opisz, co dzieje się po obrazie. Obraz kotwiczy sekundę zero; twój prompt rozwija się od niego w przód.
- Pierwsza i ostatnia klatka. Opisz ciągłą drogę między nimi, najlepiej jako jedno ujęcie. Zadaniem modelu jest przejście, więc daj mu jedną jasną zmianę do zmostowania (przypływ wchodzi, drzwi się otwierają, szkic zostaje namalowany).
- Dyscyplina kamery: jeden ruch kamery na prompt I2V. Nakładanie pano, zoomu i cięcia na jednej statycznej klatce walczy z kotwicą.
Przy pracy na pierwszej/ostatniej klatce pełny format strukturalny dodaje nad opisem linię wyrównania, która mówi, który obraz wypada pod którym znacznikiem czasu. To format, który emituje własny rozbudowywacz promptów modelu. Ręcznie pisane prompty I2V działają bez niej dobrze, o ile twój opis wyraźnie prowadzi narrację od pierwszej klatki do ostatniej.
Oto przebieg I2V od pierwszej klatki w praktyce: pojedynczy obraz kotwicy molo portowego, statyczna kamera i jedna zmiana do przeciągnięcia przez pięć sekund (wygenerowano z MiniMax H3, wrzesień 2026):
[Shot 1] A static shot of the harbor pier from the first frame. Over the next five seconds, the last orange band of sunset fades from the water while a small fishing boat crosses slowly from left to right, its lamp the first light to switch on. The camera stays still.
overall_soundscape: Gentle water lapping against the pier pilings; a distant gull call near the end.Zwróć uwagę, jak mało prompt żąda: trzymać kadr w bezruchu, pozwolić światłu zgasnąć, przemieścić jedną łódkę. Obraz kotwicy robi kompozycję; prompt reżyseruje tylko to, co się zmienia.
Napisz sam, albo zostaw optymalizatorowi
To praktyczny rozjazd na naszym workbenchu. H3 Max na Epochal ma ustawienie rozbudowy promptu z trzema pozycjami:
- Off. Model dostaje dokładnie to, co wpisałeś. Użyj tego, gdy napisałeś w strukturalnym formacie powyżej i chcesz, żeby ruchy kamery, tagi dialogów i pola dźwięku były respektowane słowo w słowo.
- Balanced (domyślne). Lekka przeróbka, która uzupełnia braki i porządkuje strukturę. Dobra dla szkiców w języku naturalnym typu „a chef flambés a pan in a dark kitchen, camera slowly circles".
- Quality. Cięższa przepustka, która buduje z twojego zalążka pełniejszy strukturalny prompt. Najlepsza, gdy intencja jest jasna, ale brakuje cierpliwości do samodzielnego pisania ujęć i pejzaży dźwiękowych.
Rozsądny przepływ pracy: pisz w Balanced, zobacz, co rozbudowa dodała, potem przełącz na Off i edytuj rozszerzony prompt ręcznie. Nauczysz się formatu z własnych poprawek modelu, co idzie szybciej niż czytanie dokumentacji, tej włącznie.
Żeby zobaczyć rozjazd na własne oczy, oto ten sam szkic w języku naturalnym uruchomiony dwa razy na Epochal (MiniMax H3 Max, 5 sekund, 480p), najpierw z rozbudową wyłączoną, potem na Balanced:
someone films a tiny glowing creature standing on their kitchen table at dusk, one-handed phone footageRozbudowa wyłączona. Zdanie trafia do modelu tak, jak zostało napisane:
Balanced. To samo zdanie po tym, jak przepustka rozbudowy uzupełniła strukturę ujęć i dźwięk:
Obejrzyj oba i zauważ, ile przepustka rozbudowy po cichu dodaje do tej samej jednolinijkowej idei.
Częste błędy
- Podpisy zamiast instrukcji. „A dog running, cinematic, 4K" nie daje ci kadru, łuku akcji, kamery ani niczego do wyczucia czasu.
- Znaczniki cięć poza długością klipu. Ujęcie o 00:09.000 w 5-sekundowym klipie to martwy ciężar.
- Muzyka, którą postacie mogłyby usłyszeć, umieszczona w
non_diegetic_music. Należy do opisu. - Dialogi zapisane zwykłą prozą, więc model nie odróżnia mowy od narracji.
- Trzy ruchy kamery ułożone na jednej kotwicy I2V.
- Układanie abstrakcyjnych stylów. „Cinematic, emotional, epic, masterpiece" to nie styl; „vintage 16mm film" to styl.
FAQ
Czy Hailuo 3 rozumie tagi dialogów takie jak <d>?
Tak, to część formatu, na którym model był trenowany. Możesz też napisać po prostu „he says:" i kwestię w cudzysłowie, a model zwykle ją wypowie; wersja z tagiem jest pewniejsza co do języka i trzymania kwestii dosłownie.
Czy potrzebuję formatu trzech pól przy każdym prompcie? Nie. Zwykły opis w języku naturalnym daje w pełni dobre klipy, zwłaszcza przy włączonej rozbudowie promptów. Trzy pola mają znaczenie, gdy reżyserujesz: projekt dźwięku, muzykę albo strukturę wielu ujęć.
Jaki jest najdłuższy klip H3 Max? 15 sekund, zarówno na Epochal, jak i w oficjalnych ustawieniach H3 dla Max. Używaj znaczników czasu, by umieszczać cięcia w tym oknie.
Czy długość promptu ma limit? Oficjalne API ogranicza prompty do 7000 znaków, czyli znacznie więcej, niż 15-sekundowy klip potrafi wyrenderować. Skupiony prompt od 100 do 300 słów prawie zawsze bije dwutysięcznosłowny.
Czy mogę pisać prompty w innych językach?
Model obsługuje wiele języków, a tag <d>[Language] steruje językiem mówionych dialogów. Dla samego tekstu promptu angielski to najbezpieczniejszy domyślny wybór. W tym języku zdefiniowano słownictwo kamery (Pan, Tilt, Tracking Shot).
H3 czy H3 Max: czy promptowanie się różni? Format jest identyczny. Max wymienia część zapasu rozdzielczości na szybkość generacji, więc to na niego piszesz prompty podczas iterowania.
Dlaczego mój klip wyszedł bez dźwięku?
Zwykle prompt opisywał tylko obraz. H3 generuje dźwięk, gdy prompt daje mu coś do usłyszenia. Dodaj linię overall_soundscape albo detale otoczenia wewnątrz opisu.
Czy Hailuo 3 jest darmowy? Nigdzie w nieograniczonych ilościach. Oficjalna aplikacja MiniMax, Hailuo AI, daje nowym kontom małe dzienne kredyty, a kredyty próbne na stronach zewnętrznych szybko się kończą. Na Epochal każde generowanie pokazuje koszt przed uruchomieniem, a nowe konta startują z małym prezentem kredytowym plus codzienny check-in. Do testowania promptów najtańsza jest konfiguracja 5 sekund w 480p.
Kiedy ukazał się Hailuo 3? MiniMax wydał H3 31 lipca 2026 roku, a wersja zoptymalizowana pod kątem szybkości, H3 Max, pojawiła się we wrześniu 2026. Oba modele używają formatu promptu opisanego w tym przewodniku.
Wypróbuj
Weź jeden z przykładów powyżej, wklej go do MiniMax H3 Max na Epochal i uruchom raz z wyłączoną rozbudową, żeby zobaczyć, co robi surowy format. Jeśli pracujesz ze zdjęć, obowiązują te same reguły kotwiczenia. Nasz przegląd narzędzi image-to-video opisuje, które przepływy pasują do jakich danych wejściowych.
Meta Title: Hailuo 3 Prompt Guide: MiniMax H3 Prompt Format (2026)
Meta Description: How to write MiniMax H3 / Hailuo 3 prompts: shot structure, camera move vocabulary, dialogue tags, sound fields, and image-to-video prompting that works.
Slug: hailuo-3-prompt-guide
Primary Keyword: hailuo 3 prompt guide
Secondary Keywords: minimax h3 prompt, minimax h3 prompt guide, hailuo 3 prompts, hailuo h3 prompting
Suggested Internal Links:
/models/minimax-h3-max: the model this guide prompts for (hero + CTA)/models/hailuo-2-3: predecessor context/blog/best-image-to-video-ai-tools-2026: I2V readers
Więcej postów

Veo 3.1 vs Sora 2: Który model wideo AI pasuje do Twojego workflow?
Porównanie Google Veo 3.1 i OpenAI Sora 2 pod kątem jakości, szybkości, dźwięku, kosztów i praktycznych workflowów. Zobacz, który model pasuje do Twojego zastosowania.

Jak zrobić wideo produktowe z pomocą AI w 2026 roku
Praktyczny przewodnik po tworzeniu wideo produktowych z AI: trzy podejścia, przykłady promptów, wybór modeli i realne przypadki użycia dla reklam, e-commerce i mediów społecznościowych.

Czym jest FLUX 3? Model multimodalny vs generatory obrazów
FLUX 3 to model multimodalny Black Forest Labs dla obrazu i wideo z natywnym dźwiękiem. Zobacz, czym różni się od dzisiejszych generatorów obrazów.