
Hailuo 3 Prompt-Guide: So schreibst du Prompts für MiniMax H3 (und H3 Max)

Das Prompt-Format, auf das MiniMax H3 tatsächlich reagiert: Shot-Struktur, Kamerabewegungen, Dialogue-Tags, Sound-Felder und wann du den Prompt-Optimizer arbeiten lässt.
Die meisten Hailuo-3-Prompts scheitern an einem banalen Grund: Die Leute schreiben Bildunterschriften statt Regieanweisungen. „Eine Frau geht im Regen spazieren, cinematic" gibt dem Modell fast nichts, was es timen, rahmen oder vertonen könnte. MiniMax H3 baut auf einer Prompt-Struktur auf, die sich eher wie ein Drehbuch liest als wie eine Bildunterschrift, und einmal gesehen, ist der Unterschied im Output sofort sichtbar.
Dieser Guide deckt das Format ab, auf das das Modell wirklich reagiert: Shots, Kamerabewegungen, Dialogue-Tags und die Sound-Felder. Copy-Paste-Beispiele für Text-to-Video und Image-to-Video inklusive. Alles hier gilt gleichermaßen für H3 und die schnellere H3-Max-Variante, die wir auf Epochal betreiben.
Kurzer Kontext: Worauf du promptest
Hailuo 3 ist MiniMax' aktuelles Videomodell. Es erzeugt Clips mit synchronisiertem Audio: Bild, Atmosphäre, Musik und gesprochene Dialoge kommen in einem Durchlauf heraus, nicht als separate Spuren, die du später zusammenfügst. Hailuo 2.3, die vorherige Generation, lieferte stummes Video; H3 behandelt Sound als Teil desselben Prompts.
H3 Max ist die geschwindigkeitsoptimierte Variante derselben Familie. Gleiches Prompt-Format, schnellere Generierung, kürzere Auflösungsleiter. Wenn du an Prompt-Ideen iterierst, bringt dich Max schneller ans Ziel; die Prompt-Techniken unten übertragen sich eins zu eins.
Auf Epochal läuft H3 Max mit Clips von 5 bis 15 Sekunden bei 480p, 768p oder 1080p, aus einem Text-Prompt oder aus einem Bild (erstes Frame, oder erstes und letztes Frame zusammen). Das ist die Leinwand, von der die Beispiele unten ausgehen.
Die drei Felder
Das Prompt-Format von H3 hat drei benannte Felder. Zwei sind optional, aber alle drei zu kennen verändert, wie du das erste schreibst:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...- integrated_multimodal_description ist der Körper des Prompts. Er umfasst alles Sichtbare und Hörbare auf der Timeline: Shots, Kamerabewegungen, Aktionen, Dialoge.
- overall_soundscape ist der Hintergrundsound des gesamten Clips: Regen, Verkehr, Raumton, Schritte. Dialoge und Musik gehören nie hierhin.
- non_diegetic_music ist Score, Musik, die nur das Publikum hört. Wenn eine Figur in der Szene sie hören könnte (ein Radio, ein Straßenmusiker, ein Klingelton), gehört sie ins erste Feld.
Den visuellen Teil schreiben: Shots und Kamerabewegungen
Öffne mit Stil und Framing, dann beschreibe, was passiert. Hier ein vollständiger Prompt in dieser Form, dazu der Clip, den er erzeugt hat (generiert mit MiniMax H3, September 2026):
integrated_multimodal_description: [Shot 1] An extreme close-up macro shot of a whole pomegranate carved from transparent ruby-red crystal glass, centered on a wooden cutting board, studio backlight scattering refractions and internal reflections through the seeds. A polished steel cleaver enters the frame and presses down in one slow, clean cut. The glass splits with a fine network of cracks before the two halves separate and rock gently on the board.
overall_soundscape: Quiet room tone; the only sound is the blade's crisp contact and a bright, crystalline crunch as the glass pomegranate splits, with tiny shards scattering across the wood.
non_diegetic_music: N/ADrei Dinge arbeiten in diesem Beispiel:
Stilwörter bestimmen den Render. Live-Action, cinematic, 2D-Animation, 3D CG, Claymation, Aquarell, Vintage-Film. Wähle eins und stell es nach vorn. Hier leisten „extreme close-up macro" plus Materialwörter („transparent ruby-red crystal glass") mehr als jedes „cinematic" es könnte. „Photorealistic" und „watercolor" im selben Prompt zu mischen lässt das Modell sie mitteln, meistens schlecht.
Kamerabewegungen sind Sätze, keine Adjektive. H3 versteht ein bestimmtes Bewegungsvokabular: Zoom In, Zoom Out, Push In (Heranfahren), Pull Out, Pan Left/Right (Schwenk), Truck Left/Right, Tilt Up/Down (Neigen), Pedestal Up/Down, Arc Shot, Tracking Shot (Kamerafahrt), Static Shot, POV, Roll. Du kannst Amplitude anhängen („with small amplitude") und Tempo („at fast speed"). „The camera slowly pushes in" zu schreiben schlägt „cinematic camera work" jedes Mal, weil das Modell einen Push-in ausführen kann; eine Stimmung kann es nicht ausführen.
Sound ist ein eigenes Feld. Beachte, wo das Knacken lebt: in overall_soundscape, nicht im Musikfeld und nicht als Prosa in der Beschreibung. Wenn eine Figur den Sound hören könnte, gehört er in die Beschreibung; ist er der physische Sound der Szene, ist das Soundscape-Feld sein Zuhause. non_diegetic_music: N/A hält den Clip frei von Score, sodass nichts mit dem Zerspringen des Glases konkurriert.
Mehrere Shots brauchen Timestamps. Der erste Shot startet bei null. Ein Schnitt sieht so aus:
[Shot 2] At 00:05.000, the camera cuts to a close-up of the split halves rocking on the board.Die Schnittzeit muss innerhalb deiner Clip-Dauer liegen. Bei einem 5-Sekunden-Max-Clip passiert ein Shot bei 00:09.000 schlicht nie. Und schneide nur, wenn der neue Shot etwas wirklich Neues liefert (ein Subjekt, ein Ort, ein Zustand). Willst du nur einen anderen Blickwinkel auf denselben Moment, beweg die Kamera, statt zu schneiden.
Dialoge: das <d>-Tag
Weil H3 Audio generiert, werden Dialoge mit einem Tag in den Prompt geschrieben. Die Grundlagen:
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>(S1),(S2)sind Sprecher-IDs, vergeben in der Reihenfolge, in der Figuren erstmals sprechen. Beschreibe die Stimme bei erster Erwähnung: Alter, Tonlage, Tempo, Akzent.- Der Text in
<d>wird wortwörtlich gesprochen. Paraphrasiere ihn nicht, und halte das Sprach-Tag ehrlich:<d>[Japanese]…</d>für eine japanische Zeile. - Bei Voiceover, wo der Erzähler off-screen bleibt, sag das und füge hinzu, dass die Lippen des Sprechers geschlossen bleiben, sonst versucht das Modell, eine Off-Screen-Zeile auf die Lippen zu synchronisieren:
An older man in a wool coat says in an off-screen voiceover: <d>[English] Nobody remembered the lighthouse that winter.</d> while his lips remain completely closed.- Text im Bild (ein Neonschild, ein Handydisplay) steht in doppelten Anführungszeichen innerhalb der Beschreibung:
A red neon sign reading "OPEN" hums above the doorway.
Die Sound-Felder, kurz
Je ein bis drei Sätze. Konkret schlägt abstrakt:
overall_soundscape: Steady rain taps against the café windows; low room ambience continues underneath.
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that swell before fading out.Vermeide Stimmungswörter im Musikfeld. „Melancholy" ist nicht abspielbar; „sparse piano at a slow tempo with sustained low strings" ist es. Beide Felder akzeptieren N/A, wenn du den Clip außer dem Szenenton still lassen willst.
Image-to-Video: an einem Frame verankern
I2V ist das Feld, in dem Hailuo 3 glänzt, und das Prompten ändert sich. Dein Bild ist ein Frame auf der Timeline, und der Text-Prompt sollte dazu passen:
- Nur erstes Frame. Beschreibe, was nach dem Bild passiert. Das Bild verankert Sekunde null; dein Prompt entwickelt sich von dort nach vorn.
- Erstes und letztes Frame. Beschreibe den kontinuierlichen Pfad dazwischen, idealerweise als einen Shot. Die Aufgabe des Modells ist der Übergang, also gib ihm eine einzige klare Veränderung zum Überbrücken (die Flut kommt herein, die Tür schwingt auf, die Skizze wird gemalt).
- Kameradisziplin: eine Kamerabewegung pro I2V-Prompt. Pan, Zoom und Schnitt auf ein einziges Standbild zu stapeln, kämpft gegen den Anker.
Für First-/Last-Frame-Arbeit fügt das vollständige strukturierte Format eine Ausrichtungslinie über der Beschreibung hinzu, die angibt, welches Bild bei welchem Timestamp sitzt. Das ist das Format, das der eigene Prompt-Expander des Modells ausgibt. Handgeschriebene I2V-Prompts funktionieren auch ohne, solange deine Beschreibung klar vom ersten zum letzten Frame erzählt.
Hier ein First-Frame-I2V-Run in der Praxis: ein einzelnes Ankerbild eines Hafenstegs, eine statische Kamera und eine Veränderung, die über fünf Sekunden getragen wird (generiert mit MiniMax H3, September 2026):
[Shot 1] A static shot of the harbor pier from the first frame. Over the next five seconds, the last orange band of sunset fades from the water while a small fishing boat crosses slowly from left to right, its lamp the first light to switch on. The camera stays still.
overall_soundscape: Gentle water lapping against the pier pilings; a distant gull call near the end.Beachte, wie wenig der Prompt verlangt: Frame halten, Licht ausklingen lassen, ein Boot bewegen. Das Ankerbild macht die Komposition; der Prompt dirigiert nur, was sich ändert.
Selbst schreiben, oder den Optimizer lassen
Das ist die praktische Weiche auf unserem Workbench. H3 Max auf Epochal hat eine Prompt-Expansion-Einstellung mit drei Stufen:
- Off. Das Modell bekommt exakt, was du getippt hast. Nutze das, wenn du im strukturierten Format oben geschrieben hast und deine Kamerabewegungen, Dialogue-Tags und Sound-Felder Wort für Wort respektiert wissen willst.
- Balanced (Standard). Eine leichte Überarbeitung, die Lücken füllt und die Struktur ordnet. Gut für natürlichsprachige Entwürfe wie „a chef flambés a pan in a dark kitchen, camera slowly circles".
- Quality. Ein tieferer Durchgang, der aus deinem Ausgangsgedanken einen volleren strukturierten Prompt baut. Am besten, wenn die Absicht klar ist, aber die Geduld fehlt, Shots und Soundscapes selbst zu schreiben.
Ein sinnvoller Workflow: Im Balanced-Modus entwerfen, ansehen, was die Expansion hinzugefügt hat, dann auf Off schalten und den erweiterten Prompt von Hand bearbeiten. Du lernst das Format aus den eigenen Edits des Modells, was schneller geht als Dokumentation zu lesen, diese hier eingeschlossen.
Um die Weiche selbst zu sehen, hier derselbe natürlichsprachige Entwurf zweimal auf Epochal ausgeführt (MiniMax H3 Max, 5 Sekunden, 480p), zuerst mit Expansion aus, dann auf Balanced:
someone films a tiny glowing creature standing on their kitchen table at dusk, one-handed phone footageExpansion aus. Der Satz geht so, wie geschrieben, ans Modell:
Balanced. Derselbe Satz, nachdem die Expansionsstufe Shot-Struktur und Sound ergänzt hat:
Schau dir beide an und beachte, wie viel die Expansionsstufe still zu derselben Einzeilen-Idee hinzufügt.
Häufige Fehler
- Captions statt Regieanweisungen. „A dog running, cinematic, 4K" liefert kein Framing, keinen Handlungsbogen, keine Kamera und nichts zum Timen.
- Schnitt-Timestamps außerhalb der Clip-Länge. Ein Shot bei 00:09.000 in einem 5-Sekunden-Clip ist totes Gewicht.
- Musik, die Figuren hören könnten, in
non_diegetic_musicplatziert. Sie gehört in die Beschreibung. - Dialoge als normale Prosa geschrieben, sodass das Modell gesprochene Sprache nicht von Erzählung unterscheiden kann.
- Drei Kamerabewegungen auf einem I2V-Anker gestapelt.
- Abstrakte Stil-Stapelung. „Cinematic, emotional, epic, masterpiece" ist kein Stil; „vintage 16mm film" ist einer.
FAQ
Versteht Hailuo 3 Dialogue-Tags wie <d>?
Ja, sie sind Teil des Formats, auf dem das Modell trainiert ist. Du kannst auch einfach „he says:" schreiben, gefolgt von der Zeile in Anführungszeichen, und das Modell spricht sie meist; die Tag-Version ist zuverlässiger bei der Sprache und darin, die Zeile wortwörtlich zu halten.
Brauche ich das Drei-Felder-Format für jeden Prompt? Nein. Eine einfache natürlichsprachige Beschreibung liefert völlig gute Clips, besonders mit eingeschalteter Prompt-Expansion. Die drei Felder zählen, wenn du Regie führst: Sounddesign, Musik oder Multi-Shot-Struktur.
Wie lang ist der längste H3-Max-Clip? 15 Sekunden, sowohl auf Epochal als auch in den offiziellen H3-Einstellungen für Max. Nutze Timestamps, um Schnitte in dieses Fenster zu legen.
Gibt es ein Limit für die Prompt-Länge? Die offizielle API begrenzt Prompts auf 7.000 Zeichen, weit mehr, als ein 15-Sekunden-Clip rendern kann. Ein fokussierter Prompt von 100 bis 300 Wörtern schlägt einen mit 2.000 Wörtern fast immer.
Kann ich Prompts in anderen Sprachen schreiben?
Das Modell beherrscht mehrere Sprachen, und das <d>[Language]-Tag steuert die Sprache der gesprochenen Dialoge. Für den Prompt-Text selbst ist Englisch der sicherste Standard. In dieser Sprache wurde das Kameravokabular (Pan, Tilt, Tracking Shot) definiert.
H3 oder H3 Max: Ist das Prompten anders? Das Format ist identisch. Max tauscht etwas Auflösungsspielraum gegen Generierungstempo, also ist es das Modell, gegen das du promptest, wenn du iterierst.
Warum ist mein Clip stumm herausgekommen?
Meistens hat der Prompt nur Visuals beschrieben. H3 generiert Audio, wenn der Prompt ihm etwas zum Hören gibt. Füge eine overall_soundscape-Zeile hinzu oder Ambient-Details in der Beschreibung.
Ist Hailuo 3 kostenlos? Nirgendwo in unbegrenzter Menge. Die offizielle Hailuo-AI-App von MiniMax gibt neuen Konten ein kleines tägliches Guthaben, und Trial-Credits auf Drittanbieter-Seiten sind schnell verbraucht. Auf Epochal zeigt jeder Run vor dem Generieren seine Kosten, und neue Konten starten mit einem kleinen Credit-Geschenk plus täglichem Check-in. Zum Testen von Prompts ist die 5-Sekunden-480p-Einstellung der günstigste Weg.
Wann ist Hailuo 3 erschienen? MiniMax hat H3 am 31. Juli 2026 veröffentlicht, die speed-optimierte Variante H3 Max folgte im September 2026. Beide nutzen das in diesem Guide beschriebene Prompt-Format.
Ausprobieren
Nimm eines der Beispiele oben, füge es in MiniMax H3 Max auf Epochal ein und führe es einmal mit Expansion aus, um zu sehen, was das rohe Format macht. Wenn du von Stills aus arbeitest, gelten dieselben Verankerungsregeln. Unser Überblick über Image-to-Video-Tools deckt, welche Workflows zu welchen Inputs passen.
Meta Title: Hailuo 3 Prompt Guide: MiniMax H3 Prompt Format (2026)
Meta Description: How to write MiniMax H3 / Hailuo 3 prompts: shot structure, camera move vocabulary, dialogue tags, sound fields, and image-to-video prompting that works.
Slug: hailuo-3-prompt-guide
Primary Keyword: hailuo 3 prompt guide
Secondary Keywords: minimax h3 prompt, minimax h3 prompt guide, hailuo 3 prompts, hailuo h3 prompting
Suggested Internal Links:
/models/minimax-h3-max: the model this guide prompts for (hero + CTA)/models/hailuo-2-3: predecessor context/blog/best-image-to-video-ai-tools-2026: I2V readers
Weitere Beiträge

Beste KI-Videogeneratoren 2026: Veo 3.1, Kling 3.0, Seedance 2.0 und mehr im Test
Ein praxisnaher Vergleich der besten KI-Videogeneratoren 2026 – Ausgabequalität, Audiogenerierung, Prompt-Kontrolle, Geschwindigkeit und Workflow-Eignung im Überblick.

So betreiben Sie einen lokalen KI-Videogenerator auf Ihrem eigenen Computer
Ein praxisnaher Leitfaden zur lokalen Ausführung von KI-Videogenerierung: Setup-Tools, Hardware-Anforderungen, Datenschutzvorteile und wann Cloud-Tools Zeit sparen.

Veo 3.1 vs Sora 2: Welches KI-Videomodell passt zu Ihrem Workflow?
Ein Vergleich zwischen Google Veo 3.1 und OpenAI Sora 2 hinsichtlich Qualität, Geschwindigkeit, Audio, Kosten und praktischer Workflows. Finden Sie heraus, welches Modell zu Ihrem Anwendungsfall passt.