
Hailuo 3 프롬프트 가이드: MiniMax H3(H3 Max) 프롬프트 작성법

MiniMax H3가 실제로 반응하는 프롬프트 형식. 샷 구조, 카메라 무빙, 대사 태그, 사운드 필드, 그리고 프롬프트 확장에 맡겨도 되는 지점까지 정리했습니다.
Hailuo 3 프롬프트가 실패하는 이유는 대부분 단순합니다. 방향 지시가 아니라 캡션을 쓰고 있기 때문입니다. "빗속을 걷는 여성, 시네마틱"은 모델에게 타이밍을 잡을 것도, 프레이밍할 것도, 목소리를 만들 것도 거의 주지 못합니다. MiniMax H3는 캡션이라기보다 촬영 대본에 가까운 프롬프트 구조를 전제로 만들어졌고, 그 구조가 한번 보이면 출력 차이는 바로 드러납니다.
이 가이드는 모델이 실제로 반응하는 형식을 다룹니다. 샷, 카메라 무빙, 대사 태그, 사운드 필드. 텍스트to비디오와 이미지to비디오 예제는 복사해서 바로 쓸 수 있게 포함했습니다. 내용은 모두 H3와, Epochal에서 돌아가는 고속 버전인 H3 Max 양쪽에 그대로 적용됩니다.
먼저: 무엇을 향해 프롬프트를 쓰는가
Hailuo 3는 MiniMax의 현재 비디오 모델입니다. 싱크된 오디오가 포함된 클립을 생성합니다. 화면, 앰비언스, 음악, 대사가 한 번의 패스로 함께 나오고, 나중에 별도 트랙을 이어 붙일 필요가 없습니다. 이전 세대인 Hailuo 2.3은 소리 없는 영상을 만들었지만, H3는 사운드를 같은 프롬프트의 일부로 취급합니다.
H3 Max는 같은 패밀리의 속도 최적화 버전입니다. 프롬프트 형식은 같고, 생성이 빠르고, 해상도 선택지가 적습니다. 프롬프트 아이디어를 반복하는 단계라면 Max가 더 빨리 돌려주고, 아래의 작성법은 그대로 옮겨 쓸 수 있습니다.
Epochal에서 H3 Max는 텍스트 프롬프트 또는 이미지(첫 프레임, 혹은 첫 프레임과 마지막 프레임 세트)로부터 480p, 768p, 1080p의 5~15초 클립을 생성합니다. 아래 예제는 이 캔버스를 전제로 합니다.
세 개의 필드
H3의 프롬프트 형식에는 라벨이 붙은 필드가 세 개 있습니다. 두 개는 생략 가능하지만, 세 개 모두를 알고 있으면 첫 번째 필드를 쓰는 방식이 달라집니다.
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...- integrated_multimodal_description은 프롬프트의 본문입니다. 타임라인 위의 보이는 것·들리는 것 전부를 커버합니다. 샷, 카메라 무빙, 액션, 대사.
- overall_soundscape는 클립 전체의 배경 소리입니다. 비, 차량 소음, 실내 잔향, 발소리. 대사와 음악은 절대 여기에 쓰지 않습니다.
- non_diegetic_music은 스코어, 즉 관객만 듣는 음악입니다. 극중 인물이 들을 수 있는 소리(라디오, 길거리 버스커, 벨소리)는 첫 번째 필드에 씁니다.
영상 부분 쓰기: 샷과 카메라 무빙
스타일과 프레이밍으로 시작하고, 무슨 일이 일어나는지 묘사합니다. 그 형태로 쓴 프롬프트 전문과, 실제로 나온 클립입니다(MiniMax H3로 생성, 2026년 9월).
integrated_multimodal_description: [Shot 1] An extreme close-up macro shot of a whole pomegranate carved from transparent ruby-red crystal glass, centered on a wooden cutting board, studio backlight scattering refractions and internal reflections through the seeds. A polished steel cleaver enters the frame and presses down in one slow, clean cut. The glass splits with a fine network of cracks before the two halves separate and rock gently on the board.
overall_soundscape: Quiet room tone; the only sound is the blade's crisp contact and a bright, crystalline crunch as the glass pomegranate splits, with tiny shards scattering across the wood.
non_diegetic_music: N/A이 예제에서 일하고 있는 요소는 세 가지입니다.
스타일 단어가 렌더링을 결정한다. 실사, 시네마틱, 2D 애니메이션, 3D CG, 클레이 애니메이션, 수채화, 빈티지 필름. 하나를 골라 앞에 둡니다. 이 예제에서는 "익스트림 클로즈업 매크로"라는 프레이밍과 소재 단어("투명한 루비색 크리스털 글라스")가 어떤 "시네마틱"보다 크게 일합니다. 같은 프롬프트에 "photorealistic"과 "watercolor"를 섞으면 모델은 둘의 평균을 냅니다. 대체로 나쁜 쪽으로.
카메라 무빙은 형용사가 아니라 문장으로 쓴다. H3는 구체적인 움직임 어휘를 이해합니다. Zoom In, Zoom Out, Push In(푸시 인), Pull Out, Pan Left/Right(팬), Truck Left/Right, Tilt Up/Down(틸트), Pedestal Up/Down, Arc Shot, Tracking Shot, Static Shot, POV, Roll. 진폭을 나타내는 "with small amplitude", 속도를 나타내는 "at fast speed"를 덧붙일 수도 있습니다. "카메라가 천천히 푸시 인한다"고 쓰는 편이 "시네마틱한 카메라 워크"보다 항상 낫습니다. 모델은 푸시 인은 실행할 수 있어도, 분위기는 실행할 수 없기 때문입니다.
사운드에는 전용 필드가 있다. 그 바삭한 소리가 어디에 쓰였는지 보세요. overall_soundscape입니다. 음악 필드도 아니고, 묘사문 속 산문도 아닙니다. 인물이 들을 수 있는 소리는 묘사문으로, 장면의 물리적 소리는 사운드스케이프 필드가 본진입니다. non_diegetic_music: N/A로 두면 스코어 없이 진행되므로, 유리가 갈라지는 소리와 겨루는 것이 없습니다.
멀티 샷에는 타임스탬프가 필요하다. 첫 샷은 0초에서 시작합니다. 컷은 이렇게 씁니다.
[Shot 2] At 00:05.000, the camera cuts to a close-up of the split halves rocking on the board.컷 시각은 클립 길이 안에 들어와야 합니다. 5초 Max 클립에서 00:09.000의 샷은 그냥 영원히 오지 않습니다. 그리고 새 샷이 정말로 새로운 무언가(새 피사체, 새 장소, 새 상태)를 실어 올 때만 컷하세요. 같은 순간의 다른 앵글만 원한다면, 컷하지 말고 카메라를 움직이세요.
대사: <d> 태그
H3는 오디오를 생성하므로 대사는 태그를 붙여 프롬프트에 씁니다. 핵심만 정리하면:
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>(S1),(S2)는 화자 ID이고, 캐릭터가 처음 말을 시작한 순서대로 부여됩니다. 첫 등장 시에 목소리를 묘사하세요. 나이, 음높이, 말하는 속도, 억양.<d>안의 텍스트는 그대로 발화됩니다. 바꿔 쓰지 말고, 언어 태그도 정직하게. 일본어 대사라면<d>[Japanese]…</d>입니다.- 내레이터가 화면 밖에 있는 보이스오버는 그 사실과 "화자의 입은 완전히 감긴 채"임을 명시합니다. 쓰지 않으면 모델이 화면 밖 대사에 립싱크를 시키려 합니다.
An older man in a wool coat says in an off-screen voiceover: <d>[English] Nobody remembered the lighthouse that winter.</d> while his lips remain completely closed.- 화면 속 텍스트(네온사인, 휴대폰 화면)는 묘사문 안에서 큰따옴표로 감쌉니다.
A red neon sign reading "OPEN" hums above the doorway.
사운드 필드, 짧게
각각 한세 문장. 구체가 추상을 이깁니다.
overall_soundscape: Steady rain taps against the café windows; low room ambience continues underneath.
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that swell before fading out.음악 필드에 무드 단어를 쓰지 마세요. "멜랑콜리한"은 연주할 수 없습니다. "느린 템포의 성긴 피아노에 지속되는 저음 현악"은 연주할 수 있습니다. 두 필드 모두 N/A를 받으므로, 장면 소리 외에는 조용한 클립을 만들 수 있습니다.
이미지to비디오: 프레임에 고정하기
I2V는 Hailuo 3의 진가가 드러나는 지점이고, 프롬프트 쓰는 법이 달라집니다. 이미지는 타임라인 위의 한 프레임이고, 텍스트 프롬프트는 그것과 모순되지 않아야 합니다.
- 첫 프레임만. 이미지 "이후"에 일어나는 일을 묘사합니다. 이미지가 0초를 고정하고, 프롬프트는 그 앞으로 전개됩니다.
- 첫 프레임과 마지막 프레임. 두 장 사이의 연속적인 경로를, 가급적 한 샷으로 묘사합니다. 모델의 임무는 전환이므로, 건너게 할 변화는 하나, 명확하게 주세요(밀물이 들어온다, 문이 열린다, 스케치가 채워진다).
- 카메라 규율: I2V 프롬프트의 카메라 무빙은 한 번까지. 정지 이미지 한 장에 팬, 줌, 컷을 쌓으면 앵커와 싸웁니다.
첫/마지막 프레임 작업에서는 완전한 구조화 형식이 묘사문 위에, 어떤 그림이 어느 타임스탬프에 놓이는지 알려주는 정렬 행을 추가합니다. 이것은 모델 자체의 프롬프트 익스팬더가 내보내는 형식입니다. 손으로 쓴 I2V 프롬프트는 묘사문이 첫 프레임에서 마지막 프레임을 향해 명확하게 서술만 하면, 이 행 없이도 잘 동작합니다.
실제 첫 프레임 I2V 실행 예제입니다. 항구 부두의 앵커 이미지 한 장, 고정 카메라, 5초 동안 실어 보낼 변화 하나(MiniMax H3로 생성, 2026년 9월).
[Shot 1] A static shot of the harbor pier from the first frame. Over the next five seconds, the last orange band of sunset fades from the water while a small fishing boat crosses slowly from left to right, its lamp the first light to switch on. The camera stays still.
overall_soundscape: Gentle water lapping against the pier pilings; a distant gull call near the end.이 프롬프트가 요구하는 것이 얼마나 적은지 보세요. 프레임을 고정하고, 빛을 페이드시키고, 보트 한 척을 움직인다. 구도는 앵커 이미지가 담당하고, 프롬프트가 지시하는 것은 변화뿐입니다.
직접 쓰거나, 옵티마이저에 맡기거나
여기가 우리 워크벤치에서의 실질적인 갈림길입니다. Epochal의 H3 Max에는 프롬프트 확장 설정이 세 단계 있습니다.
- Off. 입력한 텍스트가 그대로 모델에 전달됩니다. 위의 구조화 형식으로 썼고 카메라 무빙·대사 태그·사운드 필드를 한 글자까지 존중받고 싶을 때 씁니다.
- Balanced(기본값). 빈칸을 채우고 구조를 다듬는 가벼운 재작성. "어두운 주방에서 셰프가 팬을 플람베한다, 카메라가 천천히 선회한다" 같은 자연어 초안에 적합합니다.
- Quality. 씨앗 아이디어에서 더 완전한 구조화 프롬프트를 세워주는 무거운 패스. 의도는 명확하지만 샷과 사운드스케이프를 직접 쓸 인내심이 없을 때.
현실적인 워크플로는 이렇습니다. Balanced로 초안을 쓰고, 확장이 무엇을 추가했는지 살펴본 뒤, Off로 바꿔서 확장된 프롬프트를 손으로 고칩니다. 모델 자신의 편집에서 형식을 배우게 되는데, 문서를 읽는 것보다 빠릅니다. 이 글을 포함해서요.
갈림길을 직접 확인할 수 있게, 같은 자연어 초안을 Epochal에서 두 번 돌린 결과입니다(MiniMax H3 Max, 5초, 480p). 첫 번째는 확장 끄고, 두 번째는 Balanced.
someone films a tiny glowing creature standing on their kitchen table at dusk, one-handed phone footage확장 끔. 문장이 쓰인 그대로 모델에 전달됩니다.
Balanced. 같은 문장을 확장 패스가 통과시킨 후. 샷 구조와 사운드가 채워집니다.
둘을 비교해 보고, 확장 패스가 같은 한 줄 아이디어 위에 조용히 얼마나 많은 것을 얹는지 확인해 보세요.
흔한 실수
- 방향 지시 대신 캡션. "달리는 개, 시네마틱, 4K"는 프레이밍도, 액션 아크도, 카메라도, 타이밍도 주지 못합니다.
- 클립 길이 밖의 컷 타임스탬프. 5초 클립의 00:09.000은 그냥 죽은 짐입니다.
- 인물이 들을 수 있는 음악을
non_diegetic_music에 두기. 묘사문에 있어야 합니다. - 대사를 평범한 산문으로 쓰기. 모델이 대사와 내레이션을 구분하지 못합니다.
- I2V 앵커 하나에 카메라 무빙 세 개 쌓기.
- 추상적인 스타일 쌓기. "시네마틱, 감성적, 웅장한, 걸작"은 스타일이 아닙니다. "빈티지 16mm 필름"은 스타일입니다.
FAQ
Hailuo 3는 <d> 같은 대사 태그를 이해하나요?
네. 모델이 학습한 형식의 일부입니다. "he says:"에 이어 따옴표로 대사를 써도 대체로 발화해 주지만, 태그 버전이 언어 처리와 원문 유지 측면에서 더 신뢰할 수 있습니다.
모든 프롬프트에 세 필드 형식이 필요한가요? 아니요. 평범한 자연어 묘사로도 충분히 좋은 클립이 나옵니다. 프롬프트 확장이 켜져 있으면 더욱 그렇습니다. 세 필드가 빛을 발하는 때는 연출할 때입니다. 사운드 디자인, 음악, 멀티 샷 구조.
H3 Max 클립의 최대 길이는? 15초입니다. Epochal도 Max의 공식 설정도 마찬가지입니다. 타임스탬프로 이 범위 안에 컷을 배치하세요.
프롬프트 길이에 제한이 있나요? 공식 API는 프롬프트를 7,000자로 제한합니다. 15초 클립이 렌더링할 수 있는 분량을 훨씬 넘습니다. 초점이 맞춰진 100~300단어 프롬프트가 거의 항상 2,000단어짜리를 이깁니다.
다른 언어로 프롬프트를 쓸 수 있나요?
모델은 여러 언어를 다루고, <d>[Language] 태그가 발화되는 대사의 언어를 결정합니다. 프롬프트 본문 자체는 영어가 가장 안전한 기본값입니다. 카메라 어휘(Pan, Tilt, Tracking Shot)가 영어로 정의되어 있으니까요.
H3와 H3 Max, 프롬프트가 다른가요? 형식은 동일합니다. Max는 해상도 여유의 일부를 생성 속도로 바꿉니다. 반복하는 단계에서는 Max를 상대로 쓰게 됩니다.
클립이 소리 없이 나온 이유는?
대부분 프롬프트가 영상만 묘사했기 때문입니다. H3는 프롬프트가 들을 것을 주었을 때 오디오를 생성합니다. overall_soundscape 행을 추가하거나 묘사문 안에 앰비언스 디테일을 넣으세요.
Hailuo 3은 무료인가요? 어디에서도 무제한 무료로 쓸 수는 없습니다. MiniMax 공식 Hailuo AI 앱은 신규 계정에 소량의 일일 크레딧을 주고, 서드파티 사이트의 체험 크레딧도 금방 소진됩니다. Epochal에서는 생성 전에 매번 비용이 표시되며, 신규 계정에는 소액 크레딧과 매일 출석 보너스가 제공됩니다. 프롬프트 테스트에는 5초 480p 설정이 가장 저렴합니다.
Hailuo 3 출시일은 언제인가요? MiniMax는 2026년 7월 31일에 H3를 출시했고, 고속 버전인 H3 Max는 2026년 9월에 이어서 나왔습니다. 두 모델 모두 이 가이드의 프롬프트 형식을 그대로 사용합니다.
직접 해보기
위 예제 중 하나를 골라 Epochal의 MiniMax H3 Max에 붙여넣고, 확장을 끈 채 한 번 실행해서 날것의 형식이 무엇을 하는지 보세요. 정지 이미지에서 시작한다면 같은 앵커 규칙이 적용됩니다. 어떤 워크플로가 어떤 입력에 맞는지는 이미지to비디오 툴 총정리에서 다룹니다.
Meta Title: Hailuo 3 Prompt Guide: MiniMax H3 Prompt Format (2026)
Meta Description: How to write MiniMax H3 / Hailuo 3 prompts: shot structure, camera move vocabulary, dialogue tags, sound fields, and image-to-video prompting that works.
Slug: hailuo-3-prompt-guide
Primary Keyword: hailuo 3 prompt guide
Secondary Keywords: minimax h3 prompt, minimax h3 prompt guide, hailuo 3 prompts, hailuo h3 prompting
Suggested Internal Links:
/models/minimax-h3-max: the model this guide prompts for (hero + CTA)/models/hailuo-2-3: predecessor context/blog/best-image-to-video-ai-tools-2026: I2V readers
더 많은 게시물

2026년 최고의 AI 영상 생성기 비교: Veo 3.1, Kling 3.0, Seedance 2.0 실전 테스트
2026년 현재 이용 가능한 최고의 AI 영상 생성 모델을 출력 품질, 오디오 생성, 프롬프트 제어, 속도, 워크플로우 적합성 측면에서 실용적으로 비교합니다.

Veo 3.1 vs Seedance 2.0: 어떤 모델이 내 제작 워크플로에 더 맞을까?
Veo 3.1과 Seedance 2.0을 비교하는 사람을 위해, 화질, 제어력, 생성 속도, 상업적 활용 관점에서 각각 어떤 용도에 더 잘 맞는지 정리합니다.

Grok 동영상 생성이 가능한가요? Grok Imagine 가이드 2026
Grok Imagine 동영상 생성을 알아보세요. 텍스트와 정지 이미지 모드, 제한, 프롬프트 구성, 크레딧과 워크플로 선택을 설명합니다.