- ComfyUI에서 MiniMax H3 사용: 모듈화되고 사용자 정의 가능한 노드 워크플로우로 AI 비디오 모델을 로컬에서 실행하세요
- 하드웨어 기준: 안정적인 생성을 위해 충분한 시스템 RAM을 갖춘 NVIDIA RTX 3060 이상
- 다중 입력 모드: 텍스트-비디오, 첫/마지막 프레임, 다중 참조 이미지/비디오 입력을 지원합니다
- 오디오 생성: 모델은 동기화된 오디오, 음성 복제 및 배경 음악을 생성할 수 있습니다
- 라이선스 요구 사항: 미국 및 EU 사용자는 다운로드 전에 라이선스 양식을 통해 액세스를 요청해야 합니다
MiniMax H3 ComfyUI 개요
ComfyUI에서 MiniMax H3를 실행하면 AI 비디오 생성을 완벽하게 로컬에서 제어할 수 있습니다. 클라우드 API에 의존하는 대신, 텍스트 프롬프트, 이미지 및 참조 비디오를 처리하는 모듈식 노드 기반 워크플로우를 자신의 하드웨어에서 완전히 구축할 수 있습니다. 이 모델은 복잡한 프롬프트, 다중 이미지 참조, 오디오 합성 및 음성 복제까지 처리합니다.
비디오 하이라이트:
- 가지치기된 int8 모델을 사용한 864x480 해상도의 텍스트-비디오 생성
- 제어된 비디오 전환을 위한 첫 프레임과 마지막 프레임 이미지 입력
- 최대 4개의 이미지, 비디오 클립 및 오디오 트랙을 결합한 다중 참조 입력
- 두 개의 개별 비디오 소스에서 오디오를 병합하여 음성 복제
- 쉬운 모델 전환을 위해 RG3 fast group bypass 노드를 사용하는 워크플로우 아키텍처
MiniMax H3에 ComfyUI를 사용하는 핵심 이점은 유연성입니다. 간단한 부울 스위치를 사용하여 첫-마지막 프레임 모델과 참조 모델 사이를 전환할 수 있습니다. K 샘플러 및 비디오 출력 노드는 표준 ComfyUI 규칙을 따르므로 워크플로우를 쉽게 수정하고 확장할 수 있습니다.
NVIDIA RTX 3090 사용자의 경우, 가지치기된 int8 모델(FL2va)이 품질과 성능의 훌륭한 균형을 제공합니다. 3060 또는 3070이 있는 경우, 시스템 RAM이 충분하다면 ComfyUI의 최적화로도 여전히 작업 부하를 처리할 수 있습니다.
하드웨어 요구 사항 및 모델 변형
MiniMax H3는 소비자용 NVIDIA GPU에서 실행되도록 설계되었습니다. ComfyUI는 RTX 3060 이상을 지원한다고 확인했지만, 하드웨어 등급에 따라 생성 시간이 크게 달라집니다.
| GPU 모델 | 최소 RAM | 예상 성능 | 권장 모델 |
|---|---|---|---|
| RTX 3060 | 시스템 32GB | 느린 생성, 기본 해상도 | 가지치기된 int8 |
| RTX 3070/3080 | 시스템 32GB | 보통 속도, 표준 해상도 | 가지치기된 int8 |
| RTX 3090/4090 | 시스템 64GB | 빠른 생성, 높은 해상도 | 가지치기된 int8 또는 전체 |
생성 시간은 입력 복잡성에 크게 좌우됩니다. 864x480 해상도의 간단한 텍스트-비디오 프롬프트는 빠르게 완료될 수 있지만, 비디오 및 오디오 입력이 포함된 다중 참조 워크플로우는 RTX 3090에서 5분 이상 걸릴 수 있습니다.
모델은 공식적으로 최대 15초의 비디오를 지원합니다. 그러나 테스트에 따르면 20초까지 늘려도 결과가 깨지지 않고 일관된 출력을 생성할 수 있는 것으로 나타났습니다. 이는 보장되지 않으며 실험적인 것으로 취급하십시오.
입력 모드 및 생성 기능
MiniMax H3는 각기 다른 창작 목표에 맞는 여러 가지 고유한 입력 모드를 제공합니다. 각 모드를 언제 사용해야 하는지 이해하면 최상의 결과를 얻는 데 도움이 됩니다.
텍스트-비디오
- 입력 이미지 불필요
- 복잡하고 상세한 프롬프트 처리
- 순수 창작 생성에 가장 적합
- 일러스트 및 실사 스타일 지원
첫 프레임 & 마지막 프레임
- 시작과 끝 프레임 정의
- 프롬프트로 전환 스타일 제어
- picture zero 및 picture one 태그 사용
- 비디오는 항상 제공된 이미지로 시작하고 끝남
참조 모델
- 여러 이미지 및 비디오 허용
- 이미지는 정확한 프레임이 아닌 외형 안내
- 최대 6개 이상의 결합된 입력 지원
- 음성 복제 및 오디오 병합 활성화
해상도 옵션
워크플로우에는 사용 가능한 모든 출력 크기에 대한 참조 미리보기가 포함된 해상도 선택기가 있습니다.
| 해상도 | 화면비 | 사용 사례 | 참고 사항 |
|---|---|---|---|
| 864x480 | 16:9 | 표준 비디오 | 가장 빠른 생성 시간 |
| 1216x672 | 16:9 | 고품질 | 긴 처리 시간, 더 선명한 디테일 |
| 사용자 정의 | 다양함 | 특수 포맷 | 컨디셔닝 노드에서 너비/높이 조정 |
MiniMax H3는 비디오와 함께 동기화된 오디오를 생성합니다. 배경 음악, 캐릭터 대사를 생성할 수 있으며, 참조 비디오 클립에서 음성을 복제할 수도 있습니다. 별도의 오디오 트랙이 있는 두 개의 입력 비디오를 사용하면, 모델이 두 음성을 새로 생성된 장면으로 병합할 수 있습니다.
단계별 워크플로우 설정
ComfyUI에서 MiniMax H3 워크플로우를 구축하려면 모델 로더, 컨디셔닝 노드 및 입력 선택기를 신중하게 구성해야 합니다. 다음 단계에 따라 기능적인 워크플로우를 만드세요.
모델 로드
MiniMax H3 모델 파일(예: 가지치기된 int8 FL2va)을 ComfyUI 모델 디렉터리에 넣습니다. 첫-마지막 프레임 버전이나 참조 비디오 버전 중 하나에 대한 전용 모델 로더 노드를 사용합니다. 두 가지 모두 동일한 CLIP 및 VAE 모델이 필요합니다.
RG3 바이패스 구성
한 번에 하나의 모델 그룹만 활성화되도록 RG3 fast group bypass 노드를 추가합니다. 이 노드는 토글 역할을 하여 첫-마지막 프레임 컨디셔닝과 참조 비디오 컨디셔닝 간의 충돌을 방지합니다.
컨디셔닝 설정
첫-마지막 프레임 모드의 경우, 프롬프트 텍스트, 너비, 높이 및 비디오 길이 매개변수와 함께 첫 프레임 및 마지막 프레임 이미지를 컨디셔닝 노드에 연결합니다. 참조 모드의 경우, 모든 이미지, 비디오 및 오디오 입력을 참조-비디오 노드에 연결합니다.
K 샘플러 구성
표준 K 샘플러 노드를 사용합니다. 일반적인 단계, CFG 및 디노이즈 설정 외에는 특별한 구성이 필요하지 않습니다. 샘플러는 두 모델 경로 중 하나에서 컨디셔닝된 잠재 공간을 처리합니다.
출력 옵션 설정
선호하는 접두사와 형식으로 비디오 출력 노드를 구성합니다. 옵션에는 MP4 및 애니메이션 GIF가 포함됩니다. 나중에 FILM 또는 RIFE 모델을 사용하여 프레임 보간을 수행할 계획이라면 최종 이미지와 오디오를 별도로 저장하세요.
모델 로더 그룹에 설정된 레이블에 연결된 부울 스위치를 사용하세요. 이렇게 하면 첫-마지막 프레임 모델과 참조 모델 사이를 전환할 때 파이프라인을 통해 올바른 컨디셔닝과 잠재 공간이 전달됩니다.
프롬프트 기술 및 참조 인덱싱
MiniMax H3 워크플로우에서 효과적인 프롬프트 작성은 모델이 이미지 및 비디오 참조를 해석하는 방법을 이해해야 합니다. 참조 모델은 꺾쇠괄호 인덱싱을 사용하여 다양한 입력 소스를 식별합니다.
프롬프트 참조 구문
| 구문 | 목적 | 예시 사용법 |
|---|---|---|
| [picture zero] | 첫 번째 이미지 입력 참조 | 캐릭터 외형 안내용으로 사용 |
| [picture one] | 두 번째 이미지 입력 참조 | 보조 캐릭터 또는 사물용으로 사용 |
| [video zero] | 첫 번째 비디오 입력 참조 | 모션 또는 장면 참조용으로 사용 |
| [video one] | 두 번째 비디오 입력 참조 | 전환 대상 또는 스타일용으로 사용 |
| [audio zero] | 오디오 전용 입력 참조 | 음성 또는 음악 안내용으로 사용 |
인덱싱 시스템은 유연합니다. 선호도에 따라 0 또는 1부터 시작할 수 있습니다. 모델은 엄격한 번호 매기기를 강제하지 않지만, 단일 워크플로우 내에서는 일관성을 유지하는 것이 좋습니다.
첫 프레임과 마지막 프레임 이미지를 사용할 때는 두 이미지 사이에서 일어나는 일을 설명하는 변환 프롬프트를 작성하세요. 시작 부분 근처에는 picture zero를 언급하고 끝부분에는 picture one을 언급하세요. 프롬프트 내용과 상관없이 모델은 항상 제공된 프레임에서 시작하고 끝나지만, 프롬프트는 전환이 언제, 어떻게 일어나는지를 결정합니다.
고급 다중 입력 예시
참조 모델은 복잡한 입력 조합을 처리할 수 있습니다. 테스트된 한 구성에서는 다른 스타일과 크기의 4개 입력 이미지, 하나의 비디오 클립, 그리고 그 비디오의 오디오 등 총 6개의 서로 다른 입력을 사용했습니다. 프롬프트는 방 안에 4명의 캐릭터를 만들고 마지막 비디오 클립이 거울을 통해 보는 것처럼 나타나게 끝내도록 모델에 지시했습니다.
참조 모드에서 이미지는 정확한 시작 또는 끝 프레임이 아닌 외형 안내 역할을 합니다. 모델은 이를 사용하여 캐릭터와 사물의 모양을 결정하지만, 생성된 비디오가 반드시 그 이미지로 시작하거나 끝나지는 않습니다. 이는 제공된 이미지가 시작과 끝을 보장하는 첫-마지막 프레임 모드와 다른 점입니다.
라이선스 및 후처리
라이선스 고려 사항
MiniMax H3 라이선스는 현재 미국과 유럽 연합에서의 다운로드를 제한하고 있습니다. 그러나 개인은 라이선스 요청 양식을 제출하여 액세스를 요청할 수 있습니다. 2026년 현재 사용자 보고에 따르면 제출 후 승인 이메일이 빠르게 도착합니다.
이 가이드는 법적 자문이 아닙니다. 라이선스 약관은 시간이 지남에 따라 변경될 수 있습니다. 모델을 다운로드하여 사용하기 전에 항상 공식 라이선스 계약을 읽고 직접 조사를 수행하십시오. 상업적 사용에는 추가적인 제한이 있을 수 있습니다.
프레임 보간
비디오를 생성한 후, ComfyUI에서 사용 가능한 프레임 보간 모델을 사용하여 부드러움을 개선할 수 있습니다.
| 보간 모델 | 출력 FPS | 배수 | 품질 |
|---|---|---|---|
| FILM | 48 fps | 2배 | 부드럽고 자연스러운 움직임 |
| RIFE | 48 fps | 2배 | 선명하고 디테일한 프레임 |
| RIFE | 72 fps | 3배 | 매우 부드러움, 처리 시간 김 |
생성 전 체크리스트:
- GPU에 선택한 해상도를 위한 충분한 VRAM이 있는지 확인
- 두 모델 경로 모두에 대해 CLIP 및 VAE 모델이 로드되었는지 확인
- RG3 바이패스 토글 스위치가 모델 간에 올바르게 전환되는지 테스트
- 후처리를 위해 최종 이미지와 오디오를 별도로 저장
- 비디오 출력 형식이 의도한 용도와 일치하는지 확인
FAQ
Q: ComfyUI에서 MiniMax H3를 실행하려면 어떤 GPU가 필요한가요?
ComfyUI는 NVIDIA RTX 3060 이상의 지원을 확인했습니다. GPU와 함께 충분한 시스템 RAM이 필요합니다. 시스템 RAM 64GB의 RTX 3090은 빠른 생성 시간을 제공하며, 32GB RAM의 3060은 여전히 표준 해상도에서 결과를 생성할 수 있습니다.
Q: MiniMax H3는 비디오와 함께 오디오를 생성할 수 있나요?
네. 이 모델은 배경 음악, 대화 및 효과음을 포함하여 동기화된 오디오를 생성합니다. 또한 참조 비디오 클립의 오디오 트랙을 사용하여 음성 복제를 지원합니다. 두 개의 개별 비디오에서 음성을 가져와 하나의 새로운 장면으로 병합할 수 있습니다.
Q: MiniMax H3의 최대 비디오 길이는 얼마인가요?
공식 최대 길이는 15초입니다. 그러나 테스트에 따르면 20초까지 늘려도 여전히 일관된 출력을 생성할 수 있습니다. 프롬프트 복잡성과 입력 유형에 따라 결과가 달라질 수 있으므로 15초 이상으로 하는 것은 실험적인 것으로 취급해야 합니다.
Q: 하나의 워크플로우에서 첫-마지막 프레임 모델과 참조 모델 간을 어떻게 전환하나요?
한 번에 하나의 모델 그룹만 활성화되도록 RG3 fast group bypass 노드를 사용하세요. 모델 로더 그룹에 설정된 레이블에 연결된 부울 스위치를 추가하세요. 이렇게 하면 선택한 모델에 따라 파이프라인을 통해 올바른 컨디셔닝과 잠재 공간이 전달됩니다.
Q: 참조 이미지를 2개 이상 사용할 수 있나요?
네. 참조 모델은 여러 이미지, 비디오 및 오디오 전용 입력을 지원합니다. 테스트된 구성에는 오디오가 포함된 하나의 비디오와 4개의 이미지가 포함되어 총 6개의 입력이 사용되었습니다. 워크플로우에 추가 입력 노드를 추가하여 5~6개 이미지로 확장하는 것은 간단합니다.