- ComfyUI의 MiniMax H3: 모든 파라미터를 제어하여 오픈 웨이트 AI 비디오 생성을 로컬에서 실행하세요
- 세 가지 핵심 모드: 텍스트-비디오(T2V), 이미지-비디오(I2V), 참조-비디오(R2V)
- 네이티브 스테레오 오디오: 대사, 효과음 및 음악이 비디오와 함께 생성됩니다
- 하드웨어 요구 사항: 충분한 시스템 RAM을 갖춘 NVIDIA RTX 3060 이상
- 속도 최적화: Sage Attention을 설치하여 생성 속도를 대략 두 배로 높이세요
MiniMax H3 ComfyUI 개요
MiniMax H3는 ComfyUI를 통해 강력한 오픈 웨이트 AI 비디오 생성을 로컬 머신으로 직접 가져옵니다. 이 통합을 통해 크리에이터는 텍스트 프롬프트, 참조 이미지 및 비디오 클립을 통합된 멀티모달 출력으로 결합하여 네이티브 스테레오 오디오가 포함된 고품질 비디오 콘텐츠를 생성할 수 있습니다. 로컬에서 실행하면 클라우드 API에 의존하지 않고 모든 파라미터를 완벽하게 제어할 수 있습니다.
비디오 하이라이트:
- RTX 3090에서 가지치기된(pruned) int8 모델을 사용한 로컬 텍스트-비디오 생성
- 와이프 및 페이즈 효과가 적용된 첫 프레임과 마지막 프레임 이미지-비디오 전환
- 여러 이미지, 비디오 클립 및 오디오 트랙을 결합한 참조-비디오
- 별도의 클립에서 캐릭터 외모와 목소리를 병합하는 음성 복제 기능
- 15초 최대 길이 제한을 성공적으로 넘어서는 테스트
MiniMax H3 라이선스는 기본적으로 미국 및 유럽 연합에서의 다운로드를 제한합니다. 그러나 개인은 라이선스 요청 양식을 제출하여 액세스를 요청할 수 있습니다. 승인 이메일은 일반적으로 빠르게 발송됩니다. 특정 사용 권한에 대해서는 항상 직접 조사를 수행하십시오.
핵심 생성 모드
MiniMax H3는 각각 다른 크리에이티브 사용 사례를 위해 설계된 세 가지 기본 생성 워크플로우를 통해 작동합니다. 최적의 결과를 얻으려면 각 모드를 언제 사용해야 하는지 이해하는 것이 필수적입니다.
텍스트-비디오 (T2V)
- 입력 미디어 불필요
- 텍스트 프롬프트만으로 생성
- FL2VA 모델 사용
- 빠른 콘셉트 테스트에 적합
이미지-비디오 (I2V)
- 첫 프레임 및/또는 마지막 프레임 제어
- 선택적 키프레임 입력
- FL2VA 모델 사용
- 정적 이미지에 애니메이션을 적용하는 데 이상적
참조-비디오 (R2V)
- 최대 9개 이미지, 3개 비디오, 3개 오디오 클립
- 캐릭터 정체성과 스타일 고정
- Ref2VA 모델 사용
- 일관된 캐릭터 작업에 가장 적합
모드 비교 표
| 기능 | 텍스트-비디오 | 이미지-비디오 | 참조-비디오 |
|---|---|---|---|
| 모델 가중치 | FL2VA | FL2VA | Ref2VA |
| 최대 참조 이미지 | 0 | 2 (첫/마지막) | 9 |
| 최대 참조 비디오 | 0 | 0 | 3 |
| 독립 오디오 입력 | 0 | 0 | 3 |
| 네이티브 오디오 출력 | 예 | 예 | 예 |
| 최적의 사용 사례 | 콘셉트 탐구 | 키프레임 애니메이션 | 캐릭터 일관성 |
T2V 및 I2V 워크플로우는 동일한 FL2VA 모델 가중치를 공유합니다. R2V는 별도의 Ref2VA 확산 모델을 사용합니다. 사용자 정의 워크플로우를 구축할 때 모델 로더 그룹에 연결된 부울 스위치를 사용하여 둘 사이를 쉽게 전환할 수 있습니다.
설치 및 설정
ComfyUI에서 MiniMax H3를 실행하려면 호환되는 버전으로 업데이트하고 Hugging Face에서 적절한 모델 가중치를 다운로드해야 합니다.
ComfyUI 업데이트
ComfyUI 설치를 버전 0.30.0 이상으로 업데이트하세요. 이전 버전은 MiniMax H3 워크플로우 및 노드에 대한 기본 지원이 부족합니다.
템플릿 라이브러리 액세스
ComfyUI 인터페이스 내의 템플릿 라이브러리 > 비디오로 이동하세요. 의도한 생성 모드와 일치하는 MiniMax H3 워크플로우를 선택하세요.
모델 다운로드
팝업 프롬프트에 따라 필요한 모델 파일을 자동으로 다운로드하세요. 모델은 Hugging Face의 Comfy-Org/MiniMax-H3 리포지토리에 호스팅됩니다.
해상도 구성
해상도 선택기 노드를 사용하여 출력 크기를 설정하세요. H3 해상도 그리드와 일치하도록 배수를 32로 유지하세요. 16:9, 9:16 또는 1:1과 같은 사전 설정에서 선택하세요.
생성 실행
입력을 연결하고, 프롬프트를 작성한 후 워크플로우를 실행하세요. 생성 시간은 하드웨어, 해상도 및 참조 수에 따라 다릅니다.
하드웨어 권장 사항
| GPU 등급 | 최소 사양 | 권장 사양 | 하이엔드 |
|---|---|---|---|
| GPU | RTX 3060 | RTX 4070 | RTX 3090/4090 |
| 모델 버전 | 가지치기 int8 | 표준 | 표준 |
| 예상 생성 시간 (10초) | 8-12분 | 5-7분 | 3-5분 |
| 최대 실용 해상도 | 864x480 | 1080p | 1216x672+ |
RTX 3060과 같은 8GB VRAM 카드를 가진 사용자의 경우, 가지치기된 int8 모델이 품질과 성능의 최상의 균형을 제공합니다. 24GB 카드(RTX 3090/4090)를 가진 사용자는 타협 없이 더 높은 해상도에서 전체 정밀도 모델을 실행할 수 있습니다.
프롬프트 작성 전략
MiniMax H3에서 효과적인 프롬프팅을 위해서는 단일 프롬프트 블록 내에서 장면, 카메라 이동 및 오디오 큐를 설명하는 구조화된 접근 방식이 필요합니다. 이 모델은 복잡하고 여러 문장으로 된 프롬프트를 효과적으로 처리합니다.
모드별 프롬프트 구조
| 모드 | 프롬프트 구조 | 핵심 구문 |
|---|---|---|
| T2V | 장면 설명, 샷 분석, 카메라 이동, 오디오 큐 | 일반 텍스트 |
| I2V | 모션 설명, 전환 스타일, 오디오 요소 | 일반 텍스트 |
| 첫/마지막 프레임 | 첫 번째에서 마지막 이미지로의 전환 설명 | <Picture 0> 및 <Picture 1> 태그 |
| R2V | 각 참조에 역할을 명시적으로 할당 | <Picture 1>, <Video 1>, <Audio 1> 태그 |
프롬프팅 모범 사례
- 전체 장면을 먼저 설명하세요: 타이밍이 지정된 샷으로 나누기 전에 위치, 캐릭터 및 액션을 명시하세요
- 오디오 지침 포함: 동일한 프롬프트 블록 내에서 대사, 효과음 및 음악을 지정하세요
- R2V에서 참조 태그 사용: 정확한 연결 순서에 따라 태그로 각 입력을 참조하세요 (예:
<Picture 1>,<Video 1>) - 각 참조에 역할 할당: 어떤 참조가 정체성, 스타일, 모션, 카메라 또는 음성을 구동하는지 명시적으로 언급하세요
- 첫/마지막 프레임 태그 활용: 모델이 시작 및 끝 프레임을 자동으로 매핑하지만,
<Picture 0>및<Picture 1>을 사용하면 R2V 워크플로우를 위한 좋은 습관을 기를 수 있습니다
길이 입력은 24fps에서 모델의 블록당 17프레임(17k+5) 그리드에 스냅됩니다. 명시된 최대치는 15초이지만, 테스트에 따르면 20초까지 늘려도 깨지지 않고 일관된 결과를 생성할 수 있습니다.
Sage Attention을 사용한 속도 최적화
큰 비디오 모델을 로컬로 실행할 때 생성 속도는 중요한 요소입니다. Sage Attention은 품질 저하를 최소화하면서 상당한 성능 향상을 제공합니다.
SageAttention 설치
SageAttention 릴리스 페이지에서 PyTorch 및 CUDA 버전과 일치하는 Python 휠을 다운로드하세요. pip install <wheel-file>을 사용하여 설치하세요.
KJNodes 설치
ComfyUI Manager를 사용하여 KJNodes 사용자 정의 노드 패키지를 설치하세요. 또는 리포지토리를 ComfyUI/custom_nodes/ 디렉토리에 복제하고 ComfyUI를 다시 시작하세요.
패치 노드 추가
UNETLoader와 BasicGuider 노드 사이에 Patch Sage Attention KJ 노드를 삽입하세요. sage_attention 파라미터를 auto로 설정하세요.
워크플로우 실행
평소처럼 워크플로우를 실행하세요. 가이더에만 패치가 필요하며 스케줄러는 변경되지 않습니다.
Sage Attention은 float16 또는 bfloat16 텐서가 필요합니다. MiniMax H3는 일부 레이어를 다른 dtype으로 실행하므로 "Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead"라는 메시지가 표시될 수 있습니다. 이는 예상된 동작이며 생성은 여전히 올바르게 작동합니다.
최적화 비교
| 설정 | 표준 어텐션 | Sage Attention | 글로벌 플래그 |
|---|---|---|---|
| 속도 | 기준선 | 약 2배 빠름 | 약 2배 빠름 |
| 품질 | 완전한 충실도 | 최소 손실 | 최소 손실 |
| 설정 | 없음 | 노드 기반 | --use-sage-attention |
| 콘솔 경고 | 없음 | 예상된 폴백 메시지 | 예상된 폴백 메시지 |
워크플로우 아키텍처 및 체크리스트
노드 아키텍처를 이해하면 사용자 정의 MiniMax H3 워크플로우를 구축하고 문제를 해결하는 데 도움이 됩니다. 이 워크플로우는 모델 로더, 컨디셔닝 노드, 표준 K 샘플러 및 출력 구성으로 구성됩니다.
핵심 노드 구성 요소
| 구성 요소 | 기능 | 참고 사항 |
|---|---|---|
| 모델 로더 | FL2VA 또는 Ref2VA 가중치 로드 | 첫/마지막 vs 참조를 위한 별도 그룹 |
| CLIP 및 VAE | 텍스트 인코딩 및 디코딩 | 두 모델 유형에서 공유 |
| RG3 Fast Group Bypass | 활성 모델 그룹 전환 | 한 번에 하나의 그룹만 실행되도록 보장 |
| 해상도 선택기 | 너비와 높이 계산 | 출력이 H3 노드 입력에 연결 |
| K 샘플러 | 표준 샘플링 | 특별한 구성이 필요하지 않음 |
| 비디오 출력 | 최종 MP4 렌더링 | GIF, 프레임 보간 지원 |
기본 워크플로우는 제한된 수의 입력을 보여주지만, 시스템은 훨씬 더 많은 입력을 지원합니다. 입력 노드를 복제하고 프롬프트 태그를 그에 맞게 업데이트하여 5~6개 이미지로 쉽게 확장하거나 추가 비디오 및 오디오 참조를 추가할 수 있습니다.
MiniMax H3 ComfyUI 설정 체크리스트:
- ComfyUI를 버전 0.30.0 이상으로 업데이트
- Hugging Face에서 모델 가중치 다운로드 (Comfy-Org/MiniMax-H3)
- GPU에 8GB 이상의 VRAM이 있는지 확인 (RTX 3060+)
- 모델 로드를 위한 충분한 시스템 RAM 보장
- 적절한 모델 변형 선택 (낮은 VRAM의 경우 가지치기 int8)
- 해상도 선택기에서 해상도 배수를 32로 설정
- 더 빠른 생성을 위해 Sage Attention 및 KJNodes 설치
- 해당 지역에 대한 MiniMax H3 라이선스 약관 확인
FAQ
Q: ComfyUI에서 MiniMax H3를 실행하려면 어떤 GPU가 필요합니까?
충분한 시스템 RAM을 갖춘 NVIDIA RTX 3060이 최소 요구 사항입니다. 최적의 성능을 위해, 특히 더 높은 해상도에서 여러 참조 입력으로 작업할 때 RTX 3090 또는 4090을 권장합니다. 가지치기된 int8 모델 변형은 VRAM이 낮은 카드에서 잘 작동합니다.
Q: MiniMax H3가 비디오와 함께 오디오를 생성할 수 있습니까?
예, MiniMax H3는 단일 MP4 파일로 비디오와 함께 대사, 효과음 및 음악을 포함한 네이티브 스테레오 오디오를 생성합니다. 또한 R2V 모드에서 참조 오디오 클립을 제공하여 음성을 복제하거나 특정 오디오 스타일을 일치시킬 수 있습니다.
Q: 참조-비디오 모드에서 몇 개의 참조 입력을 사용할 수 있습니까?
R2V는 최대 9개의 참조 이미지, 3개의 참조 비디오(각각 자체 사운드트랙 포함) 및 3개의 독립 참조 오디오 클립을 지원합니다. 이러한 입력을 혼합하여 캐릭터 정체성, 스타일, 모션, 카메라 이동 및 음성을 고정할 수 있습니다.
Q: 15초 최대 비디오 길이를 초과할 수 있습니까?
공식 최대치는 15초이지만, 테스트에 따르면 길이를 20초로 설정해도 여전히 일관된 결과를 생성할 수 있습니다. 길이 입력은 24fps에서 모델의 블록당 17프레임 그리드에 스냅되므로, 길이는 특정 증분 패턴을 따릅니다.
Q: 하나의 워크플로우에서 텍스트-비디오와 참조-비디오를 어떻게 전환합니까?
RG3 Fast Group Bypass 노드를 사용하여 한 번에 하나의 모델 로더 그룹만 활성화되도록 하세요. 모델 로더 그룹에 설정된 레이블을 기반으로 한 부울 스위치를 사용하면 FL2VA와 Ref2VA 컨디셔닝 및 잠재 공간을 쉽게 전환할 수 있습니다.