- MiniMax H3 en ComfyUI: Ejecuta la generación de vídeo con IA de pesos abiertos localmente con control total de los parámetros
- Tres modos principales: Texto a Vídeo (T2V), Imagen a Vídeo (I2V) y Referencia a Vídeo (R2V)
- Audio estéreo nativo: Diálogos, efectos de sonido (SFX) y música se generan junto con el vídeo
- Requisito de hardware: NVIDIA RTX 3060 o superior con suficiente memoria RAM del sistema
- Optimización de velocidad: Instala Sage Attention para duplicar aproximadamente la velocidad de generación
Descripción General de MiniMax H3 ComfyUI
MiniMax H3 lleva la potente generación de vídeo con IA de pesos abiertos directamente a tu máquina local a través de ComfyUI. Esta integración permite a los creadores generar contenido de vídeo de alta calidad con audio estéreo nativo, combinando indicaciones de texto (prompts), imágenes de referencia y clips de vídeo en salidas multimodales cohesivas. Ejecutarlo localmente proporciona control total sobre cada parámetro sin depender de APIs en la nube.
Puntos Destacados del Vídeo:
- Generación local de texto a vídeo utilizando el modelo int8 podado en una RTX 3090
- Transiciones de imagen a vídeo de primer y último fotograma con efectos de barrido y fase
- Referencia a vídeo combinando múltiples imágenes, clips de vídeo y pistas de audio
- Capacidades de clonación de voz mediante la fusión de apariencias y voces de personajes de clips separados
- Superando con éxito el límite máximo de duración de 15 segundos
La licencia de MiniMax H3 restringe las descargas en EE. UU. y la Unión Europea por defecto. Sin embargo, los individuos pueden solicitar acceso enviando un formulario de solicitud de licencia. Los correos electrónicos de aprobación suelen enviarse rápidamente. Siempre realiza tu propia investigación con respecto a tus derechos de uso específicos.
Modos Principales de Generación
MiniMax H3 opera a través de tres flujos de trabajo de generación principales, cada uno diseñado para diferentes casos de uso creativo. Comprender cuándo usar cada modo es esencial para lograr resultados óptimos.
Texto a Vídeo (T2V)
- No requiere medios de entrada
- Genera solo a partir de indicaciones de texto
- Usa el modelo FL2VA
- Ideal para pruebas rápidas de conceptos
Imagen a Vídeo (I2V)
- Control del primer y/o último fotograma
- Entradas de fotogramas clave opcionales
- Usa el modelo FL2VA
- Ideal para animar imágenes estáticas
Referencia a Vídeo (R2V)
- Hasta 9 imágenes, 3 vídeos, 3 clips de audio
- Bloquea la identidad y el estilo del personaje
- Usa el modelo Ref2VA
- Mejor para trabajos de consistencia de personajes
Tabla Comparativa de Modos
| Característica | Texto a Vídeo | Imagen a Vídeo | Referencia a Vídeo |
|---|---|---|---|
| Pesos del Modelo | FL2VA | FL2VA | Ref2VA |
| Máximo de Imágenes de Referencia | 0 | 2 (primero/último) | 9 |
| Máximo de Vídeos de Referencia | 0 | 0 | 3 |
| Entradas de Audio Independientes | 0 | 0 | 3 |
| Salida de Audio Nativo | Sí | Sí | Sí |
| Mejor Caso de Uso | Exploración de conceptos | Animación de fotogramas clave | Consistencia de personajes |
Los flujos de trabajo T2V e I2V comparten los mismos pesos del modelo FL2VA. R2V utiliza un modelo de difusión Ref2VA separado. Al crear flujos de trabajo personalizados, usa un interruptor booleano conectado a tus grupos de carga de modelos para alternar fácilmente entre ellos.
Instalación y Configuración
Poner en marcha MiniMax H3 en ComfyUI requiere actualizar a una versión compatible y descargar los pesos del modelo apropiados desde Hugging Face.
Actualizar ComfyUI
Actualiza tu instalación de ComfyUI a la versión 0.30.0 o posterior. Las versiones anteriores carecen de soporte nativo para los flujos de trabajo y nodos de MiniMax H3.
Acceder a la Biblioteca de Plantillas
Navega a Template Library > Video dentro de la interfaz de ComfyUI. Selecciona cualquier flujo de trabajo de MiniMax H3 que coincida con tu modo de generación previsto.
Descargar Modelos
Sigue las indicaciones emergentes para descargar automáticamente los archivos de modelo requeridos. Los modelos están alojados en Hugging Face en el repositorio Comfy-Org/MiniMax-H3.
Configurar Resolución
Usa el nodo Resolution Selector para establecer tus dimensiones de salida. Mantén el múltiplo en 32 para que coincida con la cuadrícula de resolución de H3. Elige entre preajustes como 16:9, 9:16 o 1:1.
Ejecutar Generación
Conecta tus entradas, escribe tu indicación (prompt) y ejecuta el flujo de trabajo. El tiempo de generación depende de tu hardware, resolución y número de referencias.
Recomendaciones de Hardware
| Nivel de GPU | Mínimo | Recomendado | Gama Alta |
|---|---|---|---|
| GPU | RTX 3060 | RTX 4070 | RTX 3090/4090 |
| Versión del Modelo | int8 podado | Estándar | Estándar |
| Tiempo Est. de Gen. (10s) | 8-12 min | 5-7 min | 3-5 min |
| Res. Práctica Máxima | 864x480 | 1080p | 1216x672+ |
Para usuarios con tarjetas de 8GB de VRAM como la RTX 3060, el modelo int8 podado ofrece el mejor equilibrio entre calidad y rendimiento. Aquellos con tarjetas de 24GB (RTX 3090/4090) pueden ejecutar modelos de precisión completa a resoluciones más altas sin compromiso.
Estrategias para Escribir Prompts
La creación efectiva de prompts en MiniMax H3 requiere un enfoque estructurado que describa escenas, movimientos de cámara y señales de audio dentro de un solo bloque de texto. El modelo maneja eficazmente prompts complejos de múltiples oraciones.
Estructura de Prompt por Modo
| Modo | Estructura del Prompt | Sintaxis Clave |
|---|---|---|
| T2V | Descripción de escena, desglose de tomas, movimientos de cámara, señales de audio | Texto sin formato |
| I2V | Descripción de movimiento, estilo de transición, elementos de audio | Texto sin formato |
| Primer/Último Fotograma | Describir transición de la primera a la última imagen | Etiquetas <Picture 0> y <Picture 1> |
| R2V | Asignar roles a cada referencia explícitamente | Etiquetas <Picture 1>, <Video 1>, <Audio 1> |
Mejores Prácticas para Prompts
- Describe toda la escena primero: Indica la ubicación, el personaje y la acción antes de dividir en tomas cronometradas
- Incluye instrucciones de audio: Especifica diálogos, efectos de sonido y música dentro del mismo bloque de prompt
- Usa etiquetas de referencia en R2V: Haz referencia a cada entrada por etiqueta en el orden exacto de conexión (por ejemplo,
<Picture 1>,<Video 1>) - Asigna una función a cada referencia: Indica explícitamente qué referencia controla la identidad, el estilo, el movimiento, la cámara o la voz
- Aprovecha las etiquetas de primer/último fotograma: Aunque el modelo mapea automáticamente los fotogramas de inicio y fin, usar
<Picture 0>y<Picture 1>crea buenos hábitos para los flujos de trabajo R2V
La entrada de duración se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) del modelo a 24fps. Aunque la duración máxima establecida es de 15 segundos, las pruebas demuestran que aumentar a 20 segundos puede producir resultados coherentes sin salida distorsionada.
Optimización de Velocidad con Sage Attention
La velocidad de generación es un factor crítico al ejecutar modelos de vídeo grandes localmente. Sage Attention proporciona un aumento significativo en el rendimiento con una degradación mínima de la calidad.
Instalar SageAttention
Descarga el wheel de Python que coincida con tus versiones de PyTorch y CUDA desde la página de lanzamientos de SageAttention. Instálalo usando pip install <wheel-file>.
Instalar KJNodes
Usa ComfyUI Manager para instalar el paquete de nodos personalizados KJNodes. Alternativamente, clona el repositorio en tu directorio ComfyUI/custom_nodes/ y reinicia ComfyUI.
Añadir el Nodo de Parche
Inserta un nodo Patch Sage Attention KJ entre el nodo UNETLoader y el nodo BasicGuider. Establece el parámetro sage_attention en auto.
Ejecutar el Flujo de Trabajo
Ejecuta tu flujo de trabajo como de costumbre. Solo el guider necesita el parche; el programador (scheduler) permanece sin cambios.
Sage Attention requiere tensores float16 o bfloat16. MiniMax H3 ejecuta algunas capas en otros dtypes, por lo que es posible que veas mensajes como "Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead". Este es un comportamiento esperado y la generación seguirá funcionando correctamente.
Comparación de Optimización
| Configuración | Atención Estándar | Sage Attention | Marca Global (Flag) |
|---|---|---|---|
| Velocidad | Línea base | ~2x más rápido | ~2x más rápido |
| Calidad | Fidelidad total | Pérdida mínima | Pérdida mínima |
| Configuración | Ninguna | Basada en nodos | --use-sage-attention |
| Advertencias en Consola | Ninguna | Mensajes de respaldo esperados | Mensajes de respaldo esperados |
Arquitectura de Flujo de Trabajo y Lista de Verificación
Comprender la arquitectura de nodos te ayuda a construir y solucionar problemas en flujos de trabajo personalizados de MiniMax H3. El flujo de trabajo consta de cargadores de modelos, nodos de acondicionamiento (conditioning), un K Sampler estándar y configuración de salida.
Componentes Clave de los Nodos
| Componente | Función | Notas |
|---|---|---|
| Cargadores de Modelos (Model Loaders) | Cargan los pesos FL2VA o Ref2VA | Grupos separados para primero/último vs referencia |
| CLIP y VAE | Codificación y decodificación de texto | Compartido entre ambos tipos de modelo |
| RG3 Fast Group Bypass | Alterna el grupo de modelos activo | Asegura que solo un grupo se ejecute a la vez |
| Resolution Selector | Calcula el ancho y el alto | Las salidas se conectan a las entradas del nodo H3 |
| K Sampler | Muestreo estándar | No se necesita configuración especial |
| Salida de Vídeo (Video Output) | Renderiza el MP4 final | Admite GIF, interpolación de fotogramas |
Aunque los flujos de trabajo predeterminados muestran un número limitado de entradas, el sistema admite muchas más. Puedes expandir fácilmente a 5-6 imágenes o añadir referencias adicionales de vídeo y audio duplicando los nodos de entrada y actualizando tus etiquetas de prompt en consecuencia.
Lista de Verificación de Configuración de MiniMax H3 ComfyUI:
- Actualizar ComfyUI a la versión 0.30.0 o posterior
- Descargar los pesos del modelo desde Hugging Face (Comfy-Org/MiniMax-H3)
- Verificar que la GPU tenga al menos 8GB de VRAM (RTX 3060+)
- Asegurar suficiente RAM del sistema para la carga del modelo
- Seleccionar la variante de modelo adecuada (int8 podado para VRAM más baja)
- Establecer el múltiplo de resolución en 32 en el Resolution Selector
- Instalar Sage Attention y KJNodes para una generación más rápida
- Verificar los términos de la licencia de MiniMax H3 para tu región
Preguntas Frecuentes (FAQ)
Q: ¿Qué GPU necesito para ejecutar MiniMax H3 en ComfyUI?
Una NVIDIA RTX 3060 con suficiente memoria RAM del sistema es el requisito mínimo. Para un rendimiento óptimo, se recomienda una RTX 3090 o 4090, especialmente al trabajar con múltiples entradas de referencia a resoluciones más altas. La variante del modelo int8 podado funciona bien en tarjetas con menor VRAM.
Q: ¿Puede MiniMax H3 generar audio junto con el vídeo?
Sí, MiniMax H3 genera audio estéreo nativo que incluye diálogos, efectos de sonido y música junto con el vídeo en un solo archivo MP4. También puedes proporcionar clips de audio de referencia en el modo R2V para clonar voces o hacer coincidir estilos de audio específicos.
Q: ¿Cuántas entradas de referencia puedo usar en el modo Referencia a Vídeo?
R2V admite hasta 9 imágenes de referencia, 3 vídeos de referencia (cada uno con su propia pista de audio) y 3 clips de audio de referencia independientes. Puedes mezclar y combinar estas entradas para bloquear la identidad del personaje, el estilo, el movimiento, los movimientos de cámara y las voces.
Q: ¿Es posible exceder la duración máxima de vídeo de 15 segundos?
Aunque el máximo oficial es de 15 segundos, las pruebas demuestran que establecer la duración en 20 segundos aún puede producir resultados coherentes. La entrada de duración se ajusta a la cuadrícula de 17 fotogramas por bloque del modelo a 24fps, por lo que las duraciones siguen un patrón de incremento específico.
Q: ¿Cómo cambio entre Texto a Vídeo y Referencia a Vídeo en un solo flujo de trabajo?
Usa un nodo RG3 Fast Group Bypass para asegurarte de que solo un grupo de carga de modelos esté activo a la vez. Un interruptor booleano basado en la etiqueta establecida en los grupos de carga de modelos te permite alternar fácilmente entre el acondicionamiento y los latentes de FL2VA y Ref2VA.