MiniMax H3 ComfyUI: Guía de Configuración y Consejos de Flujo de Trabajo - Código abierto

MiniMax H3 ComfyUI: Guía de Configuración y Consejos de Flujo de Trabajo

Aprende a ejecutar MiniMax H3 en ComfyUI para la generación local de vídeo con IA. Cubre flujos de trabajo de texto a vídeo, imagen a vídeo y referencia a vídeo.

2026-08-10
Equipo del Wiki de MiniMax H3
Guía Rápida
  • MiniMax H3 en ComfyUI: Ejecuta la generación de vídeo con IA de pesos abiertos localmente con control total de los parámetros
  • Tres modos principales: Texto a Vídeo (T2V), Imagen a Vídeo (I2V) y Referencia a Vídeo (R2V)
  • Audio estéreo nativo: Diálogos, efectos de sonido (SFX) y música se generan junto con el vídeo
  • Requisito de hardware: NVIDIA RTX 3060 o superior con suficiente memoria RAM del sistema
  • Optimización de velocidad: Instala Sage Attention para duplicar aproximadamente la velocidad de generación

Descripción General de MiniMax H3 ComfyUI

MiniMax H3 lleva la potente generación de vídeo con IA de pesos abiertos directamente a tu máquina local a través de ComfyUI. Esta integración permite a los creadores generar contenido de vídeo de alta calidad con audio estéreo nativo, combinando indicaciones de texto (prompts), imágenes de referencia y clips de vídeo en salidas multimodales cohesivas. Ejecutarlo localmente proporciona control total sobre cada parámetro sin depender de APIs en la nube.

Puntos Destacados del Vídeo:

  • Generación local de texto a vídeo utilizando el modelo int8 podado en una RTX 3090
  • Transiciones de imagen a vídeo de primer y último fotograma con efectos de barrido y fase
  • Referencia a vídeo combinando múltiples imágenes, clips de vídeo y pistas de audio
  • Capacidades de clonación de voz mediante la fusión de apariencias y voces de personajes de clips separados
  • Superando con éxito el límite máximo de duración de 15 segundos
Nota sobre Licencias

La licencia de MiniMax H3 restringe las descargas en EE. UU. y la Unión Europea por defecto. Sin embargo, los individuos pueden solicitar acceso enviando un formulario de solicitud de licencia. Los correos electrónicos de aprobación suelen enviarse rápidamente. Siempre realiza tu propia investigación con respecto a tus derechos de uso específicos.

Modos Principales de Generación

MiniMax H3 opera a través de tres flujos de trabajo de generación principales, cada uno diseñado para diferentes casos de uso creativo. Comprender cuándo usar cada modo es esencial para lograr resultados óptimos.

Texto a Vídeo (T2V)

  • No requiere medios de entrada
  • Genera solo a partir de indicaciones de texto
  • Usa el modelo FL2VA
  • Ideal para pruebas rápidas de conceptos

Imagen a Vídeo (I2V)

  • Control del primer y/o último fotograma
  • Entradas de fotogramas clave opcionales
  • Usa el modelo FL2VA
  • Ideal para animar imágenes estáticas

Referencia a Vídeo (R2V)

  • Hasta 9 imágenes, 3 vídeos, 3 clips de audio
  • Bloquea la identidad y el estilo del personaje
  • Usa el modelo Ref2VA
  • Mejor para trabajos de consistencia de personajes

Tabla Comparativa de Modos

CaracterísticaTexto a VídeoImagen a VídeoReferencia a Vídeo
Pesos del ModeloFL2VAFL2VARef2VA
Máximo de Imágenes de Referencia02 (primero/último)9
Máximo de Vídeos de Referencia003
Entradas de Audio Independientes003
Salida de Audio Nativo
Mejor Caso de UsoExploración de conceptosAnimación de fotogramas claveConsistencia de personajes
Selección de Modelo

Los flujos de trabajo T2V e I2V comparten los mismos pesos del modelo FL2VA. R2V utiliza un modelo de difusión Ref2VA separado. Al crear flujos de trabajo personalizados, usa un interruptor booleano conectado a tus grupos de carga de modelos para alternar fácilmente entre ellos.

Instalación y Configuración

Poner en marcha MiniMax H3 en ComfyUI requiere actualizar a una versión compatible y descargar los pesos del modelo apropiados desde Hugging Face.

1

Actualizar ComfyUI

Actualiza tu instalación de ComfyUI a la versión 0.30.0 o posterior. Las versiones anteriores carecen de soporte nativo para los flujos de trabajo y nodos de MiniMax H3.

2

Acceder a la Biblioteca de Plantillas

Navega a Template Library > Video dentro de la interfaz de ComfyUI. Selecciona cualquier flujo de trabajo de MiniMax H3 que coincida con tu modo de generación previsto.

3

Descargar Modelos

Sigue las indicaciones emergentes para descargar automáticamente los archivos de modelo requeridos. Los modelos están alojados en Hugging Face en el repositorio Comfy-Org/MiniMax-H3.

4

Configurar Resolución

Usa el nodo Resolution Selector para establecer tus dimensiones de salida. Mantén el múltiplo en 32 para que coincida con la cuadrícula de resolución de H3. Elige entre preajustes como 16:9, 9:16 o 1:1.

5

Ejecutar Generación

Conecta tus entradas, escribe tu indicación (prompt) y ejecuta el flujo de trabajo. El tiempo de generación depende de tu hardware, resolución y número de referencias.

Recomendaciones de Hardware

Nivel de GPUMínimoRecomendadoGama Alta
GPURTX 3060RTX 4070RTX 3090/4090
Versión del Modeloint8 podadoEstándarEstándar
Tiempo Est. de Gen. (10s)8-12 min5-7 min3-5 min
Res. Práctica Máxima864x4801080p1216x672+
Variantes del Modelo

Para usuarios con tarjetas de 8GB de VRAM como la RTX 3060, el modelo int8 podado ofrece el mejor equilibrio entre calidad y rendimiento. Aquellos con tarjetas de 24GB (RTX 3090/4090) pueden ejecutar modelos de precisión completa a resoluciones más altas sin compromiso.

Estrategias para Escribir Prompts

La creación efectiva de prompts en MiniMax H3 requiere un enfoque estructurado que describa escenas, movimientos de cámara y señales de audio dentro de un solo bloque de texto. El modelo maneja eficazmente prompts complejos de múltiples oraciones.

Estructura de Prompt por Modo

ModoEstructura del PromptSintaxis Clave
T2VDescripción de escena, desglose de tomas, movimientos de cámara, señales de audioTexto sin formato
I2VDescripción de movimiento, estilo de transición, elementos de audioTexto sin formato
Primer/Último FotogramaDescribir transición de la primera a la última imagenEtiquetas <Picture 0> y <Picture 1>
R2VAsignar roles a cada referencia explícitamenteEtiquetas <Picture 1>, <Video 1>, <Audio 1>

Mejores Prácticas para Prompts

  • Describe toda la escena primero: Indica la ubicación, el personaje y la acción antes de dividir en tomas cronometradas
  • Incluye instrucciones de audio: Especifica diálogos, efectos de sonido y música dentro del mismo bloque de prompt
  • Usa etiquetas de referencia en R2V: Haz referencia a cada entrada por etiqueta en el orden exacto de conexión (por ejemplo, <Picture 1>, <Video 1>)
  • Asigna una función a cada referencia: Indica explícitamente qué referencia controla la identidad, el estilo, el movimiento, la cámara o la voz
  • Aprovecha las etiquetas de primer/último fotograma: Aunque el modelo mapea automáticamente los fotogramas de inicio y fin, usar <Picture 0> y <Picture 1> crea buenos hábitos para los flujos de trabajo R2V
Control de Duración

La entrada de duración se ajusta a la cuadrícula de 17 fotogramas por bloque (17k+5) del modelo a 24fps. Aunque la duración máxima establecida es de 15 segundos, las pruebas demuestran que aumentar a 20 segundos puede producir resultados coherentes sin salida distorsionada.

Optimización de Velocidad con Sage Attention

La velocidad de generación es un factor crítico al ejecutar modelos de vídeo grandes localmente. Sage Attention proporciona un aumento significativo en el rendimiento con una degradación mínima de la calidad.

1

Instalar SageAttention

Descarga el wheel de Python que coincida con tus versiones de PyTorch y CUDA desde la página de lanzamientos de SageAttention. Instálalo usando pip install <wheel-file>.

2

Instalar KJNodes

Usa ComfyUI Manager para instalar el paquete de nodos personalizados KJNodes. Alternativamente, clona el repositorio en tu directorio ComfyUI/custom_nodes/ y reinicia ComfyUI.

3

Añadir el Nodo de Parche

Inserta un nodo Patch Sage Attention KJ entre el nodo UNETLoader y el nodo BasicGuider. Establece el parámetro sage_attention en auto.

4

Ejecutar el Flujo de Trabajo

Ejecuta tu flujo de trabajo como de costumbre. Solo el guider necesita el parche; el programador (scheduler) permanece sin cambios.

Mensajes Esperados en la Consola

Sage Attention requiere tensores float16 o bfloat16. MiniMax H3 ejecuta algunas capas en otros dtypes, por lo que es posible que veas mensajes como "Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead". Este es un comportamiento esperado y la generación seguirá funcionando correctamente.

Comparación de Optimización

ConfiguraciónAtención EstándarSage AttentionMarca Global (Flag)
VelocidadLínea base~2x más rápido~2x más rápido
CalidadFidelidad totalPérdida mínimaPérdida mínima
ConfiguraciónNingunaBasada en nodos--use-sage-attention
Advertencias en ConsolaNingunaMensajes de respaldo esperadosMensajes de respaldo esperados

Arquitectura de Flujo de Trabajo y Lista de Verificación

Comprender la arquitectura de nodos te ayuda a construir y solucionar problemas en flujos de trabajo personalizados de MiniMax H3. El flujo de trabajo consta de cargadores de modelos, nodos de acondicionamiento (conditioning), un K Sampler estándar y configuración de salida.

Componentes Clave de los Nodos

ComponenteFunciónNotas
Cargadores de Modelos (Model Loaders)Cargan los pesos FL2VA o Ref2VAGrupos separados para primero/último vs referencia
CLIP y VAECodificación y decodificación de textoCompartido entre ambos tipos de modelo
RG3 Fast Group BypassAlterna el grupo de modelos activoAsegura que solo un grupo se ejecute a la vez
Resolution SelectorCalcula el ancho y el altoLas salidas se conectan a las entradas del nodo H3
K SamplerMuestreo estándarNo se necesita configuración especial
Salida de Vídeo (Video Output)Renderiza el MP4 finalAdmite GIF, interpolación de fotogramas
Expansión de Entradas

Aunque los flujos de trabajo predeterminados muestran un número limitado de entradas, el sistema admite muchas más. Puedes expandir fácilmente a 5-6 imágenes o añadir referencias adicionales de vídeo y audio duplicando los nodos de entrada y actualizando tus etiquetas de prompt en consecuencia.

Lista de Verificación de Configuración de MiniMax H3 ComfyUI:

  • Actualizar ComfyUI a la versión 0.30.0 o posterior
  • Descargar los pesos del modelo desde Hugging Face (Comfy-Org/MiniMax-H3)
  • Verificar que la GPU tenga al menos 8GB de VRAM (RTX 3060+)
  • Asegurar suficiente RAM del sistema para la carga del modelo
  • Seleccionar la variante de modelo adecuada (int8 podado para VRAM más baja)
  • Establecer el múltiplo de resolución en 32 en el Resolution Selector
  • Instalar Sage Attention y KJNodes para una generación más rápida
  • Verificar los términos de la licencia de MiniMax H3 para tu región

Preguntas Frecuentes (FAQ)

Q: ¿Qué GPU necesito para ejecutar MiniMax H3 en ComfyUI?

Una NVIDIA RTX 3060 con suficiente memoria RAM del sistema es el requisito mínimo. Para un rendimiento óptimo, se recomienda una RTX 3090 o 4090, especialmente al trabajar con múltiples entradas de referencia a resoluciones más altas. La variante del modelo int8 podado funciona bien en tarjetas con menor VRAM.

Q: ¿Puede MiniMax H3 generar audio junto con el vídeo?

Sí, MiniMax H3 genera audio estéreo nativo que incluye diálogos, efectos de sonido y música junto con el vídeo en un solo archivo MP4. También puedes proporcionar clips de audio de referencia en el modo R2V para clonar voces o hacer coincidir estilos de audio específicos.

Q: ¿Cuántas entradas de referencia puedo usar en el modo Referencia a Vídeo?

R2V admite hasta 9 imágenes de referencia, 3 vídeos de referencia (cada uno con su propia pista de audio) y 3 clips de audio de referencia independientes. Puedes mezclar y combinar estas entradas para bloquear la identidad del personaje, el estilo, el movimiento, los movimientos de cámara y las voces.

Q: ¿Es posible exceder la duración máxima de vídeo de 15 segundos?

Aunque el máximo oficial es de 15 segundos, las pruebas demuestran que establecer la duración en 20 segundos aún puede producir resultados coherentes. La entrada de duración se ajusta a la cuadrícula de 17 fotogramas por bloque del modelo a 24fps, por lo que las duraciones siguen un patrón de incremento específico.

Q: ¿Cómo cambio entre Texto a Vídeo y Referencia a Vídeo en un solo flujo de trabajo?

Usa un nodo RG3 Fast Group Bypass para asegurarte de que solo un grupo de carga de modelos esté activo a la vez. Un interruptor booleano basado en la etiqueta establecida en los grupos de carga de modelos te permite alternar fácilmente entre el acondicionamiento y los latentes de FL2VA y Ref2VA.