MiniMax H3 AI: Guía paso a paso para la configuración en ComfyUI - Guía

MiniMax H3 AI: Guía paso a paso para la configuración en ComfyUI

Aprende cómo funciona MiniMax H3 AI en ComfyUI, incluyendo modos de vídeo, referencias, audio, resolución, duración y consejos de configuración del flujo de trabajo.

2026-08-05
Equipo de Wiki de MiniMax H3
Guía rápida
  • MiniMax H3 AI admite texto a vídeo, guía por imagen, referencias, entradas de vídeo y flujos de trabajo con audio.
  • La configuración de ComfyUI utiliza rutas de condicionamiento separadas para primer y último fotograma, y para referencia a vídeo.
  • Mejor punto de partida: prueba primero una generación corta y de baja resolución antes de añadir varias referencias.
  • Planificación de hardware: un flujo de trabajo en una 3090 puede tardar alrededor de cinco minutos o más con entradas complejas.
  • Comprobación de licencia: revisa las condiciones regionales actuales de acceso al modelo antes de usar flujos de trabajo locales.

Capacidades de MiniMax H3 AI en ComfyUI

MiniMax H3 AI es un flujo de trabajo local de generación de vídeo diseñado para ofrecer un control flexible dentro de ComfyUI. Los casos de uso más potentes incluyen texto a vídeo, animación de primer fotograma, transiciones de primer y último fotograma, escenas guiadas por referencias, combinaciones de vídeo a vídeo y generación con conciencia del audio.

Aspectos destacados del vídeo:

  • La generación de texto a vídeo puede crear escenas ilustradas a partir de prompts detallados.
  • Las imágenes inicial y final pueden controlar los fotogramas de comienzo y cierre.
  • Los flujos de trabajo con referencias pueden combinar varias imágenes, vídeos y entradas de audio.
  • El modelo puede animar personajes, transicionar entre clips y alterar la interpretación de la voz.
  • Los ajustes de salida incluyen resolución, duración, formato, guardado de imágenes y preparación para la interpolación de fotogramas.

El flujo de trabajo mostrado en el tutorial disponible de MiniMax H3 utiliza dos rutas principales de condicionamiento. La ruta de primer y último fotograma resulta útil cuando las imágenes de inicio y cierre deben permanecer claras. La ruta de referencia a vídeo es más flexible cuando varias imágenes, clips o fuentes de sonido deben influir en el resultado sin definir de forma rígida el primer y el último fotograma exactos.

Modo de flujo de trabajoEntradas principalesMejor uso
Texto a vídeoSolo promptProbar conceptos y generar una escena original
Vídeo con primer fotogramaPrompt, imagen inicialAnimar un visual existente
Primer y último fotogramaPrompt, imagen de inicio, imagen de cierreTransiciones y transformaciones controladas
Referencia a vídeoVarias imágenes, vídeos, audioPersonaje, estilo, movimiento y composición de escena
Flujo de trabajo con audioAudio del vídeo, entradas de audio separadasDiálogo, música, voz y conceptos guiados por sonido

Un prompt detallado puede describir varias acciones conectadas, como pasar de un personaje a un objeto y después a un entorno lejano. Esto hace que MiniMax H3 sea útil para transiciones surrealistas, composiciones recursivas y clips narrativos que dependen de más de un momento visual.

Consejo del editor

Empieza con un prompt y una sola imagen de entrada. Añade referencias solo después de que el flujo de trabajo básico produzca un movimiento, un encuadre y una identidad del sujeto estables.

Configuración del flujo de trabajo en ComfyUI

Una configuración práctica de MiniMax H3 comienza con el cargador de modelo correcto, componentes de clip y VAE coincidentes, y una ruta de condicionamiento claramente separada. El flujo de trabajo mostrado usa un interruptor de omisión para que el grupo de primer y último fotograma y el grupo de referencia a vídeo puedan alternarse sin reconstruir el grafo.

Las fases de KSampler y salida de vídeo siguen siendo familiares para los usuarios de ComfyUI. La principal complejidad está en preparar las entradas de condicionamiento y seleccionar la ruta de modelo correcta. Mantén estas secciones agrupadas visualmente para que los cambios futuros sean más fáciles de depurar.

Componente del flujo de trabajoPropósitoGuía de configuración
Cargadores de modeloCargan las variantes de modelo H3 necesariasMantén los cargadores de primer y último fotograma y los de referencia en grupos separados
Clip y VAECodifican prompts y datos visualesUsa los componentes coincidentes que requiere el flujo de trabajo
Interruptor de omisiónActiva un grupo de flujo de trabajo a la vezEtiqueta los grupos con claridad antes de cambiar de modo
Selector de resoluciónDefine el ancho y alto de salidaEmpieza con una resolución más pequeña para probar
Selector de duraciónDefine la duración del clipComienza cerca de la duración recomendada antes de ampliarla
KSamplerGenera el resultado de vídeo latenteLa fase de muestreo sigue un patrón estándar de ComfyUI
Salida de vídeoGuarda el clip final y los recursos relacionadosElige un prefijo y un formato de salida adecuados
1

Prepara los grupos de modelo

Coloca el cargador de primer y último fotograma y el cargador de referencia a vídeo en grupos separados y etiquetados. Confirma que los componentes de clip y VAE estén conectados a la ruta prevista.

2

Añade el selector de entradas

Crea una sección de prompt y de entrada que pueda aceptar texto, imágenes, vídeos y audio donde sea compatible. Mantén las entradas no utilizadas desconectadas hasta que la prueba básica tenga éxito.

3

Configura la resolución y la duración

Selecciona una resolución conservadora y una duración corta. El flujo de trabajo mostrado comienza en 864×480 para una prueba inicial y luego usa resoluciones más altas como 1216×672.

4

Conecta el muestreo y la salida

Envía el condicionamiento activo y los datos latentes a través de KSampler y luego conecta el resultado al nodo de salida de vídeo. Establece el prefijo del archivo y el formato de vídeo preferido.

El tutorial señala que una GPU 3060 o más reciente puede ser viable si hay suficiente RAM disponible, mientras que la configuración mostrada en una 3090 puede requerir aproximadamente cinco minutos o más para trabajos complejos de referencia a vídeo. El tiempo real de generación depende de la resolución, la duración, la cantidad de entradas y el hardware local.

Advertencia de hardware

No juzgues el rendimiento a partir de un clip simple de baja resolución. Varios vídeos, pistas de audio, alta resolución y duraciones más largas pueden aumentar considerablemente el tiempo de procesamiento.

Control de prompts y referencias

El diseño del prompt cambia según si las imágenes definen puntos finales exactos o actúan como referencias generales. Para la generación de primer y último fotograma, el modelo ya usa las imágenes proporcionadas como límites de inicio y fin. El prompt describe principalmente cómo ocurre la transición.

Para la generación de referencia a vídeo, usa referencias explícitas de imagen y vídeo en el prompt cuando el flujo de trabajo admita entradas indexadas. El método mostrado utiliza etiquetas como “picture zero”, “picture one”, “video zero” y “video one”. Una indexación coherente ayuda a aclarar qué sujeto, acción o estilo pertenece a cada entrada.

Dirección del texto

Describe el sujeto, el entorno, el movimiento, el comportamiento de la cámara y el estilo visual en un orden claro.

Transición de fotogramas

Explica cómo la imagen inicial cambia en la imagen final, incluyendo barridos, fundidos, zooms o transformaciones.

Identidad de la referencia

Asigna a cada imagen o vídeo un papel claro, como personaje, objeto, entorno o guía de movimiento.

Intención del audio

Indica si el resultado debe preservar, reformular, reemplazar o ampliar creativamente el sonido proporcionado.

Una estructura de prompt útil es:

  1. Identifica la escena general.
  2. Define los sujetos y sus relaciones.
  3. Describe el movimiento y la progresión de la cámara.
  4. Haz referencia a imágenes o vídeos indexados cuando sea necesario.
  5. Especifica el sonido, el diálogo, la música o el comportamiento de transición.
  6. Añade el estilo y la intención de salida.

El modelo de referencias puede combinar varios tipos de entrada diferentes. El tutorial muestra cuatro imágenes, un vídeo y el audio de ese vídeo en una única configuración creativa. Las entradas pueden diferir en tamaño, fondo, medio y estilo visual, así que el prompt debe explicar cómo encajan entre sí.

Elemento del promptDirección de ejemploPor qué importa
Sujeto“Aparece un robot blanco junto al portátil”Establece el papel visual principal
Movimiento“La cámara se mueve desde la pantalla hacia la siguiente escena”Guía la continuidad temporal
Referencia“Usa picture zero para el diseño del robot”Conecta el lenguaje con una entrada específica
Transición“Integra la habitación en una vista de espejo”Define cómo cambia la toma
Audio“Preserva el ritmo del diálogo y añade música”Aclara el comportamiento del sonido
Patrón de prompt fiable

Escribe el prompt como una secuencia de eventos visibles en lugar de una lista de objetos desconectados. Un orden claro de acciones suele dar al modelo una guía temporal más sólida.

Modos de vídeo, duración y calidad de salida

MiniMax H3 puede probarse en varios niveles de complejidad. Un clip corto de texto a vídeo es la forma más rápida de verificar que el cargador del modelo, la codificación del prompt, el sampler y el nodo de salida están conectados correctamente. Después de eso, añade una imagen inicial, luego prueba una transición de primer y último fotograma y, por último, pasa a varias referencias.

Los ejemplos mostrados incluyen un clip de baja resolución de 864×480 y un resultado de mayor resolución de 1216×672. Estos valores deben tratarse como ejemplos de flujo de trabajo y no como preajustes universales. La configuración adecuada depende de la memoria disponible, el nivel de detalle deseado y cuántas entradas estén activas.

Fase de pruebaEntradasResolución de ejemploObjetivo recomendado
Prueba básica del promptPrompt de texto864×480Confirmar que el grafo genera un clip reproducible
Prueba guiada por imagenPrompt, primera imagen864×480 o similarComprobar el movimiento del sujeto y la interpretación de la imagen
Transición de límitesPrompt, primera y última imagenResolución moderadaEvaluar el tiempo y la coherencia del punto final
Escena con referenciasVarias imágenes o vídeosMayor resolución cuando sea prácticoProbar identidad, composición y mezcla entre entradas
Referencia de audioEntradas de vídeo o audioSegún la capacidad del hardwareEvaluar el comportamiento del diálogo, la música y la voz

Se describe que el modelo admite clips de hasta 15 segundos, pero el flujo de trabajo mostrado también probó una configuración de 20 segundos sin producir un resultado inutilizable. La generación más larga debe seguir tratándose como experimental, porque la estabilidad temporal, el uso de memoria y la coherencia visual pueden cambiar a medida que aumenta la duración.

El nodo de salida puede guardar el vídeo generado, la imagen final y el conjunto de audio para procesarlos más adelante. Esto resulta útil si planeas aplicar interpolación de fotogramas con herramientas como FILM o RIFE. Un multiplicador de dos puede producir un resultado de 48 FPS cuando la fuente es de 24 FPS, pero el aspecto final depende del clip de origen y de los ajustes de interpolación.

Antes de renderizar:

  • Confirma que solo está activo el grupo de modelo previsto
  • Comprueba que las referencias del prompt coincidan con los índices de entrada
  • Usa una duración corta para el primer renderizado
  • Verifica la resolución y la memoria disponible
  • Elige el formato de salida y el prefijo del archivo
Comprobación de calidad

Si un resultado parece inestable, reduce el número de referencias antes de reescribir todo el prompt. La complejidad de las entradas suele ser la primera variable que conviene aislar.

Acceso local, licencias y buenas prácticas

La generación local ofrece control sobre la organización del flujo de trabajo, los ajustes de salida y la preparación de referencias, pero las condiciones de acceso al modelo siguen siendo importantes. El tutorial mostrado plantea una preocupación de licencia regional para descargar o usar el modelo MiniMax en Estados Unidos y la Unión Europea. También señala que puede haber disponible un formulario de solicitud de licencia y que la aprobación puede llegar rápidamente.

Toma esa información como un punto de control, no como un sustituto de la lectura de las condiciones actuales. Antes de configurar un flujo de trabajo local, revisa las últimas condiciones a través del sitio web oficial de MiniMax y confirma si tu ubicación y caso de uso previstos están cubiertos a fecha de 5 de agosto de 2026.

Buena prácticaMotivo
Revisa la licencia actualEl acceso regional y los usos permitidos pueden cambiar
Mantén etiquetados los grupos del flujo de trabajoUna organización clara facilita la depuración
Guarda los detalles del prompt y de las entradasLa reproducibilidad mejora al probar variaciones
Prueba una variable a la vezAísla problemas de duración, referencias o resolución
Conserva el audio original por separadoFacilita comparar más tarde la voz y el sonido
Evita asumir la precisión del textoEl texto pequeño puede funcionar en algunas escenas, pero sigue siendo difícil

MiniMax H3 encaja especialmente bien con flujos de trabajo modulares de ComfyUI. Un grafo bien organizado puede exponer controles separados para el condicionamiento de primer y último fotograma, las entradas de referencia, la resolución, la duración, el formato de salida y el audio opcional. Esta estructura también facilita ampliar de dos entradas de imagen a más referencias cuando la escena lo requiera.

La progresión más práctica es establecer una base fiable y luego aumentar la complejidad gradualmente. Evita cambiar al mismo tiempo el prompt, la resolución, la duración, los ajustes del sampler y la cantidad de entradas. Los ajustes pequeños y controlados facilitan identificar por qué una generación mejoró o empeoró.

Consejo profesional de flujo de trabajo

Guarda una base funcional antes de experimentar. Duplica el grafo, cambia un solo ajuste y registra el resultado para que las configuraciones exitosas sigan siendo fáciles de recuperar.

Q: ¿Para qué se usa mejor MiniMax H3 AI en ComfyUI?

Es ideal para texto a vídeo, animación guiada por imagen, transiciones de primer y último fotograma, escenas basadas en referencias, mezcla de vídeo y experimentos con conciencia del audio.

Q: ¿MiniMax H3 puede usar más de una imagen?

Sí. El flujo de trabajo de referencia a vídeo puede usar varias imágenes, y la configuración mostrada combina cuatro imágenes con un vídeo y su audio.

Q: ¿MiniMax H3 admite cambios de audio y voz?

El flujo de trabajo mostrado utiliza audio de vídeo, entradas de audio separadas, música, diálogo y transformaciones de estilo clonación de voz. Los resultados dependen de las entradas y de la configuración local.

Q: ¿Cuánto tarda una generación de MiniMax H3?

El tiempo de procesamiento varía según el hardware, la resolución, la duración y la cantidad de entradas. Un trabajo complejo de referencia a vídeo en una 3090 puede tardar alrededor de cinco minutos o más.