- MiniMax H3 AI admite texto a vídeo, guía por imagen, referencias, entradas de vídeo y flujos de trabajo con audio.
- La configuración de ComfyUI utiliza rutas de condicionamiento separadas para primer y último fotograma, y para referencia a vídeo.
- Mejor punto de partida: prueba primero una generación corta y de baja resolución antes de añadir varias referencias.
- Planificación de hardware: un flujo de trabajo en una 3090 puede tardar alrededor de cinco minutos o más con entradas complejas.
- Comprobación de licencia: revisa las condiciones regionales actuales de acceso al modelo antes de usar flujos de trabajo locales.
Capacidades de MiniMax H3 AI en ComfyUI
MiniMax H3 AI es un flujo de trabajo local de generación de vídeo diseñado para ofrecer un control flexible dentro de ComfyUI. Los casos de uso más potentes incluyen texto a vídeo, animación de primer fotograma, transiciones de primer y último fotograma, escenas guiadas por referencias, combinaciones de vídeo a vídeo y generación con conciencia del audio.
Aspectos destacados del vídeo:
- La generación de texto a vídeo puede crear escenas ilustradas a partir de prompts detallados.
- Las imágenes inicial y final pueden controlar los fotogramas de comienzo y cierre.
- Los flujos de trabajo con referencias pueden combinar varias imágenes, vídeos y entradas de audio.
- El modelo puede animar personajes, transicionar entre clips y alterar la interpretación de la voz.
- Los ajustes de salida incluyen resolución, duración, formato, guardado de imágenes y preparación para la interpolación de fotogramas.
El flujo de trabajo mostrado en el tutorial disponible de MiniMax H3 utiliza dos rutas principales de condicionamiento. La ruta de primer y último fotograma resulta útil cuando las imágenes de inicio y cierre deben permanecer claras. La ruta de referencia a vídeo es más flexible cuando varias imágenes, clips o fuentes de sonido deben influir en el resultado sin definir de forma rígida el primer y el último fotograma exactos.
| Modo de flujo de trabajo | Entradas principales | Mejor uso |
|---|---|---|
| Texto a vídeo | Solo prompt | Probar conceptos y generar una escena original |
| Vídeo con primer fotograma | Prompt, imagen inicial | Animar un visual existente |
| Primer y último fotograma | Prompt, imagen de inicio, imagen de cierre | Transiciones y transformaciones controladas |
| Referencia a vídeo | Varias imágenes, vídeos, audio | Personaje, estilo, movimiento y composición de escena |
| Flujo de trabajo con audio | Audio del vídeo, entradas de audio separadas | Diálogo, música, voz y conceptos guiados por sonido |
Un prompt detallado puede describir varias acciones conectadas, como pasar de un personaje a un objeto y después a un entorno lejano. Esto hace que MiniMax H3 sea útil para transiciones surrealistas, composiciones recursivas y clips narrativos que dependen de más de un momento visual.
Empieza con un prompt y una sola imagen de entrada. Añade referencias solo después de que el flujo de trabajo básico produzca un movimiento, un encuadre y una identidad del sujeto estables.
Configuración del flujo de trabajo en ComfyUI
Una configuración práctica de MiniMax H3 comienza con el cargador de modelo correcto, componentes de clip y VAE coincidentes, y una ruta de condicionamiento claramente separada. El flujo de trabajo mostrado usa un interruptor de omisión para que el grupo de primer y último fotograma y el grupo de referencia a vídeo puedan alternarse sin reconstruir el grafo.
Las fases de KSampler y salida de vídeo siguen siendo familiares para los usuarios de ComfyUI. La principal complejidad está en preparar las entradas de condicionamiento y seleccionar la ruta de modelo correcta. Mantén estas secciones agrupadas visualmente para que los cambios futuros sean más fáciles de depurar.
| Componente del flujo de trabajo | Propósito | Guía de configuración |
|---|---|---|
| Cargadores de modelo | Cargan las variantes de modelo H3 necesarias | Mantén los cargadores de primer y último fotograma y los de referencia en grupos separados |
| Clip y VAE | Codifican prompts y datos visuales | Usa los componentes coincidentes que requiere el flujo de trabajo |
| Interruptor de omisión | Activa un grupo de flujo de trabajo a la vez | Etiqueta los grupos con claridad antes de cambiar de modo |
| Selector de resolución | Define el ancho y alto de salida | Empieza con una resolución más pequeña para probar |
| Selector de duración | Define la duración del clip | Comienza cerca de la duración recomendada antes de ampliarla |
| KSampler | Genera el resultado de vídeo latente | La fase de muestreo sigue un patrón estándar de ComfyUI |
| Salida de vídeo | Guarda el clip final y los recursos relacionados | Elige un prefijo y un formato de salida adecuados |
Prepara los grupos de modelo
Coloca el cargador de primer y último fotograma y el cargador de referencia a vídeo en grupos separados y etiquetados. Confirma que los componentes de clip y VAE estén conectados a la ruta prevista.
Añade el selector de entradas
Crea una sección de prompt y de entrada que pueda aceptar texto, imágenes, vídeos y audio donde sea compatible. Mantén las entradas no utilizadas desconectadas hasta que la prueba básica tenga éxito.
Configura la resolución y la duración
Selecciona una resolución conservadora y una duración corta. El flujo de trabajo mostrado comienza en 864×480 para una prueba inicial y luego usa resoluciones más altas como 1216×672.
Conecta el muestreo y la salida
Envía el condicionamiento activo y los datos latentes a través de KSampler y luego conecta el resultado al nodo de salida de vídeo. Establece el prefijo del archivo y el formato de vídeo preferido.
El tutorial señala que una GPU 3060 o más reciente puede ser viable si hay suficiente RAM disponible, mientras que la configuración mostrada en una 3090 puede requerir aproximadamente cinco minutos o más para trabajos complejos de referencia a vídeo. El tiempo real de generación depende de la resolución, la duración, la cantidad de entradas y el hardware local.
No juzgues el rendimiento a partir de un clip simple de baja resolución. Varios vídeos, pistas de audio, alta resolución y duraciones más largas pueden aumentar considerablemente el tiempo de procesamiento.
Control de prompts y referencias
El diseño del prompt cambia según si las imágenes definen puntos finales exactos o actúan como referencias generales. Para la generación de primer y último fotograma, el modelo ya usa las imágenes proporcionadas como límites de inicio y fin. El prompt describe principalmente cómo ocurre la transición.
Para la generación de referencia a vídeo, usa referencias explícitas de imagen y vídeo en el prompt cuando el flujo de trabajo admita entradas indexadas. El método mostrado utiliza etiquetas como “picture zero”, “picture one”, “video zero” y “video one”. Una indexación coherente ayuda a aclarar qué sujeto, acción o estilo pertenece a cada entrada.
Dirección del texto
Describe el sujeto, el entorno, el movimiento, el comportamiento de la cámara y el estilo visual en un orden claro.
Transición de fotogramas
Explica cómo la imagen inicial cambia en la imagen final, incluyendo barridos, fundidos, zooms o transformaciones.
Identidad de la referencia
Asigna a cada imagen o vídeo un papel claro, como personaje, objeto, entorno o guía de movimiento.
Intención del audio
Indica si el resultado debe preservar, reformular, reemplazar o ampliar creativamente el sonido proporcionado.
Una estructura de prompt útil es:
- Identifica la escena general.
- Define los sujetos y sus relaciones.
- Describe el movimiento y la progresión de la cámara.
- Haz referencia a imágenes o vídeos indexados cuando sea necesario.
- Especifica el sonido, el diálogo, la música o el comportamiento de transición.
- Añade el estilo y la intención de salida.
El modelo de referencias puede combinar varios tipos de entrada diferentes. El tutorial muestra cuatro imágenes, un vídeo y el audio de ese vídeo en una única configuración creativa. Las entradas pueden diferir en tamaño, fondo, medio y estilo visual, así que el prompt debe explicar cómo encajan entre sí.
| Elemento del prompt | Dirección de ejemplo | Por qué importa |
|---|---|---|
| Sujeto | “Aparece un robot blanco junto al portátil” | Establece el papel visual principal |
| Movimiento | “La cámara se mueve desde la pantalla hacia la siguiente escena” | Guía la continuidad temporal |
| Referencia | “Usa picture zero para el diseño del robot” | Conecta el lenguaje con una entrada específica |
| Transición | “Integra la habitación en una vista de espejo” | Define cómo cambia la toma |
| Audio | “Preserva el ritmo del diálogo y añade música” | Aclara el comportamiento del sonido |
Escribe el prompt como una secuencia de eventos visibles en lugar de una lista de objetos desconectados. Un orden claro de acciones suele dar al modelo una guía temporal más sólida.
Modos de vídeo, duración y calidad de salida
MiniMax H3 puede probarse en varios niveles de complejidad. Un clip corto de texto a vídeo es la forma más rápida de verificar que el cargador del modelo, la codificación del prompt, el sampler y el nodo de salida están conectados correctamente. Después de eso, añade una imagen inicial, luego prueba una transición de primer y último fotograma y, por último, pasa a varias referencias.
Los ejemplos mostrados incluyen un clip de baja resolución de 864×480 y un resultado de mayor resolución de 1216×672. Estos valores deben tratarse como ejemplos de flujo de trabajo y no como preajustes universales. La configuración adecuada depende de la memoria disponible, el nivel de detalle deseado y cuántas entradas estén activas.
| Fase de prueba | Entradas | Resolución de ejemplo | Objetivo recomendado |
|---|---|---|---|
| Prueba básica del prompt | Prompt de texto | 864×480 | Confirmar que el grafo genera un clip reproducible |
| Prueba guiada por imagen | Prompt, primera imagen | 864×480 o similar | Comprobar el movimiento del sujeto y la interpretación de la imagen |
| Transición de límites | Prompt, primera y última imagen | Resolución moderada | Evaluar el tiempo y la coherencia del punto final |
| Escena con referencias | Varias imágenes o vídeos | Mayor resolución cuando sea práctico | Probar identidad, composición y mezcla entre entradas |
| Referencia de audio | Entradas de vídeo o audio | Según la capacidad del hardware | Evaluar el comportamiento del diálogo, la música y la voz |
Se describe que el modelo admite clips de hasta 15 segundos, pero el flujo de trabajo mostrado también probó una configuración de 20 segundos sin producir un resultado inutilizable. La generación más larga debe seguir tratándose como experimental, porque la estabilidad temporal, el uso de memoria y la coherencia visual pueden cambiar a medida que aumenta la duración.
El nodo de salida puede guardar el vídeo generado, la imagen final y el conjunto de audio para procesarlos más adelante. Esto resulta útil si planeas aplicar interpolación de fotogramas con herramientas como FILM o RIFE. Un multiplicador de dos puede producir un resultado de 48 FPS cuando la fuente es de 24 FPS, pero el aspecto final depende del clip de origen y de los ajustes de interpolación.
Antes de renderizar:
- Confirma que solo está activo el grupo de modelo previsto
- Comprueba que las referencias del prompt coincidan con los índices de entrada
- Usa una duración corta para el primer renderizado
- Verifica la resolución y la memoria disponible
- Elige el formato de salida y el prefijo del archivo
Si un resultado parece inestable, reduce el número de referencias antes de reescribir todo el prompt. La complejidad de las entradas suele ser la primera variable que conviene aislar.
Acceso local, licencias y buenas prácticas
La generación local ofrece control sobre la organización del flujo de trabajo, los ajustes de salida y la preparación de referencias, pero las condiciones de acceso al modelo siguen siendo importantes. El tutorial mostrado plantea una preocupación de licencia regional para descargar o usar el modelo MiniMax en Estados Unidos y la Unión Europea. También señala que puede haber disponible un formulario de solicitud de licencia y que la aprobación puede llegar rápidamente.
Toma esa información como un punto de control, no como un sustituto de la lectura de las condiciones actuales. Antes de configurar un flujo de trabajo local, revisa las últimas condiciones a través del sitio web oficial de MiniMax y confirma si tu ubicación y caso de uso previstos están cubiertos a fecha de 5 de agosto de 2026.
| Buena práctica | Motivo |
|---|---|
| Revisa la licencia actual | El acceso regional y los usos permitidos pueden cambiar |
| Mantén etiquetados los grupos del flujo de trabajo | Una organización clara facilita la depuración |
| Guarda los detalles del prompt y de las entradas | La reproducibilidad mejora al probar variaciones |
| Prueba una variable a la vez | Aísla problemas de duración, referencias o resolución |
| Conserva el audio original por separado | Facilita comparar más tarde la voz y el sonido |
| Evita asumir la precisión del texto | El texto pequeño puede funcionar en algunas escenas, pero sigue siendo difícil |
MiniMax H3 encaja especialmente bien con flujos de trabajo modulares de ComfyUI. Un grafo bien organizado puede exponer controles separados para el condicionamiento de primer y último fotograma, las entradas de referencia, la resolución, la duración, el formato de salida y el audio opcional. Esta estructura también facilita ampliar de dos entradas de imagen a más referencias cuando la escena lo requiera.
La progresión más práctica es establecer una base fiable y luego aumentar la complejidad gradualmente. Evita cambiar al mismo tiempo el prompt, la resolución, la duración, los ajustes del sampler y la cantidad de entradas. Los ajustes pequeños y controlados facilitan identificar por qué una generación mejoró o empeoró.
Guarda una base funcional antes de experimentar. Duplica el grafo, cambia un solo ajuste y registra el resultado para que las configuraciones exitosas sigan siendo fáciles de recuperar.
Q: ¿Para qué se usa mejor MiniMax H3 AI en ComfyUI?
Es ideal para texto a vídeo, animación guiada por imagen, transiciones de primer y último fotograma, escenas basadas en referencias, mezcla de vídeo y experimentos con conciencia del audio.
Q: ¿MiniMax H3 puede usar más de una imagen?
Sí. El flujo de trabajo de referencia a vídeo puede usar varias imágenes, y la configuración mostrada combina cuatro imágenes con un vídeo y su audio.
Q: ¿MiniMax H3 admite cambios de audio y voz?
El flujo de trabajo mostrado utiliza audio de vídeo, entradas de audio separadas, música, diálogo y transformaciones de estilo clonación de voz. Los resultados dependen de las entradas y de la configuración local.
Q: ¿Cuánto tarda una generación de MiniMax H3?
El tiempo de procesamiento varía según el hardware, la resolución, la duración y la cantidad de entradas. Un trabajo complejo de referencia a vídeo en una 3090 puede tardar alrededor de cinco minutos o más.