- La API de ComfyUI de MiniMax H3 conecta los flujos de trabajo de ComfyUI con el modelo de video H3.
- La salida actual admite resolución 2K y duraciones de video de 5 a 15 segundos.
- Los flujos de trabajo principales incluyen texto a video, generación con múltiples referencias y video con fotograma inicial y final.
- La elección de configuración depende de si prefieres control local o un entorno de ComfyUI alojado.
- La regla del flujo de trabajo requiere omitir los grupos no utilizados antes de ejecutar un modo de generación seleccionado.
Descripción general de la API de ComfyUI de MiniMax H3
MiniMax H3 es un modelo de generación de video con IA diseñado para clips de alta resolución, sonido estéreo y flujos de trabajo estructurados en ComfyUI. A fecha del 3 de agosto de 2026, el enfoque de flujo de trabajo disponible se centra en invocar H3 a través de la integración más reciente de la API de ComfyUI, en lugar de instalar localmente pesos del modelo publicados de forma pública.
El modelo es especialmente útil cuando un proyecto necesita algo más que un simple texto de entrada. Su flujo de trabajo admite texto a video, múltiples referencias de imagen o video, referencias de audio y control de fotograma inicial y final. Eso lo hace adecuado para desarrollo conceptual, pruebas de producción de formato corto, previsualización visual y experimentos de movimiento guiados por referencias.
Aspectos destacados del video:
- La salida 2K es actualmente la opción principal de resolución.
- La duración del clip va de 5 segundos a 15 segundos.
- Los flujos de trabajo con referencias pueden usar imágenes, videos y audio.
- La generación de fotograma inicial y final puede cambiar al modo imagen a video.
- El flujo de trabajo se divide en tres grupos funcionales de generación.
| Capability | Current workflow detail | Practical use |
|---|---|---|
| Resolution | 2K output | High-quality previews and short-form clips |
| Duration | 5–15 seconds | Tests, transitions, social video, concept shots |
| Reference inputs | Images, videos, audio | Style, identity, motion, and sound guidance |
| Frame control | First and last frame options | Controlled transitions and shot endpoints |
| Prompting | No official format required | Natural-language prompts are suitable |
Empieza con texto a video antes de añadir referencias. Esto aísla la calidad del prompt de la compatibilidad de archivos y facilita la resolución de problemas.
Texto a video
Describe la escena, el sujeto, el movimiento de cámara, la iluminación y la acción en un solo prompt.
Modo de referencia
Combina varias imágenes, videos o archivos de audio cuando la coherencia y la dirección sean importantes.
Control de fotogramas
Define una imagen inicial y otra final para una progresión visual más deliberada.
Acceso alojado
Usa un entorno de ComfyUI gestionado cuando el mantenimiento local no sea práctico.
Opciones de configuración de la API de ComfyUI de MiniMax H3
Hay dos formas prácticas de abordar el flujo de trabajo de H3 en ComfyUI: una instalación local de ComfyUI o un entorno alojado como RunningHub. La ruta local ofrece más control sobre los archivos y la ejecución, mientras que una ruta alojada reduce el trabajo necesario para mantener dependencias y hardware.
La información actual no establece una especificación final de hardware local porque los pesos de H3 no han sido publicados. Se ha descrito que una GPU de clase 3060 puede ejecutar el modelo lentamente, pero el rendimiento dependerá del flujo de trabajo, el uso de memoria, la configuración de controladores y la configuración general de ComfyUI.
| Setup route | Main advantage | Main limitation | Best for |
|---|---|---|---|
| Local ComfyUI | Direct control over workflows and files | Requires updates, configuration, and suitable hardware | Technical users and repeat workflows |
| Hosted ComfyUI | Less environment maintenance | Depends on provider availability and account limits | Fast testing and lower setup overhead |
| Local API workflow | Integrates with existing automation | Requires API and node troubleshooting | Developers and pipeline builders |
| Hosted API workflow | Easier initial access | Provider-specific controls may apply | Creators validating H3 output |
Actualizar ComfyUI
Instala o actualiza ComfyUI a la versión más reciente disponible antes de cargar el flujo de trabajo de H3. Las compilaciones más antiguas pueden carecer de los nodos o del comportamiento de API que requiere el flujo de trabajo.
Elegir un entorno de ejecución
Selecciona una instalación local si quieres control directo. Elige un servicio de ComfyUI alojado si quieres evitar mantener un entorno complejo.
Cargar el flujo de trabajo de H3
Importa el flujo de trabajo en ComfyUI e identifica los tres grupos funcionales: texto a video, generación con múltiples referencias y generación de fotograma inicial y final.
Comprobar las entradas disponibles
Confirma que tu prompt, los archivos de referencia, la duración, la resolución y la relación de aspecto coinciden con el grupo seleccionado.
Ejecutar un grupo a la vez
Omite los dos grupos no utilizados y luego selecciona el control de ejecución en la esquina superior derecha de ComfyUI.
No tomes la orientación sobre la 3060 como un objetivo de rendimiento garantizado. Los requisitos locales siguen siendo inciertos mientras no estén disponibles los pesos públicos de H3.
Un entorno alojado puede ser útil para una primera prueba porque separa el comportamiento del flujo de trabajo de los problemas de instalación local. Si utilizas un proveedor alojado, revisa directamente sus términos de uso actuales, los requisitos de cuenta y las reglas de créditos antes de comprometerte con una canalización de producción.
Modos y parámetros del flujo de trabajo
El flujo de trabajo de H3 está organizado en tres grupos. Cada grupo utiliza controles de generación relacionados, pero la lógica de entrada cambia según si el modelo recibe solo texto, múltiples referencias o puntos de inicio y final del fotograma.
| Workflow group | Required input | Available control | Recommended first test |
|---|---|---|---|
| Text-to-video | Text prompt | 2K, 5–15 seconds, aspect ratio | 5-second scene with one subject |
| Multi-reference | Image, video, or audio references | Same core settings plus multiple files | Two images with a simple motion prompt |
| First-last frame | Beginning and ending images | Same core settings with endpoint control | 5-second transition between two frames |
Para texto a video, escribe una descripción clara del sujeto y la acción. Incluye detalles visuales como el entorno, la hora del día, el movimiento de cámara, la sensación de la lente, la iluminación y el movimiento deseado. No existe un formato oficial obligatorio para el prompt, así que una descripción en lenguaje natural es un punto de partida adecuado.
Para la generación con referencias, sube los archivos a los nodos de referencia y mantén el prompt enfocado. Varias referencias pueden aportar una dirección más fuerte, pero añadir más archivos también dificulta identificar qué entrada afectó al resultado. Empieza con un conjunto pequeño y con un propósito claro.
El grupo de fotograma inicial y final tiene un cambio de modo importante:
- Subir dos imágenes de punto final activa la generación de fotograma inicial y final.
- Subir solo una imagen cambia el flujo de trabajo al modo imagen a video.
- Eliminar los nodos de carga de imagen permite que el flujo de trabajo funcione como texto a video.
- Los ajustes restantes siguen usando los mismos controles de resolución, duración y relación de aspecto.
Usa resolución 2K, una duración de 5 segundos y una relación de aspecto común para tu primera prueba exitosa. Aumenta la complejidad solo después de que funcione la línea base.
| Parameter | Available guidance | Editing recommendation |
|---|---|---|
| Resolution | 2K is the current supported option | Keep it fixed while testing prompt changes |
| Duration | 5 seconds minimum, 15 seconds maximum | Start at 5 seconds for faster iteration |
| Aspect ratio | Common ratios are supported | Match the destination platform or source media |
| Prompt | No formal format required | State subject, action, camera, setting, and mood |
| References | Multiple image, video, and audio inputs | Add files gradually to preserve control |
Estrategia de prompting y referencias
Un flujo de trabajo de H3 exitoso depende de separar la dirección creativa del diagnóstico técnico. Empieza con un solo sujeto, una acción principal y un movimiento de cámara. Eso te da una línea base limpia para juzgar el movimiento, la identidad, la composición y el tiempo.
Una estructura útil para el prompt es:
- Sujeto: Identifica la persona, el objeto, la criatura o el entorno.
- Acción: Describe qué cambia durante la toma.
- Cámara: Especifica seguimiento, paneo, zoom, movimiento en mano o una vista estática.
- Entorno: Añade ubicación, iluminación, clima, hora y detalles del fondo.
- Estilo: Define el estado visual sin acumular adjetivos innecesarios.
Para la generación basada en referencias, usa archivos con un propósito claro. Una imagen puede establecer la apariencia, un video puede guiar el movimiento y el audio puede influir en la dirección del sonido. Cuando se usan varias referencias, evita instrucciones contradictorias, como una cámara estática en el prompt junto con un movimiento rápido de cámara en el clip de referencia.
Antes de ejecutar una generación:
- ComfyUI está actualizado a la versión más reciente disponible
- Solo un grupo del flujo de trabajo de H3 está activo
- El prompt describe el sujeto, la acción, la cámara y el entorno
- La resolución, la duración y la relación de aspecto están seleccionadas
- Los archivos de referencia son relevantes, legibles y elegidos de forma intencionada
Cambia una sola variable por prueba siempre que sea posible. Ajusta primero el prompt, luego las referencias y después la duración o el encuadre para que cada resultado siga siendo fácil de comparar.
| Test stage | Inputs | Goal | What to inspect |
|---|---|---|---|
| Baseline | Text only | Confirm API and workflow operation | Render completion and basic motion |
| Direction | Text plus one image | Test subject or style consistency | Identity, framing, and visual continuity |
| Motion | Text plus video reference | Guide movement or camera behavior | Temporal flow and action clarity |
| Sound | Text plus audio reference | Explore audio influence | Synchronization and overall sound direction |
| Endpoint | First and last frames | Control shot progression | Opening pose, transition, and final pose |
Evita sobrecargar la primera generación con muchas referencias, un prompt largo y una duración de 15 segundos. Esa combinación dificulta el diagnóstico de los fallos y puede aumentar el tiempo de iteración. Una prueba corta de 5 segundos suele ser más informativa durante la configuración.
Resolución de problemas y prácticas seguras del flujo de trabajo
La mayoría de los problemas con un flujo de trabajo de la API de ComfyUI provienen de un desajuste del entorno, nodos inactivos, entradas no admitidas o varios grupos de generación que se han dejado activos. Usa un diagnóstico estructurado en lugar de cambiar todos los ajustes a la vez.
| Symptom | Likely cause | Recommended action |
|---|---|---|
| Workflow does not start | Multiple groups are active or a node is incomplete | Bypass unused groups and inspect required inputs |
| Generation is slow | Local hardware or workflow complexity | Test a shorter clip and reduce reference complexity |
| Output ignores references | Files or prompt provide conflicting direction | Use fewer references and clarify the main subject |
| Frame mode behaves unexpectedly | One or both image inputs are missing | Check whether the workflow should be image-to-video or endpoint mode |
| Results vary widely | Too many variables changed between tests | Keep duration, ratio, and references fixed during prompt testing |
La regla operativa más importante es omitir los dos grupos que no estás usando. Si los tres siguen activos, ComfyUI puede intentar procesar cada rama en lugar del único modo que pretendías. Eso puede generar carga innecesaria, resultados confusos o errores de ejecución.
Mantén los archivos de origen organizados con nombres descriptivos, como subject-front.jpg, motion-reference.mp4 o audio-guide.wav. Registra el prompt, la duración, la relación de aspecto y el grupo activo para cada resultado útil. Este registro simple facilita reproducir una buena generación.
Nunca asumas que la vista de interfaz seleccionada es la única ruta activa. Confirma que los grupos inactivos estén explícitamente omitidos antes de iniciar la solicitud de API.
El único recurso de referencia directamente relevante disponible para esta guía es el video de prueba de la API de ComfyUI de MiniMax H3. Úsalo para comparar la disposición del flujo de trabajo y los modos de generación mostrados, mientras revisas tu propia instalación en busca de cambios actuales.
Preguntas frecuentes sobre la API de ComfyUI de MiniMax H3
Las siguientes respuestas resumen el comportamiento actual del flujo de trabajo y las decisiones prácticas de configuración cubiertas arriba.
Q: ¿Para qué se usa la API de ComfyUI de MiniMax H3?
Se usa para invocar flujos de trabajo de generación de MiniMax H3 a través de ComfyUI. El flujo de trabajo actual admite modos de texto a video, generación con múltiples referencias y fotograma inicial y final o imagen a video.
Q: ¿Qué resolución y duración admite H3 en este flujo de trabajo?
La guía actual del flujo de trabajo identifica 2K como la resolución disponible. La duración del video va de 5 segundos a 15 segundos, y se recomiendan 5 segundos para las pruebas iniciales.
Q: ¿Puede MiniMax H3 usar referencias de imagen, video y audio?
Sí. El flujo de trabajo con múltiples referencias puede aceptar entradas de imagen, video y audio, incluidas varias referencias. Añade archivos gradualmente para poder identificar cómo cambia cada referencia el resultado.
Q: ¿Debo ejecutar los tres grupos del flujo de trabajo de H3 a la vez?
No. Activa un grupo a la vez y omite los otros dos. Ejecutar todos los grupos simultáneamente puede crear procesamiento innecesario y producir un comportamiento confuso del flujo de trabajo.
Para una primera sesión fiable, actualiza ComfyUI, selecciona texto a video, usa un prompt enfocado, elige 2K y 5 segundos, omite los otros grupos y luego amplía gradualmente.