MiniMax H3 API de ComfyUI: guía de configuración paso a paso - API

MiniMax H3 API de ComfyUI: guía de configuración paso a paso

Aprende a usar la API de ComfyUI de MiniMax H3 para texto a video, flujos de trabajo con referencias, ajustes de resolución y generación de fotograma inicial y final.

2026-08-03
Equipo de la Wiki de MiniMax H3
Guía rápida
  • La API de ComfyUI de MiniMax H3 conecta los flujos de trabajo de ComfyUI con el modelo de video H3.
  • La salida actual admite resolución 2K y duraciones de video de 5 a 15 segundos.
  • Los flujos de trabajo principales incluyen texto a video, generación con múltiples referencias y video con fotograma inicial y final.
  • La elección de configuración depende de si prefieres control local o un entorno de ComfyUI alojado.
  • La regla del flujo de trabajo requiere omitir los grupos no utilizados antes de ejecutar un modo de generación seleccionado.

Descripción general de la API de ComfyUI de MiniMax H3

MiniMax H3 es un modelo de generación de video con IA diseñado para clips de alta resolución, sonido estéreo y flujos de trabajo estructurados en ComfyUI. A fecha del 3 de agosto de 2026, el enfoque de flujo de trabajo disponible se centra en invocar H3 a través de la integración más reciente de la API de ComfyUI, en lugar de instalar localmente pesos del modelo publicados de forma pública.

El modelo es especialmente útil cuando un proyecto necesita algo más que un simple texto de entrada. Su flujo de trabajo admite texto a video, múltiples referencias de imagen o video, referencias de audio y control de fotograma inicial y final. Eso lo hace adecuado para desarrollo conceptual, pruebas de producción de formato corto, previsualización visual y experimentos de movimiento guiados por referencias.

Aspectos destacados del video:

  • La salida 2K es actualmente la opción principal de resolución.
  • La duración del clip va de 5 segundos a 15 segundos.
  • Los flujos de trabajo con referencias pueden usar imágenes, videos y audio.
  • La generación de fotograma inicial y final puede cambiar al modo imagen a video.
  • El flujo de trabajo se divide en tres grupos funcionales de generación.
CapabilityCurrent workflow detailPractical use
Resolution2K outputHigh-quality previews and short-form clips
Duration5–15 secondsTests, transitions, social video, concept shots
Reference inputsImages, videos, audioStyle, identity, motion, and sound guidance
Frame controlFirst and last frame optionsControlled transitions and shot endpoints
PromptingNo official format requiredNatural-language prompts are suitable
Mejor punto de partida

Empieza con texto a video antes de añadir referencias. Esto aísla la calidad del prompt de la compatibilidad de archivos y facilita la resolución de problemas.

Texto a video

Describe la escena, el sujeto, el movimiento de cámara, la iluminación y la acción en un solo prompt.

Modo de referencia

Combina varias imágenes, videos o archivos de audio cuando la coherencia y la dirección sean importantes.

Control de fotogramas

Define una imagen inicial y otra final para una progresión visual más deliberada.

Acceso alojado

Usa un entorno de ComfyUI gestionado cuando el mantenimiento local no sea práctico.

Opciones de configuración de la API de ComfyUI de MiniMax H3

Hay dos formas prácticas de abordar el flujo de trabajo de H3 en ComfyUI: una instalación local de ComfyUI o un entorno alojado como RunningHub. La ruta local ofrece más control sobre los archivos y la ejecución, mientras que una ruta alojada reduce el trabajo necesario para mantener dependencias y hardware.

La información actual no establece una especificación final de hardware local porque los pesos de H3 no han sido publicados. Se ha descrito que una GPU de clase 3060 puede ejecutar el modelo lentamente, pero el rendimiento dependerá del flujo de trabajo, el uso de memoria, la configuración de controladores y la configuración general de ComfyUI.

Setup routeMain advantageMain limitationBest for
Local ComfyUIDirect control over workflows and filesRequires updates, configuration, and suitable hardwareTechnical users and repeat workflows
Hosted ComfyUILess environment maintenanceDepends on provider availability and account limitsFast testing and lower setup overhead
Local API workflowIntegrates with existing automationRequires API and node troubleshootingDevelopers and pipeline builders
Hosted API workflowEasier initial accessProvider-specific controls may applyCreators validating H3 output
1

Actualizar ComfyUI

Instala o actualiza ComfyUI a la versión más reciente disponible antes de cargar el flujo de trabajo de H3. Las compilaciones más antiguas pueden carecer de los nodos o del comportamiento de API que requiere el flujo de trabajo.

2

Elegir un entorno de ejecución

Selecciona una instalación local si quieres control directo. Elige un servicio de ComfyUI alojado si quieres evitar mantener un entorno complejo.

3

Cargar el flujo de trabajo de H3

Importa el flujo de trabajo en ComfyUI e identifica los tres grupos funcionales: texto a video, generación con múltiples referencias y generación de fotograma inicial y final.

4

Comprobar las entradas disponibles

Confirma que tu prompt, los archivos de referencia, la duración, la resolución y la relación de aspecto coinciden con el grupo seleccionado.

5

Ejecutar un grupo a la vez

Omite los dos grupos no utilizados y luego selecciona el control de ejecución en la esquina superior derecha de ComfyUI.

Hardware y disponibilidad

No tomes la orientación sobre la 3060 como un objetivo de rendimiento garantizado. Los requisitos locales siguen siendo inciertos mientras no estén disponibles los pesos públicos de H3.

Un entorno alojado puede ser útil para una primera prueba porque separa el comportamiento del flujo de trabajo de los problemas de instalación local. Si utilizas un proveedor alojado, revisa directamente sus términos de uso actuales, los requisitos de cuenta y las reglas de créditos antes de comprometerte con una canalización de producción.

Modos y parámetros del flujo de trabajo

El flujo de trabajo de H3 está organizado en tres grupos. Cada grupo utiliza controles de generación relacionados, pero la lógica de entrada cambia según si el modelo recibe solo texto, múltiples referencias o puntos de inicio y final del fotograma.

Workflow groupRequired inputAvailable controlRecommended first test
Text-to-videoText prompt2K, 5–15 seconds, aspect ratio5-second scene with one subject
Multi-referenceImage, video, or audio referencesSame core settings plus multiple filesTwo images with a simple motion prompt
First-last frameBeginning and ending imagesSame core settings with endpoint control5-second transition between two frames

Para texto a video, escribe una descripción clara del sujeto y la acción. Incluye detalles visuales como el entorno, la hora del día, el movimiento de cámara, la sensación de la lente, la iluminación y el movimiento deseado. No existe un formato oficial obligatorio para el prompt, así que una descripción en lenguaje natural es un punto de partida adecuado.

Para la generación con referencias, sube los archivos a los nodos de referencia y mantén el prompt enfocado. Varias referencias pueden aportar una dirección más fuerte, pero añadir más archivos también dificulta identificar qué entrada afectó al resultado. Empieza con un conjunto pequeño y con un propósito claro.

El grupo de fotograma inicial y final tiene un cambio de modo importante:

  • Subir dos imágenes de punto final activa la generación de fotograma inicial y final.
  • Subir solo una imagen cambia el flujo de trabajo al modo imagen a video.
  • Eliminar los nodos de carga de imagen permite que el flujo de trabajo funcione como texto a video.
  • Los ajustes restantes siguen usando los mismos controles de resolución, duración y relación de aspecto.
Línea base de parámetros

Usa resolución 2K, una duración de 5 segundos y una relación de aspecto común para tu primera prueba exitosa. Aumenta la complejidad solo después de que funcione la línea base.

ParameterAvailable guidanceEditing recommendation
Resolution2K is the current supported optionKeep it fixed while testing prompt changes
Duration5 seconds minimum, 15 seconds maximumStart at 5 seconds for faster iteration
Aspect ratioCommon ratios are supportedMatch the destination platform or source media
PromptNo formal format requiredState subject, action, camera, setting, and mood
ReferencesMultiple image, video, and audio inputsAdd files gradually to preserve control

Estrategia de prompting y referencias

Un flujo de trabajo de H3 exitoso depende de separar la dirección creativa del diagnóstico técnico. Empieza con un solo sujeto, una acción principal y un movimiento de cámara. Eso te da una línea base limpia para juzgar el movimiento, la identidad, la composición y el tiempo.

Una estructura útil para el prompt es:

  1. Sujeto: Identifica la persona, el objeto, la criatura o el entorno.
  2. Acción: Describe qué cambia durante la toma.
  3. Cámara: Especifica seguimiento, paneo, zoom, movimiento en mano o una vista estática.
  4. Entorno: Añade ubicación, iluminación, clima, hora y detalles del fondo.
  5. Estilo: Define el estado visual sin acumular adjetivos innecesarios.

Para la generación basada en referencias, usa archivos con un propósito claro. Una imagen puede establecer la apariencia, un video puede guiar el movimiento y el audio puede influir en la dirección del sonido. Cuando se usan varias referencias, evita instrucciones contradictorias, como una cámara estática en el prompt junto con un movimiento rápido de cámara en el clip de referencia.

Antes de ejecutar una generación:

  • ComfyUI está actualizado a la versión más reciente disponible
  • Solo un grupo del flujo de trabajo de H3 está activo
  • El prompt describe el sujeto, la acción, la cámara y el entorno
  • La resolución, la duración y la relación de aspecto están seleccionadas
  • Los archivos de referencia son relevantes, legibles y elegidos de forma intencionada
Método de iteración

Cambia una sola variable por prueba siempre que sea posible. Ajusta primero el prompt, luego las referencias y después la duración o el encuadre para que cada resultado siga siendo fácil de comparar.

Test stageInputsGoalWhat to inspect
BaselineText onlyConfirm API and workflow operationRender completion and basic motion
DirectionText plus one imageTest subject or style consistencyIdentity, framing, and visual continuity
MotionText plus video referenceGuide movement or camera behaviorTemporal flow and action clarity
SoundText plus audio referenceExplore audio influenceSynchronization and overall sound direction
EndpointFirst and last framesControl shot progressionOpening pose, transition, and final pose

Evita sobrecargar la primera generación con muchas referencias, un prompt largo y una duración de 15 segundos. Esa combinación dificulta el diagnóstico de los fallos y puede aumentar el tiempo de iteración. Una prueba corta de 5 segundos suele ser más informativa durante la configuración.

Resolución de problemas y prácticas seguras del flujo de trabajo

La mayoría de los problemas con un flujo de trabajo de la API de ComfyUI provienen de un desajuste del entorno, nodos inactivos, entradas no admitidas o varios grupos de generación que se han dejado activos. Usa un diagnóstico estructurado en lugar de cambiar todos los ajustes a la vez.

SymptomLikely causeRecommended action
Workflow does not startMultiple groups are active or a node is incompleteBypass unused groups and inspect required inputs
Generation is slowLocal hardware or workflow complexityTest a shorter clip and reduce reference complexity
Output ignores referencesFiles or prompt provide conflicting directionUse fewer references and clarify the main subject
Frame mode behaves unexpectedlyOne or both image inputs are missingCheck whether the workflow should be image-to-video or endpoint mode
Results vary widelyToo many variables changed between testsKeep duration, ratio, and references fixed during prompt testing

La regla operativa más importante es omitir los dos grupos que no estás usando. Si los tres siguen activos, ComfyUI puede intentar procesar cada rama en lugar del único modo que pretendías. Eso puede generar carga innecesaria, resultados confusos o errores de ejecución.

Mantén los archivos de origen organizados con nombres descriptivos, como subject-front.jpg, motion-reference.mp4 o audio-guide.wav. Registra el prompt, la duración, la relación de aspecto y el grupo activo para cada resultado útil. Este registro simple facilita reproducir una buena generación.

Evita ejecuciones ambiguas

Nunca asumas que la vista de interfaz seleccionada es la única ruta activa. Confirma que los grupos inactivos estén explícitamente omitidos antes de iniciar la solicitud de API.

El único recurso de referencia directamente relevante disponible para esta guía es el video de prueba de la API de ComfyUI de MiniMax H3. Úsalo para comparar la disposición del flujo de trabajo y los modos de generación mostrados, mientras revisas tu propia instalación en busca de cambios actuales.

Preguntas frecuentes sobre la API de ComfyUI de MiniMax H3

Las siguientes respuestas resumen el comportamiento actual del flujo de trabajo y las decisiones prácticas de configuración cubiertas arriba.

Q: ¿Para qué se usa la API de ComfyUI de MiniMax H3?

Se usa para invocar flujos de trabajo de generación de MiniMax H3 a través de ComfyUI. El flujo de trabajo actual admite modos de texto a video, generación con múltiples referencias y fotograma inicial y final o imagen a video.

Q: ¿Qué resolución y duración admite H3 en este flujo de trabajo?

La guía actual del flujo de trabajo identifica 2K como la resolución disponible. La duración del video va de 5 segundos a 15 segundos, y se recomiendan 5 segundos para las pruebas iniciales.

Q: ¿Puede MiniMax H3 usar referencias de imagen, video y audio?

Sí. El flujo de trabajo con múltiples referencias puede aceptar entradas de imagen, video y audio, incluidas varias referencias. Añade archivos gradualmente para poder identificar cómo cambia cada referencia el resultado.

Q: ¿Debo ejecutar los tres grupos del flujo de trabajo de H3 a la vez?

No. Activa un grupo a la vez y omite los otros dos. Ejecutar todos los grupos simultáneamente puede crear procesamiento innecesario y producir un comportamiento confuso del flujo de trabajo.

Recomendación práctica

Para una primera sesión fiable, actualiza ComfyUI, selecciona texto a video, usa un prompt enfocado, elige 2K y 5 segundos, omite los otros grupos y luego amplía gradualmente.