MiniMax H3 input: Guía paso a paso de configuración multimodal - Características

MiniMax H3 input: Guía paso a paso de configuración multimodal

Aprende cómo funcionan los modos de entrada de MiniMax H3, los archivos de referencia, los prompts, el audio, las proporciones de aspecto y los ajustes de generación en esta práctica guía de 2026.

2026-08-03
Equipo de Wiki de MiniMax H3
Guía rápida
  • MiniMax H3 input admite texto, imágenes, pares de fotogramas y referencias mixtas.
  • Los archivos de referencia ayudan a mantener la consistencia del personaje, el producto y el estilo visual.
  • Las referencias de audio deben ir acompañadas de una imagen o una entrada de video.
  • Los ajustes de salida incluyen varias proporciones de aspecto, resolución de hasta 2K y 24 FPS.
  • Mejor flujo de trabajo: define la toma, añade referencias enfocadas, elige el encuadre y luego genera.

Modos de entrada de MiniMax H3 explicados

La entrada de MiniMax H3 está diseñada en torno a un flujo de trabajo multimodal, en lugar de una sola caja de texto. Puedes empezar con una descripción escrita de la escena, una imagen fija, un par de primer y último fotograma, o una combinación de texto y referencias visuales. Esto hace que el modelo sea adecuado para pruebas cinematográficas, clips para redes sociales, anuncios, demostraciones de producto y tomas narrativas breves.

Los mejores resultados suelen venir de adaptar el método de entrada al problema creativo. El texto es rápido y flexible, mientras que una imagen le da al modelo un punto de partida visual concreto. Los pares de fotogramas ofrecen más control sobre el movimiento entre dos momentos, y las entradas mixtas te permiten definir tanto el sujeto como la atmósfera deseada.

Aspectos destacados del video:

  • Flujos de trabajo de generación con texto, imagen, pares de fotogramas y referencias mixtas
  • Procesamiento multimodal entre texto, imágenes, video y audio
  • Consistencia de personajes y productos respaldada por cargas de referencia
  • Generación nativa de audio junto con la salida visual
  • Hasta 15 segundos de metraje en 2K a 24 fotogramas por segundo
Input ModeBest UseMain AdvantageControl Level
TextoConceptos nuevos y experimentos rápidosLa forma más rápida de empezarMedio
Una sola imagenAnimar un sujeto existenteConserva un punto de partida visualAlto
Primer y último fotogramaTransiciones controladasDefine los estados de inicio y finalMuy alto
Texto más imágenesEscenas de marca o cinematográficasCombina sujeto y dirección de estiloMuy alto

Inicio con texto

Describe el sujeto, la acción, el entorno, el comportamiento de la cámara y el estado de ánimo en un solo prompt enfocado.

Inicio con imagen

Usa una imagen fija cuando importen la apariencia del sujeto, la ropa, la forma del producto o la composición.

Par de fotogramas

Establece un fotograma de apertura y uno de cierre para guiar el recorrido visual entre dos momentos definidos.

Entrada mixta

Combina texto con imágenes o videos cuando la escena necesite tanto dirección creativa como anclajes visuales.

Consejo de redacción

Empieza con una sola toma clara en lugar de describir una película entera. Un sujeto, una acción, un movimiento de cámara y un entorno concretos son más fáciles de controlar que varias ideas sin relación.

Cómo preparar archivos de referencia

Los archivos de referencia son la principal capa de control para mantener la identidad y el estilo en un clip generado. El flujo disponible permite hasta nueve imágenes de referencia, tres videos de referencia y tres archivos de audio de referencia, con un máximo de 12 archivos en total por generación.

Usa las referencias de forma selectiva. Más archivos pueden aportar contexto útil, pero los ángulos no relacionados, la iluminación contradictoria o los diseños inconsistentes pueden hacer que el resultado deseado sea menos claro. Para un personaje recurrente, elige imágenes que muestren el rostro, la ropa, la silueta y los detalles de identificación importantes. Para un producto, prioriza vistas limpias que establezcan su forma y materiales.

Reference TypeReported LimitUseful ForPreparation Advice
ImágenesHasta 9Rostros, productos, vestuario, estiloUsa, en la medida de lo posible, detalles del sujeto e iluminación consistentes
VideosHasta 3Movimiento, actuación, comportamiento de cámaraSelecciona clips que demuestren el movimiento deseado
AudioHasta 3Voz, ambiente o dirección sonoraCombina el audio con una entrada de imagen o video
Archivos totalesHasta 12Control multimodal combinadoElimina las referencias que no respalden la misma toma

Las referencias de audio tienen una restricción operativa importante: no pueden subirse por sí solas. Al menos una imagen o un video debe acompañar a una referencia de audio. Esta regla es fácil de pasar por alto al preparar un proyecto, así que organiza el anclaje visual antes de añadir material sonoro.

Limitación de referencias

No prepares una entrega solo de audio. Combina las referencias de audio con una imagen o un video, y mantén el total de cargas en 12 archivos o menos.

Cómo elegir referencias según el objetivo creativo

  • Consistencia del personaje: usa varias vistas claras del rostro y del cuerpo completo, pero evita imágenes que muestren distintos atuendos salvo que el cambio sea intencional.
  • Consistencia del producto: incluye vistas frontal, lateral y de detalle que revelen las proporciones y materiales del producto.
  • Coincidencia de estilo: selecciona referencias con iluminación, tratamiento del color, lenguaje de lente o diseño de producción relacionados.
  • Transferencia de movimiento: usa un video de referencia que muestre con claridad el movimiento que quieres adaptar.
  • Dirección de audio: añade referencias sonoras solo después de establecer una entrada visual.

Un archivo de referencia debe responder a una pregunta concreta: ¿qué debe permanecer consistente y qué puede reinterpretar el modelo? Si esa pregunta no está clara, reduce el conjunto de referencias y haz el prompt más específico.

Flujo de trabajo paso a paso para la entrada de MiniMax H3

El proceso de generación puede organizarse en tres fases prácticas: establecer el punto de partida, describir la toma y revisar el resultado. Este método mantiene separadas las decisiones creativas y facilita diagnosticar salidas débiles.

1

Elige la entrada inicial

Selecciona texto, una sola imagen, un par de primer y último fotograma, o una configuración mixta de texto e imagen. Añade archivos de referencia solo cuando respalden el mismo sujeto, acción o identidad visual.

2

Escribe la descripción de la toma

Indica qué aparece en la escena, qué se mueve, cómo se comporta la cámara y qué estado de ánimo o estilo visual debe guiar el resultado. Usa un lenguaje directo y evita combinar varias tomas sin relación.

3

Define la forma del encuadre

Elige una proporción de aspecto que coincida con el destino previsto. El formato vertical es adecuado para contenido móvil de formato corto, mientras que los formatos panorámicos funcionan mejor para presentaciones cinematográficas y reproductores de video estándar.

4

Genera e inspecciona

Revisa la identidad del sujeto, el movimiento, la composición, el audio y la continuidad. Si cambia un detalle clave, revisa el prompt o los archivos de referencia en lugar de añadir más instrucciones sin relación.

5

Refina la toma

Usa una solicitud de cambio específica para problemas como ropa alterada, movimiento de cámara no deseado, iluminación incorrecta o una forma de producto inconsistente.

Workflow PhasePrimary DecisionRecommended Check
Punto de partida¿Qué debe anclar la escena?Confirma la imagen seleccionada, el par de fotogramas o el concepto de texto
Diseño del prompt¿Qué debe ocurrir en pantalla?Define sujeto, acción, cámara, entorno y estado de ánimo
Encuadre¿Dónde se verá el clip?Ajusta la proporción a la plataforma o presentación final
Generación¿La toma sigue el brief?Inspecciona consistencia, movimiento, sonido y composición
Refinamiento¿Qué único problema necesita corrección?Cambia una variable principal a la vez

Para ideación rápida

Empieza con texto cuando explores varios conceptos rápidamente. Mantén el prompt lo bastante breve como para revisarlo sin perder la idea central.

Para activos de marca

Usa referencias de imagen para logotipos, productos, empaques o detalles de personajes que deban seguir siendo reconocibles durante todo el clip.

Para control narrativo

Usa un par de primer y último fotograma cuando la transición en sí importe, como una transformación, una revelación o un viaje.

Flujo de trabajo confiable

El proceso más eficiente es iterativo: genera una toma enfocada, identifica el desajuste más importante y luego revisa ese problema concreto.

Resolución, duración, audio y proporciones de aspecto

El perfil de salida reportado está orientado a la producción cinematográfica de formato corto. MiniMax H3 puede generar clips de hasta 15 segundos a una resolución de 2K y 24 fotogramas por segundo. El modelo también incluye generación nativa de audio, lo que permite crear el sonido junto con lo visual, en lugar de añadirlo por completo en posproducción.

Un clip de 15 segundos es suficiente para establecer un entorno, mostrar una acción significativa o completar un breve compás narrativo. Para secuencias más complejas, trata cada generación como una sola toma y ensambla varios clips durante la edición. Este enfoque te da más control sobre el ritmo y la continuidad.

SettingAvailable or Reported OptionPractical Use
ResoluciónHasta 2KMetraje más nítido para presentaciones, ediciones y entrega en alta definición
Tasa de fotogramas24 FPSMovimiento con estilo cinematográfico y cadencia de cine familiar
Duración máximaHasta 15 segundosToma de establecimiento, acciones breves, transiciones y clips para redes sociales
AudioGeneración nativaAmbiente inicial, efectos o dirección sonora sincronizada
Aspect RatioBest FitComposition Reminder
9:16Video vertical de formato cortoMantén los rostros y productos centrados dentro del marco alto
16:9Video panorámico estándarUsa composición horizontal y más espacio ambiental
21:9Panorámica cinematográficaDeja espacio para paisajes amplios y movimiento panorámico
4:3Encuadre tradicionalFavorece sujetos centrados y composiciones compactas
1:1Publicaciones cuadradas para redes socialesMantén los detalles esenciales lejos de los bordes extremos
3:4Disposiciones en formato retratoEquilibra con cuidado el espacio superior y la acción en la parte baja del encuadre
AdaptiveExperimentos de encuadre flexibleInspecciona el recorte antes de la entrega final

La proporción de aspecto debe elegirse antes de generar, porque el encuadre cambia la forma en que los sujetos encajan en la escena. Un prompt escrito para un paisaje amplio puede perder detalles importantes cuando se adapta a un formato vertical. Describe la composición directamente cuando la toma dependa de que un sujeto permanezca en una zona concreta del encuadre.

Consejo de formato

Elige la proporción de aspecto final antes de escribir instrucciones detalladas de composición. Indica si el sujeto debe permanecer centrado, moverse por el encuadre o ocupar un lado concreto.

Consejos de consistencia y solución de problemas

La consistencia es una de las razones más valiosas para usar una entrada estructurada en MiniMax H3. Los rostros de los personajes, los productos y los estilos visuales pueden cambiar en el video generativo, especialmente cuando el prompt introduce descripciones contradictorias o cuando las referencias no coinciden entre sí.

Cuando el resultado esté cerca, pero no sea perfecto, evita reescribir cada parte del prompt. Conserva los elementos que sí funcionaron y ataca el único fallo. Por ejemplo, si el personaje se mantiene consistente pero el movimiento de cámara es incorrecto, revisa la instrucción de cámara sin cambiar la descripción del personaje.

ProblemLikely CauseFocused Correction
El rostro cambia durante el clipPocas referencias de identidad o referencias contradictoriasAñade referencias faciales más claras y simplifica la descripción de la apariencia
La forma del producto cambiaÁngulos de producto mezclados o detalles ambiguosUsa vistas limpias del producto y nombra la forma definitoria
El movimiento parece poco claroLa descripción de la acción es demasiado ampliaEspecifica la acción inicial, la dirección, la velocidad y la respuesta de la cámara
El audio no encajaLa dirección sonora carece de contextoCombina el audio con una entrada visual y describe la atmósfera deseada
La composición queda recortadaLa proporción no coincide con el diseño de la escenaReescribe el encuadre para la proporción de aspecto seleccionada
El estilo se vuelve inconsistenteLas referencias usan tratamientos visuales diferentesReduce el conjunto a referencias con iluminación y diseño relacionados

Revisión previa a la generación:

  • Elige un sujeto claro y una acción principal
  • Confirma que los archivos de referencia respalden al mismo personaje, producto o estilo
  • Mantén el total de cargas en 12 archivos o menos
  • Combina las referencias de audio con una imagen o un video
  • Selecciona la proporción de aspecto final antes de generar

Cómo mejorar un resultado débil

  • Sustituye verbos vagos como “se ve genial” por acciones visibles como “se gira hacia la cámara” o “camina bajo una lluvia que cae”.
  • Describe el movimiento de la cámara por separado del movimiento del sujeto.
  • Usa las referencias para anclar la identidad, no para introducir ideas visuales sin relación.
  • Mantén compatibles las instrucciones de iluminación y estilo entre el prompt y el conjunto de referencias.
  • Haz una sola corrección importante por iteración para poder identificar qué mejoró el resultado.

El flujo de trabajo también admite edición sin una nueva grabación tradicional. Un clip generado puede ajustarse mediante una nueva instrucción, y el movimiento de un video puede transferirse a otra escena. Estas capacidades son más útiles cuando el cambio deseado está claramente definido.

Consejo de edición

Al refinar un clip, escribe la corrección como una instrucción y no como una crítica general. Especifica qué debe cambiar y qué debe permanecer intacto.

Preguntas frecuentes sobre la entrada de MiniMax H3

Q: ¿Qué tipos de entrada de MiniMax H3 puedo usar?

Puedes empezar con un prompt de texto, una sola imagen, un par de primer y último fotograma, o una configuración mixta que combine texto con referencias visuales.

Q: ¿Cuántos archivos de referencia puede usar una sola generación?

El flujo de trabajo reportado permite hasta nueve imágenes de referencia, tres videos de referencia y tres archivos de audio de referencia, con un máximo total de 12 archivos.

Q: ¿Puedo subir referencias de audio por sí solas?

No. Las referencias de audio deben ir acompañadas de una imagen o un video cargado, así que establece primero una entrada visual antes de añadir referencias de sonido.

Q: ¿Qué ajustes de salida debería elegir primero?

Elige la proporción de aspecto según el destino final y luego define el sujeto, la acción, el movimiento de cámara y el estado de ánimo antes de generar.

Quick DecisionRecommended Input
Probar una idea originalPrompt de texto
Animar un diseño conocidoUna sola imagen
Controlar una transiciónPar de primer y último fotograma
Preservar identidad o brandingTexto más referencias enfocadas
Dirigir el sonido con lo visualImagen o video más referencia de audio
Mantén expectativas realistas

El video generativo todavía puede requerir iteración. Trata la primera salida como un borrador, revisa la continuidad con cuidado y corrige primero el desajuste más importante.

MiniMax H3 se aborda mejor como un sistema de generación de tomas: define el anclaje visual, dale al modelo una acción concreta, selecciona la forma de encuadre correcta y refina con intención. Con referencias disciplinadas y prompts concisos, el flujo de trabajo de entrada se vuelve más fácil de repetir en pruebas cinematográficas, contenido para redes y trabajos creativos de marca.