- MiniMax H3 input admite texto, imágenes, pares de fotogramas y referencias mixtas.
- Los archivos de referencia ayudan a mantener la consistencia del personaje, el producto y el estilo visual.
- Las referencias de audio deben ir acompañadas de una imagen o una entrada de video.
- Los ajustes de salida incluyen varias proporciones de aspecto, resolución de hasta 2K y 24 FPS.
- Mejor flujo de trabajo: define la toma, añade referencias enfocadas, elige el encuadre y luego genera.
Modos de entrada de MiniMax H3 explicados
La entrada de MiniMax H3 está diseñada en torno a un flujo de trabajo multimodal, en lugar de una sola caja de texto. Puedes empezar con una descripción escrita de la escena, una imagen fija, un par de primer y último fotograma, o una combinación de texto y referencias visuales. Esto hace que el modelo sea adecuado para pruebas cinematográficas, clips para redes sociales, anuncios, demostraciones de producto y tomas narrativas breves.
Los mejores resultados suelen venir de adaptar el método de entrada al problema creativo. El texto es rápido y flexible, mientras que una imagen le da al modelo un punto de partida visual concreto. Los pares de fotogramas ofrecen más control sobre el movimiento entre dos momentos, y las entradas mixtas te permiten definir tanto el sujeto como la atmósfera deseada.
Aspectos destacados del video:
- Flujos de trabajo de generación con texto, imagen, pares de fotogramas y referencias mixtas
- Procesamiento multimodal entre texto, imágenes, video y audio
- Consistencia de personajes y productos respaldada por cargas de referencia
- Generación nativa de audio junto con la salida visual
- Hasta 15 segundos de metraje en 2K a 24 fotogramas por segundo
| Input Mode | Best Use | Main Advantage | Control Level |
|---|---|---|---|
| Texto | Conceptos nuevos y experimentos rápidos | La forma más rápida de empezar | Medio |
| Una sola imagen | Animar un sujeto existente | Conserva un punto de partida visual | Alto |
| Primer y último fotograma | Transiciones controladas | Define los estados de inicio y final | Muy alto |
| Texto más imágenes | Escenas de marca o cinematográficas | Combina sujeto y dirección de estilo | Muy alto |
Inicio con texto
Describe el sujeto, la acción, el entorno, el comportamiento de la cámara y el estado de ánimo en un solo prompt enfocado.
Inicio con imagen
Usa una imagen fija cuando importen la apariencia del sujeto, la ropa, la forma del producto o la composición.
Par de fotogramas
Establece un fotograma de apertura y uno de cierre para guiar el recorrido visual entre dos momentos definidos.
Entrada mixta
Combina texto con imágenes o videos cuando la escena necesite tanto dirección creativa como anclajes visuales.
Empieza con una sola toma clara en lugar de describir una película entera. Un sujeto, una acción, un movimiento de cámara y un entorno concretos son más fáciles de controlar que varias ideas sin relación.
Cómo preparar archivos de referencia
Los archivos de referencia son la principal capa de control para mantener la identidad y el estilo en un clip generado. El flujo disponible permite hasta nueve imágenes de referencia, tres videos de referencia y tres archivos de audio de referencia, con un máximo de 12 archivos en total por generación.
Usa las referencias de forma selectiva. Más archivos pueden aportar contexto útil, pero los ángulos no relacionados, la iluminación contradictoria o los diseños inconsistentes pueden hacer que el resultado deseado sea menos claro. Para un personaje recurrente, elige imágenes que muestren el rostro, la ropa, la silueta y los detalles de identificación importantes. Para un producto, prioriza vistas limpias que establezcan su forma y materiales.
| Reference Type | Reported Limit | Useful For | Preparation Advice |
|---|---|---|---|
| Imágenes | Hasta 9 | Rostros, productos, vestuario, estilo | Usa, en la medida de lo posible, detalles del sujeto e iluminación consistentes |
| Videos | Hasta 3 | Movimiento, actuación, comportamiento de cámara | Selecciona clips que demuestren el movimiento deseado |
| Audio | Hasta 3 | Voz, ambiente o dirección sonora | Combina el audio con una entrada de imagen o video |
| Archivos totales | Hasta 12 | Control multimodal combinado | Elimina las referencias que no respalden la misma toma |
Las referencias de audio tienen una restricción operativa importante: no pueden subirse por sí solas. Al menos una imagen o un video debe acompañar a una referencia de audio. Esta regla es fácil de pasar por alto al preparar un proyecto, así que organiza el anclaje visual antes de añadir material sonoro.
No prepares una entrega solo de audio. Combina las referencias de audio con una imagen o un video, y mantén el total de cargas en 12 archivos o menos.
Cómo elegir referencias según el objetivo creativo
- Consistencia del personaje: usa varias vistas claras del rostro y del cuerpo completo, pero evita imágenes que muestren distintos atuendos salvo que el cambio sea intencional.
- Consistencia del producto: incluye vistas frontal, lateral y de detalle que revelen las proporciones y materiales del producto.
- Coincidencia de estilo: selecciona referencias con iluminación, tratamiento del color, lenguaje de lente o diseño de producción relacionados.
- Transferencia de movimiento: usa un video de referencia que muestre con claridad el movimiento que quieres adaptar.
- Dirección de audio: añade referencias sonoras solo después de establecer una entrada visual.
Un archivo de referencia debe responder a una pregunta concreta: ¿qué debe permanecer consistente y qué puede reinterpretar el modelo? Si esa pregunta no está clara, reduce el conjunto de referencias y haz el prompt más específico.
Flujo de trabajo paso a paso para la entrada de MiniMax H3
El proceso de generación puede organizarse en tres fases prácticas: establecer el punto de partida, describir la toma y revisar el resultado. Este método mantiene separadas las decisiones creativas y facilita diagnosticar salidas débiles.
Elige la entrada inicial
Selecciona texto, una sola imagen, un par de primer y último fotograma, o una configuración mixta de texto e imagen. Añade archivos de referencia solo cuando respalden el mismo sujeto, acción o identidad visual.
Escribe la descripción de la toma
Indica qué aparece en la escena, qué se mueve, cómo se comporta la cámara y qué estado de ánimo o estilo visual debe guiar el resultado. Usa un lenguaje directo y evita combinar varias tomas sin relación.
Define la forma del encuadre
Elige una proporción de aspecto que coincida con el destino previsto. El formato vertical es adecuado para contenido móvil de formato corto, mientras que los formatos panorámicos funcionan mejor para presentaciones cinematográficas y reproductores de video estándar.
Genera e inspecciona
Revisa la identidad del sujeto, el movimiento, la composición, el audio y la continuidad. Si cambia un detalle clave, revisa el prompt o los archivos de referencia en lugar de añadir más instrucciones sin relación.
Refina la toma
Usa una solicitud de cambio específica para problemas como ropa alterada, movimiento de cámara no deseado, iluminación incorrecta o una forma de producto inconsistente.
| Workflow Phase | Primary Decision | Recommended Check |
|---|---|---|
| Punto de partida | ¿Qué debe anclar la escena? | Confirma la imagen seleccionada, el par de fotogramas o el concepto de texto |
| Diseño del prompt | ¿Qué debe ocurrir en pantalla? | Define sujeto, acción, cámara, entorno y estado de ánimo |
| Encuadre | ¿Dónde se verá el clip? | Ajusta la proporción a la plataforma o presentación final |
| Generación | ¿La toma sigue el brief? | Inspecciona consistencia, movimiento, sonido y composición |
| Refinamiento | ¿Qué único problema necesita corrección? | Cambia una variable principal a la vez |
Para ideación rápida
Empieza con texto cuando explores varios conceptos rápidamente. Mantén el prompt lo bastante breve como para revisarlo sin perder la idea central.
Para activos de marca
Usa referencias de imagen para logotipos, productos, empaques o detalles de personajes que deban seguir siendo reconocibles durante todo el clip.
Para control narrativo
Usa un par de primer y último fotograma cuando la transición en sí importe, como una transformación, una revelación o un viaje.
El proceso más eficiente es iterativo: genera una toma enfocada, identifica el desajuste más importante y luego revisa ese problema concreto.
Resolución, duración, audio y proporciones de aspecto
El perfil de salida reportado está orientado a la producción cinematográfica de formato corto. MiniMax H3 puede generar clips de hasta 15 segundos a una resolución de 2K y 24 fotogramas por segundo. El modelo también incluye generación nativa de audio, lo que permite crear el sonido junto con lo visual, en lugar de añadirlo por completo en posproducción.
Un clip de 15 segundos es suficiente para establecer un entorno, mostrar una acción significativa o completar un breve compás narrativo. Para secuencias más complejas, trata cada generación como una sola toma y ensambla varios clips durante la edición. Este enfoque te da más control sobre el ritmo y la continuidad.
| Setting | Available or Reported Option | Practical Use |
|---|---|---|
| Resolución | Hasta 2K | Metraje más nítido para presentaciones, ediciones y entrega en alta definición |
| Tasa de fotogramas | 24 FPS | Movimiento con estilo cinematográfico y cadencia de cine familiar |
| Duración máxima | Hasta 15 segundos | Toma de establecimiento, acciones breves, transiciones y clips para redes sociales |
| Audio | Generación nativa | Ambiente inicial, efectos o dirección sonora sincronizada |
| Aspect Ratio | Best Fit | Composition Reminder |
|---|---|---|
| 9:16 | Video vertical de formato corto | Mantén los rostros y productos centrados dentro del marco alto |
| 16:9 | Video panorámico estándar | Usa composición horizontal y más espacio ambiental |
| 21:9 | Panorámica cinematográfica | Deja espacio para paisajes amplios y movimiento panorámico |
| 4:3 | Encuadre tradicional | Favorece sujetos centrados y composiciones compactas |
| 1:1 | Publicaciones cuadradas para redes sociales | Mantén los detalles esenciales lejos de los bordes extremos |
| 3:4 | Disposiciones en formato retrato | Equilibra con cuidado el espacio superior y la acción en la parte baja del encuadre |
| Adaptive | Experimentos de encuadre flexible | Inspecciona el recorte antes de la entrega final |
La proporción de aspecto debe elegirse antes de generar, porque el encuadre cambia la forma en que los sujetos encajan en la escena. Un prompt escrito para un paisaje amplio puede perder detalles importantes cuando se adapta a un formato vertical. Describe la composición directamente cuando la toma dependa de que un sujeto permanezca en una zona concreta del encuadre.
Elige la proporción de aspecto final antes de escribir instrucciones detalladas de composición. Indica si el sujeto debe permanecer centrado, moverse por el encuadre o ocupar un lado concreto.
Consejos de consistencia y solución de problemas
La consistencia es una de las razones más valiosas para usar una entrada estructurada en MiniMax H3. Los rostros de los personajes, los productos y los estilos visuales pueden cambiar en el video generativo, especialmente cuando el prompt introduce descripciones contradictorias o cuando las referencias no coinciden entre sí.
Cuando el resultado esté cerca, pero no sea perfecto, evita reescribir cada parte del prompt. Conserva los elementos que sí funcionaron y ataca el único fallo. Por ejemplo, si el personaje se mantiene consistente pero el movimiento de cámara es incorrecto, revisa la instrucción de cámara sin cambiar la descripción del personaje.
| Problem | Likely Cause | Focused Correction |
|---|---|---|
| El rostro cambia durante el clip | Pocas referencias de identidad o referencias contradictorias | Añade referencias faciales más claras y simplifica la descripción de la apariencia |
| La forma del producto cambia | Ángulos de producto mezclados o detalles ambiguos | Usa vistas limpias del producto y nombra la forma definitoria |
| El movimiento parece poco claro | La descripción de la acción es demasiado amplia | Especifica la acción inicial, la dirección, la velocidad y la respuesta de la cámara |
| El audio no encaja | La dirección sonora carece de contexto | Combina el audio con una entrada visual y describe la atmósfera deseada |
| La composición queda recortada | La proporción no coincide con el diseño de la escena | Reescribe el encuadre para la proporción de aspecto seleccionada |
| El estilo se vuelve inconsistente | Las referencias usan tratamientos visuales diferentes | Reduce el conjunto a referencias con iluminación y diseño relacionados |
Revisión previa a la generación:
- Elige un sujeto claro y una acción principal
- Confirma que los archivos de referencia respalden al mismo personaje, producto o estilo
- Mantén el total de cargas en 12 archivos o menos
- Combina las referencias de audio con una imagen o un video
- Selecciona la proporción de aspecto final antes de generar
Cómo mejorar un resultado débil
- Sustituye verbos vagos como “se ve genial” por acciones visibles como “se gira hacia la cámara” o “camina bajo una lluvia que cae”.
- Describe el movimiento de la cámara por separado del movimiento del sujeto.
- Usa las referencias para anclar la identidad, no para introducir ideas visuales sin relación.
- Mantén compatibles las instrucciones de iluminación y estilo entre el prompt y el conjunto de referencias.
- Haz una sola corrección importante por iteración para poder identificar qué mejoró el resultado.
El flujo de trabajo también admite edición sin una nueva grabación tradicional. Un clip generado puede ajustarse mediante una nueva instrucción, y el movimiento de un video puede transferirse a otra escena. Estas capacidades son más útiles cuando el cambio deseado está claramente definido.
Al refinar un clip, escribe la corrección como una instrucción y no como una crítica general. Especifica qué debe cambiar y qué debe permanecer intacto.
Preguntas frecuentes sobre la entrada de MiniMax H3
Q: ¿Qué tipos de entrada de MiniMax H3 puedo usar?
Puedes empezar con un prompt de texto, una sola imagen, un par de primer y último fotograma, o una configuración mixta que combine texto con referencias visuales.
Q: ¿Cuántos archivos de referencia puede usar una sola generación?
El flujo de trabajo reportado permite hasta nueve imágenes de referencia, tres videos de referencia y tres archivos de audio de referencia, con un máximo total de 12 archivos.
Q: ¿Puedo subir referencias de audio por sí solas?
No. Las referencias de audio deben ir acompañadas de una imagen o un video cargado, así que establece primero una entrada visual antes de añadir referencias de sonido.
Q: ¿Qué ajustes de salida debería elegir primero?
Elige la proporción de aspecto según el destino final y luego define el sujeto, la acción, el movimiento de cámara y el estado de ánimo antes de generar.
| Quick Decision | Recommended Input |
|---|---|
| Probar una idea original | Prompt de texto |
| Animar un diseño conocido | Una sola imagen |
| Controlar una transición | Par de primer y último fotograma |
| Preservar identidad o branding | Texto más referencias enfocadas |
| Dirigir el sonido con lo visual | Imagen o video más referencia de audio |
El video generativo todavía puede requerir iteración. Trata la primera salida como un borrador, revisa la continuidad con cuidado y corrige primero el desajuste más importante.
MiniMax H3 se aborda mejor como un sistema de generación de tomas: define el anclaje visual, dale al modelo una acción concreta, selecciona la forma de encuadre correcta y refina con intención. Con referencias disciplinadas y prompts concisos, el flujo de trabajo de entrada se vuelve más fácil de repetir en pruebas cinematográficas, contenido para redes y trabajos creativos de marca.