Guía de prompts de MiniMax H3: configuración de video paso a paso - Guía

Guía de prompts de MiniMax H3: configuración de video paso a paso

Crea prompts de video más potentes para MiniMax H3 con instrucciones estructuradas para escenas, movimiento, audio, referencias, resolución y flujos de trabajo de API.

2026-08-03
Equipo de la Wiki de MiniMax H3
Guía rápida
  • Guía de prompts de MiniMax H3: usa instrucciones ordenadas para sujeto, acción, cámara, iluminación, audio y salida.
  • Entradas multimodales: combina texto con imágenes, referencias de video y audio cuando el flujo de trabajo requiera un control más sólido.
  • Prioridad del prompt: describe las relaciones entre referencias en lugar de enumerar detalles visuales desconectados.
  • Planificación de salida: establece duración, resolución, relación de aspecto y expectativas de sonido antes de enviar una solicitud de generación.
  • Verificación de seguridad: confirma los nombres de modelo actuales, los límites de archivo, los precios de la API y el estado de lanzamiento local a través de los canales oficiales.

Guía de prompts de MiniMax H3: flujo de trabajo básico

Los principios de la guía de prompts de MiniMax H3 funcionan mejor cuando el prompt se lee como un breve resumen de producción. Empieza con el sujeto principal, define la acción y luego explica cómo deben interactuar la cámara, el entorno, la iluminación y el sonido. Esta estructura le da al modelo una jerarquía más clara que una simple colección de adjetivos.

El material de referencia proporcionado describe un flujo de trabajo multimodal de propósito general que puede interpretar texto, imágenes, video y audio en conjunto. También describe generación nativa en 2K, sonido estéreo sincronizado, movimiento de cámara guiado por referencias y resultados diseñados para producción creativa de formato corto. Trata esas capacidades como dependientes de la configuración y verifica su disponibilidad actual antes de planificar un proyecto grande.

Aspectos destacados del video:

  • Los prompts multimodales pueden conectar una imagen de personaje con una referencia de movimiento.
  • Las instrucciones de texto pueden definir el movimiento de cámara y las relaciones de audio.
  • El flujo de trabajo apunta a la consistencia visual, el sonido sincronizado y la composición cinematográfica.
  • El acceso a la API puede requerir una cuenta, una clave de API y créditos disponibles.

El orden del prompt en cinco capas

Un prompt fiable suele seguir este orden:

  1. Sujeto — Identifica a la persona, personaje, producto o entorno.
  2. Acción — Indica qué cambia durante la toma.
  3. Cámara — Describe el encuadre, el movimiento, la sensación de lente y el punto de vista.
  4. Mundo e iluminación — Define la ubicación, el color, la atmósfera y el comportamiento de la luz.
  5. Audio y salida — Explica el habla, la música, los efectos de sonido, la duración, la relación de aspecto y la resolución.
Capa del promptQué especificarEjemplo útil
SujetoIdentidad, apariencia, vestuario, rasgos claveUna cantante de cabello plateado con chaqueta negra de escenario
AcciónMovimiento, emoción, sincronizaciónCanta hacia la lente mientras gira lentamente
CámaraTipo de plano, movimiento, perspectivaDolly lento hacia adelante con un plano medio centrado
EntornoUbicación, profundidad, color, atmósferaSala de conciertos oscura con bruma violeta y luz de contorno cian
AudioVoz, música, efectos, mezclaVoz principal clara, base de sintetizador contenida, ambiente sutil de la multitud
SalidaDuración, relación, resoluciónToma horizontal de cinco segundos en 16:9 y 2K
Prioridad del prompt

Coloca primero los detalles no negociables. Si lo más importante es la identidad del sujeto o el movimiento de cámara, describe esos elementos antes que los detalles secundarios de estilo.

Crea prompts que controlen el movimiento y el sonido

Los prompts más sólidos explican relaciones, no solo objetos. En lugar de escribir “una cantante, luces de neón, cámara en movimiento, música”, describe cómo canta la intérprete mientras se mueve la cámara y cómo responde la iluminación a la actuación. Eso le da al modelo una interpretación más coherente de la escena.

Para la generación basada en referencias, asigna a cada entrada un rol claro. Una imagen puede establecer la identidad del personaje, un video puede guiar el movimiento de cámara y un archivo de audio puede definir la voz o la atmósfera. El prompt de texto debe conectar luego esas referencias en una sola instrucción de producción.

Fórmula reutilizable para prompts

Usa esta plantilla como punto de partida:

Crea un [duración] [tipo de plano] con [sujeto] realizando [acción] en [entorno]. Usa [movimiento de cámara] desde [punto de vista inicial] hasta [punto de vista final]. Conserva [identidad o detalles de referencia]. Ilumina la escena con [iluminación y color]. Haz coincidir [voz, música o efectos de sonido] con la acción visible. Mantén [composición, relación de aspecto y calidad de salida].

La siguiente tabla separa los controles más importantes.

ControlDirección recomendadaError común
Identidad del personajeRepite rasgos visuales distintivos y vestuarioAñadir varias descripciones contradictorias
Movimiento de cámaraUsa un movimiento dominante por toma cortaCombinar órbita, zoom, sacudida y grúa
SincronizaciónVincula la acción al inicio, medio o final del clipDescribir varios eventos sin secuencia
IluminaciónEspecifica fuente, color, intensidad y atmósferaUsar solo etiquetas generales de estilo
AudioIdentifica voz, música, ambiente y sincronizaciónTratar el audio como un paso de posproducción sin relación
ReferenciasIndica qué controla cada imagen, video o archivo de audioSubir archivos sin asignarles un propósito

Ejemplo: prompt de actuación de un personaje

Crea una toma cinematográfica de actuación de cinco segundos del personaje de referencia cantando directamente hacia la cámara. Conserva sus rasgos faciales, peinado y atuendo oscuro de escenario. Sigue el suave movimiento de cámara hacia adelante del video de referencia, manteniéndola centrada en un plano medio. Usa iluminación violeta intensa y cian sobre el escenario con una bruma suave detrás de ella. Haz coincidir la sincronización vocal con el movimiento de su boca y añade un ambiente estéreo contenido de la multitud. Mantén la composición limpia, realista y adecuada para un encuadre horizontal 16:9.

Ejemplo: prompt de movimiento abstracto

Crea un bucle infinito de punto de vista en cinco segundos viajando por un túnel geométrico hecho de marcos triangulares dorados que se alejan. Añade capas de luz neón pulsante rosa, morada y cian dentro de la estructura. Mantén el fondo como un vacío oscuro profundo. Usa un movimiento suave hacia adelante, perspectiva estable, gran profundidad y geometría repetitiva limpia. Añade una atmósfera electrónica sutil y sincronizada sin sobrepasar el ritmo visual.

Evita sobrecargar el prompt

Los clips cortos tienen poco tiempo para expresar cambios. Demasiados sujetos, movimientos, transiciones y eventos de audio pueden competir por la atención y reducir la consistencia.

Configuración paso a paso de la API de MiniMax H3

El flujo de trabajo de referencia usa un proceso basado en API con un archivo de entorno y una solicitud en Python. El endpoint exacto, el identificador del modelo, los límites de entrada y los precios pueden cambiar, así que verifícalos en la documentación actual de la plataforma de MiniMax antes de implementar.

1

Define la toma

Decide el sujeto, la acción, el movimiento de cámara, la duración, la relación de aspecto, la resolución y la dirección de audio. Escribe el prompt como un único resumen de producción antes de añadir archivos de referencia.

2

Prepara las entradas de referencia

Selecciona una imagen para la identidad, un video para el movimiento o un archivo de audio para la dirección sonora. Usa solo las referencias que resuelvan un problema concreto de control y marca claramente su propósito en el prompt.

3

Crea una clave de API protegida

Crea una cuenta a través de la plataforma oficial, genera una clave de API y guárdala en un archivo de entorno local. No coloques la clave directamente en código público, capturas de pantalla, repositorios ni archivos compartidos del proyecto.

4

Construye la carga útil de generación

Añade el nombre actual del modelo, el prompt, la resolución, la duración, la relación de aspecto y los campos de entrada compatibles a la carga útil de la solicitud. Confirma cada parámetro con la referencia actual de la API.

5

Envía y revisa el resultado

Envía la solicitud, registra el identificador de tarea, inspecciona el estado devuelto y revisa el clip final para comprobar identidad, movimiento, sincronización de audio, encuadre y artefactos no deseados.

Un plan práctico de solicitud puede organizarse así:

EtapaEntrada o configuraciónPregunta de revisión
PromptResumen estructurado de producción¿La acción principal es inequívoca?
IdentidadImagen del personaje o producto¿Se conservan los rasgos definitorios?
MovimientoReferencia de cámara o movimiento¿El movimiento tiene una dirección clara?
AudioVoz, música o ambiente¿El sonido coincide con el evento visible?
SalidaDuración, resolución, relación de aspecto¿Las configuraciones son compatibles y asequibles?
RespuestaID de tarea y estado¿La solicitud se completó sin error de API?

El material proporcionado describe una configuración de ejemplo con una duración de cinco segundos, salida en 2K y un formato horizontal 16:9. También informa un costo de API de $0.13 por segundo para el flujo de trabajo mostrado. Como los precios y la disponibilidad del modelo son sensibles al tiempo, confirma las tarifas actuales y las configuraciones compatibles en la plataforma oficial antes de generar varias variaciones.

Configuración segura

Mantén las credenciales en variables de entorno, rota de inmediato las claves expuestas y usa una pequeña solicitud de prueba antes de comprometer créditos importantes en una generación más larga.

Elige el modo de generación adecuado

Un prompt por sí solo es útil para explorar conceptos, pero las referencias se vuelven más valiosas cuando un proyecto necesita identidad, movimiento o sonido consistentes. Selecciona el modo más simple que ofrezca el control requerido. Las entradas adicionales pueden mejorar la dirección, pero también introducen más relaciones que el modelo debe interpretar.

El flujo de trabajo de referencia describe tres enfoques generales.

Texto a video

Ideal para pruebas de concepto, entornos, movimiento abstracto, tarjetas de título y situaciones en las que la identidad exacta no es esencial.

Generación guiada por imagen

Ideal para mantener un personaje, producto, vestuario o composición mientras el prompt controla el movimiento y el desarrollo de la escena.

Generación por referencia

Ideal para flujos de trabajo coordinados que usan texto, imágenes, video y audio para definir conjuntamente identidad, movimiento de cámara, actuación y sonido.

ModoMejor usoFuerza de controlPreparación
Solo textoIdeación rápida y experimentos visualesModeradaEscribe un prompt preciso
Imagen + textoContinuidad de personaje o productoFuerte control de identidadPrepara una imagen de referencia clara
Video + textoGuía de cámara o movimientoFuerte control de movimientoElige una referencia de movimiento estable
Audio + textoDirección de actuación y sonidoMejor guía de sincronizaciónUsa audio limpio y relevante
Múltiples referenciasToma compleja y coordinadaMáxima demanda de planificaciónAsigna un propósito a cada archivo

Cuándo añadir más entradas

Usa una imagen cuando el sujeto deba conservar rasgos reconocibles. Añade un video cuando la trayectoria de la cámara o el movimiento físico importen más que una composición estática. Añade audio cuando el canto, el diálogo o la sincronización rítmica sean el centro de la escena.

Evita añadir una referencia simplemente porque está disponible. Un prompt de texto sencillo puede ser más fácil de depurar que una solicitud multimodal con prioridades poco claras.

Lista de revisión del prompt:

  • Nombra el sujeto principal y sus rasgos definitorios
  • Describe una acción dominante y un movimiento de cámara principal
  • Asigna un rol claro a cada referencia de imagen, video o audio
  • Especifica iluminación, atmósfera, comportamiento del audio, duración y encuadre
  • Confirma los límites actuales de la API, la disponibilidad del modelo y los precios antes de enviar
Estrategia de referencias

Usa el número mínimo de referencias necesario para controlar la toma. Los roles claros producen resultados más útiles que una gran colección de archivos vagamente relacionados.

Solución de problemas y refinamiento del prompt

El refinamiento del prompt debe ser sistemático. Cambia una sola variable importante a la vez, compara el resultado con la versión anterior y lleva un registro breve de lo que cambió. Esto facilita determinar si un problema provino del prompt, del material de referencia o de una configuración de generación.

ProblemaCausa probableRefinamiento
El sujeto cambia de identidadLa descripción de identidad es demasiado vaga o las referencias entran en conflictoRepite los rasgos clave y usa una referencia de imagen sólida
La cámara se siente inestableHay demasiadas instrucciones de movimientoMantén una trayectoria de cámara dominante y simplifica la toma
El audio no coincide con la acciónLa relación de sincronización no está explícitaIndica cuándo deben alinearse la voz, los efectos o el movimiento
La escena se ve recargadaDemasiados detalles de estilo y entornoElimina objetos secundarios y prioriza la composición
El formato de salida es incorrectoParámetros no compatibles o con nombres incorrectosComprueba el esquema actual de la API y los valores compatibles
La solicitud fallaFalta la clave, la carga útil es inválida o la entrada no es compatibleValida variables de entorno, campos, límites de archivo y estado de la respuesta

Un ciclo práctico de iteración

Empieza con una prueba de cinco segundos y un solo sujeto claro. Una vez que la identidad y la composición sean aceptables, añade una referencia de cámara o una capa de audio. Solo entonces experimenta con iluminación más compleja, movimiento ambiental o varios archivos fuente.

Para prompts cinematográficos, prioriza:

  • Una posición estable del sujeto
  • Un estado inicial y final claramente definidos
  • Un movimiento principal de cámara
  • Relaciones de color simples
  • Sincronización de audio explícita
  • Una duración corta para las pruebas iniciales

El material de referencia describe una arquitectura que comprime el contexto multimodal antes de la generación. Eso hace que la claridad del prompt sea especialmente importante: el modelo debe interpretar la relación entre las entradas proporcionadas, no solo procesarlas como activos no relacionados.

Q: ¿Cuál es la mejor estructura para un prompt de MiniMax H3?

Usa el orden de un resumen de producción: sujeto, acción, cámara, entorno, iluminación, audio, referencias y ajustes de salida. Coloca primero las restricciones más importantes.

Q: ¿Debo usar imágenes, video y audio en cada solicitud?

No. Usa cada referencia solo cuando resuelva un problema concreto de control. El texto es adecuado para ideación, mientras que las referencias de imagen, video y audio añaden guía de identidad, movimiento o sincronización.

Q: ¿Qué ajustes de salida debería probar primero?

Un clip corto en horizontal es un punto de partida práctico. El flujo de trabajo proporcionado usa cinco segundos, resolución 2K y una relación 16:9, pero confirma la compatibilidad actual antes de enviar.

Q: ¿La generación local de MiniMax H3 está garantizada actualmente?

No. El material proporcionado describe la disponibilidad planificada de pesos del modelo para la comunidad y la compatibilidad con hardware de consumo, pero el calendario de lanzamiento y los requisitos de hardware deben comprobarse en los anuncios oficiales.

Regla de refinamiento

Cuando un resultado esté cerca, conserva las partes exitosas del prompt y modifica solo una variable, como la velocidad de cámara, el color de la iluminación o la sincronización del audio.