- Guía de prompts de MiniMax H3: usa instrucciones ordenadas para sujeto, acción, cámara, iluminación, audio y salida.
- Entradas multimodales: combina texto con imágenes, referencias de video y audio cuando el flujo de trabajo requiera un control más sólido.
- Prioridad del prompt: describe las relaciones entre referencias en lugar de enumerar detalles visuales desconectados.
- Planificación de salida: establece duración, resolución, relación de aspecto y expectativas de sonido antes de enviar una solicitud de generación.
- Verificación de seguridad: confirma los nombres de modelo actuales, los límites de archivo, los precios de la API y el estado de lanzamiento local a través de los canales oficiales.
Guía de prompts de MiniMax H3: flujo de trabajo básico
Los principios de la guía de prompts de MiniMax H3 funcionan mejor cuando el prompt se lee como un breve resumen de producción. Empieza con el sujeto principal, define la acción y luego explica cómo deben interactuar la cámara, el entorno, la iluminación y el sonido. Esta estructura le da al modelo una jerarquía más clara que una simple colección de adjetivos.
El material de referencia proporcionado describe un flujo de trabajo multimodal de propósito general que puede interpretar texto, imágenes, video y audio en conjunto. También describe generación nativa en 2K, sonido estéreo sincronizado, movimiento de cámara guiado por referencias y resultados diseñados para producción creativa de formato corto. Trata esas capacidades como dependientes de la configuración y verifica su disponibilidad actual antes de planificar un proyecto grande.
Aspectos destacados del video:
- Los prompts multimodales pueden conectar una imagen de personaje con una referencia de movimiento.
- Las instrucciones de texto pueden definir el movimiento de cámara y las relaciones de audio.
- El flujo de trabajo apunta a la consistencia visual, el sonido sincronizado y la composición cinematográfica.
- El acceso a la API puede requerir una cuenta, una clave de API y créditos disponibles.
El orden del prompt en cinco capas
Un prompt fiable suele seguir este orden:
- Sujeto — Identifica a la persona, personaje, producto o entorno.
- Acción — Indica qué cambia durante la toma.
- Cámara — Describe el encuadre, el movimiento, la sensación de lente y el punto de vista.
- Mundo e iluminación — Define la ubicación, el color, la atmósfera y el comportamiento de la luz.
- Audio y salida — Explica el habla, la música, los efectos de sonido, la duración, la relación de aspecto y la resolución.
| Capa del prompt | Qué especificar | Ejemplo útil |
|---|---|---|
| Sujeto | Identidad, apariencia, vestuario, rasgos clave | Una cantante de cabello plateado con chaqueta negra de escenario |
| Acción | Movimiento, emoción, sincronización | Canta hacia la lente mientras gira lentamente |
| Cámara | Tipo de plano, movimiento, perspectiva | Dolly lento hacia adelante con un plano medio centrado |
| Entorno | Ubicación, profundidad, color, atmósfera | Sala de conciertos oscura con bruma violeta y luz de contorno cian |
| Audio | Voz, música, efectos, mezcla | Voz principal clara, base de sintetizador contenida, ambiente sutil de la multitud |
| Salida | Duración, relación, resolución | Toma horizontal de cinco segundos en 16:9 y 2K |
Coloca primero los detalles no negociables. Si lo más importante es la identidad del sujeto o el movimiento de cámara, describe esos elementos antes que los detalles secundarios de estilo.
Crea prompts que controlen el movimiento y el sonido
Los prompts más sólidos explican relaciones, no solo objetos. En lugar de escribir “una cantante, luces de neón, cámara en movimiento, música”, describe cómo canta la intérprete mientras se mueve la cámara y cómo responde la iluminación a la actuación. Eso le da al modelo una interpretación más coherente de la escena.
Para la generación basada en referencias, asigna a cada entrada un rol claro. Una imagen puede establecer la identidad del personaje, un video puede guiar el movimiento de cámara y un archivo de audio puede definir la voz o la atmósfera. El prompt de texto debe conectar luego esas referencias en una sola instrucción de producción.
Fórmula reutilizable para prompts
Usa esta plantilla como punto de partida:
Crea un [duración] [tipo de plano] con [sujeto] realizando [acción] en [entorno]. Usa [movimiento de cámara] desde [punto de vista inicial] hasta [punto de vista final]. Conserva [identidad o detalles de referencia]. Ilumina la escena con [iluminación y color]. Haz coincidir [voz, música o efectos de sonido] con la acción visible. Mantén [composición, relación de aspecto y calidad de salida].
La siguiente tabla separa los controles más importantes.
| Control | Dirección recomendada | Error común |
|---|---|---|
| Identidad del personaje | Repite rasgos visuales distintivos y vestuario | Añadir varias descripciones contradictorias |
| Movimiento de cámara | Usa un movimiento dominante por toma corta | Combinar órbita, zoom, sacudida y grúa |
| Sincronización | Vincula la acción al inicio, medio o final del clip | Describir varios eventos sin secuencia |
| Iluminación | Especifica fuente, color, intensidad y atmósfera | Usar solo etiquetas generales de estilo |
| Audio | Identifica voz, música, ambiente y sincronización | Tratar el audio como un paso de posproducción sin relación |
| Referencias | Indica qué controla cada imagen, video o archivo de audio | Subir archivos sin asignarles un propósito |
Ejemplo: prompt de actuación de un personaje
Crea una toma cinematográfica de actuación de cinco segundos del personaje de referencia cantando directamente hacia la cámara. Conserva sus rasgos faciales, peinado y atuendo oscuro de escenario. Sigue el suave movimiento de cámara hacia adelante del video de referencia, manteniéndola centrada en un plano medio. Usa iluminación violeta intensa y cian sobre el escenario con una bruma suave detrás de ella. Haz coincidir la sincronización vocal con el movimiento de su boca y añade un ambiente estéreo contenido de la multitud. Mantén la composición limpia, realista y adecuada para un encuadre horizontal 16:9.
Ejemplo: prompt de movimiento abstracto
Crea un bucle infinito de punto de vista en cinco segundos viajando por un túnel geométrico hecho de marcos triangulares dorados que se alejan. Añade capas de luz neón pulsante rosa, morada y cian dentro de la estructura. Mantén el fondo como un vacío oscuro profundo. Usa un movimiento suave hacia adelante, perspectiva estable, gran profundidad y geometría repetitiva limpia. Añade una atmósfera electrónica sutil y sincronizada sin sobrepasar el ritmo visual.
Los clips cortos tienen poco tiempo para expresar cambios. Demasiados sujetos, movimientos, transiciones y eventos de audio pueden competir por la atención y reducir la consistencia.
Configuración paso a paso de la API de MiniMax H3
El flujo de trabajo de referencia usa un proceso basado en API con un archivo de entorno y una solicitud en Python. El endpoint exacto, el identificador del modelo, los límites de entrada y los precios pueden cambiar, así que verifícalos en la documentación actual de la plataforma de MiniMax antes de implementar.
Define la toma
Decide el sujeto, la acción, el movimiento de cámara, la duración, la relación de aspecto, la resolución y la dirección de audio. Escribe el prompt como un único resumen de producción antes de añadir archivos de referencia.
Prepara las entradas de referencia
Selecciona una imagen para la identidad, un video para el movimiento o un archivo de audio para la dirección sonora. Usa solo las referencias que resuelvan un problema concreto de control y marca claramente su propósito en el prompt.
Crea una clave de API protegida
Crea una cuenta a través de la plataforma oficial, genera una clave de API y guárdala en un archivo de entorno local. No coloques la clave directamente en código público, capturas de pantalla, repositorios ni archivos compartidos del proyecto.
Construye la carga útil de generación
Añade el nombre actual del modelo, el prompt, la resolución, la duración, la relación de aspecto y los campos de entrada compatibles a la carga útil de la solicitud. Confirma cada parámetro con la referencia actual de la API.
Envía y revisa el resultado
Envía la solicitud, registra el identificador de tarea, inspecciona el estado devuelto y revisa el clip final para comprobar identidad, movimiento, sincronización de audio, encuadre y artefactos no deseados.
Un plan práctico de solicitud puede organizarse así:
| Etapa | Entrada o configuración | Pregunta de revisión |
|---|---|---|
| Prompt | Resumen estructurado de producción | ¿La acción principal es inequívoca? |
| Identidad | Imagen del personaje o producto | ¿Se conservan los rasgos definitorios? |
| Movimiento | Referencia de cámara o movimiento | ¿El movimiento tiene una dirección clara? |
| Audio | Voz, música o ambiente | ¿El sonido coincide con el evento visible? |
| Salida | Duración, resolución, relación de aspecto | ¿Las configuraciones son compatibles y asequibles? |
| Respuesta | ID de tarea y estado | ¿La solicitud se completó sin error de API? |
El material proporcionado describe una configuración de ejemplo con una duración de cinco segundos, salida en 2K y un formato horizontal 16:9. También informa un costo de API de $0.13 por segundo para el flujo de trabajo mostrado. Como los precios y la disponibilidad del modelo son sensibles al tiempo, confirma las tarifas actuales y las configuraciones compatibles en la plataforma oficial antes de generar varias variaciones.
Mantén las credenciales en variables de entorno, rota de inmediato las claves expuestas y usa una pequeña solicitud de prueba antes de comprometer créditos importantes en una generación más larga.
Elige el modo de generación adecuado
Un prompt por sí solo es útil para explorar conceptos, pero las referencias se vuelven más valiosas cuando un proyecto necesita identidad, movimiento o sonido consistentes. Selecciona el modo más simple que ofrezca el control requerido. Las entradas adicionales pueden mejorar la dirección, pero también introducen más relaciones que el modelo debe interpretar.
El flujo de trabajo de referencia describe tres enfoques generales.
Texto a video
Ideal para pruebas de concepto, entornos, movimiento abstracto, tarjetas de título y situaciones en las que la identidad exacta no es esencial.
Generación guiada por imagen
Ideal para mantener un personaje, producto, vestuario o composición mientras el prompt controla el movimiento y el desarrollo de la escena.
Generación por referencia
Ideal para flujos de trabajo coordinados que usan texto, imágenes, video y audio para definir conjuntamente identidad, movimiento de cámara, actuación y sonido.
| Modo | Mejor uso | Fuerza de control | Preparación |
|---|---|---|---|
| Solo texto | Ideación rápida y experimentos visuales | Moderada | Escribe un prompt preciso |
| Imagen + texto | Continuidad de personaje o producto | Fuerte control de identidad | Prepara una imagen de referencia clara |
| Video + texto | Guía de cámara o movimiento | Fuerte control de movimiento | Elige una referencia de movimiento estable |
| Audio + texto | Dirección de actuación y sonido | Mejor guía de sincronización | Usa audio limpio y relevante |
| Múltiples referencias | Toma compleja y coordinada | Máxima demanda de planificación | Asigna un propósito a cada archivo |
Cuándo añadir más entradas
Usa una imagen cuando el sujeto deba conservar rasgos reconocibles. Añade un video cuando la trayectoria de la cámara o el movimiento físico importen más que una composición estática. Añade audio cuando el canto, el diálogo o la sincronización rítmica sean el centro de la escena.
Evita añadir una referencia simplemente porque está disponible. Un prompt de texto sencillo puede ser más fácil de depurar que una solicitud multimodal con prioridades poco claras.
Lista de revisión del prompt:
- Nombra el sujeto principal y sus rasgos definitorios
- Describe una acción dominante y un movimiento de cámara principal
- Asigna un rol claro a cada referencia de imagen, video o audio
- Especifica iluminación, atmósfera, comportamiento del audio, duración y encuadre
- Confirma los límites actuales de la API, la disponibilidad del modelo y los precios antes de enviar
Usa el número mínimo de referencias necesario para controlar la toma. Los roles claros producen resultados más útiles que una gran colección de archivos vagamente relacionados.
Solución de problemas y refinamiento del prompt
El refinamiento del prompt debe ser sistemático. Cambia una sola variable importante a la vez, compara el resultado con la versión anterior y lleva un registro breve de lo que cambió. Esto facilita determinar si un problema provino del prompt, del material de referencia o de una configuración de generación.
| Problema | Causa probable | Refinamiento |
|---|---|---|
| El sujeto cambia de identidad | La descripción de identidad es demasiado vaga o las referencias entran en conflicto | Repite los rasgos clave y usa una referencia de imagen sólida |
| La cámara se siente inestable | Hay demasiadas instrucciones de movimiento | Mantén una trayectoria de cámara dominante y simplifica la toma |
| El audio no coincide con la acción | La relación de sincronización no está explícita | Indica cuándo deben alinearse la voz, los efectos o el movimiento |
| La escena se ve recargada | Demasiados detalles de estilo y entorno | Elimina objetos secundarios y prioriza la composición |
| El formato de salida es incorrecto | Parámetros no compatibles o con nombres incorrectos | Comprueba el esquema actual de la API y los valores compatibles |
| La solicitud falla | Falta la clave, la carga útil es inválida o la entrada no es compatible | Valida variables de entorno, campos, límites de archivo y estado de la respuesta |
Un ciclo práctico de iteración
Empieza con una prueba de cinco segundos y un solo sujeto claro. Una vez que la identidad y la composición sean aceptables, añade una referencia de cámara o una capa de audio. Solo entonces experimenta con iluminación más compleja, movimiento ambiental o varios archivos fuente.
Para prompts cinematográficos, prioriza:
- Una posición estable del sujeto
- Un estado inicial y final claramente definidos
- Un movimiento principal de cámara
- Relaciones de color simples
- Sincronización de audio explícita
- Una duración corta para las pruebas iniciales
El material de referencia describe una arquitectura que comprime el contexto multimodal antes de la generación. Eso hace que la claridad del prompt sea especialmente importante: el modelo debe interpretar la relación entre las entradas proporcionadas, no solo procesarlas como activos no relacionados.
Q: ¿Cuál es la mejor estructura para un prompt de MiniMax H3?
Usa el orden de un resumen de producción: sujeto, acción, cámara, entorno, iluminación, audio, referencias y ajustes de salida. Coloca primero las restricciones más importantes.
Q: ¿Debo usar imágenes, video y audio en cada solicitud?
No. Usa cada referencia solo cuando resuelva un problema concreto de control. El texto es adecuado para ideación, mientras que las referencias de imagen, video y audio añaden guía de identidad, movimiento o sincronización.
Q: ¿Qué ajustes de salida debería probar primero?
Un clip corto en horizontal es un punto de partida práctico. El flujo de trabajo proporcionado usa cinco segundos, resolución 2K y una relación 16:9, pero confirma la compatibilidad actual antes de enviar.
Q: ¿La generación local de MiniMax H3 está garantizada actualmente?
No. El material proporcionado describe la disponibilidad planificada de pesos del modelo para la comunidad y la compatibilidad con hardware de consumo, pero el calendario de lanzamiento y los requisitos de hardware deben comprobarse en los anuncios oficiales.
Cuando un resultado esté cerca, conserva las partes exitosas del prompt y modifica solo una variable, como la velocidad de cámara, el color de la iluminación o la sincronización del audio.