Despliegue local de MiniMax H3: guía de configuración - Código abierto

Despliegue local de MiniMax H3: guía de configuración

Aprende a descargar los pesos abiertos de MiniMax H3, preparar las dependencias, planificar el hardware y separar la inferencia local de las funciones alojadas de H3.

2026-08-03
Equipo de la Wiki de MiniMax H3
Guía rápida
  • El despliegue local de MiniMax H3 utiliza los pesos H3-Base publicados en lugar de todas las funciones de la plataforma alojada.
  • Fuente de descarga: usa el repositorio oficial de MiniMax H3 en Hugging Face.
  • Entorno: prepara Git LFS, acceso a Hugging Face, un entorno aislado de Python y aceleradores compatibles.
  • Planificación de hardware: las necesidades de memoria varían según la precisión, la duración, la resolución, el offloading y el número de dispositivos.
  • Límite de funciones: Context-IR alojado y la compatibilidad completa con Regenerate 2K están separados de la versión de pesos abiertos.

Despliegue local de MiniMax H3: qué está disponible

MiniMax H3 es un modelo multimodal de generación de vídeo con IA lanzado el 31 de julio de 2026. Está diseñado para trabajar con texto, imágenes, video y audio, y produce clips de video cortos con audio estéreo nativo sincronizado. Las especificaciones públicas oficiales describen salidas de hasta 15 segundos, resoluciones de hasta 2K, video a 24 FPS, audio estéreo a 32 kHz y un Transformer H3-Omni de aproximadamente 33B parámetros.

Para los usuarios locales, la distinción más importante es entre los pesos abiertos H3-Base descargables y los servicios alojados de MiniMax. Descargar los archivos del modelo ofrece a los desarrolladores un punto de partida de inferencia autogestionada. No proporciona automáticamente todos los flujos de trabajo de API gestionados, optimizaciones del lado del servicio, la capacidad de Context-IR ni el módulo completo de regeneración 2K.

Pesos abiertos

Descarga los archivos del modelo H3 publicados oficialmente desde el repositorio de MiniMaxAI en Hugging Face y gestiona el almacenamiento de forma local.

API alojada

Usa la infraestructura de MiniMax para tareas asíncronas, escalado, servicio del modelo, recuperación de archivos y actualizaciones gestionadas por la plataforma.

Flujo de trabajo de CLI

Usa la CLI de MiniMax para las operaciones de línea de comandos compatibles, manteniendo el modelo de servicio alojado.

Inferencia local

Configura tu propio entorno de Python, acelerador, precisión, almacenamiento y salida alrededor de los pesos publicados.

ÁreaInformación descrita oficialmenteSignificado para el despliegue local
ModeloModelo multimodal de vídeo de MiniMax H3Descarga la configuración y los pesos publicados
Estado de los pesosLos pesos H3-Base están disponiblesLa versión abierta no es idéntica a todas las funciones del servicio alojado
VideoHasta 15 segundos, hasta 2K, 24 FPSLos límites locales reales dependen de la configuración y el hardware
AudioAudio estéreo nativo sincronizado, 32 kHzConfirma la compatibilidad de audio en el flujo del repositorio antes de usarlo en producción
ArquitecturaTransformer H3-Omni, aproximadamente 33B parámetrosPlanifica un entorno de inferencia considerable
Módulos alojadosContext-IR y Regenerate 2K completo no están completamente abiertos de forma localNo asumas que están incluidos en la descarga base
Principio de despliegue

Trata la versión de Hugging Face como un paquete de modelo autogestionado, no como un espejo de toda la plataforma alojada de MiniMax. Consulta la documentación del repositorio antes de habilitar cualquier flujo de trabajo específico.

El mejor método de despliegue depende de tu objetivo:

  • Elige la API alojada cuando necesites servicio gestionado, manejo de tareas asíncronas o una integración sencilla con la aplicación.
  • Elige la CLI cuando quieras acceso desde la terminal a los servicios compatibles de MiniMax.
  • Elige los pesos locales cuando el control de la infraestructura, el almacenamiento privado, la inferencia personalizada o la flexibilidad de investigación sean más importantes que la comodidad gestionada.

Entre las referencias oficiales útiles se incluyen el anuncio de MiniMax H3, el repositorio de MiniMax H3 en Hugging Face y el repositorio de MiniMax CLI.

Descarga segura de los pesos de MiniMax H3

Empieza con el repositorio oficial MiniMaxAI/MiniMax-H3. Antes de descargar, revisa la tarjeta del repositorio, la licencia, la estructura de archivos, el acceso requerido y las instrucciones de inferencia. Los archivos grandes del modelo suelen usar Git LFS, por lo que una instalación normal de Git puede no ser suficiente para recuperar correctamente todos los archivos.

Los siguientes comandos representan el patrón de configuración documentado. Los nombres de las dependencias, los archivos del repositorio y las opciones de comando pueden cambiar a medida que se actualiza la versión, así que verifícalos en el repositorio el día de la instalación.

1

Revisa la licencia y las notas del repositorio

Lee la licencia de la comunidad y las condiciones de uso antes de descargar o desplegar MiniMax H3. Confirma el uso permitido, las reglas de redistribución, las condiciones sobre obras derivadas, los requisitos comerciales y cualquier obligación de aviso o atribución.

2

Prepara Git LFS y el acceso a Hugging Face

Instala Git LFS, inicialízalo y autentícate con Hugging Face si el repositorio requiere una cuenta o que se acepte la licencia. Mantén las credenciales fuera de los scripts públicos y los cuadernos compartidos.

3

Descarga los archivos oficiales

Usa el clon oficial del repositorio o el flujo de Hugging Face CLI. Un patrón típico es git lfs install seguido de huggingface-cli download MiniMaxAI/MiniMax-H3 --local-dir ./MiniMax-H3.

4

Verifica el directorio local

Confirma que el directorio contiene la configuración publicada, los archivos del modelo, el tokenizador o los componentes de texto y la documentación del repositorio. Compara los tamaños de archivo o los checksums cuando la versión los proporcione.

5

Conserva una copia versionada

Registra la fecha de descarga, la revisión del repositorio, las versiones de las dependencias, el entorno CUDA y la configuración local. Esto hace que la resolución de problemas y la comparación de resultados posteriores sean más fiables.

Método de descargaMejor usoRequisito principalNota importante
Clon de Git con LFSExtracción completa del repositorioGit, Git LFS, acceso al repositorioAsegúrate de que los archivos grandes se descargan realmente
Hugging Face CLIDescargas automatizadas o selectivasHugging Face CLI y autenticaciónUsa un directorio local dedicado para el modelo
API alojadaSin almacenamiento local del modeloCuenta de MiniMax y clave APIEsto es acceso al servicio, no despliegue de pesos
MiniMax CLIFlujo alojado basado en terminalInstalación de CLI y autenticaciónLos comandos compatibles siguen el servicio alojado
No uses espejos no verificados

Evita los archivos de modelo de terceros cuando el repositorio oficial de Hugging Face esté disponible. Una descarga incompleta o modificada puede generar errores de archivos faltantes, configuraciones incompatibles o obligaciones de licencia poco claras.

Para la gestión del almacenamiento, mantén los archivos del modelo separados de las salidas generadas. Usa una estructura predecible como:

  • models/MiniMax-H3/ para la versión descargada
  • configs/ para los ajustes de inferencia local
  • inputs/ para los activos de referencia aprobados
  • outputs/ para los videos y audios generados
  • logs/ para registros de tareas, errores y detalles del entorno

Esta estructura ayuda a evitar la eliminación accidental del paquete del modelo cuando limpias archivos temporales de salida.

Planificación de hardware y entorno

El despliegue local de MiniMax H3 requiere más planificación que descargar un pequeño checkpoint. La arquitectura Transformer de aproximadamente 33B es solo una parte de la carga de trabajo. El uso de memoria también cambia con la precisión, la resolución, la duración, el número de fotogramas, las entradas de referencia, la implementación de atención, el offloading y el número de aceleradores.

Los materiales disponibles no establecen un único requisito universal de GPU. En su lugar, planifica tu sistema en torno a la configuración que pretendes ejecutar y a las instrucciones oficiales del repositorio.

Factor de configuraciónEfecto en la inferencia localRespuesta práctica de planificación
PrecisiónUna precisión menor puede reducir el uso de memoria del aceleradorUsa solo los modos compatibles con la versión y prueba la calidad de salida
DuraciónLos clips más largos aumentan la carga temporalEmpieza con clips de prueba cortos antes de ampliar la duración en producción
ResoluciónUna resolución más alta aumenta la demanda de memoria y procesamientoPrototipa con un ajuste compatible más bajo cuando sea apropiado
OffloadingEl offloading a CPU o disco reduce la presión sobre la GPUEspera una generación más lenta y supervisa la memoria del sistema
Número de dispositivosVarios aceleradores pueden distribuir cargas de trabajo más grandesConfirma que el repositorio admite el mapeo de dispositivos previsto
Entradas de referenciaImágenes, videos y contexto multimodal pueden añadir cargaPrueba cada combinación de entradas de forma independiente
AlmacenamientoLos pesos, la caché, las entradas y las salidas requieren mucho espacioConserva capacidad libre para la caché del modelo y los resultados generados

La memoria primero

Comprueba la memoria del acelerador, la RAM del sistema y el espacio de disco disponible antes de intentar una generación larga o de alta resolución.

Configuración reproducible

Fija el entorno de Python y registra las revisiones de CUDA, del controlador, del framework y del repositorio para realizar pruebas repetibles.

Pruebas controladas

Empieza con una generación breve solo con prompt y luego añade referencias, instrucciones de audio, duración y resolución, una variable cada vez.

Una secuencia práctica de entorno es:

  1. Crea un entorno virtual o un contenedor.
  2. Instala las versiones de dependencias especificadas por el repositorio H3.
  3. Confirma que el acelerador es visible para el framework.
  4. Ejecuta el ejemplo de inferencia más pequeño compatible.
  5. Aumenta la duración, la resolución o la complejidad de las referencias de forma gradual.
  6. Supervisa el uso de memoria, el tiempo de generación y la integridad de la salida.
Orden de prueba recomendado

Primero valida texto a video o el ejemplo más pequeño del repositorio. Después prueba por separado las referencias de imagen, las referencias de video, el comportamiento del audio, una duración mayor y una resolución más alta.

No asumas que una descarga exitosa del modelo significa que el sistema está listo para todos los modos de H3. La compatibilidad local depende de los scripts de inferencia publicados y de la configuración. Las funciones alojadas, como la regeneración 2K gestionada, pueden tener requisitos de infraestructura y disponibilidad diferentes.

Pesos locales vs funciones alojadas de H3

La forma más clara de evitar confusiones en el despliegue es separar lo que se ejecuta en tu infraestructura de lo que sigue siendo una capacidad del servicio alojado. La versión de pesos abiertos y la API pertenecen a flujos de trabajo relacionados, pero distintos.

CapacidadPesos locales de H3Servicio alojado de MiniMax
Almacenamiento del modeloTu infraestructura local o privadaGestionado por MiniMax
EscaladoConfigurado por tu equipo de despliegueGestionado por la plataforma
ActualizacionesDescargadas y desplegadas manualmenteAplicadas a través del servicio
Manejo de tareasImplementado en tu flujo de inferenciaPuntos finales de tareas asíncronas y consultas
Entrega de salidaGuardada en almacenamiento local o conectadoRecuperada mediante APIs de archivos o herramientas de la plataforma
Acceso a H3-BaseDisponible a través de los archivos publicadosDisponible según la configuración del servicio
Context-IRNo completamente incluido en la versión abierta localDisponible solo donde lo admita el servicio alojado
Regenerate 2K completoNo está completamente abierto de forma local según el material proporcionadoCapacidad alojada separada donde esté disponible

Para una integración con API alojada, el patrón documentado es asíncrono:

  • Envía una solicitud de generación de video.
  • Guarda el task_id devuelto.
  • Consulta la tarea hasta que alcance un estado de éxito o fallo.
  • Recupera el identificador de archivo devuelto.
  • Copia la descarga resultante al almacenamiento permanente de la aplicación.

Esto difiere de la inferencia local, donde tu script normalmente escribe la salida directamente en un directorio configurado. La API alojada también introduce autenticación, límites de tasa, cuotas de cuenta y manejo de errores del lado del servicio.

Límite de funciones

Descargar los pesos de MiniMax H3 no concede acceso a los precios de la API alojada, colas gestionadas, optimización del lado del servicio ni a los módulos que no se incluyeron en la versión abierta.

Usa la siguiente tabla de decisión al seleccionar una arquitectura:

PrioridadRuta recomendadaMotivo
Resultado inicial más rápidoAPI alojada o Hailuo AILa infraestructura gestionada reduce el trabajo de configuración
Infraestructura privadaPesos localesLas entradas y salidas pueden permanecer dentro de tu entorno
Flujo de trabajo automatizado de la aplicaciónAPI alojadaLa creación de tareas, el sondeo y la recuperación de archivos están documentados
Investigación y servicio personalizadoPesos localesControlas la configuración de inferencia y el diseño del despliegue
Baja carga operativaServicio alojadoEl escalado y el servicio del modelo se gestionan externamente
Máxima paridad de funcionesVerifica la disponibilidad alojadaH3-Base local no es toda la superficie del producto alojado

Lista de verificación y solución de problemas del despliegue local

Usa esta lista de verificación antes de tratar una instalación local de H3 como lista para producción.

Lista de verificación previa:

  • Lee la licencia oficial de MiniMax H3 y las instrucciones del repositorio
  • Instala Git LFS o la herramienta de descarga de Hugging Face compatible
  • Verifica los archivos del modelo, los archivos de configuración y la capacidad de almacenamiento local
  • Crea un entorno aislado de Python o de contenedor
  • Confirma la compatibilidad entre acelerador, controlador, framework y precisión
  • Ejecuta una prueba breve antes de habilitar referencias o salida de alta resolución
SíntomaÁrea probable de inspecciónRespuesta recomendada
Falta un archivo del modeloGit LFS o descarga incompletaRevisa de nuevo el acceso al repositorio y vuelve a descargar los archivos grandes
Error de memoria insuficienteResolución, duración, precisión o referenciasReduce la carga, usa el offloading compatible o añade aceleradores
Error de importación o versiónDependencias de PythonCoincide con las versiones requeridas por el repositorio en un entorno limpio
Generación lentaOffloading o hardware insuficienteComprueba la asignación de dispositivos y reduce la complejidad de la prueba
Modo no compatibleLimitación de la versión localConfirma si el modo está documentado para H3-Base
Desajuste de audioScript de inferencia o configuraciónVerifica el flujo de audio nativo de la versión y los ajustes de salida
Resultados diferentes tras las actualizacionesDependencias o revisión cambiadasRegistra las versiones y fija una configuración que sepas que funciona
Método de solución de problemas

Cambia una sola variable cada vez. Si una prueba breve solo con prompt funciona, añade por separado un archivo de referencia, la duración, la resolución o una instrucción de audio para aislar la causa del fallo.

Para el mantenimiento, conserva un pequeño registro de despliegue que incluya:

  • Revisión del repositorio y fecha de descarga
  • Sistema operativo y versión de Python
  • Versiones del framework, CUDA y controlador
  • Ajustes de precisión y offloading
  • Resolución de entrada, duración y tipo de referencia
  • Ruta de salida y tiempo de generación observado
  • Mensajes de error de las pruebas fallidas

Este registro es especialmente útil porque el comportamiento de H3 puede depender de algo más que de los pesos del modelo. Un cambio en el script de inferencia, el framework, el controlador del acelerador o la configuración puede afectar al uso de memoria y al comportamiento de la salida.

Q: ¿Qué incluye el despliegue local de MiniMax H3?

Incluye descargar y ejecutar los archivos del modelo H3-Base publicados oficialmente en un entorno que tú gestionas. No incluye automáticamente todas las funciones alojadas de MiniMax.

Q: ¿Está disponible localmente toda la plataforma alojada de MiniMax H3?

No. El material proporcionado distingue los pesos abiertos H3-Base de los servicios alojados de Context-IR y del módulo completo Regenerate 2K, que no están completamente abiertos de forma local.

Q: ¿Qué GPU se requiere para MiniMax H3?

El material proporcionado no establece un único requisito universal. Las necesidades de hardware varían según la precisión, la duración, la resolución, las referencias, el offloading y el número de dispositivos, así que sigue la guía actual del repositorio.

Q: ¿Deben usar los principiantes los pesos locales o la API alojada?

Los principiantes suelen tener un camino de configuración más corto con Hailuo AI o la API alojada. Los pesos locales son más adecuados para usuarios que necesitan control de la infraestructura, procesamiento privado o gestión personalizada de la inferencia.