MiniMax H3 puede convertir una imagen de origen en un video corto. Los mejores resultados parten de una imagen limpia, un prompt centrado en el movimiento y un final bien definido. Esta guía explica cómo preparar la fuente, usar el primer y el último fotograma, añadir referencias, revisar el resultado y corregir errores frecuentes.
¿Qué hace la función de imagen a video de MiniMax H3?
La generación de imagen a video usa una imagen fija como punto de partida visual del movimiento. La fuente define el sujeto, la composición, la paleta, la iluminación y gran parte de la geometría de la escena.
El prompt debe explicar qué sucede después. Puede dirigir la acción del sujeto, el movimiento de cámara, el movimiento del entorno, el ritmo y el final previsto.
La API oficial de MiniMax identifica el modelo como MiniMax-H3. Admite salidas 768P o 2K, duraciones de 4 a 15 segundos y audio estéreo nativo. Los flujos documentados incluyen texto a video, imagen a video desde el primer fotograma, generación con primer y último fotograma y Reference Generation multimodal.
H3 no elimina la necesidad de planificar. Las extremidades ocultas, el texto dañado o las señales de profundidad contradictorias aumentan el riesgo de movimiento inestable o cambios visuales.
Empieza con una imagen preparada para el movimiento
Una imagen fija atractiva no siempre es una fuente estable para animar. Revísala como si fuera el primer fotograma de una toma.
Lista de comprobación de la imagen de origen
- Sujeto claro: el público identifica de inmediato a la persona, el objeto o el producto principal.
- Bordes legibles: las manos, el rostro, el contorno del producto y los objetos importantes no se confunden con el fondo.
- Espacio visible para el movimiento: el encuadre deja margen para que se mueva el sujeto o la cámara.
- Anatomía coherente: las extremidades y los rasgos faciales ya se ven correctos.
- Texto y logotipos estables: los elementos de marca siguen siendo legibles y no están deformados.
- Iluminación coherente: los brillos y las sombras corresponden a la escena.
- Profundidad clara: el primer plano, el sujeto y el fondo se distinguen como capas separadas.
- Relación de aspecto correcta: la fuente ya se adapta al formato de publicación previsto.
Corrige los problemas de origen antes de gastar generaciones de video. El Generador y editor de imágenes multimodelo puede reparar manos, texto, vestuario, fondos y detalles del producto. Entre sus modelos se encuentran GPT Image 2, Nano Banana 2 y Nano Banana Pro.
No intentes corregirlo todo a la vez. Cambia un problema visible, revisa el resultado y conserva el sujeto ya aprobado.
Describe el movimiento en vez de repetir la imagen
La imagen ya muestra el contenido de la escena. Usa el prompt para definir el movimiento y las restricciones.
Una estructura útil es la siguiente:
Subject action + camera movement + environmental motion + timing + locked details + forbidden changes
Este prompt de presentación de producto asigna una función a cada parte:
Animate this source image into a 6-second cinematic product reveal. Keep the same subject, color, logo placement, and background layout. Start with a slow push-in, add soft reflections on the surface, then finish with a slight camera arc from left to right. No new objects, no text changes, no face or logo distortion.
El prompt no vuelve a describir cada color u objeto. Protege los detalles importantes y dirige la toma.
Para una escena con un personaje, prueba lo siguiente:
The same character looks toward the window and takes one slow breath. Her hair moves slightly in the evening breeze. The camera makes a gentle push-in. Keep her face, outfit, room layout, and cel-shaded style unchanged. No new characters or sudden camera shake.
En la primera prueba, usa una acción principal del sujeto y un solo movimiento de cámara. Añade complejidad únicamente cuando la toma básica sea estable.

Usa cada componente del prompt para dirigir una parte de la toma o proteger un detalle que deba permanecer estable.
Usa el primer y el último fotograma cuando el final sea importante
Con una sola imagen inicial, la composición final queda abierta. Añade un último fotograma cuando la toma deba terminar en un ángulo, una pose, una composición o una transición concretos.
| Necesidad de la toma | Solo imagen inicial | Primer y último fotograma |
|---|---|---|
| Movimiento ambiental del personaje | Suele ser suficiente | Opcional |
| Acercamiento lento de cámara | Suele ser suficiente | Úsalo cuando el encuadre final deba ser preciso |
| Giro o presentación de un producto | Menos predecible | Mejor para definir un ángulo final |
| Cambio de antes y después | Poco control del punto final | Define ambos estados |
| Corte coincidente o transición | El final puede cambiar | Admite puntos de edición planificados |
| Cierre con logotipo o toma de producto | Riesgo de cambios en la composición | Ayuda a proteger la composición final |
Los dos fotogramas deben describir una transición plausible. Si el producto aparece de frente al inicio y la imagen final muestra una escena cenital sin relación, el modelo tendrá que inventar demasiado entre ambos puntos.
Si planificas fuera de MiniMax, Fotogramas a video ofrece dos flujos relacionados. Los modos Seedance 2.0 de ByteDance usan un fotograma inicial y uno final, mientras que DomoAI 2.4.1 admite de dos a ocho fotogramas clave con prompts por segmento.
Añade referencias solo cuando aclaren la toma
Las referencias deben resolver una ambigüedad, no convertirse en una carpeta de recursos sin filtrar.
Usa Reference Generation para referencias visuales y para audio opcional acompañado de medios visuales. La API actual admite hasta nueve imágenes, tres clips de video y tres clips de audio, con un máximo de 12 archivos en una entrada mixta. Cada clip de video o audio debe durar entre 2 y 15 segundos. La duración total de los videos de referencia y la del audio de referencia no puede superar 15 segundos en cada caso. La documentación de H3 indica que el audio debe acompañar al menos una imagen o un video, en lugar de ser la única referencia.
H3-Context-IR es un paso asíncrono independiente que interpreta el contexto multimodal y devuelve un prompt mejorado. No genera un video.
Asigna una función a cada referencia:
- Referencia de identidad para un rostro o personaje
- Referencia de estilo para el lenguaje visual y la paleta
- Referencia de producto para la forma, la etiqueta y el material
- Referencia de movimiento para una acción física concreta
- Referencia del entorno para una arquitectura o ubicación
Elimina las referencias que contradigan el fotograma de origen. Dos chaquetas, peinados o etiquetas de producto diferentes dificultan la interpretación de “mantener igual”.
Comprueba la configuración de salida antes de generar
Revisa los ajustes antes de evaluar la calidad del modelo. Una relación de aspecto incorrecta o una opción de audio inadecuada puede inutilizar una buena prueba de movimiento.
Confirma lo siguiente:
- Modelo H3 seleccionado
- Modo de imagen a video o de primer y último fotograma
- Duración del clip
- Salida directa 768P o 2K y, cuando esté disponible, regeneración opcional de 768P a 2K
- Relación de aspecto
- Comportamiento del audio
- Costo en créditos, acceso del plan y disponibilidad en tu región e interfaz
La API oficial permite solicitar directamente una salida 768P o 2K, con duraciones de 4 a 15 segundos y relaciones de aspecto comunes o adaptativas. Los resultados 768P que cumplan los requisitos también pueden usar el flujo documentado de regeneración a 2K. Esta regeneración es opcional, no la única forma de obtener 2K. H3 puede generar audio estéreo nativo. Las interfaces de terceros pueden ofrecer menos controles.
Aumenta la resolución solo cuando el movimiento, la identidad y la composición hayan superado la revisión. El Mejorador de video de DomoAI puede escalar el clip final hasta 4K, reducir el ruido y mejorar los detalles.
Revisa el inicio, la mitad y el final
Mira una vez el clip completo y después inspecciona tres fotogramas. La parte intermedia suele revelar errores que quedan ocultos en el primero y el último.
| Comprobación | Condición de aprobación | Señal de alerta |
|---|---|---|
| Identidad | El sujeto sigue siendo reconocible | Cambian el rostro, la forma del producto o el vestuario |
| Movimiento | La acción se desarrolla de forma natural | El sujeto queda congelado o acelera de repente |
| Cámara | El movimiento coincide con el prompt | Aparece un zoom, una sacudida o un cambio de ángulo no deseado |
| Fondo | La geometría se mantiene coherente | Las paredes, los letreros o los objetos se deforman |
| Texto y logotipos | Los detalles siguen siendo legibles | Las letras cambian o se desplazan |
| Audio | El sonido corresponde al acontecimiento visible | El diálogo, los efectos o el ambiente parecen desconectados |
| Final | El fotograma final sirve para la edición | La toma se detiene a mitad de la acción o pierde la composición |
Revisa el clip a velocidad normal y fotograma por fotograma. Un clip puede parecer fluido aunque el logotipo cambie durante varios fotogramas.
Corrige el movimiento débil, los cambios de identidad y el audio desajustado
El sujeto apenas se mueve
Sustituye palabras vagas como “dinámico” por una acción visible. Indica la parte del cuerpo, la dirección, la distancia y el ritmo.
En vez de make the scene more dynamic, escribe the subject takes two steps forward while the camera slowly tracks backward.
La cámara se mueve demasiado
Elimina las instrucciones de cámara que compitan entre sí. Elige un solo movimiento y añade una restricción como stable horizon, no handheld shake.
El rostro o el producto cambia
Reduce el movimiento, refuerza la restricción de identidad y usa una referencia más clara. En el caso de un producto, fija la posición del logotipo, el texto de la etiqueta, las proporciones y el material.
El fondo se deforma
Pide un movimiento local en lugar de cambiar toda la escena. Mantén fijas la arquitectura y la composición. Añade únicamente viento, reflejos, humo u otro efecto limitado.
El audio no encaja
Trata el audio como una capa de revisión independiente. Confirma los controles disponibles en el modo H3 que utilices. Cuando sea necesario, sustituye o mezcla la música, la narración y el sonido de marca en un editor externo.
El final no tiene la composición prevista
Usa un último fotograma si el modo actual lo admite. Haz que la transición sea físicamente plausible y simplifica la acción entre ambos extremos.
Adapta el movimiento al formato de publicación
Una misma imagen de origen necesita planes de movimiento distintos para una página de producto, un feed social o una secuencia cinematográfica.
Presentaciones de producto
Protege la silueta, la etiqueta, el material y el logotipo del producto. Usa un movimiento lento de cámara y pocos reflejos. Termina con una toma clara del producto, no en mitad del movimiento.
Shorts y Reels
Empieza de inmediato con una acción visible. Mantén el sujeto lo bastante grande para una pantalla de teléfono y compón en 9:16. Deja un margen seguro para los subtítulos antes de generar.
Escenas narrativas
Usa el movimiento para revelar una emoción o información. Una mirada, una respiración o un pequeño movimiento de cámara suele preservar mejor la identidad que una acción compleja de cuerpo completo. Planifica el siguiente corte antes de elegir el último fotograma.
Anuncios UGC con IA
Separa el gancho, la demostración del producto, la aparición del presentador y la toma final. Genera cada parte como una unidad breve. Así resulta más fácil sustituir clips débiles y revisar los detalles de marca.
Haz una toma representativa para la plataforma final antes de generar un lote. Una prueba horizontal estable no demuestra que un encuadre vertical más cerrado conservará las manos, el texto o los bordes del producto.
MiniMax H3 y la imagen a video en DomoAI
MiniMax H3 ya está disponible en DomoAI a través de Omni Reference.
Preguntas frecuentes
¿Cómo uso MiniMax H3 para crear un video a partir de una imagen?
Carga o referencia una imagen de origen limpia, elige la tarea de imagen a video disponible y escribe un prompt centrado en el movimiento. Revisa la identidad, el movimiento, la cámara, el fondo, el audio y el final antes de generar más clips.
¿MiniMax H3 admite video con primer y último fotograma?
La documentación actual de MiniMax describe flujos con primer y último fotograma, aunque los nombres de las tareas, las reglas de entrada y las vías de acceso pueden variar según la interfaz.
¿Qué tipo de imagen de origen funciona mejor?
Usa un sujeto claro, bordes legibles, anatomía coherente, texto estable, iluminación limpia y espacio suficiente para el movimiento. Adapta la relación de aspecto de la fuente a la plataforma final.
¿Puede H3 mantener consistente al mismo personaje o producto?
Las referencias y los prompts fijos pueden mejorar la continuidad, pero no la garantizan. Prueba clips cortos y comprueba los rostros, la ropa, las formas, el texto y el color en varios fotogramas.
¿Puede MiniMax H3 generar video con audio?
Sí. La página de lanzamiento y el repositorio oficiales de MiniMax documentan audio estéreo nativo. El repositorio especifica una salida estéreo de 32 kHz. Confirma qué controles de audio aparecen en la vía de acceso que utilices.
¿Puedo usar MiniMax H3 dentro de DomoAI?
Sí. MiniMax H3 ya está disponible en DomoAI a través de Omni Reference.
Planifica el movimiento antes de generar
Un resultado estable de imagen a video comienza con una fuente que pueda moverse, un prompt que describa el movimiento y un método de revisión definido.
Prepara una imagen fija sólida, ejecuta un prompt controlado e inspecciona el inicio, la mitad y el final antes de ampliar la escena.


