Para animar un personaje de Midjourney sin perder su aspecto, fija la identidad en una imagen limpia y deja que el prompt de vídeo describa el movimiento, sin volver a describir todo el personaje. Mi regla es sencilla: la imagen se encarga de la identidad; el prompt, del movimiento.
Si la cara, una mano o un detalle del vestuario ya resulta poco claro en la imagen, lo corrijo antes de animar. Un prompt de movimiento más largo rara vez recupera información visual ausente; normalmente ofrece al generador más posibilidades de reinterpretarla.
Por qué los personajes de Midjourney cambian al moverse
Midjourney es muy bueno en algo concreto: producir una imagen de estilo fijo con el rostro, la paleta y el acabado que realmente quieres. El problema empieza al pasar a la siguiente etapa.
La mayoría de los creadores pierde el aspecto porque vuelve a describir el personaje al animarlo: «anime girl, silver hair, red jacket, walking». El modelo de vídeo tiene entonces dos fuentes de verdad: tu imagen y tus palabras. Las mezcla y el rostro cambia.
Los cambios suelen empezar al pasar de una herramienta a otra: una descripción nueva puede contradecir los detalles de la imagen. Trata la referencia como la fuente de identidad y estilo, y reserva el prompt de vídeo para el movimiento y la dirección de cámara.
¿Puede Midjourney animar sus propias imágenes?
Los vídeos de Midjourney empiezan con 5 segundos. Puedes ampliarlos cuatro veces en incrementos de 4 segundos, hasta un máximo de 21 segundos. Admite Low Motion, High Motion, prompts de movimiento opcionales, bucles y un fotograma final diferente. La salida estándar es de 480p; los planes Standard, Pro y Mega permiten generar a 720p en Fast Mode.
Es realmente bueno en el movimiento ambiental: cabello que flota, un acercamiento lento, telas en movimiento y atmósfera.
Su límite está en la actuación de los personajes. No hay sincronización labial ni audio nativo, así que un personaje no puede hablar ni cantar. No puedes darle una actuación de referencia para que tu personaje copie el movimiento. Y el control sobre qué se mueve es limitado: una queja habitual es que anima bocas y rostros que debían permanecer quietos.
Así que la conclusión sincera es esta: si quieres que una imagen cobre vida, Animate de Midjourney suele bastar. Si quieres que un personaje actúe, necesitas un conjunto de herramientas de vídeo que use la imagen como fuente de verdad. Ese es el flujo que se explica a continuación.
Fija el aspecto antes de animar
No animes tu primera imagen buena. Anima la más clara y cuidada.
Una referencia que se mantiene bien al animarla suele tener un rostro legible, un vestuario inequívoco, iluminación uniforme y extremidades sin recortar. Los modelos de movimiento extrapolan lo que ven; cualquier ambigüedad puede convertirse en una invención del vídeo.
Corrige los problemas mientras todavía sea barato hacerlo. En Multi-Model Image Generator & Editor de DomoAI puedes limpiar la imagen de Midjourney antes de gastar un solo crédito de vídeo: reparar manos, corregir texto en la ropa, ajustar un detalle del vestuario o simplificar un fondo recargado. Incluye tres modelos: GPT Image 2 para un control preciso y una tipografía limpia, Nano Banana 2 para ediciones rápidas del día a día, y Nano Banana Pro para trabajar la consistencia de los personajes, con hasta nueve imágenes de referencia por sesión y salida en 4K.
Aportar varias referencias a Nano Banana Pro puede añadir contexto visual si necesitas otra pose o ángulo. Revisa el resultado frente al personaje aprobado antes de animarlo.
Guarda las imágenes que quieras conservar en Assets. Podrás reutilizarlas entre tomas sin volver a subirlas.
Elige el proceso de animación adecuado para la toma
No existe un único botón de «Midjourney a vídeo», porque no existe una única tarea. Tres rutas cubren casi todo, y elegir la incorrecta es la segunda causa más importante de desviación.
Proceso 1: una buena imagen se convierte en una toma animada
Usa Image to Video. Es el punto de partida para presentar un personaje, crear ambiente, acercar la cámara o animar una imagen principal de Midjourney.
DomoAI ofrece Seedance 2.0 como modelo de Image to Video, con resultados de 4–15 segundos, ajustes 480P/720P/1080P, movimiento cinematográfico, audio nativo y soporte para varios planos. También están disponibles DomoAI 2.4.1 Advanced y Fast para lograr movimiento realista y consistencia visual en clips de 5 o 10 segundos.
Consejo práctico: haz borradores con un modelo Fast a baja resolución hasta acertar con el movimiento y después vuelve a generar el mejor a 1080P. Los planos de personajes suelen requerir varios intentos y no hay motivo para pagar el precio completo por los descartes.
Proceso 2: importan tanto el inicio como el final de la toma
Usa Frames to Video para transiciones y transformaciones: ojos cerrados a abiertos, ropa cotidiana a disfraz, antes y después.
Dos modos con una diferencia real. Con Seedance 2.0 / Seedance 2.0 Fast, proporcionas solo un fotograma inicial y uno final y el modelo rellena el intervalo. Con DomoAI 2.4.1, puedes aportar 2–8 fotogramas clave con prompts de movimiento por segmento y generar de 1 a 56 segundos. Es lo que necesitas cuando has creado el storyboard de una secuencia en Midjourney y quieres que el vídeo pase por cada fotograma.
Midjourney también puede animar desde un fotograma inicial hasta otro final distinto. Úsalo para una transición nativa de Midjourney de hasta 21 segundos. Usa DomoAI Frames to Video cuando necesites el control de inicio y final de Seedance o los 2–8 fotogramas clave, prompts por segmento y flujo de 1–56 segundos de DomoAI 2.4.1.
Proceso 3: tu personaje interpreta un movimiento de referencia
Usa Character to Video. Esto es algo que Midjourney sencillamente no puede hacer y la razón por la que la mayoría de los creadores de personajes acaba usando una segunda herramienta.
Proporciona un vídeo de referencia y la imagen de tu personaje de Midjourney. Sustituye al personaje conservando exactamente el movimiento original. Un baile, un ciclo de marcha o un gesto: ahora tu personaje lo ejecuta. Subject Only sustituye al personaje mientras mantiene el resto de la escena más cerca del original.
Los modos de Seedance 2.0 duran de 4 a 15 segundos; DomoAI 2.4.1 llega a 30 segundos por generación. La imagen del personaje puede ser JPEG, PNG o JPG de hasta 10 MB; el vídeo de referencia puede ser MP4, MOV o AVI.
Es el flujo de anime y VTuber en un solo paso: una imagen de un personaje original de Midjourney, una referencia de baile y tu personaje ya baila sin que animes ni un fotograma.
Crea una ficha de identidad antes del movimiento
Guardo una pequeña ficha de identidad junto a la imagen fuente. No es otro prompt enorme, sino una lista breve de detalles que puedo revisar al principio, en medio y al final de cada clip.
| Elemento fijo | Qué registrar | Cuándo descartar el clip |
|---|---|---|
| Rostro | Color de ojos, forma de la cara, línea del cabello y rasgo distintivo | Cambian dos o más rasgos |
| Vestuario | Forma de la chaqueta, color de los ribetes y accesorios | Un detalle clave desaparece o cambia de lado |
| Silueta | Longitud del pelo, anchura de hombros y contorno de falda o abrigo | El contorno corporal cambia durante la acción principal |
| Toma | Recorte, sensación de lente, altura de cámara y dirección de la luz | El encuadre rompe la continuidad con la toma anterior |
| Complejidad del movimiento | Una acción del sujeto + un movimiento de cámara + una indicación ambiental | El clip inventa acciones adicionales que ocultan la identidad |
Si ya fallan dos comprobaciones de la imagen de origen, vuelvo a Multi-Model Image Generator & Editor. Para fuentes anime, la guía de animación con Niji 7 ayuda a separar las decisiones de diseño de imagen de las de movimiento. Para una secuencia más larga, uso el flujo de coherencia de personajes y planifico la escena con la guía de storyboards con IA.
Un prompt para copiar en tu primera toma
El prompt describe el movimiento y la cámara. No describe al personaje: la imagen ya lo ha hecho.
El sujeto mantiene su posición, respira lentamente y el pelo se mueve con suavidad. La cámara se acerca despacio, con poca profundidad de campo. Luz de contorno suave y partículas de polvo en el aire. Sin cambios en el rostro, el vestuario ni el peinado.
Fíjate en la última línea. Indicar qué no debe cambiar tiene poco glamour, pero funciona. Añade indicaciones de cámara por segmentos de tiempo cuando quieras más control: CAM 1 (0-3s): slow push in — o pulsa AI Optimize para ampliar un prompt escaso hasta convertirlo en algo que el modelo realmente pueda utilizar.
Cuando el aspecto sigue cambiando: correcciones útiles
El rostro cambia a mitad del clip. El clip es demasiado largo para la cantidad de información de la imagen. Acórtalo. Dos clips limpios de 5 segundos montados juntos superan a una toma de 15 segundos que se desvía; esta es la solución más habitual.
El vestuario inventa detalles. La imagen era ambigua en esa zona. Vuelve a la edición de imagen, define el detalle y anima otra vez. No intentes resolver con prompts una imagen de origen imprecisa.
El personaje se mueve cuando no debería. Añade una indicación explícita, como «sin cambios en el rostro, vestuario ni peinado», y elige un encuadre con menos movimiento.
El estilo pierde carácter. El acabado de Midjourney forma parte del personaje. Si un proceso lo diluye, reduce el movimiento solicitado: un movimiento amplio obliga a reconstruir más información y puede afectar al estilo.
Todo se desvía, siempre. El problema es la imagen de referencia, no el modelo. Los recortes, los ángulos extremos y las sombras intensas privan al modelo de información. Regenera una referencia más limpia, más plana y más completa y vuelve a intentarlo.
Haz que el personaje hable o cante
El vídeo de Midjourney no tiene sincronización labial, así que este paso siempre se hace fuera de la plataforma.
Talking Avatar toma la imagen de tu personaje de Midjourney y audio, ya sea generado con el texto a voz de DomoAI o un MP3/WAV subido, y produce un personaje que habla o canta. Las duraciones estándar son 5/10/20 segundos, con modo rápido de 30 y 60 segundos en el plan Pro. Puedes dirigir la expresión por separado del guion, sin tener que introducir «sonríe» o «asiente» dentro del diálogo.
Para cantantes de IA, divide una pista vocal larga en segmentos cortos. Revisar y sustituir una toma mala de 15 segundos es mucho más barato que volver a generar una canción completa.
Una limitación que conviene reconocer: aquí no se añaden la música de fondo ni la mezcla de la canción completa. Exporta el clip y coloca la pista debajo en CapCut, Premiere Pro o DaVinci Resolve.
Termina el clip
La generación alcanza 1080P. Para la entrega, pasa el montaje final por Video Upscaler para llegar hasta 4K.
El orden importa: aumenta la resolución de la toma que vas a conservar, no de cada borrador. Y si haces muchas iteraciones, Relax Mode en el plan Standard y superiores genera resultados aptos sin gastar créditos. Es más lento, pero trabajar con personajes requiere muchos intentos y aquí es donde empiezan a salir asequibles. Los detalles están en la página de precios.
Preguntas frecuentes
¿Puedo usar comercialmente imágenes de Midjourney en herramientas de vídeo con IA?
Midjourney afirma que los suscriptores suelen ser propietarios de las imágenes y vídeos que crean, sujetos a sus condiciones y excepciones. Las empresas con más de un millón de dólares de ingresos brutos anuales necesitan un plan Pro o Mega para uso comercial. DomoAI concede derechos comerciales sobre los resultados de planes de pago. Consulta las condiciones actuales de ambos servicios antes de publicar para un cliente.
¿Por qué mi personaje cambia de aspecto en cada toma?
Estás describiendo al personaje en el prompt en vez de dejar que la imagen transmita su identidad. Anima a partir de una única referencia fijada y limita el prompt al movimiento.
¿Es suficiente el modelo de vídeo de Midjourney?
Para movimiento ambiental sobre una única imagen, a menudo sí. Para sincronización labial, transferencia de movimiento desde una actuación de referencia o clips más allá de su límite de ampliación, necesitarás herramientas de vídeo específicas.
¿Cuál es el clip más largo que puedo generar a partir de una imagen de Midjourney?
Midjourney empieza con 5 segundos y permite cuatro ampliaciones de 4 segundos, hasta un máximo de 21. En DomoAI, Image to Video con una sola imagen y Seedance 2.0 genera entre 4 y 15 segundos. Los flujos más largos de Frames to Video y Character to Video usan entradas adicionales y resuelven tareas distintas.
¿Tengo que volver a subir mi imagen en cada herramienta?
No. Guarda las imágenes una vez en Assets y luego arrástralas desde el panel History directamente a la herramienta que vayas a usar después.
Empieza con una imagen
Toma tu mejor personaje de Midjourney, cuyo aspecto quieres conservar, haz una edición cuidada y luego una animación de 5 segundos. Empieza por una sola toma antes de plantearte un vídeo musical completo.
Si el rostro se mantiene, el flujo funciona y todo lo anterior es solo cuestión de escala.
Anima tu personaje de Midjourney con DomoAI →


