Para hacer hablar a un objeto en DomoAI, dale una boca reconocible, una frase corta y audio de voz limpio. Yo limitaría el primer clip a un solo chiste o queja, usaría un encuadre cercano y reservaría el movimiento de cámara para un plano de recurso separado.
Qué necesitas antes de empezar
Solo necesitas tres materiales: una imagen, un guion corto y audio de voz limpio. Decide qué debe hacer el clip terminado antes de generar nada. Una taza de café que cuenta un chiste de seis segundos necesita un guion y un recorte distintos de los de una mascota que explica una función del producto.
- Un sujeto reconocible: Usa un personaje, mascota, ilustración, producto u objeto de frente con una zona de la boca clara.
- Un guion breve: Escribe para hablar, no para una página de destino. Mantén las frases sencillas y fáciles de interpretar.
- Audio de voz limpio: Genéralo con DomoAI Text to Speech o sube audio de voz compatible, como MP3 o WAV.
Para la primera prueba, busca una emoción, una idea y un encuadre. Cuando el personaje funcione, podrás construir un vídeo más largo con varias tomas breves.
Crea una cara capaz de sostener la interpretación
Si ya tienes una buena imagen, úsala. Si no, crea un sujeto nuevo con DomoAI Text to Image. Para un objeto, dale una cara sencilla que se entienda a tamaño pequeño: dos ojos claros, una boca evidente y espacio suficiente alrededor para la relación de aspecto final.
Usa el generador y editor de imágenes multimodelo cuando la fuente necesite retoques. DomoAI ofrece GPT Image 2, Nano Banana 2 y Nano Banana Pro como opciones de modelo para generar imágenes y editarlas con lenguaje cotidiano.
Corrige los problemas antes de animar:
- Elimina los textos o logotipos que puedan deformarse cuando se mueva la cara.
- Evita que manos, pelo, accesorios o sombras profundas tapen la boca.
- Usa un encuadre cercano o medio cuando la cara sea la acción principal.
- Elige un fondo sencillo si piensas añadir subtítulos después.
No hace falta un rostro humano fotorrealista. Talking Avatar también es adecuado para personajes estilizados, retratos de anime, mascotas, personajes ilustrados de marca y objetos divertidos.
Comprueba la imagen de origen
Un objeto parlante no necesita una cara humana realista. Necesita una boca que el espectador pueda reconocer y un diseño que deje espacio para la interpretación.
| Comprobación | Aprobado | Corregir antes de animar |
|---|---|---|
| Boca | Visible a tamaño de miniatura | Demasiado pequeña, oculta o mezclada con la textura |
| Texto del producto | Fuera de la zona de la boca y del movimiento | La etiqueta está donde la cara debe deformarse |
| Accesorios superpuestos | Ningún asa, pajita, mano o sombra tapa la cara | Mueve o retira la obstrucción |
| Espacio para subtítulos | Zona despejada encima o debajo del sujeto | Reencuadra o amplía el lienzo |
| Relación de aspecto | Coincide con la plataforma final | Fija el encuadre antes de colocar la cara |
Para ideas de personajes divertidos, compara la aplicación rápida Talking Avatar con el AI VTuber Maker. Una versión con mascota puede seguir la colección de flujos de mascotas parlantes, mientras que un dibujo animado en movimiento puede continuar con el flujo de caminar y hablar en 2D.
Escribe un guion que suene natural
Lee el guion en voz alta antes de generar el audio. Si te falta el aire o te trabas en una frase, acórtala. Un primer guion útil tiene entre 15 y 35 palabras.
Prueba esta estructura sencilla:
- Gancho: Di primero lo sorprendente.
- Un detalle útil: Explica lo que el espectador necesita saber.
- Cierre: Termina con una pregunta, un remate o un siguiente paso.
Ejemplo para una lámpara de escritorio parlante:
Llevo tres noches viéndote trabajar a oscuras. Enciéndeme, baja el brillo de la pantalla y dale un descanso a tus ojos.
No sobrecargues un clip breve con narración, acciones de cámara y varias emociones. Graba frases separadas cuando el sujeto deba cambiar de expresión o cuando quieras un punto de corte.
Genera o sube la voz
DomoAI Text to Speech admite el modo Single para un hablante y el modo Multi para diálogos entre dos hablantes. También admite clonación de voz, etiquetas de emoción como [Cheerful] y guiones de hasta 4.000 caracteres. Para las voces clonadas, el control de velocidad va de 0,5x a 2,0x.
Genera primero la voz, escucha la pronunciación y el ritmo y envía después el audio aprobado a Talking Avatar. También puedes subir un archivo compatible de voz o canto.
Mantén el audio limpio. La música, el ruido de multitudes o los efectos intensos pueden dificultar la revisión de la voz. DomoAI no mezcla una pista completa de música de fondo dentro de Talking Avatar, así que añade toda la banda sonora después de exportar, en CapCut, Premiere Pro, DaVinci Resolve u otro editor.
Anima el personaje u objeto en Talking Avatar
Abre DomoAI Talking Avatar y añade la imagen o el vídeo y el audio aprobado. Talking Avatar ofrece duraciones estándar de 5, 10 y 20 segundos. Los usuarios Pro también pueden utilizar las opciones Fast Mode de 30 y 60 segundos.
Usa el prompt independiente de acción o expresión para dirigir la actuación visible. El guion controla lo que dice el sujeto; este prompt controla cómo se comporta.
Algunas indicaciones útiles:
Sonrisa cálida, pequeño asentimiento, contacto visual relajado.Expresión de sorpresa, parpadeo rápido, ligera inclinación hacia la cámara.Presentación tranquila, movimiento sutil de cabeza, mirada estable.
Empieza con movimientos sutiles. Los giros grandes, los gestos rápidos o varias acciones en un prompt dificultan la consistencia, especialmente con objetos pequeños o caras ilustradas.
Mantén el diálogo y la acción en campos separados
| Campo | Ejemplo de lámpara de escritorio |
|---|---|
| Guion o audio | «Ilumino cada entrega urgente, ¿y así me lo agradeces?» |
| Prompt de acción | Expresión impasible, un parpadeo lento, ligera inclinación de la pantalla de la lámpara, cuerpo quieto, cámara fija |
Mis tres personalidades iniciales son un producto sarcástico que se queja de su trabajo, una mascota amable que explica una función y un objeto doméstico impasible que reacciona a una costumbre humana. Escribo primero la frase y después creo o subo la voz. Text to Speech es útil cuando la interpretación necesita una emoción o un ritmo repetible.
Si importa más la demostración del producto que la cara, el flujo de explicativos sin mostrar la cara puede ser un mejor siguiente paso que añadir más movimiento al avatar.
Elige el flujo adecuado para el sujeto
Mascotas parlantes
Usa una foto en la que el animal mire a la cámara y se vea el hocico. Evita que una lengua, juguete o pata tape la boca. Para un flujo centrado en mascotas, consulta la guía de vídeos de mascotas parlantes.
Personajes de anime e ilustrados
Mantén la cara lo bastante grande para reconocerla y evita el pelo sobre los labios. Una ficha de personaje clara o un retrato aprobado ayuda cuando necesitas varios clips. Explora más ideas de avatares parlantes para anime, mascotas y VTubers.
Productos y objetos
Decide si el propio objeto tiene cara o si debe presentarlo una mascota. Si la etiqueta del producto debe ser exacta, mantenla lejos de la boca animada y añade textos legales, precios y llamadas a la acción después de generar.
Presentadores y mascotas de marca
Usa Screen Keying cuando necesites componer al hablante sobre un fondo personalizado. Esto permite continuar el trabajo de forma más limpia en CapCut, Premiere Pro o un editor similar.
Soluciona problemas habituales de los objetos parlantes
La boca apenas se mueve
Usa un encuadre más cercano y una fuente con una zona de la boca más evidente. Comprueba que el pelo, los accesorios, las sombras o el desenfoque por baja resolución no tapen la cara.
La interpretación parece demasiado agitada
Acorta el prompt de acción. Mantén una emoción y un gesto por toma. Reserva los movimientos mayores para un plano separado de Image to Video o Character to Video.
El audio no se entiende bien
Regenera o vuelve a grabar la voz sin música ni ruido de fondo intenso. Divide el diálogo largo en secciones más breves para poder sustituir una frase débil sin reconstruir todo el vídeo.
El clip final parece estático
Combina un primer plano hablado con reacciones, planos de producto, subtítulos o escenas animadas breves. Talking Avatar debe encargarse del momento hablado; el montaje debe sostener toda la historia.
Preguntas frecuentes
¿Puede DomoAI hacer hablar a un objeto a partir de una imagen?
Sí. Usa una imagen clara junto con audio de voz generado o subido en Talking Avatar. Un rostro o una zona de la boca visible proporciona al modelo un objetivo de actuación más definido.
¿Puedo hacer hablar a una mascota o un personaje de anime?
Sí. Talking Avatar es adecuado para retratos realistas, mascotas, caras de anime, personajes ilustrados de marca y otras imágenes centradas en personajes. Usa una fuente frontal con una zona de la boca claramente visible.
¿Puedo añadir mi propia voz?
Sí. Puedes subir audio de voz compatible o generar la frase con DomoAI Text to Speech, incluidas voces clonadas cuando estén disponibles.
¿Puede Talking Avatar añadir música de fondo?
Añade la mezcla musical terminada después de exportar. Usa Talking Avatar para la actuación guiada por la voz y luego combina el clip con música y subtítulos en un editor externo.
¿Cuánto puede durar un clip de Talking Avatar?
Las opciones de duración estándar son de 5, 10 y 20 segundos. Los usuarios Pro pueden acceder a las opciones Fast Mode de 30 y 60 segundos. Consulta la página de precios actual de DomoAI, ya que el acceso según el plan puede cambiar.
Empieza con una prueba corta, aprueba la cara y la voz y construye después el vídeo final con las mejores tomas. Así concentras las revisiones y evitas gastar créditos en un clip largo antes de que el personaje funcione.


