El archivo WAV aporta el ritmo, las pausas, la velocidad y la interpretación; el retrato aporta la cara. Genera primero solo cinco o diez segundos. Antes de crear el clip completo, revisa la primera palabra, una pausa y el cierre final de la boca.
Qué controla el WAV y qué no controla
El WAV controla el ritmo de la interpretación, pero no determina el aspecto del personaje ni garantiza un movimiento natural. Al investigar un problema, separa la función del audio de la función de la imagen.
El audio puede influir en:
- El inicio y el final del habla
- El tiempo de las palabras y las pausas
- La velocidad y el ritmo
- El énfasis, la emoción y la energía vocal
- La duración total del clip impulsado por audio
El audio no define:
- El aspecto de la persona o del personaje
- El ángulo del rostro, la iluminación ni el detalle de la imagen
- El fondo y el encuadre
- Cuánto se mueven la cabeza o el cuerpo
- Si una boca estilizada puede formar cada sonido con claridad
Una cara parlante creada desde un retrato necesita movimiento facial nuevo. La sincronización labial sobre video hereda la interpretación existente y cambia principalmente cómo sigue la boca al audio de sustitución.
Esta diferencia también separa la animación de retratos de la sincronización labial basada en video. En el primer flujo, la imagen aporta el sujeto y el audio la interpretación. En el segundo, el clip de origen ya contiene la actuación.
Revisa el WAV antes de subirlo
Un archivo puede ser técnicamente válido y seguir siendo una mala entrada de voz. Escucha la grabación completa y corrige los problemas evidentes antes de generar video.
Lista de comprobación del WAV:
- Confirma la compatibilidad. Comprueba los formatos, el tamaño y la duración que admite actualmente la herramienta. No todos los WAV usan una codificación aceptada.
- Escucha de principio a fin. Que un archivo se abra no significa que esté completo ni libre de errores.
- Comprueba la claridad. Cada palabra necesaria debe entenderse sin subtítulos.
- Detecta el clipping. Los picos aplastados o los chasquidos pueden ocultar consonantes.
- Reduce sonidos que compiten. Elimina música, ruido de sala, eco, zumbidos o tráfico cuando tapen la voz.
- Recorta el silencio accidental. Quita el espacio vacío del principio y del final, pero conserva las pausas intencionales.
- Comprueba el ritmo. Un habla demasiado rápida deja menos tiempo para formar bocas claras.
- Cierra el contenido. Corrige nombres, cifras, pronunciación y redacción antes de animar.
- Verifica los permisos. Usa únicamente una voz y una grabación que puedas animar y publicar.
En DomoAI, Talking Avatar admite MP3, WAV y M4A de hasta 80 MB. La voz clara y sin música de fondo es el punto de partida más fácil de revisar.
No impongas una frecuencia de muestreo ni una profundidad de bits universal sin consultar la herramienta elegida. WAV es un contenedor y las codificaciones compatibles varían. Importa más una voz inteligible en un archivo aceptado que una especificación genérica.
Añade una pausa intencional como prueba de sincronización
Coloca una pausa breve y natural cerca del centro de la grabación. Ejemplo: «La primera escena está lista. [pausa] Vamos a revisar el tiempo».
La pausa crea un punto observable: la boca debe cerrarse o estabilizarse cuando se detiene la voz. Si continúa moviéndose, puede haber ruido residual, música, respiración, sonido ambiente o movimiento generado por el modelo.
Mantén corta la prueba. Un archivo de cinco o diez segundos basta para revisar la primera palabra, una pausa y el cierre final.
Elige una cara capaz de seguir el audio
El retrato debe mostrar suficiente información facial para crear un movimiento estable. Un WAV limpio no puede reparar una boca oculta, un ángulo lateral extremo ni un rostro borroso.
Empieza con una imagen que tenga:
- Un solo sujeto claro
- La cabeza de frente o casi de frente
- La boca visible y en posición neutra
- Luz uniforme sobre la parte inferior del rostro
- Ojos, labios y mandíbula nítidos
- Espacio alrededor de la cabeza para movimientos pequeños
Evita manos, micrófonos, cabello, sombras o accesorios sobre la boca. Un recorte excesivamente cerrado también puede producir fallos visibles en los bordes.
Ilustraciones, personajes anime, animales, pinturas y retratos históricos pueden requerir más pruebas porque sus proporciones y texturas no son las de una fotografía normal. Elige ojos y boca bien definidos y genera una muestra corta antes de usar un WAV largo.
Si la sincronización es correcta pero cambia el aspecto del personaje, revisa el retrato o la dirección de movimiento. Corrige la fuente con Edición de imagen o reduce el movimiento. Si la cara permanece estable pero la boca empieza tarde, revisa el WAV o la sincronización.
Genera el primer clip impulsado por audio
La primera generación debe probar las entradas, no intentar ser la producción final. Mantén una configuración controlada para relacionar cada resultado con una causa.
Sigue esta secuencia:
- Sube el retrato aprobado.
- Abre Talking Avatar y usa Texto a voz de DomoAI, graba directamente o sube MP3, WAV o M4A.
- Añade el WAV ya revisado.
- Elige una duración corta compatible.
- Añade una sola indicación de interpretación moderada si la herramienta lo permite.
- Previsualiza la imagen y el audio antes de enviar.
- Genera el clip y guarda la configuración utilizada.
Ejemplo de indicación:
Habla con naturalidad, mueve poco la cabeza, parpadea de vez en cuando y mantén una expresión neutra durante la pausa.
No acumules instrucciones contradictorias. Los gestos grandes, los giros rápidos o las expresiones extremas dificultan evaluar la sincronización del WAV.
Nombra cada versión con claridad, por ejemplo portraitA_wav-clean_motion-low_v01. Si modificas el audio, crea otro nombre. Un registro evita comparar dos clips en los que cambiaron varias entradas a la vez.
Cuando una versión supere la revisión de sincronización, coherencia facial y encuadre, aplica el Mejorador de video solo a ese resultado elegido.
Compara el resultado con la forma de onda
La sincronización es más fácil de evaluar cuando comparas el video con momentos identificados del audio. Reproducir al azar suele producir impresiones vagas, no correcciones concretas.
Marca estos puntos:
- Inicio del habla: ¿la boca empieza con la primera palabra audible?
- Frase rápida con consonantes: ¿los sonidos marcados provocan cambios de boca plausibles?
- Pausa intencional: ¿la boca se cierra o se estabiliza cuando se detiene la voz?
- Palabra enfatizada: ¿la energía visual coincide con la interpretación?
- Última palabra: ¿la boca se detiene al terminar el audio?
Mira una vez con sonido normal, otra sin sonido y otra a velocidad reducida. La reproducción normal muestra la experiencia real; el silencio revela movimientos repetidos, parpadeos extraños o cambios en el rostro; la velocidad reducida localiza el fotograma donde comienza el desfase.
Usa una hoja con marcas de tiempo:
| Tiempo | Evento de audio | Revisión visual | Resultado | Siguiente prueba |
|---|---|---|---|---|
| 00:01 | Primera palabra | La boca empieza con la voz | Correcto | Ninguna |
| 00:08 | Pausa intencional | La boca sigue moviéndose | Fallo | Revisar ruido en la pausa |
| 00:17 | Última palabra | La boca se cierra tarde | Revisar | Recortar el final y repetir |
Después de cualquier revisión fotograma a fotograma, mira el clip completo a velocidad normal. Un desajuste mínimo visible solo en cámara lenta quizá no afecte al público, pero los errores repetidos en las pausas sí suelen hacerlo.
Separa los problemas de audio de los de imagen
Cambia la entrada relacionada con el síntoma visible. Regenerar sin una hipótesis clara puede consumir tiempo y créditos sin corregir la causa.
| Síntoma | Fuente probable | Siguiente prueba |
|---|---|---|
| La boca se mueve durante el silencio | Ruido, música, respiración o comportamiento del modelo | Crear una pausa más limpia y repetir la muestra |
| La boca empieza tarde | Silencio inicial o desfase | Recortar el inicio y comparar |
| Las palabras rápidas se ven débiles | Habla acelerada o poco detalle en la boca | Ralentizar la frase o usar un retrato más claro |
| La parte inferior del rostro se estira | Ángulo lateral, boca tapada o movimiento fuerte | Usar una fuente frontal y reducir el movimiento |
| El rostro del personaje cambia | Poco detalle, recorte cerrado o variación de generación | Usar una fuente nítida y mantener el recorte |
| La cabeza queda rígida | Movimiento limitado o instrucción demasiado restrictiva | Probar un movimiento pequeño y explícito |
| El tiempo se desvía al final | Clip largo o problema de audio | Dividir el WAV en segmentos cortos aprobados |
Cambia una sola variable por versión. Si limpias el audio, cambias el retrato y reescribes la indicación a la vez, no sabrás qué produjo la mejora.
Divide los guiones largos en límites naturales de frase o escena. Mantén el retrato, el recorte y la dirección de movimiento entre segmentos. Revisa las uniones porque los clips separados pueden variar ligeramente en posición o expresión.
Ruta opcional para desarrolladores con recursos validados
Automatiza solo después de que el retrato y el WAV funcionen en una prueba manual. Una carga válida no demuestra que el resultado visual cumpla el estándar.
En un flujo con API, confirma la autenticación y el método de carga actuales. Consulta la API de Talking Avatar para referencias de medios, campos, reglas de duración, callbacks y errores. Envía la misma imagen y el mismo audio validados y guarda el ID de tarea, la versión de entrada, los ajustes, el resultado y el estado de fallo.
Deja la implementación completa en la documentación para desarrolladores. El flujo creativo debe centrarse en preparar y validar los recursos.
Preguntas frecuentes
¿Puede un WAV animar por sí solo una foto estática?
No. También necesitas una imagen facial compatible. El audio determina el ritmo y la interpretación; la imagen determina el aspecto del personaje.
¿Debe incluir música de fondo el WAV?
Por lo general, no. La voz sola es más fácil de analizar y sincronizar. Añade música en la edición después de aprobar la voz y el tiempo de la boca.
¿Por qué se mueve la boca durante el silencio?
La pausa puede contener ruido, música, respiración o sonido de sala. El modelo también puede mantener movimientos pequeños. Revisa la forma de onda, crea una pausa más limpia y compara otra generación corta.
¿Es WAV mejor que MP3 para una cara que habla?
No de forma automática. Usa un formato admitido y prioriza una voz clara. Si ambos funcionan, compara la misma grabación en lugar de asumir que el contenedor determina la calidad.
Prueba una pausa antes de usar la grabación completa
Usa un retrato claro y una grabación limpia con permiso. Añade una pausa intencional, marca los tiempos y cambia solo una variable cuando algo falle. Crea el clip completo únicamente cuando la versión corta sea estable.



