Le fichier WAV fournit le rythme, les pauses, la vitesse et l'interprétation ; le portrait fournit le visage. Générez d'abord cinq ou dix secondes. Avant de créer la vidéo complète, vérifiez le premier mot, une pause et la fermeture finale de la bouche.
Ce que le WAV contrôle, et ce qu'il ne contrôle pas
Le WAV contrôle le rythme de l'interprétation, mais il ne détermine pas l'apparence du personnage et ne garantit pas un mouvement naturel. Distinguez le rôle de l'audio de celui de l'image pendant le diagnostic.
L'audio peut influencer :
- Le début et la fin de la parole
- Le timing des mots et des pauses
- Le débit et le rythme
- L'accentuation, l'émotion et l'énergie vocale
- La durée totale de la séquence pilotée par l'audio
L'audio ne définit pas :
- L'apparence de la personne ou du personnage
- L'angle du visage, l'éclairage ou les détails de l'image
- L'arrière-plan et le cadrage
- L'amplitude des mouvements de tête ou de corps
- La capacité d'une bouche stylisée à former clairement chaque son
Un visage parlant créé depuis un portrait nécessite de nouveaux mouvements faciaux. La synchronisation labiale appliquée à une vidéo conserve l'interprétation existante et adapte surtout la bouche au nouvel audio.
Cette distinction sépare aussi l'animation de portrait de la synchronisation labiale à partir d'une vidéo. Dans le premier cas, l'image fournit le sujet et l'audio la diction. Dans le second, la prestation est déjà présente dans la vidéo source.
Vérifiez le WAV avant l'importation
Un fichier peut être techniquement valide tout en constituant une mauvaise source vocale. Écoutez l'enregistrement complet et corrigez les défauts évidents avant de générer la vidéo.
Contrôle préalable du WAV :
- Confirmez la compatibilité. Vérifiez les formats, la taille et la durée pris en charge par l'outil. Tous les encodages WAV ne sont pas forcément acceptés.
- Écoutez du début à la fin. Un fichier qui s'ouvre n'est pas nécessairement complet ni exempt d'erreurs.
- Vérifiez l'intelligibilité. Chaque mot nécessaire doit être compréhensible sans sous-titres.
- Repérez l'écrêtage. Des crêtes aplaties ou des craquements peuvent masquer les consonnes.
- Réduisez les sons concurrents. Retirez musique, bruit de pièce, écho, ronflement ou trafic lorsqu'ils couvrent la voix.
- Coupez les silences accidentels. Retirez le vide au début et à la fin, mais gardez les pauses voulues.
- Contrôlez le débit. Une diction trop rapide laisse moins de temps à la bouche générée pour former des mouvements lisibles.
- Validez le texte. Corrigez noms, chiffres, prononciation et formulation avant l'animation.
- Vérifiez les droits. Utilisez uniquement une voix et un enregistrement que vous êtes autorisé à animer et publier.
Dans DomoAI, Talking Avatar accepte les fichiers MP3, WAV et M4A jusqu'à 80 Mo. Une voix claire sans musique de fond constitue le meilleur point de départ.
N'imposez pas une fréquence d'échantillonnage ou une profondeur de bits universelle sans consulter l'outil choisi. WAV désigne un conteneur et les encodages compatibles varient. Une parole intelligible dans un fichier accepté compte davantage qu'un réglage technique générique.
Ajoutez une pause volontaire comme test de synchronisation
Placez une courte pause naturelle vers le milieu de l'enregistrement. Exemple : « Votre première scène est prête. [pause] Vérifions le timing ensemble. »
La pause crée un point de contrôle observable : la bouche doit se fermer ou se stabiliser lorsque la voix s'arrête. Si elle continue de bouger, recherchez du bruit résiduel, de la musique, une respiration, le bruit de la pièce ou un mouvement généré par le modèle.
Gardez le test court. Cinq ou dix secondes suffisent pour examiner le premier mot, une pause et la fermeture finale.
Choisissez un visage capable de suivre l'audio
Le portrait doit fournir assez d'informations faciales pour produire un mouvement stable. Un WAV propre ne peut pas réparer une bouche cachée, un profil prononcé ou un visage flou.
Privilégiez une image avec :
- Un seul sujet bien visible
- Une tête de face ou presque
- Une bouche visible en position neutre
- Un éclairage uniforme sur le bas du visage
- Des yeux, des lèvres et une mâchoire nets
- Assez d'espace autour de la tête pour de petits mouvements
Évitez les mains, microphones, cheveux, ombres ou accessoires devant la bouche. Un cadrage trop serré peut aussi créer des défauts aux bords lors des mouvements de tête.
Les illustrations, personnages d'anime, animaux, peintures et portraits historiques peuvent demander davantage d'essais, car leurs proportions ou textures diffèrent d'une photo classique. Choisissez des yeux et une bouche bien définis, puis générez un échantillon court avant d'utiliser un long WAV.
Si le timing est juste mais que l'apparence du personnage change, vérifiez le portrait ou la direction du mouvement. Corrigez la source avec la Retouche d'image ou réduisez le mouvement. Si le visage reste stable mais que la bouche démarre tard, vérifiez le WAV ou la synchronisation.
Générez une première séquence pilotée par l'audio
La première génération sert à tester les entrées, pas à produire la version finale. Gardez une configuration simple afin de relier chaque résultat à une cause claire.
Suivez cette séquence :
- Importez le portrait approuvé.
- Ouvrez Talking Avatar et utilisez la Synthèse vocale DomoAI, un enregistrement direct, ou un fichier MP3, WAV ou M4A.
- Ajoutez le WAV vérifié.
- Choisissez une courte durée prise en charge.
- Ajoutez une seule consigne de jeu modérée si l'outil le permet.
- Prévisualisez l'image et l'audio avant de lancer la tâche.
- Générez la séquence et conservez les réglages utilisés.
Exemple de consigne :
Parle naturellement, avec de petits mouvements de tête, quelques clignements et une expression neutre pendant la pause.
N'empilez pas des consignes contradictoires. Les grands gestes, les rotations rapides ou les expressions extrêmes compliquent l'évaluation de la synchronisation du WAV.
Nommez clairement chaque version, par exemple portraitA_wav-clean_motion-low_v01. Si vous révisez l'audio, créez un nouveau nom. Un journal de réglages évite de comparer deux séquences où plusieurs entrées ont changé à la fois.
Lorsqu'une version réussit les contrôles de synchronisation, de cohérence du visage et de cadrage, appliquez l'Améliorateur vidéo uniquement à ce résultat retenu.
Comparez le résultat à la forme d'onde
La synchronisation devient plus facile à juger lorsque la vidéo est comparée à des moments nommés dans l'audio. Les relectures aléatoires produisent souvent des impressions vagues plutôt que des corrections précises.
Marquez ces points :
- Début de la parole : la bouche démarre-t-elle avec le premier mot audible ?
- Phrase rapide riche en consonnes : les sons marqués produisent-ils des formes plausibles ?
- Pause volontaire : la bouche se ferme-t-elle ou se stabilise-t-elle lorsque la voix s'arrête ?
- Mot accentué : l'énergie visuelle reste-t-elle cohérente avec l'interprétation ?
- Dernier mot : la bouche s'arrête-t-elle après la fin de l'audio ?
Regardez une fois avec le son normal, une fois sans son et une fois au ralenti. La lecture normale montre l'expérience du public. Le mode silencieux révèle les mouvements répétitifs, le scintillement ou les changements du visage. Le ralenti aide à localiser l'image où commence le décalage.
Utilisez une feuille de contrôle horodatée :
| Temps | Événement audio | Contrôle visuel | Résultat | Test suivant |
|---|---|---|---|---|
| 00:01 | Premier mot | La bouche démarre avec la voix | Réussi | Aucun |
| 00:08 | Pause volontaire | La bouche continue de bouger | Échec | Examiner le bruit pendant la pause |
| 00:17 | Dernier mot | La bouche se ferme tard | À revoir | Couper la fin et refaire le test |
Après l'inspection image par image, regardez toujours la séquence entière à vitesse normale. Un minuscule écart visible uniquement au ralenti peut être sans effet, tandis que des erreurs répétées pendant les pauses sont souvent gênantes.
Séparez les problèmes audio des problèmes d'image
Modifiez l'entrée liée au symptôme visible. Régénérer sans hypothèse claire peut consommer temps et crédits sans corriger la cause.
| Symptôme | Source probable | Test suivant |
|---|---|---|
| La bouche bouge pendant le silence | Bruit, musique, respiration ou comportement du modèle | Créer une pause plus propre et relancer le test court |
| La bouche démarre tard | Silence initial ou décalage | Couper le début et comparer le démarrage |
| Les mots rapides semblent faibles | Débit trop rapide ou bouche peu détaillée | Ralentir la phrase ou choisir un portrait plus net |
| Le bas du visage s'étire | Profil, bouche cachée ou mouvement trop fort | Utiliser une source frontale et réduire le mouvement |
| Le visage du personnage change | Peu de détails, cadrage serré ou variation de génération | Utiliser une source nette et garder le cadrage |
| La tête reste rigide | Mouvement limité ou consigne trop restrictive | Tester un petit mouvement explicite |
| Le timing dérive en fin de clip | Séquence longue ou problème audio | Diviser le WAV en segments courts validés |
Ne modifiez qu'une variable par version. Si vous nettoyez l'audio, changez le portrait et réécrivez la consigne en même temps, vous ne saurez pas ce qui a produit l'amélioration.
Divisez un long texte aux limites naturelles des phrases ou des scènes. Gardez le portrait, le cadrage et la direction du mouvement identiques entre les segments. Vérifiez les raccords, car les séquences séparées peuvent varier légèrement en position ou en expression.
Parcours développeur facultatif pour des médias validés
L'automatisation doit commencer après la réussite d'un test manuel avec le portrait et le WAV. Un import valide ne prouve pas que l'image répond à vos critères.
Pour un flux API, confirmez l'authentification et la méthode d'importation actuelles, puis consultez l'API Talking Avatar pour les références média, champs de requête, règles de durée, callbacks et erreurs. Envoyez la même image et le même audio validés, puis stockez l'identifiant de tâche, la version d'entrée, les paramètres, la sortie et l'état d'échec.
Conservez l'implémentation complète dans la documentation développeur. Le processus de création doit rester centré sur la préparation et la validation des médias.
Questions fréquentes
Un WAV peut-il animer seul une photo fixe ?
Non. Une image de visage compatible reste nécessaire. L'audio détermine le rythme et l'interprétation ; l'image détermine l'apparence du personnage.
Le WAV doit-il contenir une musique de fond ?
En général, non. Une piste de parole seule est plus facile à analyser et à synchroniser. Ajoutez la musique au montage après validation de la voix et du mouvement de bouche.
Pourquoi la bouche bouge-t-elle pendant le silence ?
La pause peut contenir du bruit, de la musique, une respiration ou l'ambiance de la pièce. Le modèle peut aussi maintenir un léger mouvement. Examinez la forme d'onde, créez une pause plus propre et comparez une nouvelle génération courte.
Le WAV est-il meilleur que le MP3 pour un visage parlant ?
Pas automatiquement. Utilisez un format accepté par l'outil et privilégiez une voix claire. Si les deux formats sont pris en charge, comparez le même enregistrement plutôt que d'attribuer la qualité au conteneur.
Testez une pause avant l'enregistrement complet
Utilisez un portrait net et un enregistrement propre dont vous détenez les droits. Ajoutez une pause volontaire, marquez les temps et ne changez qu'une variable en cas d'échec. Ne créez la version complète qu'après validation de la séquence courte.



