Faire parler des objets avec l’IA dans DomoAI

7 min de lecture

Un pancréas souriant en dessin animé devant un guide illustré en japonais sur les vidéos de personnages parlants

Pour faire parler un objet dans DomoAI, donnez-lui une bouche lisible, une réplique courte et une piste de parole propre. Je limiterais le premier clip à une plaisanterie ou une plainte, avec un cadrage serré, en réservant les mouvements de caméra à un plan de coupe distinct.

À préparer avant de commencer

Vous n’avez besoin que de trois éléments : une image, un court script et un audio de parole propre. Décidez de l’objectif du clip terminé avant de générer quoi que ce soit. Une tasse de café qui raconte une blague de six secondes demande un script et un recadrage différents de ceux d’une mascotte expliquant une fonctionnalité produit.

  • Un sujet lisible : utilisez un personnage, un animal, une mascotte illustrée, un produit ou un objet de face, avec une bouche bien visible.
  • Un script court : écrivez pour la parole, pas pour une page de vente. Privilégiez des phrases simples et faciles à interpréter.
  • Une voix propre : générez-la avec DomoAI Text to Speech ou importez un fichier de parole compatible, comme un MP3 ou un WAV.

Pour un premier essai, visez une émotion, une idée et un cadrage. Lorsque le personnage fonctionne, assemblez plusieurs courtes prises pour créer une vidéo plus longue.

Créer un visage capable de porter le jeu

Si vous possédez déjà une bonne image, utilisez-la. Sinon, créez votre sujet avec DomoAI Text to Image. Donnez à l’objet un visage simple et lisible en petit : deux yeux nets, une bouche évidente et assez d’espace autour pour le format final.

Utilisez le générateur et éditeur d’images multimodèle lorsque la source doit être corrigée. DomoAI propose GPT Image 2, Nano Banana 2 et Nano Banana Pro pour la génération d’images et la retouche en langage courant.

Corrigez les problèmes avant l’animation :

  • Supprimez les textes ou logos qui risquent de se déformer lorsque le visage bouge.
  • Évitez qu’une main, des cheveux, un accessoire ou une ombre profonde masque la bouche.
  • Choisissez un plan rapproché ou moyen lorsque le visage porte l’action principale.
  • Préférez un fond simple si vous comptez ajouter des sous-titres.

Un visage humain photoréaliste n’est pas nécessaire. Talking Avatar convient aussi aux personnages stylisés, aux portraits d’anime, aux animaux de compagnie, aux mascottes illustrées et aux objets amusants.

Valider l’image source

Un objet parlant n’a pas besoin d’un visage humain réaliste. Il lui faut une bouche que le spectateur peut lire et un dessin qui laisse de la place au jeu.

Point à vérifierCritère de réussiteÀ corriger avant l’animation
BoucheVisible au format miniatureTrop petite, cachée ou confondue avec la texture
Texte du produitHors de la bouche et de la zone de mouvementÉtiquette placée là où le visage doit se déformer
Accessoires superposésAucune anse, paille, main ou ombre devant le visageDéplacer ou retirer l’obstacle
Place pour les sous-titresZone libre au-dessus ou au-dessous du sujetRecadrer ou étendre la toile
Rapport d’imageAdapté à la plateforme finaleDéfinir le cadrage avant de placer les traits du visage

Pour des personnages ludiques, comparez l’application rapide Talking Avatar au créateur de VTubers IA. Une version animale peut prolonger la collection de parcours pour animaux parlants, tandis qu’un dessin animé mobile peut suivre le parcours 2D de marche et de dialogue.

Écrire un script naturel à l’oral

Lisez le script à voix haute avant de générer l’audio. Si vous manquez de souffle ou butez sur une phrase, raccourcissez-la. Un premier script utile compte 15 à 35 mots.

Essayez cette structure simple :

  1. Accroche : commencez par l’élément surprenant.
  2. Un détail utile : expliquez ce que le spectateur doit savoir.
  3. Conclusion : terminez par une question, une chute ou une prochaine étape.

Exemple pour une lampe de bureau parlante :

Ça fait trois nuits que je te regarde travailler dans le noir. Allume-moi, baisse la luminosité de l’écran et laisse tes yeux se reposer.

Ne surchargez pas un clip court avec de la narration, des mouvements de caméra et plusieurs émotions. Enregistrez les répliques séparément si le sujet change d’expression ou si vous souhaitez disposer d’un point de coupe.

Générer ou importer la voix

DomoAI Text to Speech prend en charge le mode Single pour un locuteur et le mode Multi pour un dialogue à deux voix. Il prend aussi en charge le clonage vocal, des balises d’émotion telles que [Cheerful] et des scripts allant jusqu’à 4 000 caractères. Pour les voix clonées, le réglage de vitesse va de 0,5x à 2,0x.

Générez d’abord la voix, écoutez la prononciation et le rythme, puis envoyez l’audio validé dans Talking Avatar. Vous pouvez aussi importer un fichier de voix ou de chant compatible.

Gardez un audio propre. La musique, le bruit de foule ou des effets marqués peuvent compliquer la vérification de la parole. DomoAI ne mixe pas de piste de musique de fond complète dans Talking Avatar : ajoutez donc la bande-son complète après exportation dans CapCut, Premiere Pro, DaVinci Resolve ou un autre logiciel de montage.

Animer le personnage ou l’objet dans Talking Avatar

Ouvrez DomoAI Talking Avatar, puis ajoutez l’image ou la vidéo et l’audio validé. Talking Avatar propose des durées standard de 5, 10 et 20 secondes. Les utilisateurs Pro peuvent aussi utiliser les options Fast Mode de 30 et 60 secondes.

Utilisez le prompt d’action ou d’expression distinct pour diriger la performance visible. Le script contrôle ce que dit le sujet ; ce prompt contrôle son comportement.

Exemples de directions utiles :

  • Sourire chaleureux, petit hochement de tête, regard détendu.
  • Expression surprise, clignement rapide, légère inclinaison vers la caméra.
  • Présentation calme, mouvements de tête discrets, regard stable.

Commencez par des mouvements subtils. Les grands changements d’orientation, gestes rapides ou actions multiples dans une consigne compliquent la cohérence, surtout pour de petits objets ou des visages dessinés.

Séparer le dialogue et l’action dans deux champs

ChampExemple de la lampe de bureau
Script ou audio« J’éclaire toutes tes nuits de travail, et voilà comment on me remercie ? »
Consigne d’actionExpression impassible, un lent clignement, abat-jour légèrement incliné, corps immobile, caméra fixe

Mes trois personnalités de départ : un produit sarcastique qui se plaint de son travail, une mascotte aimable qui explique une fonction et un objet domestique impassible face à une habitude humaine. J’écris la réplique avant de créer ou d’importer la voix. Text to Speech est utile pour reproduire une émotion ou un rythme.

Si la démonstration du produit compte davantage que le visage, le parcours de vidéo explicative sans visage peut être une meilleure suite que l’ajout de mouvements d’avatar.

Choisir le parcours adapté au sujet

Animaux parlants

Utilisez une photo où l’animal regarde la caméra et où son museau est visible. Évitez une langue, un jouet ou une patte devant la bouche. Pour un parcours dédié, consultez le guide des vidéos d’animaux parlants.

Personnages d’anime et illustrés

Gardez un visage assez grand pour être lisible et évitez les cheveux sur les lèvres. Une fiche de personnage claire ou un portrait validé aide à préparer plusieurs clips. Découvrez d’autres idées d’avatars parlants pour animes, animaux et VTubers.

Produits et objets

Décidez si l’objet porte lui-même un visage ou s’il doit être présenté par une mascotte. Si l’étiquette du produit doit rester exacte, éloignez-la de la bouche animée et ajoutez les mentions légales, les prix et l’appel à l’action après la génération.

Présentateurs et mascottes

Utilisez Screen Keying lorsque vous devez incruster le sujet parlant sur un arrière-plan personnalisé. Cela permet un passage plus propre vers CapCut, Premiere Pro ou un logiciel de montage similaire.

Corriger les problèmes courants des objets parlants

La bouche bouge à peine

Resserrez le cadrage et utilisez une source où la bouche est plus évidente. Vérifiez qu’aucun cheveu, accessoire, ombre ou flou de basse résolution ne masque le visage.

Le jeu est trop agité

Raccourcissez la consigne d’action. Conservez une émotion et un geste par prise. Réservez les mouvements plus amples à un plan distinct dans Image to Video ou Character to Video.

L’audio manque de clarté

Régénérez ou réenregistrez la parole sans musique ni bruit de fond marqué. Divisez les longs dialogues en sections courtes pour remplacer une réplique faible sans reconstruire toute la vidéo.

Le clip final paraît statique

Alternez un gros plan parlant avec des réactions, des plans de coupe du produit, des sous-titres ou de courtes scènes animées. Talking Avatar prend en charge la prise de parole ; le montage porte l’histoire entière.

Questions fréquentes

DomoAI peut-il faire parler un objet à partir d’une image ?

Oui. Utilisez une image nette avec un audio de parole généré ou importé dans Talking Avatar. Un visage ou une bouche visible donne au modèle une cible de performance plus précise.

Puis-je faire parler un animal ou un personnage d’anime ?

Oui. Talking Avatar convient aux portraits réalistes, aux animaux de compagnie, aux visages d’anime, aux mascottes illustrées et aux autres images centrées sur un personnage. Utilisez une source de face avec une bouche bien lisible.

Puis-je ajouter ma propre voix ?

Oui. Vous pouvez importer un audio de parole compatible ou générer la réplique avec DomoAI Text to Speech, y compris avec des voix clonées lorsque cette option est disponible.

Talking Avatar peut-il ajouter de la musique de fond ?

Ajoutez le mixage musical final après l’exportation. Utilisez Talking Avatar pour la performance pilotée par la voix, puis assemblez le clip, la musique et les sous-titres dans un logiciel de montage externe.

Quelle durée peut avoir un clip Talking Avatar ?

Les durées standard sont de 5, 10 et 20 secondes. Les utilisateurs Pro ont accès aux options Fast Mode de 30 et 60 secondes. Consultez la page actuelle des tarifs DomoAI, car les accès liés aux forfaits peuvent changer.

Commencez par un court essai, validez le visage et la voix, puis assemblez les meilleures prises. Vous ciblez ainsi les retouches et évitez de dépenser des crédits dans un long clip avant que le personnage fonctionne.

Articles récents