Damit ein Gegenstand in DomoAI spricht, braucht er einen gut erkennbaren Mund, einen kurzen Satz und klares Sprach-Audio. Ich würde den ersten Clip auf einen einzigen Witz oder eine Beschwerde beschränken, einen nahen Ausschnitt wählen und Kamerabewegungen für einen separaten Zwischenschnitt aufheben.
Was du vor dem Start brauchst
Du brauchst nur drei Materialien: ein Bild, ein kurzes Skript und sauberes Sprach-Audio. Entscheide vor der Generierung, was der fertige Clip leisten soll. Eine sprechende Kaffeetasse mit einem sechssekündigen Witz braucht ein anderes Skript und einen anderen Bildausschnitt als ein Maskottchen, das eine Produktfunktion erklärt.
- Ein gut erkennbares Motiv: Verwende eine frontal gezeigte Figur, ein Haustier, ein illustriertes Maskottchen, ein Produkt oder einen Gegenstand mit einem klaren Mundbereich.
- Ein kurzes Skript: Schreibe für gesprochene Sprache, nicht für eine Landingpage. Halte Sätze einfach und gut vortragbar.
- Klares Sprach-Audio: Erzeuge es mit DomoAI Text to Speech oder lade unterstütztes Sprach-Audio wie MP3 oder WAV hoch.
Beschränke den ersten Test auf eine Emotion, eine Idee und einen Bildausschnitt. Sobald die Figur funktioniert, kannst du aus mehreren kurzen Aufnahmen ein längeres Video bauen.
Ein Gesicht erstellen, das den Auftritt trägt
Wenn du bereits ein überzeugendes Bild hast, verwende es. Erstelle andernfalls mit DomoAI Text to Image ein neues Motiv. Gib einem Gegenstand ein einfaches Gesicht, das auch klein erkennbar bleibt: zwei klare Augen, einen deutlichen Mund und genug Platz um das Motiv für das endgültige Seitenverhältnis.
Verwende den Bildgenerator und Editor mit mehreren Modellen, wenn die Vorlage bereinigt werden muss. DomoAI bietet GPT Image 2, Nano Banana 2 und Nano Banana Pro als Modelle für die Bildgenerierung und Bearbeitung in Alltagssprache an.
Probleme vor der Animation beheben:
- Entferne Texte oder Logos, die sich bei Gesichtsbewegungen verformen könnten.
- Halte den Mund frei von Händen, Haaren, Requisiten und tiefen Schatten.
- Verwende einen nahen oder mittleren Ausschnitt, wenn das Gesicht die Hauptaktion trägt.
- Wähle einen einfachen Hintergrund, wenn du später Untertitel hinzufügen möchtest.
Ein fotorealistisches menschliches Gesicht ist nicht erforderlich. Talking Avatar eignet sich auch für stilisierte Figuren, Anime-Porträts, Haustiere, illustrierte Maskottchen und verspielte Gegenstände.
Das Ausgangsbild prüfen
Ein sprechender Gegenstand braucht kein realistisches menschliches Gesicht. Er braucht einen für Zuschauer erkennbaren Mund und ein Design, das Raum für den Auftritt lässt.
| Prüfpunkt | Bestanden | Vor der Animation korrigieren |
|---|---|---|
| Mund | Auch als Vorschaubild sichtbar | Zu klein, verdeckt oder mit der Textur verschmolzen |
| Produkttext | Außerhalb des Mund- und Bewegungsbereichs | Das Etikett liegt dort, wo sich das Gesicht verformen muss |
| Überlagernde Requisiten | Kein Griff, Strohhalm, keine Hand und kein Schatten verdecken das Gesicht | Hindernis versetzen oder entfernen |
| Platz für Untertitel | Freier Bereich oberhalb oder unterhalb des Motivs | Ausschnitt ändern oder Bildfläche erweitern |
| Seitenverhältnis | Passt zur Zielplattform | Ausschnitt vor der Platzierung des Gesichts festlegen |
Vergleiche für verspielte Figurenideen die Talking-Avatar-Schnellanwendung mit dem AI VTuber Maker. Für ein Haustier bietet sich die Sammlung für sprechende Haustiere an; für einen Cartoon in Bewegung kannst du mit dem Ablauf für gehende und sprechende 2D-Figuren fortfahren.
Ein natürlich klingendes Skript schreiben
Lies das Skript vor der Audiogenerierung laut vor. Wenn dir die Luft ausgeht oder du über einen Satz stolperst, kürze ihn. Ein sinnvoller erster Text umfasst 15 bis 35 Wörter.
Probiere diese einfache Struktur:
- Einstieg: Nenne zuerst das Überraschende.
- Ein nützliches Detail: Erkläre, was die Zuschauer wissen müssen.
- Abschluss: Ende mit einer Frage, Pointe oder einem nächsten Schritt.
Beispiel für eine sprechende Schreibtischlampe:
Seit drei Nächten sehe ich dir beim Arbeiten im Dunkeln zu. Schalte mich ein, reduziere die Bildschirmhelligkeit und gönn deinen Augen eine Pause.
Überlade einen kurzen Clip nicht mit Erzähltext, Kameraaktionen und mehreren Emotionen. Nimm separate Sätze auf, wenn das Motiv seinen Ausdruck ändern soll oder du einen Schnittpunkt brauchst.
Die Stimme erzeugen oder hochladen
DomoAI Text to Speech unterstützt den Single-Modus für eine Stimme und den Multi-Modus für Dialoge mit zwei Sprechern. Es unterstützt außerdem Stimmenklonen, Emotionstags wie [Cheerful] sowie Skripte mit bis zu 4.000 Zeichen. Bei geklonten Stimmen reicht die Geschwindigkeitsregelung von 0,5x bis 2,0x.
Erzeuge zuerst die Stimme, prüfe Aussprache und Tempo und übertrage das freigegebene Audio anschließend an Talking Avatar. Du kannst auch eine unterstützte Sprach- oder Gesangsdatei hochladen.
Halte das Audio sauber. Musik, Menschenlärm oder starke Effekte können die Prüfung der Sprache erschweren. DomoAI mischt in Talking Avatar keine fertige Hintergrundmusikspur. Füge den vollständigen Soundtrack deshalb nach dem Export in CapCut, Premiere Pro, DaVinci Resolve oder einem anderen Editor hinzu.
Die Figur oder den Gegenstand in Talking Avatar animieren
Öffne DomoAI Talking Avatar und füge das Bild oder Video sowie das freigegebene Audio hinzu. Talking Avatar bietet standardmäßig 5, 10 und 20 Sekunden. Pro-Nutzer können außerdem die Fast-Mode-Optionen mit 30 und 60 Sekunden verwenden.
Verwende den separaten Aktions- oder Ausdrucksprompt, um die sichtbare Darbietung zu steuern. Das Skript bestimmt, was die Figur sagt; dieser Prompt bestimmt, wie sie sich verhält.
Nützliche Anweisungen sind:
Herzliches Lächeln, kleines Nicken, entspannter Blickkontakt.Überraschter Ausdruck, schnelles Blinzeln, leichtes Vorlehnen zur Kamera.Ruhiger Moderationsstil, dezente Kopfbewegung, beständiger Blick.
Beginne mit dezenten Bewegungen. Große Drehungen, schnelle Gesten oder mehrere Aktionen in einem Prompt erschweren die Konsistenz, besonders bei kleinen Gegenständen oder illustrierten Gesichtern.
Dialog und Aktion in getrennten Feldern halten
| Feld | Beispiel Schreibtischlampe |
|---|---|
| Skript oder Audio | „Ich erhelle jede Deadline, und das ist der Dank dafür?“ |
| Aktions-Prompt | Regungsloser Gesichtsausdruck, einmal langsam blinzeln, Lampenschirm leicht neigen, Körper bleibt still, Kamera fixiert |
Meine drei Ausgangspersönlichkeiten sind ein sarkastisches Produkt, das sich über seine Arbeit beschwert, ein freundliches Maskottchen, das eine Funktion erklärt, und ein trocken reagierender Haushaltsgegenstand, der eine menschliche Gewohnheit kommentiert. Ich schreibe zuerst den Satz und erzeuge oder lade dann die Stimme hoch. Text to Speech ist hilfreich, wenn Emotion oder Tempo wiederholbar sein sollen.
Wenn die Produktdemonstration wichtiger ist als das Gesicht, kann der Ablauf für Erklärvideos ohne Gesicht ein besserer nächster Schritt sein als zusätzliche Avatarbewegung.
Den passenden Ablauf für das Motiv wählen
Sprechende Haustiere
Verwende ein Foto, auf dem das Tier zur Kamera blickt und die Schnauze sichtbar ist. Vermeide eine Zunge, ein Spielzeug oder eine Pfote vor dem Mund. Einen gezielten Ablauf findest du im Leitfaden für sprechende Haustiervideos.
Anime- und illustrierte Figuren
Halte das Gesicht groß genug, damit es gut erkennbar bleibt, und vermeide Haare über den Lippen. Ein klares Figurenblatt oder freigegebenes Porträt hilft, wenn du mehrere Clips brauchst. Entdecke weitere Ideen für sprechende Avatare mit Anime, Haustieren und VTubern.
Produkte und Gegenstände
Entscheide, ob der Gegenstand selbst ein Gesicht hat oder von einem Maskottchen präsentiert werden soll. Muss das Produktetikett exakt bleiben, halte es vom animierten Mund fern und ergänze rechtliche Hinweise, Preise und Handlungsaufforderungen erst nach der Generierung.
Moderatoren und Maskottchen
Verwende Screen Keying, wenn du die sprechende Figur vor einem eigenen Hintergrund zusammensetzen möchtest. Dadurch gelingt die Übergabe an CapCut, Premiere Pro oder einen ähnlichen Editor sauberer.
Häufige Probleme bei sprechenden Gegenständen beheben
Der Mund bewegt sich kaum
Wähle einen engeren Ausschnitt und eine Vorlage mit deutlicherem Mundbereich. Prüfe, ob Haare, Requisiten, Schatten oder Unschärfe durch geringe Auflösung das Gesicht verdecken.
Der Auftritt wirkt zu unruhig
Kürze den Aktions-Prompt. Beschränke jede Aufnahme auf eine Emotion und eine Geste. Hebe größere Bewegungen für eine separate Einstellung mit Image to Video oder Character to Video auf.
Das Audio klingt undeutlich
Erzeuge oder nimm die Sprache erneut ohne Musik und starke Hintergrundgeräusche auf. Teile lange Dialoge in kürzere Abschnitte, damit du einen schwachen Satz ersetzen kannst, ohne das gesamte Video neu aufzubauen.
Der fertige Clip wirkt statisch
Kombiniere eine sprechende Nahaufnahme mit Reaktionen, Produktzwischenschnitten, Untertiteln oder kurzen animierten Szenen. Talking Avatar übernimmt den Sprechmoment; der Schnitt trägt die gesamte Geschichte.
Häufige Fragen
Kann DomoAI einen Gegenstand anhand eines einzigen Bildes sprechen lassen?
Ja. Verwende in Talking Avatar ein klares Bild zusammen mit generiertem oder hochgeladenem Sprach-Audio. Ein sichtbares Gesicht oder ein sichtbarer Mundbereich gibt dem Modell ein deutlicheres Ziel für die Darstellung.
Kann ich ein Haustier oder eine Anime-Figur sprechen lassen?
Ja. Talking Avatar eignet sich für realistische Porträts, Haustiere, Anime-Gesichter, illustrierte Maskottchen und andere Bilder mit einer Figur im Mittelpunkt. Nutze eine frontale Vorlage mit gut erkennbarem Mundbereich.
Kann ich meine eigene Stimme hinzufügen?
Ja. Du kannst unterstütztes Sprach-Audio hochladen oder die Zeile mit DomoAI Text to Speech generieren, einschließlich geklonter Stimmen, sofern verfügbar.
Kann Talking Avatar Hintergrundmusik hinzufügen?
Füge den fertigen Musikmix nach dem Export hinzu. Verwende Talking Avatar für die sprachgesteuerte Darstellung und kombiniere den Clip anschließend in einem externen Editor mit Musik und Untertiteln.
Wie lang kann ein Talking-Avatar-Clip sein?
Die Standardlängen sind 5, 10 und 20 Sekunden. Pro-Nutzer haben Zugriff auf Fast-Mode-Optionen mit 30 und 60 Sekunden. Prüfe die aktuelle DomoAI-Preisseite, da sich der Zugang je nach Tarif ändern kann.
Beginne mit einem kurzen Test, gib Gesicht und Stimme frei und baue das fertige Video anschließend aus den besten Aufnahmen. So bleiben Korrekturen gezielt, und du verbrauchst keine Credits für einen langen Clip, bevor die Figur funktioniert.


