Um eine Midjourney-Figur zu animieren, ohne ihr Aussehen zu verlieren, fixiere die Identität in einem sauberen Standbild und beschreibe im Videoprompt die Bewegung, statt die ganze Figur erneut zu beschreiben. Meine Regel ist einfach: Das Bild übernimmt die Identität, der Prompt die Bewegung.
Ist ein Gesicht, eine Hand oder ein Outfitdetail schon im Standbild unklar, korrigiere ich zuerst das Bild. Ein längerer Bewegungsprompt rettet fehlende Bildinformationen selten. Er gibt dem Generator meist nur mehr Möglichkeiten, sie neu zu interpretieren.
Warum sich Midjourney-Figuren verändern, sobald sie sich bewegen
Midjourney ist in einer bestimmten Sache sehr gut: Es erzeugt ein Standbild mit festgelegtem Stil und genau dem Gesicht, der Farbpalette und der Darstellungsweise, die du wirklich willst. Das Problem beginnt bei der Übergabe.
Die meisten Kreativen verlieren das Aussehen, weil sie die Figur beim Animieren erneut beschreiben: „anime girl, silver hair, red jacket, walking“. Das Videomodell hat nun zwei maßgebliche Quellen: dein Bild und deine Worte. Es vermischt sie, und das Gesicht verändert sich.
Abweichungen beginnen oft beim Übergang: Eine neue Textbeschreibung kann Details widersprechen, die bereits im Standbild angelegt sind. Nutze das Referenzbild als Grundlage für Identität und Stil und den Videoprompt für Bewegung und Kameraführung.
Kann Midjourney seine eigenen Bilder animieren?
Midjourney beginnt jedes Video mit 5 Sekunden. Du kannst es viermal um jeweils 4 Sekunden verlängern, auf insgesamt höchstens 21 Sekunden. Verfügbar sind Low Motion, High Motion, optionale Bewegungsprompts, Schleifen und ein abweichendes Endbild. Die Standardausgabe beträgt 480p; mit Standard, Pro und Mega ist 720p im Fast Mode möglich.
Es ist wirklich gut bei atmosphärischer Bewegung: schwebendes Haar, eine langsame Kamerafahrt nach vorn, bewegter Stoff und Atmosphäre.
Seine Grenze liegt beim Figurenspiel. Es gibt weder Lippensynchronisation noch natives Audio, also kann eine Figur nicht sprechen oder singen. Du kannst keine Referenzdarbietung übergeben und deine Figur deren Bewegung kopieren lassen. Auch die Kontrolle darüber, was sich bewegt, ist begrenzt. Eine häufige Beschwerde ist, dass Münder und Gesichter animiert werden, die still bleiben sollten.
Die ehrliche Einschätzung lautet daher: Wenn du einem Standbild Leben einhauchen möchtest, reicht Midjourneys Animate oft aus. Soll eine Figur schauspielern, brauchst du Videowerkzeuge, die das Bild als maßgebliche Vorlage verwenden. Genau diesen Ablauf findest du unten.
Das Aussehen vor der Animation festlegen
Animiere nicht dein erstes gutes Bild. Animiere dein klarstes Bild.
Ein animationstaugliches Referenzbild zeigt meist ein klar erkennbares Gesicht, eindeutige Kleidung, gleichmäßiges Licht und keine abgeschnittenen Gliedmaßen. Bewegungsmodelle leiten aus dem Sichtbaren weitere Details ab. Was im Standbild unklar ist, wird im Video ergänzt.
Behebe Probleme, solange das noch wenig kostet. In DomoAIs Bildgenerator und Editor mit mehreren Modellen kannst du das Midjourney-Standbild bereinigen, bevor du auch nur einen Video-Credit ausgibst: Hände reparieren, Kleidungstext korrigieren, ein Outfitdetail anpassen oder einen unruhigen Hintergrund vereinfachen. Drei Modelle stehen darin zur Wahl: GPT Image 2 für präzise Kontrolle und saubere Typografie, Nano Banana 2 für schnelle Alltagsbearbeitungen und Nano Banana Pro für Figurenkonsistenz, mit bis zu neun Referenzbildern pro Sitzung und einer Ausgabe in 4K.
Mehrere Referenzen können Nano Banana Pro zusätzlichen Bildkontext für eine zweite Pose oder Perspektive geben. Vergleiche das Ergebnis vor der Animation mit der freigegebenen Figur.
Speichere jedes brauchbare Bild in Assets. So kannst du es in mehreren Aufnahmen wiederverwenden, ohne es erneut hochzuladen.
Den passenden Animationsablauf für die Aufnahme wählen
Es gibt keinen einzigen Knopf „Midjourney zu Video“, weil es nicht nur eine Aufgabe gibt. Drei Wege decken fast alles ab. Den falschen zu wählen ist die zweithäufigste Ursache für Abweichungen.
Weg 1 – aus einem starken Standbild wird eine bewegte Aufnahme
Nutze Image to Video. Das ist der Ausgangspunkt für eine Figurenenthüllung, eine stimmungsvolle Aufnahme, eine Kamerafahrt nach vorn oder ein Midjourney-Hauptmotiv.
DomoAI bietet Seedance 2.0 als Image-to-Video-Modell mit 4–15 Sekunden Ausgabe, 480P/720P/1080P-Einstellungen, filmischer Bewegung, nativem Audio und Unterstützung mehrerer Einstellungen. DomoAI 2.4.1 Advanced und Fast sind ebenfalls für lebensechte Bewegung und visuelle Konsistenz in 5- oder 10-Sekunden-Clips verfügbar.
Praxistipp: Erstelle Entwürfe mit einem Fast-Modell in niedriger Auflösung, bis die Bewegung stimmt. Generiere den besten anschließend erneut in 1080P. Figurenaufnahmen brauchen oft mehrere Versuche. Für verworfene Ergebnisse musst du nicht den vollen Preis bezahlen.
Weg 2 – Anfang und Ende der Aufnahme sind gleichermaßen wichtig
Nutze Frames to Video für Übergänge und Verwandlungen: von geschlossenen zu offenen Augen, von Alltagskleidung zum Kostüm oder vom Vorher zum Nachher.
Zwei Modi mit einem echten Unterschied. Mit Seedance 2.0 / Seedance 2.0 Fast lieferst du nur ein Startbild und ein Endbild – das Modell füllt den Zwischenraum. Mit DomoAI 2.4.1 kannst du 2–8 Schlüsselbilder mit Bewegungsanweisungen pro Segment liefern und 1–56 Sekunden generieren. Genau das brauchst du, wenn du eine Sequenz in Midjourney als Storyboard angelegt hast und das Video jedes Bild treffen soll.
Midjourney kann auch von einem Startbild zu einem anderen Endbild animieren. Nutze das für einen nativen Midjourney-Übergang von bis zu 21 Sekunden. Verwende DomoAI Frames to Video, wenn du Seedances Start-/Endkontrolle oder DomoAI 2.4.1 mit 2–8 Schlüsselbildern, segmentweisen Prompts und einem Ablauf von 1–56 Sekunden brauchst.
Weg 3 – deine Figur übernimmt eine fremde Bewegungsreferenz
Nutze Character to Video. Genau das kann Midjourney schlicht nicht. Deshalb landen die meisten Figurenkreativen letztlich bei einem zweiten Werkzeug.
Gib ein Referenzvideo und das Bild deiner Midjourney-Figur ein. Die Figur wird ersetzt, während die ursprüngliche Bewegung exakt erhalten bleibt. Ein Tanz, ein Gehzyklus, eine Geste: Deine Figur führt sie jetzt aus. Subject Only tauscht die Figur aus und hält den Rest der Szene näher am Original.
Die Seedance-2.0-Modi laufen 4–15 Sekunden; DomoAI 2.4.1 erreicht bis zu 30 Sekunden pro Generierung. Dein Figurenbild kann JPEG, PNG oder JPG mit bis zu 10 MB sein. Das Referenzvideo kann MP4, MOV oder AVI sein.
Das ist der Anime- und VTuber-Ablauf in einem Schritt: ein Standbild deiner eigenen Figur aus Midjourney, eine Tanzreferenz, und deine Figur tanzt, ohne dass du ein einziges Bild animierst.
Vor der Bewegung eine Identitätskarte anlegen
Ich speichere neben dem Ausgangsbild eine kleine Identitätskarte. Das ist kein weiterer riesiger Prompt, sondern eine kurze Liste von Details, die ich am Anfang, in der Mitte und am Ende jedes Clips prüfen kann.
| Festzulegender Bereich | Was du notierst | Wann du den Clip verwirfst |
|---|---|---|
| Gesicht | Augenfarbe, Gesichtsform, Haaransatz, markantes Merkmal | Zwei oder mehr Merkmale verändern sich |
| Outfit | Jackenform, Farbe der Besätze, Accessoires | Ein wichtiges Detail verschwindet oder wechselt die Seite |
| Silhouette | Haarlänge, Schulterbreite, Umriss von Rock oder Mantel | Der Körperumriss verändert sich während der Haupthandlung |
| Aufnahme | Bildausschnitt, Objektivwirkung, Kamerahöhe, Lichtrichtung | Die Bildgestaltung passt nicht mehr zur vorherigen Aufnahme |
| Bewegungsumfang | Eine Handlung des Motivs + eine Kamerabewegung + ein Atmosphäremerkmal | Der Clip erfindet zusätzliche Handlungen, die Erkennungsmerkmale verdecken |
Wenn bereits zwei Prüfungen des Ausgangsbildes scheitern, kehre ich zum Bildgenerator und Editor mit mehreren Modellen zurück. Bei Anime-Vorlagen hilft der Niji-7-Animationsleitfaden, Entscheidungen zur Bildgestaltung von Bewegungsentscheidungen zu trennen. Für eine längere Sequenz verwende ich den Ablauf zur Figurenkontinuität und plane die Szene mit dem Leitfaden für KI-Storyboards.
Ein kopierbarer Prompt für die erste Aufnahme
Der Prompt beschreibt Bewegung und Kamera. Er beschreibt nicht die Figur – das hat das Bild bereits getan.
Das Motiv bleibt an seiner Position, atmet ruhig, das Haar bewegt sich sanft. Die Kamera fährt langsam nach vorn, geringe Schärfentiefe. Weiches Kantenlicht, Staubpartikel in der Luft. Gesicht, Outfit und Frisur bleiben unverändert.
Beachte die letzte Zeile. Zu benennen, was sich nicht verändern darf, ist unspektakulär und funktioniert. Ergänze für engere Kontrolle Kameranweisungen in Zeitsegmenten: CAM 1 (0-3s): slow push in – oder klicke auf AI Optimize zum Erweitern eines knappen Prompts zu etwas, mit dem das Modell tatsächlich arbeiten kann.
Wenn das Aussehen trotzdem abweicht: gezielt nachbessern
Das Gesicht verändert sich auf halber Strecke. Dein Clip ist für die Informationsmenge im Standbild zu lang. Kürze ihn. Zwei saubere, zusammengeschnittene 5-Sekunden-Clips sind besser als eine abdriftende 15-Sekunden-Aufnahme. Das ist die häufigste Lösung überhaupt.
Das Outfit erfindet Details. Das Standbild war an dieser Stelle mehrdeutig. Gehe zurück zur Bildbearbeitung, mache das Detail eindeutig und animiere erneut. Versuche nicht, ein unklares Ausgangsbild mit Prompts zu umgehen.
Die Figur bewegt sich, obwohl sie stillhalten soll? Ergänze die ausdrückliche Vorgabe „Gesicht, Outfit und Frisur bleiben unverändert“ und wähle eine ruhigere Bildgestaltung.
Der Stil verflacht? Midjourneys Darstellungsweise gehört zur Figur. Geht sie in einem Ablauf verloren, reduziere die gewünschte Bewegung. Große Bewegungen erfordern mehr neu erschlossene Details, wobei der Stil verloren gehen kann.
Alles driftet ab, jedes Mal. Dein Referenzbild ist das Problem, nicht das Modell. Beschnitte, extreme Winkel und starke Schatten nehmen dem Modell Informationen. Generiere eine sauberere, flachere und vollständigere Referenz und versuche es erneut.
Die Figur sprechen oder singen lassen
Midjourneys Video hat keine Lippensynchronisation. Dieser Schritt findet daher immer außerhalb der Plattform statt.
Talking Avatar nimmt dein Midjourney-Figurenbild und Audio entgegen, entweder DomoAIs Text-to-Speech-Ausgabe oder eine hochgeladene MP3/WAV-Datei, und erzeugt eine sprechende oder singende Figur. Standardlängen sind 5/10/20 Sekunden, mit 30 und 60 Sekunden im schnellen Modus des Pro-Tarifs. Du kannst den Ausdruck getrennt vom Skript steuern, sodass „lächeln“ oder „nicken“ nicht in den Dialog eingeschmuggelt werden müssen.
Teile bei KI-Sängern eine lange Gesangsspur in kürzere Abschnitte. Eine misslungene 15-Sekunden-Aufnahme zu prüfen und zu ersetzen ist wesentlich günstiger, als einen ganzen Song erneut zu generieren.
Eine ehrliche Einschränkung: Hintergrundmusik und der Mix des vollständigen Songs entstehen nicht hier. Exportiere den Clip und lege die Tonspur in CapCut, Premiere Pro oder DaVinci Resolve darunter.
Den Clip fertigstellen
Die Generierung erreicht bis zu 1080P. Schicke den fertigen Schnitt für die Auslieferung durch Video Upscaler für bis zu 4K.
Die Reihenfolge zählt: Skaliere die Aufnahme hoch, die du behältst, nicht jeden Entwurf. Wenn du viele Varianten testest, erzeugt Relax Mode im Standard-Tarif und höher geeignete Ausgaben ohne Credit-Verbrauch. Das dauert länger, aber Figurenarbeit braucht viele Versuche, und hier werden sie bezahlbar. Einzelheiten stehen auf der Preisseite.
Häufige Fragen
Darf ich Midjourney-Bilder in KI-Videowerkzeugen kommerziell verwenden?
Midjourney zufolge besitzen Abonnenten grundsätzlich die von ihnen erstellten Bilder und Videos, vorbehaltlich der Bedingungen und Ausnahmen. Unternehmen mit mehr als 1 Million US-Dollar jährlichem Bruttoumsatz benötigen für die kommerzielle Nutzung einen Pro- oder Mega-Tarif. DomoAI gewährt kommerzielle Rechte für Ausgaben aus kostenpflichtigen Tarifen. Prüfe vor einer Kundenveröffentlichung die aktuellen Bedingungen beider Dienste.
Warum sieht meine Figur in jeder Aufnahme anders aus?
Du beschreibst die Figur im Prompt, statt dem Bild diese Aufgabe zu überlassen. Animiere ausgehend von einem einzigen festgelegten Referenzbild und beschränke den Prompt auf Bewegung.
Reicht Midjourneys eigenes Videomodell aus?
Für atmosphärische Bewegung in einem einzelnen Standbild häufig ja. Für Lippensynchronisation, Bewegungsübertragung aus einer Referenzdarbietung oder Clips über die Verlängerungsgrenze hinaus brauchst du spezialisierte Videowerkzeuge.
Wie lang kann ein Clip aus einem einzelnen Midjourney-Standbild werden?
Midjourney beginnt mit 5 Sekunden und unterstützt vier Verlängerungen um jeweils 4 Sekunden, insgesamt maximal 21 Sekunden. In DomoAI läuft Image to Video mit einem einzelnen Standbild und Seedance 2.0 über 4–15 Sekunden. Längere Frames-to-Video- und Character-to-Video-Abläufe verwenden zusätzliche Eingaben und lösen andere Aufgaben.
Muss ich mein Bild für jedes Werkzeug erneut hochladen?
Nein. Speichere die Standbilder einmal in Assets und ziehe sie anschließend aus dem History-Bereich direkt in das Werkzeug, das du als Nächstes verwendest.
Mit einem Standbild beginnen
Nimm deine beste Midjourney-Figur, deren Aussehen du bewahren möchtest, und bearbeite sie einmal sauber. Erstelle danach eine fünfsekündige Animation. Beginne mit einer einzigen Aufnahme, bevor du ein ganzes Musikvideo planst.
Wenn das Gesicht hält, hält der Arbeitsablauf. Alles oben Beschriebene ist dann nur noch eine Frage des Maßstabs.
Animiere deine Midjourney-Figur mit DomoAI →


