要讓 Midjourney 角色動起來又不失去原本的樣貌,先用一張乾淨的靜態圖鎖定角色身分,再讓影片提示詞描述動作,而不是重新描述整個角色。我的原則很簡單:靜態圖負責角色身分;提示詞負責動作。
若靜態圖中的臉、手或服裝細節已經不清楚,我會先修圖,再製作動畫。更長的動態提示詞很少能補救缺失的視覺資訊,通常只會讓生成器有更多重新詮釋的機會。
為什麼 Midjourney 角色一動就走樣
Midjourney 很擅長一件具體的事:生成風格固定的靜態圖,呈現你真正想要的臉孔、配色與渲染風格。問題出在交接給影片工具的那一刻。
大多數創作者會在製作動畫時重新描述角色,因而失去原本的樣貌,例如「動漫女孩、銀髮、紅色外套、走路」。這時影片模型有了兩個依據:圖片與文字。它把兩者混在一起,臉就變了。
走樣常從工具交接時開始:新的文字描述可能與靜態圖已呈現的細節衝突。把參考圖當作外觀身分與風格來源,影片提示詞則保留給動作與鏡頭方向。
Midjourney 能讓自己的圖片動起來嗎?
Midjourney 的影片從 5 秒開始,最多可延伸四次,每次增加 4 秒,總長上限 21 秒。它支援 Low Motion、High Motion、選用的動態提示詞、循環及不同的結尾影格。標準輸出為 480p;Standard、Pro 與 Mega 方案可在 Fast Mode 生成 720p。
它確實很擅長營造氛圍的動態:飄動的頭髮、緩慢推進的鏡頭、布料動態與空氣感。
但它的能力止於角色表演之前。它沒有對嘴,也沒有原生音訊,所以角色無法說話或唱歌。你不能交給它一段參考表演,讓角色照著動。對於哪些部位會動,控制也很有限——創作者常抱怨,本來應該保持不動的嘴巴和臉卻動了起來。
所以,坦白說:如果你只是想讓靜態圖有呼吸感,Midjourney 的 Animate 通常就夠了。如果你想讓角色表演,就需要一套以圖片為準的影片工具。以下就是這套流程。
開始動畫前先確定外觀
不要急著讓第一張不錯的圖動起來,應選擇最清楚乾淨的圖片。
適合動畫的參考靜態圖,通常具有清楚可辨的臉、明確的服裝、均勻光線,而且四肢沒有被裁掉。動態模型會根據看得到的內容推測;靜態圖中模糊不明的部分,到了影片裡就可能被憑空補出。
趁修正成本還低時先解決問題。在 DomoAI 的 多模型圖片產生器與編輯器 中,你可以先清理 Midjourney 靜態圖,再花任何影片點數:修復手部、修正衣服上的文字、調整服裝細節,或簡化雜亂的背景。其中有三種模型可選:GPT Image 2 適合精準控制與清晰文字;Nano Banana 2 適合快速的日常編輯;Nano Banana Pro 適合維持角色一致性,單次工作階段最多接受九張參考圖,並輸出 4K。
需要第二種姿勢或角度時,提供多張參考圖給 Nano Banana Pro,可以增加視覺脈絡。開始動畫前,仍須對照已審核角色檢查結果。
把所有要保留的圖片存進 Assets。不同鏡頭可以重複使用這些靜態圖,不必重新上傳。
選擇符合鏡頭需求的動畫路線
並不存在一個通用的「Midjourney 轉影片」按鈕,因為任務不只一種。三條路線幾乎能涵蓋所有情況,而選錯路線是角色走樣的第二大原因。
路線 1:讓一張好靜態圖變成動態鏡頭
使用 Image to Video。角色亮相、氛圍鏡頭、推鏡或 Midjourney 主視覺,通常可從這裡開始。
DomoAI 提供 Seedance 2.0 作為圖片轉影片模型,支援 4–15 秒輸出、480P/720P/1080P 設定、電影感動態、原生音訊與多鏡頭。DomoAI 2.4.1 Advanced 和 Fast 也可用於生成 5 秒或 10 秒片段,呈現逼真的動作並保持視覺一致性。
實用建議:先用 Fast 模型以低解析度製作草稿,直到動作正確,再將最佳版本以 1080P 重新生成。角色鏡頭往往要試好幾次,沒必要為淘汰的版本付全額成本。
路線 2:鏡頭起點與終點都很重要
使用 Frames to Video。適合轉場與變化,例如閉眼到睜眼、便服到戲服,或前後狀態轉換。
有兩種模式,差異很實際。使用 Seedance 2.0 / Seedance 2.0 Fast 時,你只需提供起始幀與結束幀,模型會填補中間的內容。使用 DomoAI 2.4.1 時,你可以提供 2–8 個關鍵影格與各段動態提示詞,生成 1–56 秒的影片。如果你已在 Midjourney 製作好一段分鏡,並希望影片逐一符合每個畫面,這就是你需要的方式。
Midjourney 也能從起始幀製作到另一個結束幀的動畫。若要直接在 Midjourney 中製作最長 21 秒的轉場,可用這個功能。若需要 Seedance 的首尾幀控制,或 DomoAI 2.4.1 的 2–8 個關鍵影格、分段提示詞與 1–56 秒流程,就使用 DomoAI Frames to Video。
路線 3:讓角色表演參考影片中的動作
使用 Character to Video。這件事 Midjourney 根本做不到,也是大多數角色創作者最後會使用第二個工具的原因。
提供一段參考影片與你的 Midjourney 角色圖片。它會替換角色,同時完整保留原本的動作。無論是舞蹈片段、走路循環還是手勢,你的角色都能照著表演。Subject Only 模式會替換角色,同時讓場景其餘部分更接近原片。
Seedance 2.0 模式支援 4–15 秒;DomoAI 2.4.1 每次生成最長可達 30 秒。角色圖片可使用 JPEG、PNG 或 JPG,大小上限 10MB;參考影片可使用 MP4、MOV 或 AVI。
這就是一步完成的動漫與 VTuber 流程:一張 Midjourney 原創角色靜態圖、一段舞蹈參考,你的角色就跳起舞來,而你不需要親手製作任何一幀動畫。
動態製作前,先做角色一致性卡片
我會在來源圖旁保存一張簡短的外觀卡片。它不是另一份冗長提示詞,而是一小份清單,讓我在每段影片的開頭、中間與結尾逐項檢查。
| 固定項目 | 要記錄的內容 | 出現什麼情況就淘汰片段 |
|---|---|---|
| 臉部 | 眼睛顏色、臉型、髮際線、代表性特徵 | 兩個或更多特徵改變 |
| 服裝 | 外套形狀、飾邊顏色、配件 | 重要細節消失或左右對調 |
| 輪廓 | 髮長、肩寬、裙子或外套外形 | 主要動作中身體輪廓改變 |
| 鏡頭 | 裁切、鏡頭感、機位高度、光線方向 | 構圖破壞與前一鏡的連貫性 |
| 動作上限 | 一個主體動作+一個鏡頭動作+一項氛圍變化 | 片段憑空增加遮蔽角色特徵的動作 |
如果來源圖已有兩項檢查不合格,我就會回到 多模型圖片產生器與編輯器。對於動漫來源,Niji 7 動畫指南 有助於把圖片設計選擇與動態選擇分開。製作較長的段落時,我會使用 角色一致性流程,並搭配 AI 分鏡指南 規劃場景。
可直接複製的第一個鏡頭提示詞
提示詞描述的是動作與鏡頭,不是角色本身;圖片已經完成角色描述。
主體保持原位、緩慢呼吸,頭髮輕柔擺動。鏡頭緩慢推近,淺景深。柔和輪廓光,空氣中有塵埃微粒。臉、服裝與髮型保持不變。
注意最後一句。明確說出哪些部分不能改變,雖然不花俏,卻很有效。若想更精準地控制,可按時間段加入鏡頭指示,例如 CAM 1 (0-3s): slow push in,或按下 AI Optimize,把簡短的提示詞擴寫成模型真正能用的內容。
外觀仍然走樣時的修正方法
臉在片段中途變了。 靜態圖提供的資訊不足以支撐這麼長的片段。縮短它。把兩段乾淨的 5 秒片段剪在一起,勝過一段持續走樣的 15 秒鏡頭;這也是最常見的有效修正方法。
服裝憑空多出細節。 靜態圖的那個部位不夠明確。回到圖片編輯,把細節交代清楚,再重新製作動畫。不要試圖只靠提示詞彌補模糊不清的來源圖。
角色在不該移動時動了。在提示詞中明確要求維持原狀,例如「臉、服裝與髮型保持不變」,並改用動作較少的構圖。
風格變得平淡。Midjourney 的繪製質感也是角色的一部分。若某條路線讓風格流失,減少要求的動作;大幅動作迫使模型重新補畫更多內容,而風格常在重新補畫時改變。
每一次都全面走樣。 問題出在參考靜態圖,而不是模型。裁切、極端角度與濃重陰影,都會讓模型得不到足夠資訊。重新生成一張更乾淨、角度更平直、呈現更完整的參考圖,再試一次。
讓角色說話或唱歌
Midjourney 的影片沒有對嘴功能,所以這一步一定要離開該平台。
Talking Avatar 接收 Midjourney 角色圖片與音訊;音訊可以是 DomoAI 的文字轉語音輸出,或上傳的 MP3/WAV,並生成說話或唱歌的角色。標準時長為 5 秒/10 秒/20 秒,Pro 方案的快速模式提供 30 秒與 60 秒。你可以在台詞之外獨立指示表情,因此不用把「微笑」或「點頭」偷偷塞進對白。
製作 AI 歌手時,把較長的人聲切成短段。檢查並替換一段不好的 15 秒片段,比重新生成整首歌便宜得多。
有一項限制需要坦白說明:這裡不處理背景音樂與整首歌的混音。匯出片段後,在 CapCut、Premiere Pro 或 DaVinci Resolve 裡加上音軌。
完成片段
生成解析度最高為 1080P。交付前,把最終剪輯送進 Video Upscaler,即可提升至最高 4K。
順序很重要:只放大你決定保留的版本,而不是每份草稿。如果你需要大量反覆嘗試,Relax Mode 在 Standard 及以上方案中可生成符合條件的作品而不消耗點數。速度較慢,但角色製作需要大量嘗試,這正是讓成本變得負擔得起的方式。詳情請見 價格頁。
常見問題
可以將 Midjourney 圖片放進 AI 影片工具商用嗎?
Midjourney 表示,訂閱者通常擁有自己生成的圖片與影片,但須遵守其條款與例外規定。年營業總收入超過 100 萬美元的企業,需使用 Pro 或 Mega 方案才能商用。DomoAI 授予付費方案生成作品的商業使用權。替客戶發布前,請檢查兩個服務的現行條款。
為什麼角色每個鏡頭都長得不一樣?
你在提示詞中重新描述角色,而沒有讓圖片承擔這個工作。以一張已鎖定的參考靜態圖製作動畫,並把提示詞限制在動作上。
Midjourney 自己的影片模型夠用嗎?
如果只是讓一張靜態圖產生氛圍動態,通常夠用。若需要對嘴、移植參考表演的動作,或製作超過其延伸上限的片段,就需要專門的影片工具。
一張 Midjourney 靜態圖最長能生成多久的片段?
Midjourney 從 5 秒開始,可延伸四次、每次 4 秒,最長共 21 秒。在 DomoAI 中,使用 Seedance 2.0 將單張靜態圖轉成影片,時長為 4–15 秒。較長的 Frames to Video 與 Character to Video 流程會使用額外輸入,處理不同的任務。
每換一個工具都要重新上傳圖片嗎?
不用。把靜態圖存入 Assets 一次,之後就能從 History 面板直接拖進接下來使用的工具。
從一張靜態圖開始
挑出你最滿意、一直努力維持外觀的 Midjourney 角色,先做一次乾淨的編輯,再製作一個五秒動畫。先做好一個鏡頭,不必立刻製作整支音樂影片。
臉能維持一致,流程就成立;以上其他步驟只是擴大製作規模。
使用 DomoAI 讓 Midjourney 角色動起來 →


