MiniMax H3 角色一致性指南

10 分鐘閱讀

minimax-h3-character-consistency-guide

MiniMax H3 的角色一致性要從生成影片前開始準備。建立乾淨的參考素材組、固定角色描述,並且每次只改變一項鏡頭變數。這種做法有助於減少角色在不同鏡頭中的臉部、服裝與風格漂移。

MiniMax H3 的角色一致性是什麼?

角色一致性是指觀眾在每個鏡頭中都能認出同一個主體。只有髮型相似,還不符合這項標準。

一致的角色應維持相同的核心身分:

  • 臉型、眼睛顏色與五官比例
  • 髮色、長度、質感與輪廓
  • 服裝、配件、標誌與代表性道具
  • 身高、體型與身體比例
  • 色盤與繪製風格
  • 年齡、個性與反覆出現的行為

相機角度、表情、姿勢與照明可以改變,但角色的辨識特徵不應改變。

MiniMax H3 接受文字、圖片、影片與音訊輸入。官方資料說明的 Reference Generation 流程以參考圖片與影片為主,也可加入與視覺媒體搭配的音訊參考。

H3-Context-IR 的用途不同:它會解讀多模態輸入並回傳增強後的提示詞,不會生成影片。參考素材有助於維持連續性,但 MiniMax 並未保證每個鏡頭中的身分都能完全一致。

製作動畫前先建立參考素材組

單張肖像會留下許多未定義的細節。它只呈現一個角度、一種表情與部分服裝,模型必須自行推測畫面以外的內容。

生成連續鏡頭前,先準備一組精簡的參考素材:

  1. 中性正面特寫: 臉部清楚、照明均勻、嘴巴閉合、直視鏡頭。
  2. 全身圖片: 輪廓、鞋子、袖子與服裝比例都清楚可見。
  3. 側面或四分之三角度圖片: 呈現側臉、髮量、下顎線與配件。
  4. 表情表: 中性、開心、擔心與堅定等表情。
  5. 服裝細節: 標誌、飾品、布料圖案與代表性道具。
  6. 顏色參考: 固定頭髮、眼睛、服裝與重點色的色盤。

每張圖片都要使用相同設計。若參考素材中的頭髮長度或夾克細節互相衝突,只會增加歧義,無法提高控制力。

若參考素材組需要修正,可使用 多模型圖片生成器與編輯器 。其中包含 GPT Image 2、Nano Banana 2 與 Nano Banana Pro;Nano Banana Pro 每次最多可接受 9 張參考圖片,適合需要多張角色參考或風格參考的工作。

你也可以使用 DomoAI 文字轉圖片建立第一張角色設定表。若需要動畫卡片風格素材, Anime Card Maker 也可作為起點。

使用角色設定表,不要憑記憶判斷

把每個鏡頭都必須保留的細節,整理成一段可重複使用的內容:

Character name: Face: Hair: Eyes: Outfit: Body silhouette: Color palette: Signature prop: Visual style: Do not change: Allowed changes per shot:

每個欄位都要能從畫面上直接確認。「獨特的英雄」幾乎沒有提供具體指引;「藍綠色短髮配一束金色挑染、琥珀色眼睛、黑色短版外套配金色滾邊、象牙白高腰長褲與新月形墜飾」則定義了肉眼可見的限制。

寫一段固定的角色描述

建立一段身分描述,原封不動地貼到每個鏡頭提示詞。不要為了變化而重寫;即使只是微小的措辭差異,也可能改變模型關注的特徵。

Keep the same character: an adult anime singer with a teal bob and one thin gold streak, amber eyes, a black cropped jacket with gold trim, ivory high-waisted pants, teal ankle boots, a crescent pendant, slim silhouette, soft cel-shaded anime style, and the same face proportions in every shot.

把這段描述放在會改變的動作之前,並在整個序列中維持相同順序。

吉祥物或產品角色也可以使用相同結構:

Keep the same mascot: a small cobalt-blue fox with rounded ears, one white tail tip, a yellow messenger bag, three dark cheek marks, and the same flat graphic style in every shot.

這段文字只需要辨識角色,不必描述整個場景。

改變動作,不要改變角色

把每個鏡頭當成受控變化。身分描述保持固定,動作、相機或環境則分別寫在其他句子中。

Same character and outfit as the reference. Change only the action: she turns toward the camera, lifts the microphone, and takes one step forward under blue stage lights. Keep face shape, hair length, jacket, ivory high-waisted pants, crescent pendant, and color palette unchanged.

每個短片段只安排一項有意義的動作。若提示詞同時改變姿勢、服裝、地點、天氣、鏡頭、風格與情緒,模型必須處理太多互相競爭的決策。

三鏡頭序列可以這樣安排:

鏡頭固定內容改變內容
特寫身分、服裝、風格、色盤視線轉向相機
中景身分、服裝、道具、照明風格角色舉起麥克風
遠景身分、服裝、舞台設計、色盤角色走進聚光燈下

這種方法也有助於找出問題。若只改變相機後臉部就開始漂移,便能更容易鎖定新加入的變數。

文字不夠時,使用 H3 參考素材

文字描述的是一類特徵,參考素材則呈現精確的視覺關係。若單靠文字無法保留臉部、道具、服裝圖案或動作概念,請加入參考媒體。

鏡頭需要視覺參考,或需要把音訊參考與視覺媒體搭配時,可使用 MiniMax-H3 Reference Generation。目前流程最多接受 9 張圖片、3 段影片與 3 段音訊,混合參考輸入合計上限為 12 個檔案。每段影片或音訊須為 2~15 秒;參考影片與參考音訊各自的總長度上限均為 15 秒。MiniMax 的 H3 參考文件指出,音訊至少要搭配 1 張圖片或 1 段影片,不能作為唯一的參考輸入。

H3-Context-IR 可在生成前整理複雜的多模態輸入。它以非同步方式運作,回傳的是增強後的提示詞,不是影片。

依用途選擇參考素材:

  • 使用特寫保護臉部身分。
  • 使用全身圖片保護輪廓與服裝。
  • 小圖案或配件很重要時,加入服裝細節圖片。
  • 只有在動作需要更明確的肢體方向時,才使用動作參考。

不要預設加入所有圖片。只有彼此一致的參考素材才有幫助;請移除重複或互相矛盾的版本。

製作長序列前,先測試三個短片段

建立完整場景前,先做一組小型連續性測試。使用三種會暴露不同風險的鏡頭。

  1. 生成一個動作幅度很小的中性特寫。
  2. 生成一個只包含單手動作的中景。
  3. 生成一個包含簡單轉身的較遠鏡頭。

把三個片段並排檢查,不要只看其中最好看的影格。

使用以下漂移檢查表:

範圍通過條件常見漂移訊號
臉部比例與年齡一致下顎、眼睛或鼻子改變
頭髮長度與輪廓一致瀏海、髮量或顏色改變
服裝剪裁與細節一致袖子、標誌或配件消失
身體身高與體型穩定四肢或比例改變
色盤主要顏色保持固定夾克或眼睛顏色改變
風格繪製語言一致寫實程度或線條粗細改變
道具形狀與位置仍清楚可辨道具大小改變,或換到另一隻手

同一細節連續失敗兩次,就要改進參考素材或身分描述。隨機重試通常無法找出原因。

修正臉部、服裝與風格漂移

不同問題需要不同的修正方式。

問題可能原因下一次測試方式
不同角度的臉部不一致側面參考不足,或臉部比例定義模糊加入四分之三角度圖片,並固定臉型
頭髮變長或變色頭髮描述缺少長度或輪廓明確寫出長度、瀏海、質感與精確顏色
服裝的小細節消失全身參考看不清細節加入服裝局部圖片,並列出固定元素
角色變得更寫實不同提示詞使用了不同的風格描述固定使用同一段風格描述,不要替換同義詞
手部或道具變形動作遮住了重要形狀簡化手勢,並讓道具維持可見
背景影響服裝顏色主體與背景明度太接近提高來源圖片中的對比

若多個區域同時失敗,請降低鏡頭複雜度。先從穩定構圖開始,再加入相機或身體動作。

依角色類型調整連續性測試

各種形式都能使用相同的身分管理方法,但不同角色與受眾有不同的失敗風險。

動畫與 VTuber 角色

保護線條粗細、眼睛設計、頭髮輪廓、服裝層次與代表性配件。說話特寫與全身動作要分開測試;同一設計可能在某個景別穩定,換到另一個景別後就開始漂移。

AI 網紅

固定臉部比例、外觀年齡、髮型、體型與反覆使用的服裝規則。相機與照明變化應保持合理;即使提示詞重複相同描述,極端的鏡頭變化仍可能改變臉部。

品牌吉祥物

把品牌細節視為製作限制,記錄精確顏色、形狀、標記與道具位置。請對照已核准的風格指南檢查吉祥物,不要只憑記憶。

電影角色

為每種預定照明條件與相機距離準備參考素材。夜間特寫與日間遠景會帶來不同的連續性風險;照明描述可以改變,身分描述則要保持固定。

不論角色類型為何,都應在正式製作前核准一小組鏡頭。這組素材會成為後續場景與審核人員的視覺基準。

在 DomoAI 使用 MiniMax H3

MiniMax H3 現已可透過 DomoAI 的Omni Reference使用。

若要把現有表演套用到新角色,可使用 角色轉影片 。此流程需要原始影片與目標角色圖片;Subject Only 模式可只保留主要主體。

對話或唱歌鏡頭則可使用 數位化身 。它接受圖片或影片搭配音訊,也支援多語言輸出。製作多段說話影片時,請固定使用同一張已核准肖像,以保護角色身分。

這些流程解決的問題不同。MiniMax H3 會依提示詞與參考素材生成新表演;DomoAI 角色轉影片會沿用既有動作;數位化身則為穩定的角色素材加入對話或歌聲。

常見問題

如何在 MiniMax H3 維持同一角色?

使用乾淨的參考素材組、固定的身分描述,以及每次只改變一項鏡頭變數的提示詞。生成長序列前,請先測試短片段。

MiniMax H3 支援參考圖片嗎?

支援。MiniMax 官方文件列有使用圖片與影片的 Reference Generation,也可加入與視覺媒體搭配的音訊參考。H3-Context-IR 是選用的提示詞增強步驟,不是生成任務本身。

要維持角色一致性,應使用多少項參考素材?

沒有適用於所有情況的最佳數量。先使用能清楚定義角色的最小一致素材組,只有缺少角度、服裝細節或動作要求時,才再加入參考。準備最終輸入時,也要遵守上方參考素材章節所列的技術限制。

如何修正 H3 的臉部漂移?

加入更清楚的臉部參考、固定五官比例,並減少同時出現的相機或表情變化。請用相同起始設定比較多個短測試。

MiniMax H3 適合動畫或 VTuber 角色嗎?

它可支援參考素材驅動的角色流程,但是否合適仍取決於特定風格與一致性目標。請分別測試臉部比例、線條風格、服裝細節與動作。

何時應使用角色轉影片,而不是 H3 生成?

若現有表演必須控制角色動作,請使用角色轉影片;若要依提示詞與參考媒體建立全新鏡頭,則使用 H3。

角色先固定,再控制變數

穩定序列來自穩定輸入,不是更長的提示詞。把已核准的參考素材組、身分描述與 QC 表保存成製作基準;同一角色通過特寫、中景與遠景測試後,再擴大製作。

最新文章