MiniMax H3 能將來源圖片轉成短影片。要提高結果的穩定度,請先準備乾淨的靜態圖片、以動作為主的提示詞,以及明確的結尾設計。本指南將說明來源圖片準備、首尾影格、參考媒體、檢查方法與常見問題的修正方式。
MiniMax H3 圖片轉影片能做什麼?
圖片轉影片會以一張靜態圖片作為動作的視覺起點。來源圖片已決定主體、構圖、色盤、照明,以及大部分的場景空間關係。
提示詞要說明接下來會發生什麼。你可以指定主體動作、相機運動、環境變化、節奏與預期的結尾。
MiniMax 官方 API 將此模型列為 MiniMax-H3。它支援 768P 或 2K 輸出、4~15 秒片長與原生立體聲音訊。官方文件列出的流程包括文字轉影片、以第一影格進行圖片轉影片、首尾影格生成,以及多模態 Reference Generation。
使用 H3 仍然需要事前規劃。四肢被遮住、文字已損壞,或景深線索互相衝突,都會增加動作不穩與畫面漂移的風險。
從經得起動態變化的圖片開始
好看的靜態圖片不一定適合拿來做動畫。請把它當成鏡頭的第一影格來檢查。
來源圖片檢查表
- 主體清楚: 觀眾能立即辨識主要人物、物件或產品。
- 邊緣清晰: 手、臉、產品輪廓與重要道具沒有融入背景。
- 保留動作空間: 畫面留有足夠空間,讓主體或相機能夠移動。
- 人體結構合理: 四肢與臉部特徵在原圖中已經正確。
- 文字與標誌穩定: 品牌標誌清楚可讀,且沒有變形。
- 照明一致: 高光與陰影符合場景條件。
- 景深層次明確: 前景、主體與背景能清楚分成不同層次。
- 長寬比正確: 來源圖片已符合預定的發布格式。
先修好來源圖片,再投入 Credits 生成影片。DomoAI 的 多模型圖片生成器與編輯器 可修正手部、文字、服裝、背景與產品細節,並提供 GPT Image 2、Nano Banana 2 與 Nano Banana Pro。
不要一次修改所有問題。每次只調整一個肉眼可見的問題,檢查結果,並保留已核准的主體設計。
描述動作,不要重複描述圖片
圖片已經告訴模型場景裡有什麼。提示詞應用來定義動作與限制條件。
可以採用以下結構:
Subject action + camera movement + environmental motion + timing + locked details + forbidden changes
以下產品展示提示詞為每個部分安排了明確用途:
Animate this source image into a 6-second cinematic product reveal. Keep the same subject, color, logo placement, and background layout. Start with a slow push-in, add soft reflections on the surface, then finish with a slight camera arc from left to right. No new objects, no text changes, no face or logo distortion.
提示詞沒有重新描述每種顏色或物件,而是保護重要細節並引導鏡頭。
角色場景可以這樣寫:
The same character looks toward the window and takes one slow breath. Her hair moves slightly in the evening breeze. The camera makes a gentle push-in. Keep her face, outfit, room layout, and cel-shaded style unchanged. No new characters or sudden camera shake.
第一次測試只安排一個主要主體動作與一種相機運動。基本鏡頭穩定後,再逐步增加複雜度。

每個提示詞組成部分,都應負責引導一項鏡頭內容,或保護一個必須維持穩定的細節。
結尾很重要時,使用首尾影格
只有起始圖片時,最後的構圖仍是開放的。若鏡頭必須停在特定產品角度、姿勢、版面或轉場位置,請加入最後一影格。
| 鏡頭需求 | 只有起始圖片 | 首尾影格 |
|---|---|---|
| 角色的輕微自然動作 | 通常已足夠 | 可選 |
| 緩慢推鏡 | 通常已足夠 | 需要精準控制結尾取景時使用 |
| 產品轉動或亮相 | 結果較難預測 | 較適合指定明確的結尾角度 |
| 前後狀態轉換 | 終點控制較弱 | 可定義前後兩種狀態 |
| 相似構圖剪接或轉場 | 結尾可能漂移 | 可支援預先規劃的剪接點 |
| 以標誌或產品定鏡收尾 | 版面可能改變 | 有助於保護最終構圖 |
兩個影格必須呈現合理的轉換。正面產品圖與毫不相關的俯視場景差異過大,會迫使模型自行補出太多中間內容。
若要在 MiniMax 以外規劃首尾畫面,可使用 DomoAI 的 多幀轉影片 。其中有兩種相關流程:ByteDance 的 Seedance 2.0 模式使用起始與結束影格;DomoAI 2.4.1 則支援 2~8 個關鍵影格,以及各段獨立提示詞。
參考媒體能釐清鏡頭時才加入
參考素材應用來消除歧義,而不是把整個未整理的素材資料夾全部塞進去。
Reference Generation 可使用視覺參考,以及與視覺媒體搭配的選用音訊。目前 API 最多接受 9 張參考圖片、3 段影片與 3 段音訊,混合參考輸入合計上限為 12 個檔案。每段影片或音訊須為 2~15 秒;參考影片與參考音訊各自的總長度上限均為 15 秒。MiniMax 的 H3 參考文件指出,音訊至少要搭配 1 張圖片或 1 段影片,不能作為唯一的參考輸入。
H3-Context-IR 是獨立的非同步步驟,會解讀多模態情境並回傳增強後的提示詞;它不會生成影片。
為每項參考素材指定一個用途:
- 以臉部或角色圖片固定身分
- 以風格圖片固定繪製語言與色盤
- 以產品圖片固定形狀、標籤與材質
- 以動作參考指定明確的肢體動作
- 以環境參考指定建築或地點
移除與來源影格互相矛盾的參考素材。若夾克、髮型或產品標籤各有兩種版本,模型會更難理解「保持不變」。
生成前先檢查輸出設定
評估模型品質前,先確認設定。長寬比或音訊選項錯誤,可能讓原本良好的動作測試無法使用。
請確認:
- 選用的 H3 模型
- 圖片轉影片或首尾影格模式
- 影片片長
- 直接輸出 768P 或 2K,以及可用時選用的 768P 轉 2K 再生成
- 長寬比
- 音訊行為
- Credits 用量、方案權限,以及所在地區與使用介面的提供狀況
目前官方 API 可直接請求 768P 或 2K 輸出,片長為 4~15 秒,並提供常用或自適應長寬比。符合條件的 768P 結果也可使用文件所述的 2K 再生成流程;但再生成只是選用管道,並非取得 2K 的唯一方式。H3 可生成原生立體聲音訊,第三方介面提供的控制項目可能較少。
動作、身分與構圖都通過檢查後,才進行畫質提升。DomoAI 的 影片放大(Video Upscaler) 可透過降噪與細節增強,將最終影片提升至 4K。
檢查開頭、中段與結尾
先完整播放一次影片,再檢查三個影格。中間影格往往能揭露首尾影格看不出的問題。
| 檢查項目 | 通過條件 | 警訊 |
|---|---|---|
| 身分 | 主體仍可清楚辨識 | 臉部、產品形狀或服裝改變 |
| 動作 | 動作發展自然 | 主體僵住或突然加速 |
| 相機 | 相機運動符合提示詞 | 出現未要求的縮放、晃動或角度變化 |
| 背景 | 空間結構保持連貫 | 牆面、招牌或物件融化變形 |
| 文字與標誌 | 細節仍清楚可讀 | 字母改變或漂移 |
| 音訊 | 聲音符合畫面事件 | 對話、效果音或環境音與畫面無關 |
| 結尾 | 最後一影格可接續後續剪輯 | 鏡頭在動作中途停止,或錯過預定構圖 |
請同時以正常速度與逐影格方式檢查。影片整體看似流暢,標誌仍可能在其中幾個影格發生變化。
修正動作不足、身分漂移與音訊不符
主體幾乎沒有動作
把「dynamic」等模糊形容換成看得見的動作,明確寫出身體部位、方向、距離與速度。
不要只寫 make the scene more dynamic,改寫成 the subject takes two steps forward while the camera slowly tracks backward.
相機運動過多
刪除互相競爭的相機指令。只選一種相機運動,再加上限制條件,例如 stable horizon, no handheld shake.
臉部或產品發生變化
減少動作、加強身分限制,並使用更清楚的參考素材。處理產品時,請固定標誌位置、標籤文字、比例與材質。
背景扭曲
要求局部動態,不要讓整個場景一起變化。固定建築與版面,只加入風、反射、煙霧或其他範圍有限的效果。
音訊與畫面不符
把音訊當成獨立的檢查層。先確認目前 H3 模式提供哪些控制項目;需要精準音樂、旁白或品牌音效時,再到外部編輯器替換或混音。
結尾沒有落在預定構圖
若目前模式支援,請加入最後一影格。確保轉換符合物理邏輯,並簡化兩個端點之間的動作。
讓動作設計符合發布格式
同一張來源圖片用於產品頁、社群動態或電影序列時,需要不同的動作設計。
產品亮相
保護產品輪廓、標籤、材質與標誌。相機運動要慢,反射變化要有限,並以清楚可讀的產品定鏡收尾,不要停在動作途中。
Shorts 與 Reels
一開始就呈現明確動作。主體在手機畫面上要足夠大,構圖採用 9:16,並在生成前為字幕保留安全範圍。
故事場景
用動作傳達情緒或資訊。相較於複雜的全身動作,一次眼神轉移、呼吸或小幅相機運動通常更能維持身分。選擇最後一影格前,也要先規劃下一個剪接點。
AI UGC 廣告
把開場吸引點、產品證明、主持人與收尾鏡頭分開,各自生成短片段。這樣較容易替換不理想的片段,也能逐段檢查品牌細節。
大量生成前,先針對最終發布平台測試一個代表性鏡頭。橫向畫面穩定,不代表裁成較窄的直式畫面後,手部、文字與產品邊緣仍能保持完整。
在 DomoAI 使用 H3 進行圖片轉影片
MiniMax H3 現已可透過 DomoAI 的Omni Reference使用。
常見問題
如何使用 MiniMax H3 將圖片轉成影片?
上傳或選用乾淨的來源圖片,選擇目前的圖片轉影片任務,再撰寫以動作為主的提示詞。繼續生成前,請檢查身分、動作、相機、背景、音訊與結尾。
MiniMax H3 支援首尾影格影片嗎?
MiniMax 目前的影片文件列有首尾影格流程,但任務名稱、輸入規則與使用管道可能因介面而異。
哪一種來源圖片效果最好?
使用主體清楚、邊緣清晰、人體結構合理、文字穩定、照明乾淨且留有動作空間的圖片。來源圖片的長寬比也要符合最終發布平台。
H3 能讓同一角色或產品保持一致嗎?
參考素材與固定提示詞有助於提高連續性,但無法保證完全一致。請先測試短片段,逐影格檢查臉部、服裝、形狀、文字與顏色。
MiniMax H3 能生成帶有音訊的影片嗎?
可以。MiniMax 官方發布頁面與儲存庫均記載原生立體聲音訊,官方儲存庫標示為 32 kHz 立體聲輸出。請確認你所用管道實際提供哪些音訊控制項目。
可以在 DomoAI 使用 MiniMax H3 嗎?
可以。MiniMax H3 現已可透過 DomoAI 的 Omni Reference 使用。
生成前先規劃動作
穩定的圖片轉影片結果,需要適合動態化的來源圖片、描述動作的提示詞,以及明確的檢查方法。
先準備一張品質良好的靜態圖片,執行一次受控測試,再檢查開頭、中段與結尾,確認後才擴展場景。


