近年,隨著生成式 AI 進步,影片製作門檻大幅降低,進入人人都能輕鬆製作動畫影片的時代。
大家好,我是 Ny@Tech。
我原本長期從事網路行銷,約 2024 年開始對生成式 AI 的可能性感興趣,進而投入AI 圖片生成、AI 作曲工具與AI 影片生成等領域。
目前正在探索以 AI 製作 MV 的工作流程。
2025 年 9 月,ChatGPT 開發商 OpenAI 發布最新影片生成模型 Sora 2,成為象徵 AI 進化的一件事。
Meta、Google 等也陸續推出影片生成工具,讓「影片生成」成為 AI 產業新的競爭舞台。
其中特別受到關注的是,幾分鐘就能生成高品質動畫影片的 DomoAI。

DomoAI 是 2023 年由新加坡企業開發的新一代影片生成 AI 工具,即使沒有專業技能,也能在幾分鐘內做出專業般的影片。
善用 DomoAI 等生成式 AI,人人都能製作高品質 MV。
本文由出身網路行銷的我,清楚解說新手利用 AI 工具製作 MV 的步驟與訣竅。
用 AI 創作:MV 製作流程
接著就來看利用生成式 AI 製作 MV 的流程。
MV 製作大致可分成 4 個步驟。

1. 製作歌曲
先準備作為 MV 基礎的歌曲。
若已有自己創作的音樂,就可以使用,但多數人應該沒有原創歌曲。
這時,利用 AI 作曲工具,就能在幾分鐘內做出原創歌曲。
例如,使用 AI 作曲服務 Suno,只要輸入歌詞與曲風,就能生成情感豐富的歌曲。
2. 準備圖片素材:蒐集素材與善用生成式 AI
可以自行拍攝真實風景、小物或通用鏡頭,也能利用 Adobe Stock 等素材網站準備圖片。
對於營造 MV 獨特世界觀與故事性的奇幻背景和角色視覺,生成式 AI 能拓展表達範圍。
例如,下列場景就很適合 AI 圖片生成工具。
- 符合歌詞世界觀的虛構背景
- 擔任故事主角的動漫角色
- 用來營造氛圍的抽象畫面,如光粒子、壓縮空間等
這些視覺可以透過 Midjourney、Stable Diffusion,或 DomoAI 的文字轉圖片功能,具體呈現符合歌詞的世界觀。

3. 生成影片:透過 AI 轉為動態影像
根據準備好的圖片素材,在 DomoAI 生成影片片段。
使用 DomoAI 的圖片轉影片(Image to Video)功能,就能輕鬆讓靜態圖片動起來。

也能使用 AI 虛擬角色(Talking Avatar)功能,為角色圖片加入口型同步,重現彷彿在唱歌的動作。
如此,依歌曲各段落用 AI 生成多個鏡頭,再按場景運用,就是 MV 製作的基本流程。
4. 剪輯與完成
最後把生成的影片片段接合,完成 MV。
不需要複雜操作,只要使用剪輯軟體或 App,按照以下流程處理。
- 匯入歌曲檔案
- 按歌曲時間放置圖片與影片
- 剪掉不要的部分
- 視需要加入字幕與特效
最後匯出,就完成了。
接下來各章會解說讓流程更順暢的具體重點。
MV 所需素材與圖片構想
要順利製作 MV,事先想好需要哪些鏡頭,並準備對應素材很重要。
尤其事先備妥以下6 個要素,不僅能增加畫面變化,也能減少製作 MV 時的困惑。

背景
也就是作為傳達歌曲世界觀基礎的風景或背景圖片。
依歌詞與曲調選擇場景,如夕陽海邊、城市夜景、近未來都市或宇宙。
全身:遠景鏡頭
這是拍到角色或人物全身的鏡頭。
適合前奏、間奏或開場等,需要傳達歌曲氛圍的場景。
搭配背景,能傳達「這裡是舞台、城市,還是奇幻世界」,讓觀眾想像整支 MV 的世界觀主軸。
上半身特寫:胸像鏡頭
這是胸部以上,或可清楚看到臉部表情的近距離鏡頭。
在副歌或情緒高漲時,插入聚焦角色表情的上半身特寫,有助於觀眾投入情感。
再搭配 AI 虛擬角色(Talking Avatar),就能呈現真的在唱歌的效果。
背影
從背後拍攝主體的鏡頭。
人物背影或背部輪廓,能有效營造哀愁與餘韻。
依曲調刻意不拍表情,插入背後視角,也能增加故事性。
小物:細節鏡頭
拍攝與歌曲或場景相關的小物,能讓觀眾想像故事。
例如以愛為主題時,拍攝歌詞中的象徵物品,如花束、戒指、信或成對杯子,能為畫面增加深度與層次。
呈現節奏的演出鏡頭
用來讓人以視覺感受歌曲節拍與節奏的演出素材。
例如,隨聲音移動的圖形、閃光或抽象粒子動畫,能讓影像與聲音同步,強化爽快感與律動。
也可以在背景疊加雷鳴、心跳、閃爍紅綠燈、時鐘秒針或等化器動畫(※)。
※指把音樂波形或頻率從低音到高音的變化,以圖像方式呈現。
關於隱私保護
上傳圖片與音訊到 DomoAI 等 AI 服務時,有些人可能擔心「資料會被擅自使用嗎?」「會分享給第三方嗎?」
不過,DomoAI 條款明確說明,使用者上傳的圖片與影片資料,不會在 AI 處理目的之外被保存或分享。
※也有不保留紀錄生成影片的幽靈模式功能。
事先準備上述素材,就能順暢切換各場景,做出不讓觀眾厭倦的結構。
先進行接下來解說的場景設計與前置準備,也能明確所需素材種類與數量,避免無謂生成或重新尋找。
MV 製作前準備:歌曲編輯與場景設計
素材備妥後,生成影片前先進行設計與規劃,能讓製作更順暢。
這個階段一邊仔細聽歌,一邊安排「什麼時候放什麼畫面」。
先把歌曲匯入剪輯軟體或 App,在想切換場景的位置加標記,或依段落分割。
再依歌詞與歌曲結構,用顏色或筆記標出想插入的場景,例如「這段放背景」「這裡角色特寫」,就能一眼看出要生成或配置哪些素材。
切換點若配合音訊波形、節拍或高潮,畫面節奏會更自然,產生影像乘著音樂前進的舒適感。

配合 MV 結構的畫面設計範例
為了更具體理解場景設計,以下依一般 MV 結構整理各段落可放哪些影片或圖片的範例。
場景類型
畫面演出的目的與用法
演奏場景:前奏與間奏
開場與間奏可放風景或視覺化節奏的鏡頭,傳達歌曲氛圍。
主歌與副歌前段
主歌與副歌前段可呈現歌手全身或上半身特寫,配合歌詞展現表情。
副歌
副歌最高潮,可加入角色特寫,再搭配光粒子或鏡頭移動等演出。
尾奏與結尾
結尾以人物背影或夕陽等留下餘韻的畫面收束。
先依歌詞與段落做好畫面計畫,不只避免漏素材,之後剪輯也不用再猶豫哪個鏡頭放哪裡。
事先確定結構,也能明確列出 AI 需生成的鏡頭,減少無謂生成,有效率地推進製作。
DomoAI 基本功能介紹
接下來正式用 DomoAI 製作影片。
本章解說 DomoAI 基本功能,以及有助 MV 製作的使用重點。
DomoAI 有許多功能,製作 MV 時主要需掌握三項:風格與範本、AI 虛擬角色(Talking Avatar),以及Screen Keying,也就是色鍵合成。
接著逐一詳看。
用風格與範本挑戰多樣視覺表現
DomoAI 可選擇稱為風格或模型的視覺調性。
提供動漫、寫實、油畫、3D 漫畫等超過 30 種視覺風格,可以改變生成結果的氛圍。
風格指定可用於:
- 從影片製作影片的 Video to Video,
- 以及從文字生成圖片的 Text to Image,
等功能。

選擇這些風格,就能依曲風與氛圍改變畫面筆觸。
例如 J-POP 搭日本動漫,抒情慢歌搭水彩或油畫,試試與歌曲相合的視覺。
用 AI 虛擬角色(Talking Avatar)讓角色唱歌
接下來介紹 AI 虛擬角色(Talking Avatar)功能。
這項 DomoAI 熱門功能,為靜態角色加上口型同步與表情變化,讓它看起來像在說話或唱歌。
例如上傳準備好的角色插畫或照片,以及用 Suno 等生成的人聲音軌,就能製作角色彷彿在唱歌的影片。
操作方式很簡單:
- 在選單選擇 AI 虛擬角色(Talking Avatar)
- 左側上傳要動起來的圖片,右側上傳想讓角色唱的音訊
這樣就可以了。

不過要注意,音訊需上傳只有人聲的檔案。
因為混入樂器聲時,口型同步也可能對伴奏節奏起反應,產生不預期的嘴部動作。
也可在提示詞加入微笑或悲傷等情緒指示,讓口型同步搭配表情變化。


使用這項功能,能為 MV 角色注入生命,做出吸引觀眾的演出。
利用 Screen Keying 自由組合影像
Screen Keying 一般稱為色鍵合成,指把特定背景色轉為透明,再換成其他影片或背景的處理。
例如用 AI 虛擬角色(Talking Avatar)生成唱歌角色時,先把背景設為綠色或其他單色,之後就能結合其他背景影片。
操作很簡單,在 DomoAI 生成角色影片時開啟 Screen Keying,選背景色,基本上用綠色,就可以了。
DomoAI:Screen Keying 功能

接著把要用的背景圖片或影片匯入剪輯軟體,在上方放綠幕角色影片,再用色鍵合成去掉綠色,就能得到只有角色融入背景的合成影片。

善用色鍵合成,就能把分開生成的 AI 影片組合成一個場景。
這項技巧可隨創意拓展影片可能性,歡迎試試。
為影片加入動作的範本
提升影片魅力時,鏡頭運動與角度是重要因素。
真人拍攝透過移動攝影機營造臨場感,DomoAI 則可利用範本與提示詞技巧,讓角色或背景動起來。
例如,圖片轉影片(Image to Video)範本能選擇拉近、升降鏡頭上升等視角移動,或親吻、擁抱等演出動作。

這些在生成時就能製作成動態影片,因此主體與背景的透視會自然計算,產生如同實拍的立體感。

提示詞中的鏡頭運動指示範例
在提示詞加入鏡頭指示,AI 有時能理解意圖,並在畫面中反映成視角移動。
以下提供一些鏡頭指示範例,作為撰寫提示詞的參考。
| 提示詞 | 解說 | 組合使用範例 |
|---|---|---|
| 拉近 | 拉近主體 | 緩慢拉近角色臉部 |
| 拉遠 | 拉遠呈現全景 | 快速拉遠呈現城市景色 |
| 向左平移 | 向左方移動 | 流暢向左平移穿過房間 |
| 向右平移 | 向右方移動 | 向右平移露出另一個角色 |
| 向上傾斜 | 鏡頭向上轉動 | 從地面向上傾斜至天空 |
| 向下傾斜 | 鏡頭向下轉動 | 向下傾斜聚焦物品 |
| 向前推軌 | 攝影機本體往前靠近 | 戲劇性向前推軌靠近門 |
| 向後拉軌 | 攝影機後退拉遠 | 緩慢向後拉軌呈現風景 |
| 跟拍鏡頭 | 與主體平行跟隨 | 跟拍奔跑者 |
| 追隨鏡頭 | 追著主體的視角 | 從汽車後方追隨 |
| 升降鏡頭上升 | 像吊臂般上升 | 升降鏡頭上升露出人群 |
| 升降鏡頭下降 | 像吊臂般下降 | 升降鏡頭下降呈現細節 |
| 鳥瞰視角 | 從正上方俯視 | 戰場的鳥瞰視角 |
| 360 度環繞 | 完整旋轉一圈 | 流暢環繞角色 360 度 |
| 手持晃動鏡頭 | 手持攝影機般的晃動 | 追逐時使用手持晃動鏡頭 |
| 穩定器鏡頭 | 穩定流暢的移動 | 穩定器鏡頭穿過走廊 |
| 移焦 | 焦點從前景移到背景 | 焦點從花移至人物 |
| 慢動作鏡頭移動 | 彷彿慢動作的移動 | 打鬥時使用慢動作鏡頭移動 |
提示詞中的鏡頭指示,會因原圖構圖與主體而有很大差異。
如果動作不如預期,可以改換圖片,或逐步調整提示詞表達方式來測試。
Standard 方案以上可使用 Relax 模式,不消耗點數就能反覆生成測試,不妨透過嘗試製作理想 MV 場景。
AI 影片製作的著作權與倫理注意事項
以上解說 AI 圖片與影片製作方法,但有幾個重要事項務必留意。
那就是著作權與倫理,也就是虛假內容的問題。
關於著作權
DomoAI 生成的影片與圖片,著作權基本歸生成它們的使用者。
也就是說,自己用 AI 製作的內容也能商業使用。
但要注意的是輸入 AI 的素材。
- 未經允許使用知名動漫角色圖片
- 擅自匯入藝人照片讓 AI 學習
- 未經許可使用商標或品牌元素
這些行為會侵害著作權、肖像權或商標權,條款也予以禁止。
關於倫理與虛假內容
隨 AI 影片技術進步,全球濫用假影片,也就是深偽的案例增加。
各國都有案例,例如讓真人說出未曾說過的話,或製作不存在事件的畫面用來詐騙。
尤其用 AI 生成並散布假新聞影片,蓄意欺騙大眾,我認為是打著創意之名進行惡意資訊操弄,絕不能被容許。
若影片可能造成誤解,附上「此影像由 AI 合成」等明確標示,我認為是創作者應有的體貼。
總結
過去需要專業知識的 MV 製作,隨 Suno、Midjourney、DomoAI 等生成式 AI 工具出現,門檻大幅降低。
現在已是人人都能自己作曲,再結合原創畫面發布的時代。
也請把握機會,挑戰用 AI 製作 MV。
一開始別想得太難,從簡單結構開始,是避免半途而廢的關鍵。


