瀏覽 Instagram Reels、TikTok 或 YouTube Shorts 時,有時會看到角色、動物、食物、家電和日用品,像人一樣說話的影片。
例如,蔬菜介紹自己的營養、家電說明產品特色,或可愛角色分享冷知識的短片。
乍看之下,這些影片似乎很難製作。
不過,使用 AI 影片生成工具 DomoAI,就能結合圖片與音訊,製作角色或物品彷彿在說話的影片。
大家好,我是 Ny@Tech。
我過去從事網路行銷,從 2024 年開始關注生成式 AI 的可能性,目前每天都在測試、研究各種影片生成 AI 工具。
本文將介紹如何使用 DomoAI,製作讓角色與物品說話的 AI 影片。
預期成品會像以下這支短片。
觀看影片(YouTube)
用 DomoAI 製作 AI 影片的整體流程
首先整理這次要製作的短片流程。
使用 DomoAI 等工具讓角色或物品說話,大致可分成以下 5 個步驟。
- 撰寫腳本
- 製作角色圖片
- 製作音訊
- 用 Talking Avatar(AI 虛擬角色)功能製作影片
- 剪輯影片
重點是別一開始就急著做影片。
先準備腳本,再依內容製作角色圖片與音訊,較容易整理整體工作流程。
撰寫腳本
第一步是撰寫影片腳本。
短片長度不長,看起來就算直接在 DomoAI 開始做,也很容易成形。
但即使是短片,要呈現一個故事,仍需要情節脈絡。
因此,事先準備名為腳本的「地圖」,就更容易推進角色圖片、音訊和影片製作。
尤其是讓角色或物品說話的影片,先決定以下三點會更好寫:
- 誰要說話
- 要談什麼
- 想傳達什麼給觀眾
例如,美容家電介紹影片可整理如下。
- 美容儀或吹風機等美容家電:誰
- 產品特色與使用好處:談什麼
- 使用後能解決困擾:想傳達的內容
若是食品影片,也可以讓青椒、番茄等角色介紹自己的營養與魅力。
如此一來,事先決定說話者、內容與目的,即使短片也更容易寫出有故事的腳本。
善用 ChatGPT、Gemini 等 AI 工具
腳本可以自己寫,不過使用 ChatGPT 或 Gemini 等 AI 工具能更有效率。
例如,可以使用以下提示詞。
目的:請撰寫 YouTube Shorts 的腳本。
主題:胰臟介紹自己的功能與重要性 出場角色:可愛的胰臟角色 影片長度:約 60 秒 氛圍:親切,帶一點迫切感 目的:讓人對胰臟功能與日常生活習慣的重要性產生興趣 結構:開頭吸引注意、正文、最後一句話
像這樣指定條件,更容易產出適合短片的腳本。
先決定角色個性與氛圍,也有助於之後用 DomoAI 生成圖片時掌握方向。
這次以胰臟角色為主,依照以下故事結構製作圖片、音訊和影片。
- 自我介紹
- 說明胰臟的功能
- 告訴觀眾胰臟是較不顯眼的器官
- 傳達需要留意的警訊(SOS)
- 送出最後想傳達的訊息
先決定結構,就更容易推進後續的圖片、音訊和影片製作。
把 AI 虛擬角色的台詞分成短句
製作角色說話影片時,台詞不要太長也很重要。
文章讀起來即使自然,轉成日語音訊後,停頓或語調也可能不協調。
日語尤其會因助詞、語尾或斷句方式改變意思與印象,因此若想讓 AI 自然發音,把文章切短會比較穩妥。
例如,影片中像這樣分成短句會更容易聽懂。
大家好,我是胰臟。 雖然不起眼,但我支撐著血糖調節與消化。 今天,簡單介紹一下我的工作。
即使人類朗讀,句子太長也會難以換氣和掌握抑揚頓挫。
AI 語音也是一樣,短句更容易接近自然的日語說話方式。
因此,AI 虛擬角色台詞比起書面資訊量,更應優先考量轉成日語音訊後是否容易聽懂。
用 DomoAI 製作角色圖片與背景
腳本完成後,接著製作角色圖片。
這次要透過 DomoAI 的 Talking Avatar 讓胰臟角色說話,因此先製作正面圖片。
用 GPT Image 2 模型製作圖片
DomoAI 提供可從文字生成圖片的 AI 圖片功能。
在左側選單選擇「AI 圖片」。
接著,從 2026 年 5 月新增的下拉選單選擇「文字→圖片生成」,就能根據文字提示詞生成圖片。
不過,這項功能是按照預設動畫範本來生成圖片。
因此這次會從圖片編輯功能使用 GPT Image 2 模型,生成角色圖片。
用於 Instagram Reels、TikTok 和 YouTube Shorts 時,基本上採用直式影片。
因此,製作圖片時就採用直式構圖,後續轉成影片更好剪輯。
這次配合直式短片,先選擇 9:16 構圖。
考慮之後要用 Talking Avatar 讓角色說話,除了外觀,臉部朝向和嘴部是否清楚也很重要。
即使生成可愛角色,若臉朝側面、嘴巴太小,或背景太複雜,也可能不適合用來製作口型同步影片。
因此,在提示詞指定以下事項,較容易產生適合轉成 AI 虛擬角色的圖片。
- 臉朝正面
- 嘴部清楚可見
- 臉不要太小
- 白色或簡單背景
- 角色位於畫面中央
先在提示詞指示生成正面角色,且臉部與嘴巴清晰可見。
正面圖片生成後,視需要再做側面、背面與不同表情的圖片,製作影片時就更容易接近預期畫面。
接著製作背景。
分開製作角色與背景,是為了減少構圖或描繪偏離預期的可能性。
也可以一開始就把角色與背景生成為同一張圖片,但角色表情、位置或背景氛圍可能不符合預期。
因此,這次先分別製作角色圖與背景圖,再用 DomoAI 圖片編輯功能合成一張。
另外,DomoAI 圖片編輯功能最多可上傳 9 張圖片。
因為能參考多張圖片生成,很適合用來結合角色圖片與背景。
用 DomoAI 製作音訊
角色與背景圖片完成後,接著製作音訊。
使用文字轉語音製作音訊
DomoAI 不只可上傳外部製作的音訊,也能使用文字轉語音功能生成音訊。
使用方式很簡單。
先在左側選單選擇「AI 影片」。
接著從 2026 年 5 月新增的下拉選單,選擇「文字轉語音」。
之後選擇想用的聲音,在文字腳本欄輸入角色要說的台詞。
截至 2026 年 5 月,文字轉語音功能提供 8 種聲音。
也能視需要,在部分台詞加入情緒表現或語氣,讓聲音更自然。
文字轉語音當然也支援日語。
不過,漢字有時不會按照預期發音。
這時可以把容易誤讀的漢字改成平假名,或用雙引號括住想正確朗讀的部分。
例如,想讓「弱点」正確發音,可輸入「じゃくてん」,就能以預期讀法生成音訊。
使用 AI 虛擬角色功能讓角色說話
圖片與音訊備妥後,使用 Talking Avatar 功能讓角色說話。
之前日語版顯示為「AI 虛擬角色」,目前名稱則是「Talking Avatar」。
Talking Avatar 的使用方式
先準備之前製作的角色圖片,或結合角色與背景的圖片。
從 DomoAI 素材中選擇,或上傳新圖片。
讓角色說話時,臉朝正面且嘴部清晰的圖片,更容易產生自然效果。
側臉或斜角圖片有時也能用,但我認為先以正面圖片測試比較不容易失敗。
接著加入想讓角色說的音訊。
這裡選擇剛才製作的音訊。
之後依音訊長度選擇生成影片秒數。
例如,音訊為 12 秒時,選擇 20 秒設定,才能涵蓋整段長度。
最後把畫面設為適合短片的 9:16,按下「生成」製作影片。
按照前述胰臟角色影片結構,重複這些工作,製作了 5 支影片及額外片段。
DomoAI 製作的圖片、音訊和影片,可下載為以下格式。
- 圖片:PNG
- 音訊:WAV
- 影片:MP4
下載各素材後,匯入 Adobe Premiere Pro 或 Final Cut Pro 等剪輯軟體,接成一支短片。
剪輯影片
DomoAI 適合從圖片生成影片、讓角色說話,但基本上沒有把多個影片素材接成一支的完整剪輯功能。
因此,若要接合多支 DomoAI 影片,或加入音效、背景音樂與字幕,需用 Adobe Premiere Pro、Final Cut Pro 等剪輯軟體完成。
下載音效與背景音樂
製作影片時,若只有角色說話的聲音,有時會顯得單調。
加入符合場景的音效與背景音樂,能創造節奏,讓短片更好看。
有幾個支援日語的素材網站,提供免費且可商用的音效與背景音樂。
知名服務包括効果音ラボ與 DOVA-SYNDROME,以下整理代表性的音效與背景音樂服務。
| 服務名稱 | 主要素材 | 署名 | 特色與注意事項 |
|---|---|---|---|
| 効果音ラボ | 音效 | 不需要 | 以音效見長的經典網站,個人、企業和公家機關皆可免費使用,但禁止再散布或用作 AI 訓練資料。 |
| DOVA-SYNDROME | 背景音樂、音效 | 不需要 | 背景音樂豐富,在條款範圍內,營利或非營利用途皆免費。不過創作者可能另訂條件。 |
| OtoLogic | 背景音樂、音效、短音樂 | 需要 | 採 CC BY 4.0 的素材網站,可商用或修改,但免費使用需署名。 |
| 甘茶の音楽工房 | 背景音樂 | 原則不需要 | 柔和氛圍的背景音樂很多,商業與個人皆可使用,但禁止單獨販售音樂、二次散布及登錄 YouTube Content ID。 |
| 魔王魂 | 背景音樂、音效、歌曲素材 | 不需要 | 擅長遊戲風格與有衝擊力的背景音樂及音效,無需回報使用或支付費用。 |
| BGMer | 背景音樂 | 自願 | 容易尋找適合影片的背景音樂,在條款範圍內,個人與商業用途皆免費。 |
使用條款可能變更,實際使用時請確認各服務的最新條款。
用剪輯軟體完成影片
把製作好的影片素材、音效等,匯入 Adobe Premiere Pro 或 Final Cut Pro 等剪輯軟體。
簡單短片只需依序接合各素材,再剪掉不要的部分、整理好,就已經足夠。
再依需要加上背景音樂、音效和字幕,就能讓影片更好理解。
剪輯 DomoAI 等生成式 AI 製作的影片時,剪輯軟體的「速度/持續時間」設定很實用。
影片生成服務有時難以細微指定每一格的動作速度。
因此,若某些動作太快,或反而拖沓,在剪輯軟體調整播放速度,有助於減少違和感。
下圖是 Adobe Premiere Pro 的畫面,不過許多剪輯軟體都有類似的速度調整功能。
此外,不只是 Adobe Premiere Pro,現在很多剪輯軟體也有自動字幕生成功能。
善用這些功能,就能減少手動輸入字幕的時間,為短片加入字幕。
以下就是實際製作的影片。
觀看影片(YouTube)
DomoAI 能在同一服務完成圖片製作、語音製作,以及透過口型同步生成嘴部動作。
因此,即使沒有專業影片製作技能,也能做出在 Instagram Reels、TikTok、YouTube Shorts 常見的食物或家電說話影片。
DomoAI 免費註冊會贈送試用點數,有興趣的話可以體驗看看。
總結與常見問題(FAQ)
最後以問答方式,整理製作短片時容易有疑問的重點。
Q1. 短片幾秒最合適?
A1. 視內容而定,但一開始以 20–60 秒為目標會比較好做。據說前 3 秒吸引注意,是讓觀眾看到最後的最大關鍵,因此有時會加入「試試這個!」「請立刻停止!」「不知道就吃虧了!」等吸睛開場。
Q2. 短片最適合什麼長寬比?
A2. 發布到 TikTok、Instagram Reels 或 YouTube Shorts,基本使用直式 9:16。以 1080×1920px 匯出,可清晰顯示而不損畫質。橫式 16:9 直接發布會出現上下黑邊,請剪裁成直式再編輯。
Q3. 應該加字幕嗎?
A3. 建議加入。社群媒體常在靜音下觀看,沒有字幕就無法傳達內容,更容易被滑過。
Q4. DomoAI 製作的影片可以商用嗎?
A4. 訂閱付費方案後,生成內容的權利基本歸使用者。不過,若原始圖片或角色著作權屬第三方,就不在此限。使用既有角色或他人圖片時,請充分留意,避免侵害著作權。
Q5. 有免費影片剪輯軟體嗎?
A5. 有,例如 CapCut 和 Vrew。兩者基本功能都能免費使用,可以先從這些軟體開始。
以上介紹製作短片時的常見問題。
AI 語音朗讀功能正穩定進步。
使用 DomoAI,可以用同一套流程嘗試圖片生成、音訊製作與口型同步影片。
歡迎用持續進化的 DomoAI,製作角色或物品說話的短片。


