如何製作讓角色與物品說話的 AI 影片

閱讀時間 6 分鐘

瀏覽 Instagram Reels、TikTok 或 YouTube Shorts 時,有時會看到角色、動物、食物、家電和日用品,像人一樣說話的影片。

例如,蔬菜介紹自己的營養、家電說明產品特色,或可愛角色分享冷知識的短片。

乍看之下,這些影片似乎很難製作。

不過,使用 AI 影片生成工具 DomoAI,就能結合圖片與音訊,製作角色或物品彷彿在說話的影片。

大家好,我是 Ny@Tech。

我過去從事網路行銷,從 2024 年開始關注生成式 AI 的可能性,目前每天都在測試、研究各種影片生成 AI 工具。

本文將介紹如何使用 DomoAI,製作讓角色與物品說話的 AI 影片。

預期成品會像以下這支短片。

觀看影片(YouTube)

用 DomoAI 製作 AI 影片的整體流程

首先整理這次要製作的短片流程。

使用 DomoAI 等工具讓角色或物品說話,大致可分成以下 5 個步驟。

  1. 撰寫腳本
  2. 製作角色圖片
  3. 製作音訊
  4. 用 Talking Avatar(AI 虛擬角色)功能製作影片
  5. 剪輯影片

重點是別一開始就急著做影片。

準備腳本,再依內容製作角色圖片與音訊,較容易整理整體工作流程。

撰寫腳本

第一步是撰寫影片腳本。

短片長度不長,看起來就算直接在 DomoAI 開始做,也很容易成形。

但即使是短片,要呈現一個故事,仍需要情節脈絡。

因此,事先準備名為腳本的「地圖」,就更容易推進角色圖片、音訊和影片製作。

尤其是讓角色或物品說話的影片,先決定以下三點會更好寫:

  • 誰要說話
  • 要談什麼
  • 想傳達什麼給觀眾

例如,美容家電介紹影片可整理如下。

  • 美容儀或吹風機等美容家電:誰
  • 產品特色與使用好處:談什麼
  • 使用後能解決困擾:想傳達的內容

若是食品影片,也可以讓青椒、番茄等角色介紹自己的營養與魅力。

如此一來,事先決定說話者、內容與目的,即使短片也更容易寫出有故事的腳本。

善用 ChatGPT、Gemini 等 AI 工具

腳本可以自己寫,不過使用 ChatGPT 或 Gemini 等 AI 工具能更有效率。

例如,可以使用以下提示詞。

目的:請撰寫 YouTube Shorts 的腳本。

主題:胰臟介紹自己的功能與重要性 出場角色:可愛的胰臟角色 影片長度:約 60 秒 氛圍:親切,帶一點迫切感 目的:讓人對胰臟功能與日常生活習慣的重要性產生興趣 結構:開頭吸引注意、正文、最後一句話

像這樣指定條件,更容易產出適合短片的腳本。

先決定角色個性與氛圍,也有助於之後用 DomoAI 生成圖片時掌握方向。

這次以胰臟角色為主,依照以下故事結構製作圖片、音訊和影片。

  1. 自我介紹
  2. 說明胰臟的功能
  3. 告訴觀眾胰臟是較不顯眼的器官
  4. 傳達需要留意的警訊(SOS)
  5. 送出最後想傳達的訊息

先決定結構,就更容易推進後續的圖片、音訊和影片製作。

把 AI 虛擬角色的台詞分成短句

製作角色說話影片時,台詞不要太長也很重要。

文章讀起來即使自然,轉成日語音訊後,停頓或語調也可能不協調。

日語尤其會因助詞、語尾或斷句方式改變意思與印象,因此若想讓 AI 自然發音,把文章切短會比較穩妥。

例如,影片中像這樣分成短句會更容易聽懂。

大家好,我是胰臟。 雖然不起眼,但我支撐著血糖調節與消化。 今天,簡單介紹一下我的工作。

即使人類朗讀,句子太長也會難以換氣和掌握抑揚頓挫。

AI 語音也是一樣,短句更容易接近自然的日語說話方式。

因此,AI 虛擬角色台詞比起書面資訊量,更應優先考量轉成日語音訊後是否容易聽懂。

用 DomoAI 製作角色圖片與背景

腳本完成後,接著製作角色圖片。

這次要透過 DomoAI 的 Talking Avatar 讓胰臟角色說話,因此先製作正面圖片。

用 GPT Image 2 模型製作圖片

DomoAI 提供可從文字生成圖片的 AI 圖片功能。

在左側選單選擇「AI 圖片」。

接著,從 2026 年 5 月新增的下拉選單選擇「文字→圖片生成」,就能根據文字提示詞生成圖片。

不過,這項功能是按照預設動畫範本來生成圖片。

因此這次會從圖片編輯功能使用 GPT Image 2 模型,生成角色圖片。

用於 Instagram Reels、TikTok 和 YouTube Shorts 時,基本上採用直式影片。

因此,製作圖片時就採用直式構圖,後續轉成影片更好剪輯。

這次配合直式短片,先選擇 9:16 構圖。

考慮之後要用 Talking Avatar 讓角色說話,除了外觀,臉部朝向和嘴部是否清楚也很重要。

即使生成可愛角色,若臉朝側面、嘴巴太小,或背景太複雜,也可能不適合用來製作口型同步影片。

因此,在提示詞指定以下事項,較容易產生適合轉成 AI 虛擬角色的圖片。

  • 臉朝正面
  • 嘴部清楚可見
  • 臉不要太小
  • 白色或簡單背景
  • 角色位於畫面中央

先在提示詞指示生成正面角色,且臉部與嘴巴清晰可見

正面圖片生成後,視需要再做側面、背面與不同表情的圖片,製作影片時就更容易接近預期畫面。

接著製作背景。

分開製作角色與背景,是為了減少構圖或描繪偏離預期的可能性

也可以一開始就把角色與背景生成為同一張圖片,但角色表情、位置或背景氛圍可能不符合預期。

因此,這次先分別製作角色圖與背景圖,再用 DomoAI 圖片編輯功能合成一張。

另外,DomoAI 圖片編輯功能最多可上傳 9 張圖片。

因為能參考多張圖片生成,很適合用來結合角色圖片與背景。

用 DomoAI 製作音訊

角色與背景圖片完成後,接著製作音訊。

使用文字轉語音製作音訊

DomoAI 不只可上傳外部製作的音訊,也能使用文字轉語音功能生成音訊。

使用方式很簡單。

先在左側選單選擇「AI 影片」。

接著從 2026 年 5 月新增的下拉選單,選擇「文字轉語音」。

之後選擇想用的聲音,在文字腳本欄輸入角色要說的台詞。

截至 2026 年 5 月,文字轉語音功能提供 8 種聲音。

也能視需要,在部分台詞加入情緒表現或語氣,讓聲音更自然

文字轉語音當然也支援日語。

不過,漢字有時不會按照預期發音。

這時可以把容易誤讀的漢字改成平假名,或用雙引號括住想正確朗讀的部分。

例如,想讓「弱点」正確發音,可輸入「じゃくてん」,就能以預期讀法生成音訊。

使用 AI 虛擬角色功能讓角色說話

圖片與音訊備妥後,使用 Talking Avatar 功能讓角色說話。

之前日語版顯示為「AI 虛擬角色」,目前名稱則是「Talking Avatar」。

Talking Avatar 的使用方式

先準備之前製作的角色圖片,或結合角色與背景的圖片。

從 DomoAI 素材中選擇,或上傳新圖片。

讓角色說話時,臉朝正面且嘴部清晰的圖片,更容易產生自然效果。

側臉或斜角圖片有時也能用,但我認為先以正面圖片測試比較不容易失敗。

接著加入想讓角色說的音訊。

這裡選擇剛才製作的音訊。

之後依音訊長度選擇生成影片秒數。

例如,音訊為 12 秒時,選擇 20 秒設定,才能涵蓋整段長度。

最後把畫面設為適合短片的 9:16,按下「生成」製作影片。

按照前述胰臟角色影片結構,重複這些工作,製作了 5 支影片及額外片段。

DomoAI 製作的圖片、音訊和影片,可下載為以下格式。

  • 圖片:PNG
  • 音訊:WAV
  • 影片:MP4

下載各素材後,匯入 Adobe Premiere Pro 或 Final Cut Pro 等剪輯軟體,接成一支短片。

剪輯影片

DomoAI 適合從圖片生成影片、讓角色說話,但基本上沒有把多個影片素材接成一支的完整剪輯功能。

因此,若要接合多支 DomoAI 影片,或加入音效、背景音樂與字幕,需用 Adobe Premiere Pro、Final Cut Pro 等剪輯軟體完成。

下載音效與背景音樂

製作影片時,若只有角色說話的聲音,有時會顯得單調。

加入符合場景的音效與背景音樂,能創造節奏,讓短片更好看。

有幾個支援日語的素材網站,提供免費且可商用的音效與背景音樂。

知名服務包括効果音ラボDOVA-SYNDROME以下整理代表性的音效與背景音樂服務。

服務名稱主要素材署名特色與注意事項
効果音ラボ音效不需要以音效見長的經典網站,個人、企業和公家機關皆可免費使用,但禁止再散布或用作 AI 訓練資料。
DOVA-SYNDROME背景音樂、音效不需要背景音樂豐富,在條款範圍內,營利或非營利用途皆免費。不過創作者可能另訂條件。
OtoLogic背景音樂、音效、短音樂需要採 CC BY 4.0 的素材網站,可商用或修改,但免費使用需署名。
甘茶の音楽工房背景音樂原則不需要柔和氛圍的背景音樂很多,商業與個人皆可使用,但禁止單獨販售音樂、二次散布及登錄 YouTube Content ID。
魔王魂背景音樂、音效、歌曲素材不需要擅長遊戲風格與有衝擊力的背景音樂及音效,無需回報使用或支付費用。
BGMer背景音樂自願容易尋找適合影片的背景音樂,在條款範圍內,個人與商業用途皆免費。

使用條款可能變更,實際使用時請確認各服務的最新條款。

用剪輯軟體完成影片

把製作好的影片素材、音效等,匯入 Adobe Premiere Pro 或 Final Cut Pro 等剪輯軟體。

簡單短片只需依序接合各素材,再剪掉不要的部分、整理好,就已經足夠。

再依需要加上背景音樂、音效和字幕,就能讓影片更好理解。

剪輯 DomoAI 等生成式 AI 製作的影片時,剪輯軟體的「速度/持續時間」設定很實用。

影片生成服務有時難以細微指定每一格的動作速度。

因此,若某些動作太快,或反而拖沓,在剪輯軟體調整播放速度,有助於減少違和感。

下圖是 Adobe Premiere Pro 的畫面,不過許多剪輯軟體都有類似的速度調整功能。

此外,不只是 Adobe Premiere Pro,現在很多剪輯軟體也有自動字幕生成功能。

善用這些功能,就能減少手動輸入字幕的時間,為短片加入字幕。

以下就是實際製作的影片。

觀看影片(YouTube)

DomoAI 能在同一服務完成圖片製作、語音製作,以及透過口型同步生成嘴部動作。

因此,即使沒有專業影片製作技能,也能做出在 Instagram Reels、TikTok、YouTube Shorts 常見的食物或家電說話影片。

DomoAI 免費註冊會贈送試用點數,有興趣的話可以體驗看看。

總結與常見問題(FAQ)

最後以問答方式,整理製作短片時容易有疑問的重點。

Q1. 短片幾秒最合適?

A1. 視內容而定,但一開始以 20–60 秒為目標會比較好做。據說前 3 秒吸引注意,是讓觀眾看到最後的最大關鍵,因此有時會加入「試試這個!」「請立刻停止!」「不知道就吃虧了!」等吸睛開場。

Q2. 短片最適合什麼長寬比?

A2. 發布到 TikTok、Instagram Reels 或 YouTube Shorts,基本使用直式 9:16。以 1080×1920px 匯出,可清晰顯示而不損畫質。橫式 16:9 直接發布會出現上下黑邊,請剪裁成直式再編輯。

Q3. 應該加字幕嗎?

A3. 建議加入。社群媒體常在靜音下觀看,沒有字幕就無法傳達內容,更容易被滑過。

Q4. DomoAI 製作的影片可以商用嗎?

A4. 訂閱付費方案後,生成內容的權利基本歸使用者。不過,若原始圖片或角色著作權屬第三方,就不在此限。使用既有角色或他人圖片時,請充分留意,避免侵害著作權。

Q5. 有免費影片剪輯軟體嗎?

A5. 有,例如 CapCut 和 Vrew。兩者基本功能都能免費使用,可以先從這些軟體開始。

以上介紹製作短片時的常見問題。

AI 語音朗讀功能正穩定進步。

使用 DomoAI,可以用同一套流程嘗試圖片生成、音訊製作與口型同步影片。

歡迎用持續進化的 DomoAI,製作角色或物品說話的短片。

最新文章