如何在 DomoAI 用 AI 讓物品開口說話

閱讀約 7 分鐘

微笑的卡通胰臟角色,背景是製作說話角色影片的日文圖解

要在 DomoAI 讓物品說話,先為它準備清楚可辨的嘴巴、一句簡短台詞與乾淨的語音音訊。我會讓第一支短片只呈現一個笑話或抱怨,採用近距離構圖,並把攝影機運動留給另一個穿插鏡頭。

開始前需要準備什麼?

你只需要三項素材:一張圖片、一段短腳本,以及清晰的語音音訊。在開始生成之前,先決定成品要達到什麼目的。說六秒笑話的咖啡杯,和解說產品功能的吉祥物,需要不同的腳本與裁切方式。

  • 一個清楚的主體:使用正面的角色、寵物、插畫吉祥物、產品或物品,並確保嘴部清楚。
  • 一份簡短腳本:為口語表演寫作,而不是撰寫著陸頁文案。句子要簡單、好說出口。
  • 乾淨的語音音訊:使用 DomoAI Text to Speech 生成,或上傳 MP3、WAV 等支援的語音音訊。

第一次測試以一種情緒、一個想法及一種畫面裁切為目標。角色效果確認後,再用多個短鏡次組成較長影片。

製作能承載表演的臉部

如果已有合適的圖片,就直接使用。否則,可以用 DomoAI Text to Image 製作新主體。物品應有縮小後仍可辨識的簡單五官:兩隻清楚的眼睛、明顯的嘴巴,以及足夠配合最終長寬比的周圍空間。

來源需要整理時,使用 多模型圖片生成與編輯工具。DomoAI 提供 GPT Image 2、Nano Banana 2 和 Nano Banana Pro 等模型,讓你生成圖片,並透過日常語言進行編輯。

製作動畫前先修正問題:

  • 移除臉部動作時可能變形的文字或標誌。
  • 不要讓手、頭髮、道具或深色陰影遮住嘴巴。
  • 臉部是主要動作時,使用近景或中景裁切。
  • 若之後要加入字幕,請選簡單背景。

不一定需要逼真的人臉。Talking Avatar 也適合風格化角色、動漫肖像、寵物、插畫吉祥物,以及趣味物品。

確認來源圖片合格

說話物品不需要逼真的人臉。它需要觀眾看得清楚的嘴巴,以及留有表演空間的設計。

檢查項目合格條件製作動畫前需修正
嘴巴縮圖大小仍看得見太小、被遮住或與紋理混在一起
產品文字位於嘴部及運動範圍之外標籤剛好位於臉部必須變形的位置
道具重疊把手、吸管、手或陰影都不遮臉移動或移除遮擋物
字幕空間主體上方或下方有乾淨區域重新構圖或延伸畫布
長寬比符合最終平台放置五官前先設定裁切

想找趣味角色靈感,可比較 Talking Avatar 快速應用AI VTuber 製作工具。寵物版本可以延伸至 寵物說話流程合集,會走動的卡通角色則可繼續使用 2D 邊走邊說流程

寫出自然的口語腳本

生成音訊前,先把腳本大聲讀一遍。如果你氣息不夠或某個句子讀不順,就把它縮短。實用的第一版腳本長度是 15 到 35 個詞。

試試這個簡單結構:

  1. 開場鉤子:先說最出人意料的內容。
  2. 一個有用細節:解釋觀眾需要知道的事。
  3. 收尾:用問題、笑點或下一步結束。

會說話的檯燈範例:

我已經看你連續三晚摸黑工作了。把我打開,調低螢幕亮度,讓眼睛休息一下。

不要把旁白、鏡頭動作和多種情緒全塞進一支短片。主體需要變換表情,或你需要剪接點時,請分開錄製台詞。

生成或上傳聲音

DomoAI Text to Speech 支援單一說話者的 Single 模式,以及雙人對話的 Multi 模式。它也支援聲音複製、例如 [Cheerful] 等情緒標籤,以及最長 4,000 字元的腳本。複製聲音的速度控制範圍為 0.5x 至 2.0x。

先生成聲音,檢查發音與節奏,再把確認好的音訊送入 Talking Avatar。你也可以上傳支援的語音或人聲檔案。

保持音訊乾淨。音樂、人群噪音或強烈音效會讓語音更難檢查。DomoAI 不會在 Talking Avatar 中混製完整的背景音樂音軌,因此請在匯出後,使用 CapCut、Premiere Pro、DaVinci Resolve 或其他編輯器加入完整配樂。

在 Talking Avatar 製作角色或物品動畫

開啟 DomoAI Talking Avatar,然後加入圖片或影片,以及確認好的音訊。Talking Avatar 提供 5、10、20 秒的標準時長。Pro 使用者也能使用 30 秒和 60 秒的 Fast Mode 選項。

使用獨立的動作或表情提示來指導畫面中的表演。腳本控制主體說什麼;這個提示則控制主體如何表現。

實用指示包括:

  • 溫暖微笑、輕輕點頭、放鬆的眼神接觸。
  • 驚訝表情、快速眨眼、身體稍微靠近鏡頭。
  • 沉穩的主持人口吻、細微頭部動作、穩定注視。

先從細微動作開始。大幅轉身、快速手勢或在一條提示詞中加入多種動作,都會增加保持一致性的難度,尤其是小物品或插畫臉部。

把對白與動作放在不同欄位

欄位檯燈範例
腳本或音訊「每次趕截止日期都是我照亮你的工作,結果就這樣謝我?」
動作提示詞面無表情、慢慢眨眼一次、燈罩稍微傾斜、身體不動、鏡頭固定

我會先嘗試三種個性:抱怨自己工作的諷刺產品、解說一項功能的友善吉祥物,以及對人類習慣作出冷面反應的家用品。我會先寫台詞,再生成或上傳聲音。需要可重複的情緒或節奏時,Text to Speech 很有用。

如果產品示範比臉部表演更重要,無臉解說影片流程 可能比增加虛擬人物動作更適合作為下一步。

依主體選擇適合的流程

會說話的寵物

使用動物面向鏡頭、口鼻清楚的照片。避免舌頭、玩具或爪子遮住嘴部。專門的寵物流程請見 寵物說話影片指南

動漫與插畫角色

臉部要夠大,方便辨識,並避免頭髮蓋住嘴唇。需要多支片段時,清楚的角色設定圖或確認好的肖像會有幫助。也可探索更多 動漫、寵物與 VTuber 的說話虛擬人物點子

產品與物品

決定讓物品自己長出臉,還是由吉祥物介紹它。如果產品標籤必須準確,請讓它遠離動畫嘴部,並在生成後加入法律文字、價格與行動呼籲文案。

主持人與吉祥物

需要將說話主體合成到自訂背景時,請使用 Screen Keying。這能讓素材更乾淨地銜接至 CapCut、Premiere Pro 或類似編輯器。

修正常見的說話物品問題

嘴巴幾乎不動

使用更近的裁切,以及嘴部更明顯的來源圖片。檢查臉部是否被頭髮、道具、陰影或低解析度模糊遮住。

表演太繁忙

縮短動作提示詞。每次拍攝保留一種情緒與一個手勢。較大的動作留給獨立的 Image to Video 或 Character to Video 鏡頭。

音訊不清楚

重新生成或錄製不含音樂與強烈背景噪音的語音。把長對話分成短段,這樣只需替換一句效果不好的台詞,不必重做整支影片。

成片感覺太靜態

將說話特寫與反應鏡頭、產品穿插鏡頭、字幕或短動畫場景交錯剪輯。Talking Avatar 負責說話時刻,完整故事則靠剪輯承接。

常見問題

DomoAI 可以用一張圖片讓物品說話嗎?

可以。在 Talking Avatar 中使用清晰的圖片,搭配生成或上傳的語音音訊。可見的臉部或嘴巴區域,能為模型提供更明確的表演目標。

可以讓寵物或動漫角色說話嗎?

可以。Talking Avatar 適合寫實肖像、寵物、動漫臉孔、插畫吉祥物及其他以角色為主的圖片。請使用正面朝向、嘴巴區域清楚可見的來源素材。

可以加入自己的聲音嗎?

可以。你可以上傳支援的語音音訊,或使用 DomoAI Text to Speech 生成台詞,包括在提供此功能時使用複製聲音。

Talking Avatar 可以加入背景音樂嗎?

匯出後再加入完成混音的音樂。使用 Talking Avatar 製作由語音驅動的表演,再到外部編輯器將片段與音樂、字幕結合。

Talking Avatar 片段可以多長?

標準時長選項為 5、10、20 秒。Pro 使用者可使用 30 秒和 60 秒的 Fast Mode 選項。請查看 目前的 DomoAI 價格頁面,因為方案的使用權限可能改變。

先做短測試,確認臉部與聲音,再用最佳鏡次組成最終影片。這樣可以集中修改範圍,避免角色尚未成功前就把點數花在長片段上。

最新文章