如何用WAV檔案讓照片中的臉開口說話

閱讀時間:9 分鐘

make-talking-face-with-wav-audio

WAV檔案提供發話時間、停頓、速度與表演;人像則提供臉部。先生成5秒或10秒的測試片段。 製作完整影片前,先檢查第一個字、一段停頓,以及最後閉嘴的時機。

WAV能控制什麼,不能控制什麼

WAV會控制表演節奏,但無法決定人物外觀,也不能保證動作自然。排查問題時,應把音訊與圖片的作用分開來看。

音訊可以影響:

  • 語音開始與結束的時間
  • 字詞與停頓的時機
  • 語速與節奏
  • 重音、情緒與聲音能量
  • 音訊驅動片段的總長度

音訊不會決定:

  • 人物或角色的身分
  • 臉部角度、光線或圖片細節
  • 背景與裁切方式
  • 頭部或身體的動作幅度
  • 風格化的嘴型能否清楚表現每個音

以人像為起點的會說話照片,需要重新生成臉部動作。影片式唇形同步則沿用原片中的表演,主要讓嘴型跟隨替換後的音訊。

這也區分了人像動畫與以影片為起點的唇形同步。在人像流程中,圖片提供主體,音訊提供說話方式;在影片流程中,表演已存在於來源影片。

上傳前先檢查WAV

檔案即使技術上有效,也可能不是良好的語音輸入。生成影片前,請完整聆聽錄音並修正明顯問題。

WAV預檢清單:

  1. 確認相容性。 查看工具目前支援的格式、容量與長度,不要假設所有WAV編碼都可使用。
  2. 從頭聽到尾。 能開啟的檔案不代表內容完整或沒有錯誤。
  3. 確認語音清楚。 所有必要字詞都應在沒有字幕時聽得懂。
  4. 檢查削波。 刺耳、壓平的峰值或爆裂聲會遮住子音。
  5. 減少干擾聲。 音樂、環境噪音、回音、電流聲或車聲蓋過人聲時,應先移除。
  6. 裁掉意外空白。 移除錄音前後的多餘靜音,但保留有意安排的停頓。
  7. 檢查語速。 說得太快會減少嘴型形成清楚形狀的時間。
  8. 核對內容。 在動畫前修正姓名、數字、發音與最終文案。
  9. 確認權限。 只使用獲准製作動畫與公開的聲音和錄音。

DomoAI的數位化身支援最大80MB的MP3、WAV與M4A。沒有背景音樂、清楚可辨的人聲最適合作為起點。

不要在未確認工具規格前指定固定取樣率或位元深度。WAV是容器名稱,不同工具支援的編碼可能不同。符合格式且清楚可懂的語音,比套用一個通用技術設定更重要。

加入一段有意安排的停頓

在測試錄音中段放入短而自然的停頓。例如:「你的第一個場景完成了。[停頓]我們一起檢查時間。」

停頓會形成可觀察的同步點:聲音停止時,嘴巴也應閉上或安定下來。 若嘴巴仍持續移動,原因可能是殘留噪音、音樂、呼吸、環境底噪或生成結果本身。

測試檔保持簡短。5秒或10秒足以查看第一個字、一段停頓與最後閉嘴的時機。

選擇能配合音訊的臉部圖片

圖片必須提供足夠的臉部資訊,才能生成穩定動作。乾淨的WAV無法修復被遮住的嘴、過度側面的臉或模糊的人像。

建議使用:

  • 單一清楚主體
  • 正面或接近正面的頭部
  • 嘴巴可見並保持自然狀態
  • 下半臉光線均勻
  • 眼睛、嘴唇與下顎線條清楚
  • 頭部周圍保留少量動作空間

避免手、麥克風、頭髮、陰影或配件遮住嘴巴。裁切太緊也可能在頭部移動時產生邊緣瑕疵。

插畫、動漫角色、寵物、畫作與歷史肖像的臉部比例或質感不同,通常需要更多測試。選擇眼睛和嘴型清楚的素材,使用長WAV前先生成短片。

若時間正確但角色身分漂移,問題通常在圖片或動作指示。先用圖片編輯修正來源,或降低動作幅度。若臉部穩定但嘴巴啟動較晚,則檢查WAV與同步設定。

生成第一段音訊驅動影片

第一次生成的目的,是測試輸入,而不是直接完成最終作品。 保持設定簡單,才能把每個結果連回明確原因。

請依照以下順序操作:

  1. 上傳核准的人像。
  2. 選擇數位化身,使用DomoAI文字轉語音、直接錄音,或上傳MP3、WAV、M4A。
  3. 加入已通過預檢的WAV。
  4. 選擇工具支援的短測試長度。
  5. 若工具支援,加入一個克制的表演指示。
  6. 送出前預覽圖片與音訊。
  7. 生成影片,並連同設定一起保存。

指示範例:

自然說話,頭部動作小,偶爾眨眼;停頓時保持中性表情。

不要同時堆疊互相衝突的指示。大幅手勢、快速轉頭或極端表情,會讓WAV唇形同步本身更難判斷。

請清楚命名每個版本,例如portraitA_wav-clean_motion-low_v01。音訊修改後使用新的版本名稱。設定記錄可避免比較到同時更改多個輸入的片段。

只有在時間、身分與構圖都通過檢查後,才對保留的結果使用影片畫質提升

對照波形檢查結果

把音訊中的關鍵時刻命名,再與影片對照,會比反覆隨機播放更容易找到可修正的問題。

標記以下檢查點:

  1. 第一個發音: 嘴巴是否與第一個可聽字詞同時開始?
  2. 快速子音句: 尖銳音是否帶來合理嘴型變化?
  3. 有意停頓: 語音停止時,嘴巴是否閉上或安定?
  4. 重讀字詞: 視覺表演的能量是否與聲音相符?
  5. 最後一個字: 音訊結束後,嘴巴是否停止?

分別用正常音量、靜音與慢速各看一次。正常播放呈現觀眾體驗;靜音可暴露重複頭部動作、閃爍和身分漂移;慢速可定位錯位開始的畫格。

使用帶時間標記的檢查表:

時間音訊事件視覺檢查結果下一步
00:01第一個字嘴巴與聲音同時開始通過
00:08有意停頓嘴巴持續移動失敗檢查停頓中的噪音
00:17最後一個字嘴巴太晚閉上複查裁掉尾端音訊再測

逐格檢查後,仍要用正常速度播放完整片段。只在慢動作中看得到的小偏差未必影響觀看,但每次停頓都出現的錯位通常會有影響。

分離音訊問題與圖片問題

只修改與症狀直接相關的輸入。沒有假設就反覆生成,可能會浪費時間與點數,卻一直得到相同問題。

症狀可能來源下一個測試
靜音時嘴巴仍動殘留噪音、音樂、呼吸或模型動作使用更乾淨的停頓重跑短片
嘴巴啟動較晚前導靜音或時間錯位裁掉開頭後比較起點
快速字詞表現弱語速太快或嘴部細節不足稍微放慢或換更清楚的人像
下半臉拉伸側臉、嘴被遮住或動作太強使用正面素材並降低動作
臉部身分改變細節不足、裁切過緊或生成差異使用清晰來源並固定裁切
頭部太僵硬動作不足或指示限制過多測試一個小而明確的動作
後段時間漂移片段太長或音訊問題將WAV拆成較短的核准區段

每個版本只改一個變因。 若同時清理音訊、換人像並重寫動作指示,就無法確認是哪個修改帶來改善。

長文案可在自然句子或場景邊界拆段。各段保持相同人像、裁切與動作指示。分段生成可能造成臉部位置或表情略有不同,剪輯後要檢查接點。

已驗證素材的開發者流程

先用手動測試確認人像與WAV,再開始自動化。檔案成功上傳,不代表視覺結果符合品質標準。

API流程應先確認現行驗證與上傳方式,再參考Talking Avatar API的媒體引用、請求欄位、長度規則、回呼行為與錯誤回應。傳入手動測試使用過的同一組圖片和音訊,並保存工作ID、輸入版本、設定、輸出與失敗狀態,以便追蹤重複工作。

完整API實作留在開發者文件;創作者流程應集中在媒體準備與驗證。

常見問題

WAV檔案可以單獨讓靜止照片動起來嗎?

不可以。 還需要相容的臉部圖片。音訊決定時間與表演,圖片決定人物外觀。

WAV應該包含背景音樂嗎?

通常不應該。 純語音更容易分析與同步。會說話影片通過聲音和嘴型檢查後,再於剪輯階段加入音樂。

為什麼靜音時嘴巴仍會移動?

停頓中可能還有噪音、音樂、呼吸或環境底噪。 模型也可能持續小幅動作。檢查波形,建立更乾淨的有意停頓,再比較一次短片生成。

製作會說話的臉時,WAV一定比MP3好嗎?

不一定。 使用工具目前支援的格式,並優先確保語音清楚。若兩種格式都支援,請用同一份錄音比較,不要假設容器格式決定唇形同步品質。

完整錄音前先測一段停頓

使用清楚的人像和獲得授權的乾淨錄音。加入一段有意停頓、標記時間,發生問題時一次只改一個變因。短片穩定後,再製作完整版本。

最新文章