WAV檔案提供發話時間、停頓、速度與表演;人像則提供臉部。先生成5秒或10秒的測試片段。 製作完整影片前,先檢查第一個字、一段停頓,以及最後閉嘴的時機。
WAV能控制什麼,不能控制什麼
WAV會控制表演節奏,但無法決定人物外觀,也不能保證動作自然。排查問題時,應把音訊與圖片的作用分開來看。
音訊可以影響:
- 語音開始與結束的時間
- 字詞與停頓的時機
- 語速與節奏
- 重音、情緒與聲音能量
- 音訊驅動片段的總長度
音訊不會決定:
- 人物或角色的身分
- 臉部角度、光線或圖片細節
- 背景與裁切方式
- 頭部或身體的動作幅度
- 風格化的嘴型能否清楚表現每個音
以人像為起點的會說話照片,需要重新生成臉部動作。影片式唇形同步則沿用原片中的表演,主要讓嘴型跟隨替換後的音訊。
這也區分了人像動畫與以影片為起點的唇形同步。在人像流程中,圖片提供主體,音訊提供說話方式;在影片流程中,表演已存在於來源影片。
上傳前先檢查WAV
檔案即使技術上有效,也可能不是良好的語音輸入。生成影片前,請完整聆聽錄音並修正明顯問題。
WAV預檢清單:
- 確認相容性。 查看工具目前支援的格式、容量與長度,不要假設所有WAV編碼都可使用。
- 從頭聽到尾。 能開啟的檔案不代表內容完整或沒有錯誤。
- 確認語音清楚。 所有必要字詞都應在沒有字幕時聽得懂。
- 檢查削波。 刺耳、壓平的峰值或爆裂聲會遮住子音。
- 減少干擾聲。 音樂、環境噪音、回音、電流聲或車聲蓋過人聲時,應先移除。
- 裁掉意外空白。 移除錄音前後的多餘靜音,但保留有意安排的停頓。
- 檢查語速。 說得太快會減少嘴型形成清楚形狀的時間。
- 核對內容。 在動畫前修正姓名、數字、發音與最終文案。
- 確認權限。 只使用獲准製作動畫與公開的聲音和錄音。
DomoAI的數位化身支援最大80MB的MP3、WAV與M4A。沒有背景音樂、清楚可辨的人聲最適合作為起點。
不要在未確認工具規格前指定固定取樣率或位元深度。WAV是容器名稱,不同工具支援的編碼可能不同。符合格式且清楚可懂的語音,比套用一個通用技術設定更重要。
加入一段有意安排的停頓
在測試錄音中段放入短而自然的停頓。例如:「你的第一個場景完成了。[停頓]我們一起檢查時間。」
停頓會形成可觀察的同步點:聲音停止時,嘴巴也應閉上或安定下來。 若嘴巴仍持續移動,原因可能是殘留噪音、音樂、呼吸、環境底噪或生成結果本身。
測試檔保持簡短。5秒或10秒足以查看第一個字、一段停頓與最後閉嘴的時機。
選擇能配合音訊的臉部圖片
圖片必須提供足夠的臉部資訊,才能生成穩定動作。乾淨的WAV無法修復被遮住的嘴、過度側面的臉或模糊的人像。
建議使用:
- 單一清楚主體
- 正面或接近正面的頭部
- 嘴巴可見並保持自然狀態
- 下半臉光線均勻
- 眼睛、嘴唇與下顎線條清楚
- 頭部周圍保留少量動作空間
避免手、麥克風、頭髮、陰影或配件遮住嘴巴。裁切太緊也可能在頭部移動時產生邊緣瑕疵。
插畫、動漫角色、寵物、畫作與歷史肖像的臉部比例或質感不同,通常需要更多測試。選擇眼睛和嘴型清楚的素材,使用長WAV前先生成短片。
若時間正確但角色身分漂移,問題通常在圖片或動作指示。先用圖片編輯修正來源,或降低動作幅度。若臉部穩定但嘴巴啟動較晚,則檢查WAV與同步設定。
生成第一段音訊驅動影片
第一次生成的目的,是測試輸入,而不是直接完成最終作品。 保持設定簡單,才能把每個結果連回明確原因。
請依照以下順序操作:
- 上傳核准的人像。
- 選擇數位化身,使用DomoAI文字轉語音、直接錄音,或上傳MP3、WAV、M4A。
- 加入已通過預檢的WAV。
- 選擇工具支援的短測試長度。
- 若工具支援,加入一個克制的表演指示。
- 送出前預覽圖片與音訊。
- 生成影片,並連同設定一起保存。
指示範例:
自然說話,頭部動作小,偶爾眨眼;停頓時保持中性表情。
不要同時堆疊互相衝突的指示。大幅手勢、快速轉頭或極端表情,會讓WAV唇形同步本身更難判斷。
請清楚命名每個版本,例如portraitA_wav-clean_motion-low_v01。音訊修改後使用新的版本名稱。設定記錄可避免比較到同時更改多個輸入的片段。
只有在時間、身分與構圖都通過檢查後,才對保留的結果使用影片畫質提升。
對照波形檢查結果
把音訊中的關鍵時刻命名,再與影片對照,會比反覆隨機播放更容易找到可修正的問題。
標記以下檢查點:
- 第一個發音: 嘴巴是否與第一個可聽字詞同時開始?
- 快速子音句: 尖銳音是否帶來合理嘴型變化?
- 有意停頓: 語音停止時,嘴巴是否閉上或安定?
- 重讀字詞: 視覺表演的能量是否與聲音相符?
- 最後一個字: 音訊結束後,嘴巴是否停止?
分別用正常音量、靜音與慢速各看一次。正常播放呈現觀眾體驗;靜音可暴露重複頭部動作、閃爍和身分漂移;慢速可定位錯位開始的畫格。
使用帶時間標記的檢查表:
| 時間 | 音訊事件 | 視覺檢查 | 結果 | 下一步 |
|---|---|---|---|---|
| 00:01 | 第一個字 | 嘴巴與聲音同時開始 | 通過 | 無 |
| 00:08 | 有意停頓 | 嘴巴持續移動 | 失敗 | 檢查停頓中的噪音 |
| 00:17 | 最後一個字 | 嘴巴太晚閉上 | 複查 | 裁掉尾端音訊再測 |
逐格檢查後,仍要用正常速度播放完整片段。只在慢動作中看得到的小偏差未必影響觀看,但每次停頓都出現的錯位通常會有影響。
分離音訊問題與圖片問題
只修改與症狀直接相關的輸入。沒有假設就反覆生成,可能會浪費時間與點數,卻一直得到相同問題。
| 症狀 | 可能來源 | 下一個測試 |
|---|---|---|
| 靜音時嘴巴仍動 | 殘留噪音、音樂、呼吸或模型動作 | 使用更乾淨的停頓重跑短片 |
| 嘴巴啟動較晚 | 前導靜音或時間錯位 | 裁掉開頭後比較起點 |
| 快速字詞表現弱 | 語速太快或嘴部細節不足 | 稍微放慢或換更清楚的人像 |
| 下半臉拉伸 | 側臉、嘴被遮住或動作太強 | 使用正面素材並降低動作 |
| 臉部身分改變 | 細節不足、裁切過緊或生成差異 | 使用清晰來源並固定裁切 |
| 頭部太僵硬 | 動作不足或指示限制過多 | 測試一個小而明確的動作 |
| 後段時間漂移 | 片段太長或音訊問題 | 將WAV拆成較短的核准區段 |
每個版本只改一個變因。 若同時清理音訊、換人像並重寫動作指示,就無法確認是哪個修改帶來改善。
長文案可在自然句子或場景邊界拆段。各段保持相同人像、裁切與動作指示。分段生成可能造成臉部位置或表情略有不同,剪輯後要檢查接點。
已驗證素材的開發者流程
先用手動測試確認人像與WAV,再開始自動化。檔案成功上傳,不代表視覺結果符合品質標準。
API流程應先確認現行驗證與上傳方式,再參考Talking Avatar API的媒體引用、請求欄位、長度規則、回呼行為與錯誤回應。傳入手動測試使用過的同一組圖片和音訊,並保存工作ID、輸入版本、設定、輸出與失敗狀態,以便追蹤重複工作。
完整API實作留在開發者文件;創作者流程應集中在媒體準備與驗證。
常見問題
WAV檔案可以單獨讓靜止照片動起來嗎?
不可以。 還需要相容的臉部圖片。音訊決定時間與表演,圖片決定人物外觀。
WAV應該包含背景音樂嗎?
通常不應該。 純語音更容易分析與同步。會說話影片通過聲音和嘴型檢查後,再於剪輯階段加入音樂。
為什麼靜音時嘴巴仍會移動?
停頓中可能還有噪音、音樂、呼吸或環境底噪。 模型也可能持續小幅動作。檢查波形,建立更乾淨的有意停頓,再比較一次短片生成。
製作會說話的臉時,WAV一定比MP3好嗎?
不一定。 使用工具目前支援的格式,並優先確保語音清楚。若兩種格式都支援,請用同一份錄音比較,不要假設容器格式決定唇形同步品質。
完整錄音前先測一段停頓
使用清楚的人像和獲得授權的乾淨錄音。加入一段有意停頓、標記時間,發生問題時一次只改一個變因。短片穩定後,再製作完整版本。



