WAV音声で顔を話させる方法

9分で読めます

make-talking-face-with-wav-audio

WAVファイルは発話のタイミング、間、速度、演技を決め、ポートレートは顔を決めます。まず5秒か10秒だけ生成してください。 全編を作る前に、最初の言葉、1か所の間、最後に口が閉じる瞬間を確認します。

WAVが制御するもの、しないもの

WAVは演技のタイミングを制御しますが、人物の見た目を決めたり、自然な動きを保証したりはできません。問題を切り分けるときは、音声と画像の役割を分けて考えます。

音声が影響する項目:

  • 発話の開始と終了
  • 単語と間のタイミング
  • 話す速さとリズム
  • 強調、感情、声の勢い
  • 音声駆動クリップの全体尺

音声が決めない項目:

  • 人物やキャラクターの見た目
  • 顔の角度、照明、画像の細部
  • 背景とクロップ
  • 頭や体をどの程度動かすか
  • デフォルメされた口がすべての音を自然に表現できるか

静止画から作るしゃべる顔では、新しい顔の動きを生成します。一方、動画のリップシンクでは元動画の演技を引き継ぎ、主に差し替え音声に合わせて口の動きを変更します。

この違いは、静止画アニメーションと動画を起点にしたリップシンクを分ける基準にもなります。静止画ワークフローでは画像が被写体を、音声が話し方を提供します。動画ワークフローでは、演技がすでに元動画に含まれています。

アップロード前にWAVを確認する

技術的に有効なファイルでも、発話入力として適しているとは限りません。動画を生成する前に録音全体を聞き、明らかな問題を直します。

WAVの事前確認:

  1. 互換性を確認する。 利用するツールの対応形式、容量、時間を確認します。すべてのWAVエンコードが使えるとは限りません。
  2. 最初から最後まで聞く。 開けるファイルでも、録音が完全でエラーがないとは限りません。
  3. 言葉の明瞭さを確認する。 必要な単語が字幕なしでも聞き取れる状態にします。
  4. クリッピングを確認する。 潰れたピークやノイズは子音を隠し、聞き疲れの原因になります。
  5. 競合する音を減らす。 音楽、室内ノイズ、反響、ハム音、交通音が声を隠す場合は除去します。
  6. 意図しない無音を切る。 冒頭と末尾の空白は削除し、演技上必要な間は残します。
  7. 速度を確認する。 早口すぎると、生成された口が明確な形を作る時間が減ります。
  8. 内容を確定する。 名前、数字、発音、最終文言をアニメーション前に直します。
  9. 利用許諾を確認する。 アニメーション化と公開の権利がある声と録音だけを使います。

DomoAIのAIアバターは、最大80MBのMP3、WAV、M4Aに対応しています。BGMのない明瞭な声が最も確認しやすい出発点です。

選択したツールを確認せず、サンプルレートやビット深度を一律に指定しないでください。WAVはコンテナ名であり、対応エンコードは異なります。共通設定を決めつけるより、対応ファイルの中で明瞭な声を用意することが重要です。

同期確認用の意図的な間を1つ入れる

テスト録音の中ほどに、短く自然な間を入れます。例:「最初のシーンができました。[間]一緒にタイミングを確認しましょう。」

この間が観察点になります。声が止まったとき、口も閉じるか落ち着く必要があります。 動き続ける場合は、残留ノイズ、音楽、息、室内音、または生成結果が原因かもしれません。

テストは短くします。5秒か10秒あれば、最初の言葉、1か所の間、最後の口の閉じ方を確認できます。

音声に合わせやすい顔を選ぶ

安定した動きを作るには、顔の情報が十分に見えるポートレートが必要です。きれいなWAVでも、隠れた口、強い横顔、ぼやけた顔は修復できません。

次の条件から始めます:

  • 被写体は1人(1体)
  • 正面または正面に近い顔
  • 自然な状態で口が見える
  • 顔の下半分に均一な光が当たっている
  • 目、唇、輪郭が鮮明
  • 小さな動きに対応できる余白が頭の周囲にある

手、マイク、髪、影、アクセサリーで口を隠さないでください。クロップが狭すぎると、頭が動いたときに画面端の破綻が見える場合があります。

イラスト、アニメキャラクター、ペット、絵画、歴史人物の肖像は、通常の写真と顔の比率や質感が異なるため追加テストが必要です。目と口の形が明確な画像を選び、長いWAVを使う前に短いサンプルを生成します。

タイミングは合うのに顔が変わる場合、原因は画像か動きの指示です。画像編集で元画像を整えるか、動きを小さくします。顔は安定しているのに口の開始が遅い場合は、WAVまたは同期を確認します。

最初の音声駆動クリップを生成する

最初の生成は完成品ではなく、入力素材を検証するために行います。 結果の原因を判断できるよう、設定を簡潔に保ちます。

次の順序で進めます。

  1. 承認済みのポートレートをアップロードします。
  2. AIアバターを選び、DomoAIの音声読み上げ、直接録音、またはMP3、WAV、M4Aのアップロードを使います。
  3. 事前確認済みのWAVを追加します。
  4. テスト用に短い対応時間を選びます。
  5. 対応している場合は、控えめな演技指示を1つ追加します。
  6. 送信前に画像と音声をプレビューします。
  7. 生成後、使用設定と一緒に保存します。

指示例:

自然に話す。頭の動きは小さく、ときどきまばたきし、間の部分では表情をニュートラルに保つ。

大きなジェスチャー、素早い首振り、極端な表情を重ねると、WAVのリップシンク自体を判断しにくくなります。

portraitA_wav-clean_motion-low_v01のように版名を明確にします。音声を修正したら新しい版名を付けます。設定記録があれば、複数の入力を同時に変えたクリップ同士を誤って比較せずに済みます。

タイミング、顔の一貫性、フレーミングに合格した版だけを、最後に動画アップスケーラーで処理します。

波形と照合して結果を確認する

音声内の出来事に名前を付けて動画と比較すると、同期を判断しやすくなります。漠然と繰り返し再生するだけでは、修正につながる情報が得にくくなります。

次の観察点を記録します:

  1. 発話開始: 最初の音声と同時に口が動き始めるか。
  2. 速い子音の部分: 鋭い音に合う口の変化が見えるか。
  3. 意図的な間: 声が止まると口も閉じるか、落ち着くか。
  4. 強調語: 声の勢いと見た目の演技が矛盾していないか。
  5. 最後の言葉: 音声終了後に口が止まるか。

通常の音付き、ミュート、低速で各1回確認します。通常再生は視聴者体験を、ミュートは反復する頭の動きやちらつき、顔つきの変化を、低速はずれが始まるフレームを確認するために使います。

タイムスタンプ付きの確認表を使います:

時刻音声イベント映像確認結果次のテスト
00:01最初の言葉発話と同時に口が動く合格なし
00:08意図的な間口が動き続ける不合格間のノイズを確認
00:17最後の言葉口を閉じるのが遅い要確認末尾音声を切って再テスト

フレーム単位で見た後は、必ず通常速度でも全編を確認します。低速でしか見えない小さなずれは通常視聴に影響しない場合がありますが、間のたびに起きるずれは影響しやすくなります。

音声の問題と画像の問題を切り分ける

見えている症状につながる入力だけを変更します。仮説なしに再生成すると、時間とクレジットを使って同じ失敗を繰り返すことがあります。

症状主な原因次のテスト
無音中も口が動く残留ノイズ、音楽、息、モデルの動作より静かな間で短いサンプルを再生成
口の開始が遅い冒頭の無音、タイミングのずれ冒頭を切り、開始点を比較
早口部分の動きが弱い話す速度、口の情報不足少し遅くするか、鮮明な画像を使う
顔の下部が伸びる横顔、隠れた口、強すぎる動き正面画像に変え、動きを小さくする
顔が別人になる細部不足、狭いクロップ、生成差鮮明な画像と固定クロップを使う
頭が固い動き不足、制限が強すぎる指示小さな動きを1つ明示する
後半で同期がずれる長いクリップ、音声の問題WAVを承認済みの短い区間に分ける

1つの版につき変更は1項目だけにします。 音声の清掃、ポートレート交換、動き指示の変更を同時に行うと、何が改善につながったか判断できません。

長い台本は、自然な文やシーンの境界で分割します。各区間でポートレート、クロップ、動き指示を揃えます。別々のクリップでは顔位置や表情に差が出る場合があるため、編集後に接続部分を確認します。

検証済み素材向けの開発者ルート

自動化は、ポートレートとWAVが手動テストに合格してから始めます。アップロードに成功しても、映像が品質基準を満たすとは限りません。

APIワークフローでは、現行の認証方式とアップロード方法を確認し、Talking Avatar APIでメディア参照、リクエスト項目、時間規則、コールバック、エラー応答を確認します。手動テストで検証した同じ画像と音声を渡し、タスクID、入力版、設定、出力、失敗状態を保存して追跡できるようにします。

実装の詳細は開発者向け資料にまとめ、クリエイター向け手順では素材の準備と検証に集中します。

よくある質問

WAVだけで静止画をアニメーション化できますか?

いいえ。 対応する顔画像も必要です。音声がタイミングと演技を決め、画像が人物の見た目を決めます。

WAVにBGMを入れるべきですか?

通常は入れません。 声だけの音声のほうが分析と同期をしやすくなります。口のタイミング確認に合格した後、編集工程で音楽を追加してください。

無音中も口が動くのはなぜですか?

間にノイズ、音楽、息、室内音が残っている可能性があります。 モデルが小さな動きを続ける場合もあります。波形を確認し、より静かな間を作って短く再生成します。

しゃべる顔ではWAVのほうがMP3より優れていますか?

必ずしもそうではありません。 現在のツールが対応する形式を使い、明瞭な声を優先します。両方に対応する場合は、コンテナだけで品質を決めつけず、同じ録音で比較します。

全編の前に1か所の間を試す

鮮明なポートレートと、利用許諾のあるきれいな録音を使います。意図的な間を1つ入れ、時刻を記録し、問題が出たら1項目だけ変更します。短い版が安定してから全編を作ってください。

最新の記事