DomoAI에서 사물이 말하게 하려면 잘 보이는 입, 짧은 대사 한 줄, 깨끗한 음성을 준비하세요. 저는 첫 클립을 농담이나 불평 하나로 구성하고 화면을 가깝게 잡으며, 카메라 움직임은 별도의 삽입 샷에 두겠습니다.
시작 전에 준비할 것
필요한 자료는 이미지 한 장, 짧은 대본, 깨끗한 음성 오디오, 이렇게 세 가지뿐입니다. 무엇이든 생성하기 전에 완성된 영상의 목적부터 정하세요. 6초짜리 농담을 하는 커피 머그잔과 제품 기능을 설명하는 마스코트에는 서로 다른 대본과 크롭이 필요합니다.
- 잘 보이는 피사체 하나: 얼굴을 정면으로 향하고 입 주변이 명확한 캐릭터, 반려동물, 일러스트 마스코트, 제품 또는 사물을 사용하세요.
- 짧은 대본 하나: 랜딩 페이지 문구가 아닌 말할 대사를 쓰세요. 문장을 단순하고 연기하기 쉽게 만드세요.
- 깨끗한 음성: DomoAI Text to Speech로 생성하거나 MP3, WAV 등 지원되는 음성 파일을 업로드하세요.
첫 테스트는 감정 하나, 아이디어 하나, 카메라 구도 하나를 목표로 하세요. 캐릭터가 잘 작동하면 짧은 테이크 여러 개로 더 긴 영상을 만들 수 있습니다.
연기를 전달할 수 있는 얼굴 만들기
이미 좋은 이미지가 있다면 사용하세요. 없다면 DomoAI Text to Image로 새 피사체를 만드세요. 사물에는 작게 보여도 알아볼 수 있는 단순한 얼굴을 주세요. 명확한 두 눈, 눈에 띄는 입, 최종 화면비에 맞출 충분한 주변 공간이 필요합니다.
원본을 다듬어야 한다면 멀티 모델 이미지 생성·편집 도구를 사용하세요. DomoAI는 이미지 생성과 일상 언어를 통한 편집을 위해 GPT Image 2, Nano Banana 2, Nano Banana Pro를 모델 선택지로 제공합니다.
애니메이션 전에 문제를 고치세요.
- 얼굴이 움직일 때 왜곡될 수 있는 텍스트나 로고를 제거하세요.
- 손, 머리카락, 소품, 짙은 그림자가 입을 가리지 않게 하세요.
- 얼굴이 주요 동작이라면 클로즈업이나 미디엄 구도를 쓰세요.
- 나중에 자막을 추가할 계획이라면 단순한 배경을 선택하세요.
사실적인 사람 얼굴일 필요는 없습니다. Talking Avatar는 스타일화된 캐릭터, 애니메이션 초상화, 반려동물, 일러스트 마스코트, 장난스러운 사물에도 적합합니다.
원본 이미지 검사 통과하기
말하는 사물에는 사실적인 사람 얼굴이 필요하지 않습니다. 시청자가 알아볼 수 있는 입과 연기를 담을 여유가 있는 디자인이 필요합니다.
| 확인 항목 | 통과 기준 | 애니메이션 전 수정 사항 |
|---|---|---|
| 입 | 썸네일 크기에서도 보임 | 너무 작거나 가려지거나 질감에 묻힘 |
| 제품 문자 | 입과 움직임 영역 밖에 있음 | 얼굴이 변형되어야 할 위치에 라벨이 있음 |
| 소품의 겹침 | 손잡이, 빨대, 손, 그림자가 얼굴을 가리지 않음 | 가리는 요소를 옮기거나 제거 |
| 자막 공간 | 피사체 위나 아래에 비어 있는 영역이 있음 | 구도를 바꾸거나 캔버스를 확장 |
| 화면비 | 최종 플랫폼에 맞음 | 얼굴을 배치하기 전에 화면을 자를 범위 설정 |
재미있는 캐릭터 아이디어는 Talking Avatar 퀵 앱과 AI VTuber Maker를 비교해 보세요. 반려동물 버전은 반려동물 말하기 워크플로 모음으로, 움직이는 만화 캐릭터는 2D 걷고 말하기 워크플로로 이어 갈 수 있습니다.
자연스럽게 들리는 대본 쓰기
오디오를 생성하기 전에 대본을 소리 내어 읽어 보세요. 숨이 차거나 문장에서 자꾸 막히면 줄이세요. 첫 대본은 15~35단어가 유용합니다.
다음의 간단한 구조를 시도하세요.
- 훅: 놀라운 내용을 먼저 말합니다.
- 유용한 정보 하나: 시청자가 알아야 할 내용을 설명합니다.
- 마무리: 질문, 웃음을 주는 마지막 한마디, 다음 단계로 끝냅니다.
말하는 책상 스탠드의 예시:
사흘 밤이나 어둠 속에서 일하는 걸 지켜봤어. 나를 켜고 화면 밝기를 낮춰서 눈을 좀 쉬게 해 줘.
짧은 클립에 내레이션, 카메라 동작, 여러 감정을 한꺼번에 담지 마세요. 피사체가 표정을 바꿔야 하거나 편집 지점이 필요하면 대사를 나누어 녹음하세요.
음성 생성 또는 업로드하기
DomoAI Text to Speech는 화자 한 명을 위한 Single 모드와 두 사람이 대화하는 Multi 모드를 지원합니다. 음성 복제와 [Cheerful] 같은 감정 태그, 최대 4,000자 대본도 지원합니다. 복제 음성의 속도는 0.5배에서 2.0배까지 조절할 수 있습니다.
먼저 음성을 생성하고 발음과 속도를 들은 뒤 승인한 오디오를 Talking Avatar로 보내세요. 지원되는 음성이나 보컬 파일을 업로드할 수도 있습니다.
오디오를 깨끗하게 유지하세요. 음악, 군중 소음, 강한 효과음은 말을 검토하기 어렵게 할 수 있습니다. DomoAI는 Talking Avatar 안에서 완성된 배경음악 트랙을 믹싱하지 않으므로, 내보낸 뒤 CapCut, Premiere Pro, DaVinci Resolve 또는 다른 편집기에서 전체 사운드트랙을 추가하세요.
Talking Avatar로 캐릭터나 사물 움직이기
DomoAI Talking Avatar를 열고 이미지나 동영상과 승인한 오디오를 추가하세요. Talking Avatar는 5초, 10초, 20초의 표준 길이를 제공합니다. Pro 사용자는 30초 및 60초 Fast Mode 옵션도 사용할 수 있습니다.
눈에 보이는 연기를 지시하려면 별도의 동작 또는 표정 프롬프트를 사용하세요. 대본은 주인공이 무엇을 말할지 제어하고, 이 프롬프트는 어떻게 행동할지 제어합니다.
다음과 같은 지시가 유용합니다.
따뜻한 미소, 작은 끄덕임, 편안한 눈맞춤.놀란 표정, 빠른 눈깜빡임, 카메라를 향해 살짝 몸 기울이기.차분한 진행자의 전달 방식, 미세한 고개 움직임, 안정적인 시선.
미묘한 움직임으로 시작하세요. 큰 회전, 빠른 몸짓, 한 프롬프트의 여러 동작은 특히 작은 사물이나 일러스트 얼굴에서 일관성을 유지하기 어렵게 만듭니다.
대사와 동작은 별도의 입력란에 넣기
| 입력란 | 책상 스탠드 예시 |
|---|---|
| 대본 또는 오디오 | ‘마감 때마다 밝혀 줬더니, 돌아오는 대접이 이거야?’ |
| 동작 프롬프트 | 무표정, 한 번 천천히 눈 깜빡이기, 갓을 조금 기울이기, 몸체 고정, 카메라 고정 |
제가 출발점으로 삼는 세 성격은 자기 일에 불평하는 빈정대는 제품, 기능 하나를 설명하는 친근한 마스코트, 사람의 습관에 무표정하게 반응하는 가정용 물건입니다. 대사를 먼저 쓰고 음성을 만들거나 업로드합니다. 반복 가능한 감정이나 속도로 말해야 할 때는 Text to Speech가 유용합니다.
얼굴보다 제품 시연이 중요하다면 아바타 움직임을 더하는 것보다 얼굴 없는 설명 영상 워크플로가 다음 단계로 더 적합할 수 있습니다.
피사체에 맞는 워크플로 선택하기
말하는 반려동물
동물이 카메라를 향하고 주둥이가 보이는 사진을 쓰세요. 혀, 장난감, 발이 입을 가리는 사진은 피합니다. 반려동물에 집중한 작업은 말하는 반려동물 동영상 가이드를 참고하세요.
애니메이션과 일러스트 캐릭터
얼굴이 알아볼 수 있을 만큼 크게 보이게 하고 머리카락이 입술을 가로지르지 않도록 하세요. 여러 클립을 만들 때는 명확한 캐릭터 시트나 승인한 포트레이트가 도움이 됩니다. 애니메이션·반려동물·VTuber를 위한 토킹 아바타 아이디어도 살펴보세요.
제품과 사물
사물 자체에 얼굴을 넣을지, 마스코트가 소개하게 할지 정하세요. 제품 라벨이 정확해야 한다면 움직이는 입에서 떨어뜨려 놓고 법적 문구, 가격, CTA는 생성 후에 추가하세요.
진행자와 마스코트
말하는 주인공을 원하는 배경에 합성해야 한다면 Screen Keying을 사용하세요. CapCut, Premiere Pro 또는 비슷한 편집기로 더 깔끔하게 작업을 이어갈 수 있습니다.
말하는 사물에서 흔한 문제 고치기
입이 거의 움직이지 않음
더 가까운 구도와 입 주변이 더 명확한 원본을 사용하세요. 머리카락, 소품, 그림자, 낮은 해상도의 흐림이 얼굴을 가리지 않는지 확인하세요.
연기가 너무 부산스러움
동작 프롬프트를 줄이세요. 테이크마다 감정 하나와 몸짓 하나만 유지합니다. 더 큰 움직임은 별도의 Image to Video나 Character to Video 샷에 남겨 두세요.
음성이 불명확함
음악과 강한 배경 소음 없이 음성을 다시 생성하거나 녹음하세요. 긴 대화를 짧은 구간으로 나누면 전체 영상을 다시 만들지 않고 부족한 대사 하나를 교체할 수 있습니다.
완성한 클립이 정적으로 느껴짐
말하는 클로즈업에 반응 샷, 제품 삽입 샷, 자막, 짧은 애니메이션 장면을 섞으세요. 말하는 순간은 Talking Avatar가 맡고, 전체 이야기는 편집이 이끌어야 합니다.
자주 묻는 질문
DomoAI는 이미지 한 장으로 사물이 말하게 할 수 있나요?
네. Talking Avatar에서 선명한 이미지와 생성하거나 업로드한 음성을 함께 사용하세요. 얼굴이나 입 부분이 보이면 모델에 더 뚜렷한 연기 대상을 제시할 수 있습니다.
반려동물이나 애니메이션 캐릭터도 말하게 할 수 있나요?
네. Talking Avatar는 사실적인 인물 사진, 반려동물, 애니메이션 얼굴, 일러스트 마스코트 등 캐릭터 중심 이미지에 적합합니다. 입 부분을 알아보기 쉬운 정면 이미지를 사용하세요.
제 목소리를 넣을 수 있나요?
네. 지원되는 음성 오디오를 업로드하거나 DomoAI Text to Speech로 대사를 생성할 수 있으며, 제공되는 경우 복제 음성도 사용할 수 있습니다.
Talking Avatar에서 배경음악을 넣을 수 있나요?
내보낸 뒤 완성된 음악 믹스를 추가하세요. Talking Avatar로 음성에 맞춰 움직이는 연기를 만든 다음, 외부 편집기에서 영상에 음악과 자막을 결합하세요.
Talking Avatar 클립은 얼마나 길게 만들 수 있나요?
표준 길이 옵션은 5초, 10초, 20초입니다. Pro 사용자는 30초 및 60초 Fast Mode 옵션을 이용할 수 있습니다. 요금제 이용 권한은 바뀔 수 있으므로 현재 DomoAI 요금 안내를 확인하세요.
짧게 테스트하고 얼굴과 음성을 승인한 뒤 좋은 테이크로 최종 영상을 만드세요. 수정 범위를 집중할 수 있고, 캐릭터가 잘 작동하는지 확인하기 전에 긴 클립에 크레딧을 쓰는 일을 줄일 수 있습니다.


