이 튜토리얼에서 만들 결과
이 가이드에서는 VMAI의 AI TTS 음성 생성기로 짧은 보이스오버 오디오를 만듭니다.
완료하면 다음을 할 수 있습니다.
- 텍스트를 입력하고 5,000자 제한을 확인합니다.
- TTS 스크립트 전처리로 숫자, 기호, 약어를 음성에 맞게 다듬습니다.
- 언어와 음성을 함께 고릅니다.
- 속도와, 지원되는 경우 감정/톤 지시를 조정합니다.
- 내 기기에서 생성과 서버 생성을 구분합니다.
- 결과를 재생하고 MP3 또는 사용 가능한 형식으로 다운로드합니다.
- 로그인한 경우 히스토리 저장과 영상 타임라인 연결 흐름을 이해합니다.
시작하기 전에
필요한 것
- 음성으로 만들 짧은 스크립트. 처음에는 1~3문장으로 테스트하는 것이 좋습니다.
- 데스크톱 브라우저. 무료 표시 음성을 내 기기에서 생성하려면 브라우저 성능과 탭 상태의 영향을 받을 수 있습니다.
- VMAI 계정. 서버 생성, 히스토리 저장, My Voices, 일부 다운로드 형식을 사용하려면 로그인이 필요할 수 있습니다.
- 서버 생성에 사용할 이용권. 화면에서 이번 생성 비용을 먼저 확인합니다.
언제 이 도구를 쓰면 좋나요?
| 상황 | 왜 도움이 되나요? |
|---|---|
| 제품 데모용 나레이션이 필요할 때 | 스크립트에서 바로 음성 파일을 만들 수 있습니다. |
| 쇼츠나 릴스의 훅을 여러 톤으로 비교할 때 | 짧은 문장으로 목소리 후보를 빠르게 줄일 수 있습니다. |
| 영상 편집 전에 임시 음성을 넣고 싶을 때 | 브라우저 생성으로 비용 없이 샘플을 들어볼 수 있습니다. |
| 반복되는 브랜드 보이스가 필요할 때 | 로그인 후 히스토리와 My Voices 흐름을 활용할 수 있습니다. |
Step 1: AI TTS 음성 생성기 열기
AI TTS 음성 생성기를 엽니다.

AI TTS 음성 생성기 화면: 텍스트를 입력하고, 음성·언어·속도·생성 방식을 한 화면에서 선택합니다.
화면은 크게 세 부분으로 나뉩니다.
| 영역 | 역할 |
|---|---|
| 왼쪽 입력 영역 | 스크립트 입력, TTS 스크립트 전처리, 음성 선택, 언어·속도 설정을 합니다. |
| 생성 방식 영역 | 내 기기에서 생성 또는 서버에서 생성 중 현재 선택 가능한 방식을 고릅니다. |
| 오른쪽 패널 | 히스토리와 사용 팁을 확인합니다. 생성 후에는 결과 재생과 다운로드 영역이 표시됩니다. |
처음에는 긴 원고를 넣지 말고 짧은 문장으로 화면 동작과 목소리 톤을 확인하세요.
Step 2: 텍스트 입력하고 전처리하기
텍스트 입력 영역에 보이스오버로 만들 문장을 붙여넣습니다. 현재 구현 기준으로 한 번에 입력할 수 있는 최대 길이는 5,000자입니다.
긴 텍스트를 바로 넣기 전에 아래를 정리하세요.
- 날짜, 숫자, 가격, 단위를 자연스럽게 읽을 수 있는지 확인합니다.
- 기호나 약어가 그대로 읽혀도 괜찮은지 봅니다.
- 문장이 길면 두 문장으로 나눕니다.
- 장면이 바뀌는 지점에는 빈 줄을 넣습니다.
필요하면 TTS 스크립트 전처리를 실행합니다. 전처리 결과는 별도 텍스트 영역에 나타나며, 생성 전에 직접 수정할 수 있습니다.
Step 3: 언어와 음성 고르기
다음으로 언어와 음성을 고릅니다.
음성 영역에는 다음 탭이 있습니다.
| 탭 | 용도 |
|---|---|
| 전체 | 현재 언어에서 사용할 수 있는 음성을 한 번에 봅니다. |
| 무료 | 내 기기에서 무료 생성에 사용할 수 있는 음성을 찾을 때 봅니다. |
| 유료 | 서버 생성 중심의 음성을 찾을 때 봅니다. |
| My Voices | 로그인한 사용자가 만든 커스텀 보이스를 선택합니다. |
언어를 먼저 고르면 해당 언어를 지원하는 음성 후보를 좁히기 쉽습니다. 일부 음성은 특정 언어에 최적화되어 있으며, 선택한 언어와 다를 경우 결과가 달라질 수 있다는 경고가 표시될 수 있습니다.
처음 테스트할 때는 아래처럼 진행하세요.
- 영상의 주 언어를 선택합니다.
- 무료 탭에서 짧은 샘플을 들어볼 음성을 고릅니다.
- 서버 음성이나 My Voices는 최종 톤이 필요할 때 비교합니다.
- 다국어 영상은 언어별로 다른 음성을 쓰는 것도 고려합니다.
Step 4: 속도와 고급 설정 조정하기
속도 슬라이더는 0.5x부터 2.0x까지 조정할 수 있습니다. 시작은 1.00x로 두고, 샘플을 들어본 뒤 조금씩 바꾸는 편이 안전합니다.
속도 선택 기준
| 영상 유형 | 추천 접근 |
|---|---|
| 튜토리얼·강의 | 1.00x 근처에서 명확성을 우선합니다. |
| 쇼츠 훅 | 조금 빠르게 테스트하되 단어가 뭉개지지 않는지 확인합니다. |
| 제품 데모 | 화면 조작 속도와 맞춰 너무 앞서가지 않게 둡니다. |
| 브랜드 영상 | 배경음악과 함께 들어 보고 호흡을 맞춥니다. |
감정 / 톤
지원되는 음성에서는 감정이나 톤을 자연어로 입력할 수 있습니다. 예를 들어 “밝고 활기찬 톤”, “차분하고 명확하게”처럼 짧게 쓰는 방식입니다.
출력 형식과 경제적 모드
고급 설정에서는 출력 형식과, 지원되는 경우 더 빠르고 낮은 비용으로 생성하는 경제적 모드를 확인할 수 있습니다. 무료 플랜에서는 MP3만 사용할 수 있고, WAV는 유료 플랜에서 열릴 수 있습니다.
Step 5: 생성 방식 선택하기
생성 방식은 현재 선택한 음성, 기기, 로그인 상태에 따라 달라집니다.
| 방식 | 설명 | 체크할 점 |
|---|---|---|
| 내 기기에서 생성 | 무료 표시 음성을 브라우저에서 생성합니다. | 첫 사용 시 모델 다운로드가 있을 수 있고, 탭을 유지하는 것이 좋습니다. |
| 서버에서 생성 | 서버에서 처리하고 이용권을 사용합니다. | 로그인과 잔여 이용권, 이번 생성 비용을 확인합니다. |
화면에는 이번 생성: 무료 또는 이번 생성: N 이용권처럼 예상 비용이 표시됩니다. 서버 생성 버튼을 누르기 전에 반드시 이 값을 확인하세요.
처음 사용하는 문장이라면 내 기기에서 짧게 테스트하고, 최종 원고나 필요한 음성 옵션이 정해졌을 때 서버 생성을 쓰는 흐름이 효율적입니다.
Step 6: 음성 생성하고 결과 확인하기
설정이 끝나면 음성 생성을 누릅니다.
생성 중에는 진행률 또는 상태 메시지가 표시됩니다. 브라우저 생성은 사용자의 기기 상태에 영향을 받을 수 있으므로, 다른 무거운 작업을 줄이고 탭을 유지하는 것이 좋습니다. 서버 생성은 처리 완료를 기다리며, 실패나 만료 처리에 대비한 안전 장치가 코드에 포함되어 있습니다.
결과가 나오면 다음을 확인합니다.
- 재생 버튼으로 전체 흐름을 들어봅니다.
- 숫자와 약어가 자연스럽게 읽혔는지 확인합니다.
- 문장 사이 휴지가 충분한지 듣습니다.
- 속도와 톤이 영상 화면 속도와 맞는지 봅니다.
- 필요하면 해당 장면만 다시 생성합니다.
결과가 마음에 들면 MP3로 다운로드합니다. 플랜에서 지원하면 WAV도 선택할 수 있습니다.
Step 7: 히스토리, 다운로드, 영상 타임라인 활용하기
로그인한 사용자는 생성 결과를 히스토리에 저장하거나, 서버 생성 결과를 영상 타임라인에 추가하는 흐름을 사용할 수 있습니다.
다만 히스토리에 보인다고 해서 영구 보관을 가정하면 안 됩니다. 결과 파일은 플랜 정책에 따라 만료될 수 있으므로, 중요한 오디오는 반드시 로컬에도 다운로드해 두세요.
반복 작업을 한다면 아래를 함께 저장해 두면 좋습니다.
- 최종 스크립트
- 선택한 언어와 음성
- 속도와 톤 지시
- 브라우저 생성 또는 서버 생성 여부
- 다운로드한 파일명과 사용한 영상 프로젝트
이렇게 기록하면 다음 영상에서 같은 목소리 톤을 다시 맞추는 시간이 줄어듭니다.
선택 사항: My Voices 사용하기
My Voices는 로그인한 사용자가 만든 커스텀 보이스를 관리하는 영역입니다. 레퍼런스 오디오로 보이스를 만들거나, 설명만으로 보이스를 디자인하는 흐름을 제공합니다.
중요한 기준은 권한입니다.
- 본인 목소리이거나 사용할 권한이 있는 음성만 사용합니다.
- 레퍼런스 오디오는 짧고 선명한 구간을 준비합니다.
- 커스텀 보이스 생성에는 별도 이용권이 필요합니다.
- 팀이나 브랜드 채널에서는 커스텀 보이스 사용 기준을 문서화합니다.
처음에는 기본 음성으로 workflow를 익힌 뒤, 정말 반복적으로 필요한 경우에만 My Voices를 검토하세요.
체크리스트
생성 전에 마지막으로 확인하세요.
- 스크립트가 음성으로 듣기 좋게 정리되었습니다.
- 언어와 음성이 서로 맞습니다.
- 5,000자 제한을 넘지 않았습니다.
- 긴 원고는 문단 또는 장면 단위로 나눴습니다.
- 속도는 기본값에서 조금씩 조정했습니다.
- 서버 생성 전 예상 이용권과 잔여 이용권을 확인했습니다.
- 결과를 다운로드했고, 중요한 원고와 설정도 함께 보관했습니다.
- 커스텀 보이스를 쓴다면 음성 사용 권한이 명확합니다.
다음 단계
보이스오버 오디오를 만들었다면 다음 workflow로 이어갈 수 있습니다.
- 영상 전체를 만들고 싶다면 새 영상 만들기에서 오디오 또는 스크립트 입력 모드를 선택하세요.
- 오디오를 영상 타임라인에 붙여 쓰려면 서버 생성 결과의 타임라인 추가 흐름을 확인하세요.
- 어떤 음성 생성 기준을 먼저 볼지 정리하려면 텍스트 음성 변환 전에 놓치면 안 되는 7가지 기준을 참고하세요.
튜토리얼 완료!
이 튜토리얼을 읽었습니다. 다음 단계로 진행해보세요.
이 튜토리얼이 도움이 되셨나요?
구독하시면 새로운 튜토리얼과 가이드가 발행될 때 이메일로 알려드립니다. 스팸 없이, 언제든 구독 취소 가능합니다.
댓글
댓글을 작성하려면 로그인이 필요합니다
로그인아직 댓글이 없습니다. 첫 댓글을 남겨보세요!