Google Colab과 edge-tts를 이용해 별도의 프로그램 설치나 API Key 없이 텍스트를 한국어 음성 MP3로 변환하는 방법을 단계별로 정리합니다. 음성 선택, 속도·Pitch 조절, 자막 생성과 다운로드 방법까지 알아봅니다.

텍스트를 영상 내레이션이나 음성파일로 바꾸고 싶을 때 유료 TTS 서비스를 사용할 수도 있지만, 간단한 작업이라면 Google Colab과 Python의 edge-tts 패키지를 이용해 비교적 쉽게 음성을 만들 수 있습니다.
edge-tts는 Microsoft Edge의 온라인 Text-to-Speech 기능을 Python에서 사용할 수 있도록 만든 오픈소스 패키지입니다. 별도의 Windows PC나 Microsoft Edge 설치, API Key 없이도 사용할 수 있으며, 음성 종류 선택과 속도·음량·Pitch 조정도 지원합니다.
이번 글에서는 별도의 프로그램을 PC에 설치하지 않고 Google Colab에서 한국어 텍스트를 MP3 음성파일로 만드는 방법을 순서대로 살펴보겠습니다.
1. 준비할 것
필요한 것은 크게 두 가지입니다.
- Google 계정
- 음성으로 변환할 텍스트
Google Colab은 웹브라우저에서 Python 코드를 실행할 수 있는 환경이기 때문에 별도의 Python 설치가 필요하지 않습니다. 이번 TTS 작업은 연산량이 크지 않기 때문에 GPU도 필요하지 않습니다. Google Colab의 기본 CPU 런타임으로 충분합니다.
2. Google Colab 새 노트북 만들기
먼저 Google Colab에 접속합니다.
https://colab.research.google.com/
Google Colab
colab.research.google.com
Google 계정으로 로그인한 뒤 새 노트북(New Notebook)을 생성합니다. 화면에 다음과 같은 코드 입력창이 나타나면 준비가 끝난 것입니다. Colab에서는 각 코드 입력영역을 셀(Cell)이라고 부르며, 셀 왼쪽의 실행 버튼을 누르거나 Shift + Enter를 눌러 코드를 실행할 수 있습니다.


3. edge-tts 설치하기
첫 번째 셀에 다음 코드를 입력합니다.
!pip install -q edge-tts
실행하면 Google Colab 환경에 edge-tts 패키지가 설치됩니다.
-q는 설치 과정에서 출력되는 메시지를 줄이기 위한 옵션이므로 없어도 됩니다.
4. 사용할 수 있는 한국어 음성 확인하기
어떤 한국어 음성을 사용할 수 있는지 먼저 확인해보겠습니다. 새 셀에 다음 코드를 입력합니다.
!edge-tts --list-voices | grep ko-KR
실행하면 현재 제공되는 한국어 음성 목록을 확인할 수 있습니다.

음성목록은 서비스 상황에 따라 추가되거나 변경될 수 있으므로 실제 사용할 때는 --list-voices 명령으로 직접 확인하는 것이 가장 정확합니다.
https://gist.github.com/Davoda1/d0a1e0662bc3ebad7b0a5a9c0ee01ccb
list of voices available in Edge TTS.txt
GitHub Gist: instantly share code, notes, and snippets.
gist.github.com

5. 가장 간단하게 텍스트를 MP3로 만들기
먼저 짧은 문장을 테스트해보겠습니다. 새 셀에 다음 코드를 입력합니다.
!edge-tts \
--voice ko-KR-InJoonNeural \
--text "안녕하세요. 구글 코랩에서 텍스트를 음성으로 변환하고 있습니다." \
--write-media test.mp3
실행이 끝나면 Colab의 /content 폴더에
test.mp3
파일이 생성됩니다.
--voice에는 사용할 목소리를 지정하고,
--text에는 음성으로 만들 문장을 입력합니다.
--write-media 뒤에는 생성할 파일명을 지정합니다.
edge-tts 공식 사용법 역시 --text와 --write-media를 이용하는 방식을 지원합니다.
https://github.com/rany2/edge-tts
GitHub - rany2/edge-tts: Use Microsoft Edge's online text-to-speech service from Python WITHOUT needing Microsoft Edge or Window
Use Microsoft Edge's online text-to-speech service from Python WITHOUT needing Microsoft Edge or Windows or an API key - rany2/edge-tts
github.com
Colab의 /content 폴더는 화면 좌측 폴더 아이콘을 클릭하면 됩니다.

6. 생성된 음성을 Colab에서 바로 재생하기
파일을 PC로 내려받기 전에 Colab에서 음질을 확인할 수 있습니다. 다음 코드를 실행합니다.
from IPython.display import Audio
Audio("/content/test.mp3")
실행 결과에 다음과 같이 오디오 플레이어가 나타납니다. 재생 버튼을 누르면 생성된 음성을 바로 들어볼 수 있습니다.

7. 긴 텍스트는 별도 변수에 넣는 것이 편하다
실제 블로그 글이나 유튜브 스크립트처럼 긴 문장을 음성으로 만들 때는 명령어 안에 전체 문장을 넣는 것보다 Python 변수를 사용하는 편이 편합니다. 예를 들어 다음과 같이 작성합니다.
text = """
AI가 보고서를 작성하고 데이터를 분석하는 시대입니다.
그렇다면 사람이 가진 전문성은 더 이상 필요하지 않을까요?
오히려 AI가 만들어낸 결과를 검토하고,
그 의미를 해석할 수 있는 전문가의 역할은 더욱 중요해지고 있습니다.
"""
그다음 Python에서 edge-tts를 직접 사용할 수 있습니다.
import edge_tts
voice = "ko-KR-InJoonNeural"
communicate = edge_tts.Communicate(text, voice)
await communicate.save("/content/narration.mp3")
실행하면 다음 파일이 생성됩니다.
/content/narration.mp3
edge-tts는 명령행 방식뿐 아니라 Python Module로 직접 사용하는 것도 공식적으로 지원합니다. (GitHub)
8. 생성된 MP3 확인하기
다시 오디오 플레이어를 띄웁니다. 원하는 음성이 맞는지 확인합니다.
from IPython.display import Audio
Audio("/content/narration.mp3")

9. MP3 파일을 PC로 다운로드하기
완성된 파일을 PC로 내려받으려면 다음 코드를 사용합니다.
from google.colab import files
files.download("/content/narration.mp3")
실행하면 브라우저에서 MP3 파일 다운로드가 시작됩니다. 이 파일을 Premiere Pro나 다른 영상 편집 프로그램에 그대로 불러와 사용할 수 있습니다.
10. 음성 속도 조절하기
TTS에서는 음성이 너무 빠르거나 느린 경우가 있습니다. edge-tts에서는 rate 옵션을 이용해 속도를 조정할 수 있습니다. 속도뿐 아니라 음량과 Pitch 변경도 지원합니다. Python 방식에서는 다음과 같이 지정할 수 있습니다.
import edge_tts
text = """
안녕하세요.
이번 영상에서는 에이아이씨피에이 시험에 대해 알아보겠습니다.
"""
communicate = edge_tts.Communicate(
text,
voice="ko-KR-InJoonNeural",
rate="-10%"
)
await communicate.save("/content/slow_voice.mp3")
-10%는 기본보다 약간 느리게 읽도록 하는 설정입니다. 반대로 조금 빠르게 하고 싶다면:
rate="+10%"
처럼 사용할 수 있습니다.
11. Pitch도 조정할 수 있다
목소리를 조금 낮거나 높게 만들고 싶다면 pitch 옵션을 사용할 수 있습니다. 예를 들면 다음과 같습니다.
communicate = edge_tts.Communicate(
text,
voice="ko-KR-InJoonNeural",
rate="-5%",
pitch="-10Hz"
)
await communicate.save("/content/voice_pitch.mp3")
다만 지나치게 Pitch를 바꾸면 인공적인 느낌이 강해질 수 있으므로 정보형 영상에서는 큰 조정보다는 작은 범위에서 테스트하는 것이 좋습니다.
12. 자막 파일도 함께 만들 수 있다
영상 제작 목적이라면 음성뿐 아니라 자막 파일도 유용합니다. edge-tts 명령에서는 --write-subtitles 옵션으로 SRT 자막을 함께 생성할 수 있습니다.
!edge-tts \
--voice ko-KR-InJoonNeural \
--text "안녕하세요. 이번 영상에서는 AICPA 시험에 대해 알아보겠습니다." \
--write-media sample.mp3 \
--write-subtitles sample.srt
그러면 다음 두 파일이 생성됩니다.
sample.mp3
sample.srt
sample.srt는 Premiere Pro 등에서 자막작업을 할 때 활용할 수 있습니다.
13. 긴 영상용 원고는 한 번에 만들까, 나눠서 만들까?
짧은 테스트 음성이라면 한 번에 생성해도 문제가 없습니다. 하지만 3~5분 이상의 유튜브 내레이션이라면 문단별로 나눠서 생성하는 방법을 추천합니다. 예를 들어:
01_intro.mp3
02_ai_change.mp3
03_accounting.mp3
04_conclusion.mp3
처럼 나눕니다. 이렇게 하면 장점이 있습니다.
- 발음이 이상한 부분만 다시 생성 가능
- Premiere에서 영상 컷과 맞추기 쉬움
- 문장 사이 간격 조절이 쉬움
- 특정 부분의 음성속도만 변경 가능
특히 한국어 문장 안에 영어 전문용어가 많은 영상에서는 이 방식이 편합니다.
14. AICPA 같은 영어 약어 발음이 이상하다면?
한국어 TTS를 사용하다 보면 다음과 같은 영어 전문용어가 원하는 방식으로 읽히지 않을 수 있습니다.
AICPA
Dollar-Value LIFO
Inherent Risk
Price Index
이 경우 먼저 원문 그대로 테스트해보고, 발음이 어색하다면 TTS용 스크립트만 발음에 맞게 수정할 수 있습니다. 예를 들어:
AICPA
대신
에이 아이 씨 피 에이
처럼 입력합니다. 영상 자막에는 원래 표기인 AICPA를 사용하고, TTS용 원고만 발음에 맞게 따로 관리하면 됩니다. 영어 전문용어가 많은 콘텐츠에서는 이 방법이 상당히 유용합니다.
15. 전체 코드를 한 번에 정리하면
가장 간단한 Colab용 코드는 다음과 같습니다.
# 1. edge-tts 설치
!pip install -q edge-tts
# 2. 원고 입력
text = """
AI가 보고서를 작성하고 데이터를 분석하는 시대입니다.
그렇다면 AICPA를 준비하는 것이 여전히 의미가 있을까요?
AI 시대에는 단순한 계산 능력보다
AI가 만든 결과를 검증하고 판단할 수 있는 전문성이 더욱 중요합니다.
"""
# 3. 음성 생성
import edge_tts
voice = "ko-KR-InJoonNeural"
communicate = edge_tts.Communicate(
text,
voice,
rate="-5%"
)
await communicate.save("/content/narration.mp3")
# 4. 음성 미리 듣기
from IPython.display import Audio
Audio("/content/narration.mp3")
# 5. 다운로드
from google.colab import files
files.download("/content/narration.mp3")
이 다섯 단계면 기본적인 텍스트 → 한국어 MP3 음성파일 변환이 완료됩니다.
Google Colab + edge-tts의 장단점
| 항목 | 특징 |
| 별도 Python 설치 | 필요 없음 |
| GPU | 필요 없음 |
| API Key | 필요 없음 |
| 한국어 지원 | 가능 |
| 남성·여성 음성 | 가능 |
| MP3 저장 | 가능 |
| 자막 생성 | 가능 |
| 속도 조절 | 가능 |
| Pitch 조절 | 가능 |
| 영어 전문용어 | 반드시 발음 테스트 권장 |
| 사용 난이도 | 초보자도 비교적 쉬움 |
다만 edge-tts는 Microsoft Edge의 온라인 TTS 서비스를 활용하는 오픈소스 Python 패키지이므로, 인터넷 연결이 필요하고 서비스 측 변경에 따라 작동 방식이나 사용 가능한 음성이 달라질 수 있다는 점은 알고 사용하는 것이 좋습니다.
마무리
Google Colab과 edge-tts를 이용하면 별도의 Python 개발환경이나 API Key 없이도 간단하게 텍스트를 MP3 음성파일로 변환할 수 있습니다. 특히 블로그 글을 영상으로 만들거나, YouTube 정보영상의 내레이션 초안을 제작하거나, AI 음성 변환을 위한 기본 음성을 만들 때 활용하기 좋습니다.
이번 방법으로 만든 음성은 그 자체로 사용할 수도 있지만, 추가로 RVC(Retrieval-based Voice Conversion)를 이용하면 기본 TTS의 말투와 발음을 유지하면서 음색을 다른 Voice Model로 변환하는 작업도 가능합니다.
'AI와 디지털 도구' 카테고리의 다른 글
| Premiere Pro 27.0 Windows 10에서 설치할 수 있을까? 지원 버전과 OS 요구사항 정리 (0) | 2026.08.29 |
|---|---|
| PowerShell로 윈도우 파일 목록 CSV로 추출하는 방법 | 파일명·날짜·크기·재생시간 (0) | 2026.08.27 |
| 유튜브 URL만 넣으면 ChatGPT가 요약해주는 방법 (2026 최신) (0) | 2026.07.10 |
| HTML 파일 만드는 법: 텍스트 문서를 .html 파일로 바꾸는 가장 쉬운 방법 (0) | 2026.07.03 |
| AI로 쓴 글은 검색 노출에 불리할까? Google SEO 기준으로 정리 (0) | 2026.07.01 |