"두 개의 연간 구독을 끊었습니다" — voicebox 실사용 데모

먼저 비용부터 보겠습니다

voicebox는 ElevenLabs(출력)와 WisprFlow(입력)를 하나로 합친 오픈소스 대안입니다. 두 서비스를 합쳐 연 $444를 쓰고 있었다면, voicebox로 전부 대체할 수 있습니다.

ElevenLabs
$22
/ 월 (Starter 플랜)
✓ TTS 음성 생성
✓ 보이스 클로닝
✗ 받아쓰기 없음
✗ 클라우드 의존
연 $264
WisprFlow
$15
/ 월
✗ TTS 없음
✗ 클로닝 없음
✓ 받아쓰기
✗ 클라우드 의존
연 $180
voicebox
$0
영원히 무료
✓ TTS 7가지 엔진
✓ 보이스 클로닝
✓ 받아쓰기
✓ 완전 로컬 실행
연 $444 절약

voicebox가 정확히 무엇인가요?

몇 초 분량 내 목소리 샘플만 있으면 — AI가 내 목소리로 어떤 텍스트든 읽어주고, 어디서든 음성으로 입력하고, AI 에이전트에게 실제 목소리를 줄 수 있습니다. 인터넷 없이, 무료로.
기존 방식
VS
Voicebox
ElevenLabs 구독 결제
앱 한 번 다운로드
내 목소리 클라우드 업로드
10초 목소리 녹음
WisprFlow 별도 구독
AI가 즉시 목소리 복제
내 데이터 서버에 저장됨
단축키로 어디서든 받아쓰기
월마다 청구서
모든 데이터 내 PC에만 저장

7가지 AI 엔진 — 무엇이 다른가요?

voicebox는 7개의 TTS(텍스트→음성) 엔진을 지원합니다. 용도에 따라 골라 쓸 수 있습니다.

Qwen3-TTS
가장 자연스러운 클로닝. 감정 지시까지 가능 ("슬프게", "활기차게")
10개 언어클로닝추천
Chatterbox Turbo
감탄사·웃음 등 표현 가능. [laugh] [sigh] 태그로 감정 제어
영어감정 표현
Chatterbox Multilingual
가장 넓은 언어 지원. 아랍어·힌디어·스와힐리어 포함
23개 언어다국어
Kokoro
50개 프리셋 목소리. 가볍고 빠름 (82M 모델)
8개 언어프리셋 50종빠름
LuxTTS
영어 특화, 48kHz 고음질 출력. VRAM 1GB만 있으면 OK
영어48kHz경량
TADA (HumeAI)
700초 이상 긴 오디오 생성 가능. 팟캐스트·오디오북에 적합
10개 언어장문팟캐스트
Qwen CustomVoice
참고 오디오 없이도 9개 프리셋 목소리로 즉시 생성
10개 언어프리셋
한국어 지원
Qwen3-TTS, Chatterbox Multilingual, Kokoro 등에서 한국어 지원
총 23개 언어한국어 ✓

실제 사용 방법

1

앱 다운로드

voicebox.sh에서 운영체제에 맞는 버전을 다운로드합니다. macOS(Apple Silicon/Intel), Windows MSI, Linux, Docker 지원.

2

목소리 등록

마이크로 5~10초 목소리를 녹음하거나 기존 오디오 파일을 업로드합니다. AI가 즉시 목소리 프로필을 생성합니다.

3

텍스트 → 내 목소리로 변환

원하는 텍스트를 입력하면 내 목소리로 읽어줍니다. 8가지 후처리 효과(피치, 리버브, 컴프레서 등)도 적용 가능합니다.

4

전역 단축키로 받아쓰기

단축키 하나만 누르면 어디서든(문서, 이메일, 카카오톡 등) 말한 내용이 자동으로 텍스트로 입력됩니다. Whisper 기반 로컬 인식으로 인터넷 필요 없음.

voicebox 앱 메인 화면
voicebox 앱 메인 화면 — 음성 생성 + 프로필 관리
voicebox 타임라인 에디터
타임라인 에디터
멀티 트랙으로 대화·내레이션 구성
voicebox 받아쓰기 화면
받아쓰기 (Dictation)
전역 단축키로 어느 앱에서든 음성 입력

AI 에이전트에게 내 목소리 주기

voicebox의 가장 독특한 기능입니다. MCP(Model Context Protocol)를 통해 Claude Code, Cursor 같은 AI 어시스턴트가 실제로 소리를 낼 수 있습니다. AI가 코드 리뷰를 완료하면 내 목소리로 "완료됐습니다"라고 말해줍니다.

voicebox.speak("리뷰 완료됐습니다. 3개 오류를 수정했습니다.")

단 한 줄의 명령어로 AI 에이전트에게 원하는 목소리를 부여할 수 있습니다.

Claude Code Cursor Windsurf Cline

추가 유튜브 튜토리얼

설치와 사용법을 영상으로 확인하고 싶다면 아래 영상을 참고하세요.

"AI 목소리의 Ollama" — 개발자 관점 상세 리뷰

솔직한 한계

GPU가 있어야 빠릅니다. 고품질 모델(Qwen3-TTS 등)은 NVIDIA GPU 또는 Apple Silicon이 있을 때 빠르게 작동합니다. CPU만 있으면 느릴 수 있습니다.

macOS가 가장 완성도 높습니다. 받아쓰기 자동 붙여넣기 기능은 현재 macOS에서만 완전히 지원됩니다. Windows/Linux는 일부 기능 제한이 있습니다.

영어 퀄리티가 가장 좋습니다. 한국어도 지원하지만 영어 대비 자연스러움이 다소 떨어질 수 있습니다. Qwen3-TTS가 한국어 지원 중 가장 나은 선택입니다.

설치에 용량이 필요합니다. AI 모델 파일이 수 GB이므로 충분한 저장공간(최소 5GB 이상)이 필요합니다.