"두 개의 연간 구독을 끊었습니다" — voicebox 실사용 데모
먼저 비용부터 보겠습니다
voicebox는 ElevenLabs(출력)와 WisprFlow(입력)를 하나로 합친 오픈소스 대안입니다. 두 서비스를 합쳐 연 $444를 쓰고 있었다면, voicebox로 전부 대체할 수 있습니다.
voicebox가 정확히 무엇인가요?
몇 초 분량 내 목소리 샘플만 있으면 — AI가 내 목소리로 어떤 텍스트든 읽어주고, 어디서든 음성으로 입력하고, AI 에이전트에게 실제 목소리를 줄 수 있습니다. 인터넷 없이, 무료로.
7가지 AI 엔진 — 무엇이 다른가요?
voicebox는 7개의 TTS(텍스트→음성) 엔진을 지원합니다. 용도에 따라 골라 쓸 수 있습니다.
실제 사용 방법
앱 다운로드
voicebox.sh에서 운영체제에 맞는 버전을 다운로드합니다. macOS(Apple Silicon/Intel), Windows MSI, Linux, Docker 지원.
목소리 등록
마이크로 5~10초 목소리를 녹음하거나 기존 오디오 파일을 업로드합니다. AI가 즉시 목소리 프로필을 생성합니다.
텍스트 → 내 목소리로 변환
원하는 텍스트를 입력하면 내 목소리로 읽어줍니다. 8가지 후처리 효과(피치, 리버브, 컴프레서 등)도 적용 가능합니다.
전역 단축키로 받아쓰기
단축키 하나만 누르면 어디서든(문서, 이메일, 카카오톡 등) 말한 내용이 자동으로 텍스트로 입력됩니다. Whisper 기반 로컬 인식으로 인터넷 필요 없음.
AI 에이전트에게 내 목소리 주기
voicebox의 가장 독특한 기능입니다. MCP(Model Context Protocol)를 통해 Claude Code, Cursor 같은 AI 어시스턴트가 실제로 소리를 낼 수 있습니다. AI가 코드 리뷰를 완료하면 내 목소리로 "완료됐습니다"라고 말해줍니다.
단 한 줄의 명령어로 AI 에이전트에게 원하는 목소리를 부여할 수 있습니다.
추가 유튜브 튜토리얼
설치와 사용법을 영상으로 확인하고 싶다면 아래 영상을 참고하세요.
"AI 목소리의 Ollama" — 개발자 관점 상세 리뷰
솔직한 한계
GPU가 있어야 빠릅니다. 고품질 모델(Qwen3-TTS 등)은 NVIDIA GPU 또는 Apple Silicon이 있을 때 빠르게 작동합니다. CPU만 있으면 느릴 수 있습니다.
macOS가 가장 완성도 높습니다. 받아쓰기 자동 붙여넣기 기능은 현재 macOS에서만 완전히 지원됩니다. Windows/Linux는 일부 기능 제한이 있습니다.
영어 퀄리티가 가장 좋습니다. 한국어도 지원하지만 영어 대비 자연스러움이 다소 떨어질 수 있습니다. Qwen3-TTS가 한국어 지원 중 가장 나은 선택입니다.
설치에 용량이 필요합니다. AI 모델 파일이 수 GB이므로 충분한 저장공간(최소 5GB 이상)이 필요합니다.