Voicebox
Jamie Pine · 음성 및 언어
Voicebox는 macOS와 Windows를 지원하는 무료 오픈소스 음성 복제 스튜디오다. 몇 초 만에 음성을 복제하고, 7가지 TTS 엔진으로 음성을 생성하며, 데이터를 로컬에 유지한다.

Voicebox 소개
Voicebox란 무엇인가
Voicebox는 음성의 전체 흐름을 컴퓨터 한 대에서 끝내는 로컬 AI 음성 스튜디오다. 대부분의 도구는 한쪽만 맡는다. 어떤 클라우드 서비스는 텍스트 음성 변환을, 다른 서비스는 받아쓰기를 처리하고, 내 샘플은 남의 서버에 남는다. Voicebox는 양쪽 끝을 로컬에서 처리한다. 짧은 샘플로 음성 프로필을 만들고, 그것으로 말하고 듣는다. 모델과 녹음은 모두 디스크에 남는다.
매력은 통제권이다. 음성 데이터는 민감하다. 클라우드 음성 복제는 내 목소리와 대본을 글자당 요금을 매기는 회사에 업로드한다는 뜻이다. Voicebox는 이를 뒤집는다. 계정도, 글자당 요금도, 사용량 제한도 없다. 모델이 내 하드웨어에서 돌기 때문이다. 대가는 설정이다. 몇 GB짜리 모델을 내려받아야 하고, 첫 실행은 웹 도구보다 느리며, 결과는 컴퓨터의 GPU나 통합 메모리 양에 달려 있다.
프로필만 있으면 단순한 AI 음성 생성 도구로도 쓸 수 있다. 그래도 이는 MIT 라이선스의 오픈 프로젝트이지 완성된 소비자 제품이 아니다. 클라우드 동기화 같은 일부 기능은 아직 출시 예정으로 표시되어 있고, Linux 사용자는 당분간 소스에서 직접 빌드해야 한다. 클릭 한 번의 편리함을 원한다면 이 도구가 아니다. 하지만 정말로 내가 소유하는 음성 복제 소프트웨어를 원한다면, 몇 안 되는 진지한 선택지 중 하나다.
시작하기
- 공식 사이트에서 macOS나 Windows용 앱을 내려받거나, Linux에서 Docker로 실행하거나 소스에서 실행한다.
- Profiles 탭을 열고 New Profile을 클릭한 뒤, 클립을 업로드하거나 마이크로 녹음하거나 시스템 오디오를 캡처해 샘플을 추가한다.
- 사용할 TTS 엔진을 내려받는다. 각 엔진은 내 컴퓨터의 로컬 음성 모델이 된다.
- 텍스트를 입력하고 프로필과 엔진을 고른 뒤 생성한다. 받아쓰기는 전역 단축키를 누른 채 어떤 텍스트 필드에든 말하면 된다.
- 선택: Claude Code나 Cursor 같은 MCP 클라이언트에 음성을 연결해 에이전트가 복제한 목소리로 말하게 한다.
제품 정보
Voicebox의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.
추천 대상
이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.
사용자
- 개인정보를 중시하는 창작자
- 팟캐스터와 영상 편집자
- 개발자와 AI 에이전트 사용자
작업
- 짧은 샘플에서 음성 복제
- 일괄 텍스트 음성 변환
- 모든 앱에 받아쓰기
활용 상황
- 대본을 여러 캐릭터의 대화로 바꾸기
- AI 에이전트에 목소리 주기
- 오프라인이나 비행기에서 작업하기
주요 기능
몇 초 만에 되는 음성 복제
Voicebox는 긴 학습 대신 짧은 샘플에서 음성 프로필을 만든다. 오디오 파일을 넣거나, 마이크로 최대 30초를 녹음하거나, 시스템에서 재생 중인 오디오를 캡처할 수 있다. 영상이나 팟캐스트에서 바로 음성을 복제할 수 있다는 뜻이다. 프로필은 재사용할 수 있고, 여러 샘플을 합쳐 결과를 다듬을 수도 있다. 클라우드 분을 빌리지 않고 오픈소스 음성 복제를 원하는 사람에게 이 도구의 핵심이 여기 있다.
앱 하나에 7가지 TTS 엔진
하나의 모델에 걸지 않고, Voicebox는 7가지 텍스트 음성 변환 엔진을 묶어 전환할 수 있게 한다. Qwen3-TTS는 다국어 복제를 맡고, Chatterbox Multilingual은 가장 넓은 언어 범위를 덮으며, Chatterbox Turbo는 웃음과 한숨 같은 준언어 태그를 더하고, Kokoro는 작고 CPU에서도 빠르다. 최고의 엔진은 없고, 어떤 작업에 맞는 엔진만 있을 뿐이다. 일마다 골라 쓰는 편이 한 업체가 내놓는 것에 묶이는 것보다 낫다.
어디에나 붙여 넣는 받아쓰기
전역 단축키가 내 말을 어떤 앱에서든 텍스트로 바꾼다. 키를 누른 채 말하고 놓으면 전사문이 활성 필드나 클립보드에 들어간다. macOS와 Windows의 모든 앱에 받아쓰기를 할 수 있게 하는 부분이고, 모든 텍스트 상자에 앱 내 마이크 버튼이 붙는다. 전사문과 원본 오디오는 Captures에 함께 저장되어 나중에 무슨 말을 했는지 다시 볼 수 있다. 긴 메시지를 손으로 타이핑하는 일에 대한 실용적인 답이다.
MCP를 통한 에이전트 음성
도구 호출 한 번, voicebox.speak이면 MCP를 지원하는 어떤 에이전트든 내가 복제한 목소리로 말할 수 있다. Claude Code, Cursor, Cline, 그리고 MCP를 말하는 무엇이든 음성 프로필에 연결할 수 있어, 화면을 보지 않고도 어느 에이전트가 응답하는지 알 수 있다. 에이전트가 시작한 클립은 모두 화면에 같은 표시를 띄우므로, 백그라운드에서 조용히 재생되는 일은 없다. 이 엔드포인트는 같은 로컬 서버에서 ACP와 A2A 같은 다른 도구 호출 프로토콜에도 맞는다.
로컬 REST API
내려받은 엔진은 각각 내 컴퓨터의 17493 포트에서 REST 엔드포인트가 된다. API 키도, 사용량 제한도, 글자당 요금도 없다. 요청이 내 컴퓨터를 떠나지 않기 때문이다. 개발자는 NPC 대사를 만들거나, 캐릭터를 현지화하거나, 앱에 음성 응답을 붙이는 데 localhost 주소로 이를 쓴다. 음성 기능을 만드는 사람에게 흔한 가격과 개인정보의 맞바꿈을 없애 준다.
페르소나와 Stories 편집기
음성 프로필은 자유로운 페르소나를 담을 수 있고, 앱의 로컬 모델이 그 목소리로 내 텍스트를 다시 쓰거나 요청에 따라 새 대사를 즉흥으로 만든다. 게임 대사, 내레이션 신호, 긴 프로젝트에서 캐릭터를 일관되게 유지하는 데 유용하다. 이어서 Stories 편집기는 여러 음성을 멀티트랙 타임라인에 올려, 여러 화자로 한 장면이나 팟캐스트 구간을 자를 수 있게 한다. 흩어진 클립을 완성된 한 편으로 바꾼다. 스튜디오는 필요 없다.
장단점
장점
- 기본이 완전 로컬이라 음성 샘플과 생성한 오디오가 내 컴퓨터에 남는다.
- MIT 라이선스로 무료이며 오픈소스이고, 계정도 글자당 청구도 없다.
- 7가지 TTS 엔진과 수십 가지 프리셋 음성으로 작업에 맞춰 모델을 고를 여지가 있다.
- REST API와 MCP 서버를 내장해 음성을 앱과 AI 에이전트에 연결하기 쉽다.
- 크로스 플랫폼 지원으로 macOS, Windows, Linux, Docker를 아우른다.
단점
- 몇 GB짜리 모델을 직접 내려받아야 해서 첫 결과까지 시간과 디스크 공간이 든다.
- Linux 사용자는 아직 미리 빌드된 바이너리를 받지 못하고 소스에서 빌드해야 한다.
- 품질이 하드웨어에 달려 있어, 제대로 된 GPU나 Apple Silicon이 없는 구형 컴퓨터는 느리게 느껴진다.
- 클라우드 백업과 동기화가 아직 출시 예정으로 표시되어 있어 여러 기기 사용은 준비되지 않았다.
자주 묻는 질문
그렇다. 앱 전체가 영구히 무료이며 오픈소스로, 복제, 받아쓰기, 모든 TTS 엔진, MCP 지원을 포함한다. 모든 것이 로컬에서 돌아가므로 계정도 사용 상한도 없다. 유일한 유료 등급은 선택 사항인 클라우드 백업과 동기화이며, 이는 아직 출시되지 않았다.
관련 콘텐츠
Voicebox와 관련된 도구, 스킬, 아티클을 살펴보세요.
Voicebox 대안
Prosp
Prosp · 글쓰기 · 음성 및 언어 · 마케팅Prosp는 에이전시와 영업팀을 위해 만들어진 AI LinkedIn 아웃리치 도구다. 잠재 고객마다 자신의 목소리로 메시지와 음성 메시지를 작성해, 상대가 실제로 답장하도록 만든다. 계정을 연결하고 리드를 찾고, AI가 개인화된 메시지를 대량으로 작성해 보내도록 맡긴다. 전부 하나의 받은편지함에서 처리한다. 대량으로 아웃바운드를 돌리는 사람을 위해 만들어졌다. 그게 이 제품의 전부다. 그래도 모든 접점은 인간처럼 느껴져야 한다.
Wordly AI Translation
Wordly · 음성 및 언어 · 생산성Wordly AI Translation은 회의, 콘퍼런스, 행사를 위해 만들어진 실시간 AI 번역 및 자막 플랫폼이다. 60개 이상 언어로 실시간 번역, 자막, 스크립트, 요약을 제공하며, 참가자는 전용 헤드셋 대신 QR 코드를 스캔하거나 링크를 열어 참여한다. Zoom, Microsoft Teams, Google Meet, Webex와 함께 작동하고, 세션마다 사람 통역사를 고용하지 않고도 다국어 접근을 원하는 조직을 겨냥한다. 그게 전부다.
Musicful
Musicful AI · 음성 및 언어 · 동영상Musicful은 텍스트를 몇 분 만에 음악으로 바꾸는 AI 음악 생성기이자 AI 뮤직비디오 제작 도구다. 텍스트 프롬프트, 가사 한 묶음, 또는 흥얼거린 멜로디를 주면 보컬과 악기가 들어간 완성 트랙을 돌려준다. AI 곡 생성기로도 쓰이고, 직접 만든 곡으로 뮤직비디오를 만들며, AI 커버 도구와 개발자용 API도 제공한다. 웹 브라우저와 Android 앱에서 실행되므로 데스크톱에서 곡을 시작하고 휴대폰에서 이어서 할 수 있다.
