Voicebox
Jamie Pine · Voz e linguagem
O Voicebox é um estúdio de clonagem de voz gratuito e de código aberto para macOS e Windows que clona uma voz em segundos, gera fala com sete motores TTS e mantém os dados no local.

Sobre Voicebox
O que é o Voicebox
O Voicebox é um estúdio de voz com IA local que fecha todo o ciclo da voz em um único computador. Quase toda ferramenta escolhe um lado: um serviço na nuvem cuida do texto para fala, outro cuida da ditadura, e as suas amostras ficam no servidor de outra empresa. O Voicebox faz as duas pontas no local. Você cria um perfil de voz a partir de uma amostra curta, usa para falar e para ouvir, e cada modelo e cada gravação fica no seu disco.
O atrativo é o controle. Dados de voz são sensíveis. A clonagem na nuvem significa enviar a sua voz e os seus roteiros para uma empresa que cobra por caractere. O Voicebox inverte isso: sem conta, sem taxas por caractere e sem limites de uso, porque os modelos rodam no seu hardware. O custo é a configuração. Você baixa modelos de vários gigabytes, a primeira execução é mais lenta que uma ferramenta web, e os resultados dependem de quanta GPU ou memória unificada a sua máquina tem.
Ele também funciona como um gerador de voz com IA simples assim que existe um perfil. Mesmo assim, é um projeto aberto sob licença MIT, não um produto de consumo acabado. Algumas partes, como a sincronização na nuvem, ainda estão marcadas como em breve, e no Linux é preciso compilar a partir do código-fonte por enquanto. Se você quer praticidade com um clique, não é esse. Mas como software de clonagem de voz que de fato é seu, é uma das poucas opções sérias.
Como começar
- Baixe o app para macOS ou Windows no site oficial, ou execute com Docker ou a partir do código-fonte no Linux.
- Abra a aba Profiles e clique em New Profile; adicione uma amostra enviando um clipe, gravando pelo microfone ou capturando o áudio do sistema.
- Baixe o motor TTS que quiser usar. Cada um vira um modelo de voz local na sua máquina.
- Digite o texto, escolha o perfil e o motor, e gere. Para ditar, segure o atalho global e fale em qualquer campo de texto.
- Opcional: vincule uma voz a um cliente MCP como Claude Code ou Cursor para que o agente fale com a sua voz clonada.
Informações do produto
Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de Voicebox.
Ideal para
Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.
Usuários
- Criadores atentos à privacidade
- Podcasteros e editores de vídeo
- Desenvolvedores e usuários de agentes de IA
Tarefas
- Clonagem de voz a partir de uma amostra curta
- Texto para fala em lote
- Ditadura em qualquer app
Cenários
- Transformar um roteiro em diálogo com vários personagens
- Dar voz aos agentes de IA
- Trabalhar offline ou no avião
Principais recursos
Clonagem de voz em poucos segundos
O Voicebox monta um perfil de voz a partir de uma amostra curta em vez de uma longa sessão de treino. Você pode soltar um arquivo de áudio, gravar até 30 segundos pelo microfone ou capturar o áudio que toca no sistema, o que significa que dá para clonar uma voz direto de um vídeo ou podcast. Os perfis são reutilizáveis. Você pode combinar várias amostras para afinar o resultado. Para quem quer clonagem de voz de código aberto sem alugar minutos na nuvem, esse é o núcleo da ferramenta.
Sete motores TTS em um só app
Em vez de apostar em um único modelo, o Voicebox reúne sete motores de texto para fala e deixa você alternar entre eles. O Qwen3-TTS cuida da clonagem multilíngue, o Chatterbox Multilingual cobre a faixa de idiomas mais ampla, o Chatterbox Turbo adiciona tags paralinguísticas como risadas e suspiros, e o Kokoro fica pequeno e rápido na CPU. Não há um motor melhor, só o adequado para cada tarefa. Escolher por trabalho vence ficar preso ao que um único fornecedor entrega.
Ditadura que cola em qualquer lugar
Um atalho global transforma a sua fala em texto em qualquer app. Segure as teclas, fale e solte; a transcrição cai no campo em foco ou na área de transferência. É a parte que permite ditar em qualquer app no macOS e no Windows, e cada caixa de texto ganha um botão de microfone interno. A transcrição e o áudio original ficam juntos em Captures, então você pode voltar ao que falou depois. É uma resposta prática a digitar mensagens longas à mão.
Voz de agente via MCP
Uma única chamada de ferramenta, voicebox.speak, deixa qualquer agente compatível com MCP falar com uma voz que você clonou. Claude Code, Cursor, Cline e qualquer outra coisa que fale MCP podem se vincular a um perfil de voz, então você ouve qual agente responde sem olhar. Cada clipe iniciado por um agente mostra o mesmo selo na tela, então nada toca em silêncio no fundo. O endpoint também serve outros protocolos de chamada de ferramenta, como ACP e A2A, no mesmo servidor local.
API REST local
Cada motor que você baixa vira um endpoint REST na sua própria máquina, na porta 17493. Não há chaves de API, limites de uso nem taxas por caractere, porque as requisições nunca saem do seu computador. Desenvolvedores usam para gerar diálogos de NPC, localizar personagens ou adicionar respostas de voz a um app, tudo contra um endereço localhost. Para quem constrói recursos de voz, isso tira o habitual trade-off entre preço e privacidade.
Personalidades e o editor Stories
Um perfil de voz pode carregar uma personalidade livre, e o modelo local do app reescreve o seu texto nessa voz ou improvisa uma fala nova sob demanda. Isso ajuda em diálogos de jogo, indicações de narração ou para manter um personagem coerente ao longo de um projeto longo. O editor Stories então coloca várias vozes em uma linha do tempo multipista, então você pode montar uma cena ou um trecho de podcast com vários falantes. Transforma clipes soltos em uma peça final. Sem precisar de estúdio.
Prós e contras
Prós
- Totalmente local por padrão, então as amostras de voz e o áudio gerado ficam na sua máquina.
- Gratuito e de código aberto sob licença MIT, sem conta e sem cobrança por caractere.
- Sete motores TTS e dezenas de vozes predefinidas dão espaço para casar o modelo com a tarefa.
- A API REST e o servidor MCP integrados facilitam ligar a voz a apps e agentes de IA.
- O suporte multiplataforma cobre macOS, Windows, Linux e Docker.
Contras
- Você mesmo baixa os modelos de vários gigabytes, o que leva tempo e espaço em disco antes do primeiro resultado.
- Usuários de Linux ainda não têm um binário pronto e precisam compilar a partir do código-fonte.
- A qualidade depende do seu hardware, então máquinas antigas sem uma GPU decente ou Apple Silicon vão ficar lentas.
- O backup e a sincronização na nuvem ainda aparecem como em breve, então o uso em vários dispositivos não está pronto.
Perguntas frequentes
Sim. O app completo é gratuito e de código aberto para sempre, incluindo clonagem, ditadura, todos os motores TTS e suporte a MCP. Não há conta nem teto de uso, porque tudo roda no local. Os únicos níveis pagos são o backup e a sincronização opcionais na nuvem, que ainda não foram lançados.
Conteúdo relacionado
Explore ferramentas, skills e artigos relacionados a Voicebox.
Alternativas a Voicebox
Prosp
Prosp · Escrita · Voz e linguagem · MarketingO Prosp é uma ferramenta de abordagem no LinkedIn com IA, feita para agências e equipes de vendas, e escreve a mensagem e a nota de voz com a sua própria voz para cada prospect, para que eles realmente respondam. Você conecta suas contas, encontra leads e deixa a IA redigir e enviar mensagens personalizadas em escala, tudo em uma única caixa de entrada. É feita para quem faz abordagem em volume. Essa é toda a proposta. Cada toque ainda precisa parecer humano.
Wordly AI Translation
Wordly · Voz e linguagem · ProdutividadeO Wordly AI Translation é uma plataforma de tradução e legendagem com IA em tempo real feita para reuniões, conferências e eventos. Ele entrega tradução ao vivo, legendas, transcrições e resumos em mais de 60 idiomas, e os participantes entram escaneando um QR code ou abrindo um link em vez de usar fones dedicados. A plataforma funciona com Zoom, Microsoft Teams, Google Meet e Webex, e foi pensada para organizações que querem acesso multilíngue sem contratar intérpretes humanos para cada sessão. Simples assim.
Musicful
Musicful AI · Voz e linguagem · VídeoO Musicful é um gerador de música com IA e um criador de videoclipes com IA que transforma texto em música em minutos. Você entrega um texto, um conjunto de letras ou uma melodia cantarolada e ele devolve uma faixa pronta com vocais e instrumentos. Também funciona como gerador de músicas com IA, produz videoclipes a partir das músicas que você cria e oferece uma ferramenta de cover com IA mais uma API para desenvolvedores. A plataforma roda no navegador e em um app para Android, então você pode começar uma música no computador e continuar no celular.
