Voicebox
Jamie Pine · Voix et langage
Voicebox est un studio de clonage vocal gratuit et open source pour macOS et Windows qui clone une voix en quelques secondes, génère de la parole via sept moteurs TTS et garde les données en local.

À propos de Voicebox
Qu'est-ce que Voicebox
Voicebox est un studio vocal IA local qui ferme toute la boucle de la voix sur un seul ordinateur. Presque tous les outils choisissent un camp : un service cloud gère la synthèse vocale, un autre la dictée, et vos échantillons restent sur le serveur de quelqu'un d'autre. Voicebox fait les deux bouts en local. Vous créez un profil vocal à partir d'un court échantillon, vous vous en servez pour parler et pour écouter, et chaque modèle et chaque enregistrement reste sur votre disque.
L'attrait, c'est le contrôle. Les données vocales sont sensibles. Le clonage vocal dans le cloud suppose d'envoyer votre voix et vos scripts à une entreprise qui facture au caractère. Voicebox inverse la logique : pas de compte, pas de frais au caractère et pas de limite d'usage, parce que les modèles tournent sur votre matériel. Le prix à payer, c'est l'installation. Vous téléchargez des modèles de plusieurs gigaoctets, le premier lancement est plus lent qu'un outil web, et les résultats dépendent de la puissance de votre GPU ou de votre mémoire unifiée.
Il fonctionne aussi comme un générateur de voix IA simple dès qu'un profil existe. Il reste toutefois un projet ouvert sous licence MIT, pas un produit grand public abouti. Certains éléments, comme la synchronisation cloud, sont encore annoncés comme à venir, et les utilisateurs Linux doivent compiler depuis les sources pour l'instant. Si vous cherchez la simplicité en un clic, ce n'est pas ça. Mais comme logiciel de clonage vocal que vous possédez vraiment, c'est l'une des rares options sérieuses.
Pour commencer
- Téléchargez l'application pour macOS ou Windows depuis le site officiel, ou lancez-la avec Docker, ou depuis les sources sous Linux.
- Ouvrez l'onglet Profiles et cliquez sur New Profile, puis ajoutez un échantillon en important un clip, en enregistrant au micro ou en capturant l'audio du système.
- Téléchargez le moteur TTS que vous voulez utiliser. Chacun devient un modèle vocal local sur votre machine.
- Saisissez votre texte, choisissez le profil et le moteur, puis générez. Pour la dictée, maintenez le raccourci global et parlez dans n'importe quel champ de texte.
- Optionnel : associez une voix à un client MCP comme Claude Code ou Cursor pour que l'agent parle avec votre voix clonée.
Informations sur le produit
Aperçu des tarifs, des plateformes compatibles et des performances de Voicebox.
Idéal pour
Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.
Utilisateurs
- Créateurs soucieux de la vie privée
- Podcasters et monteurs vidéo
- Développeurs et utilisateurs d'agents IA
Tâches
- Clonage vocal à partir d'un court échantillon
- Synthèse vocale par lots
- Dictée dans n'importe quelle application
Cas d'usage
- Transformer un script en dialogue à plusieurs personnages
- Donner une voix aux agents IA
- Travailler hors ligne ou en avion
Fonctionnalités clés
Clonage vocal en quelques secondes
Voicebox crée un profil vocal à partir d'un court échantillon plutôt que d'une longue session d'entraînement. Vous pouvez déposer un fichier audio, enregistrer jusqu'à 30 secondes au micro ou capturer l'audio qui joue sur votre système, ce qui veut dire que vous clonez une voix directement depuis une vidéo ou un podcast. Les profils sont réutilisables. Vous pouvez combiner plusieurs échantillons pour affiner le résultat. Pour qui veut du clonage vocal open source sans louer des minutes cloud, c'est le cœur de l'outil.
Sept moteurs TTS dans une seule application
Plutôt que de parier sur un seul modèle, Voicebox réunit sept moteurs de synthèse vocale et vous laisse basculer entre eux. Qwen3-TTS gère le clonage multilingue, Chatterbox Multilingual couvre la plage de langues la plus large, Chatterbox Turbo ajoute des balises paralinguistiques comme les rires et les soupirs, et Kokoro reste minuscule et rapide sur CPU. Il n'y a pas de meilleur moteur, juste le bon pour une tâche. Choisir selon le besoin vaut mieux que de rester enfermé dans ce que fournit un seul éditeur.
Une dictée qui colle partout
Un raccourci global transforme votre parole en texte dans n'importe quelle application. Maintenez les touches, parlez, relâchez ; la transcription tombe dans le champ actif ou dans votre presse-papiers. C'est la partie qui vous laisse dicter dans n'importe quelle application sur macOS et Windows, et chaque zone de texte gagne un bouton micro intégré. La transcription et l'audio d'origine sont conservés ensemble dans Captures, donc vous pouvez revenir sur ce que vous avez dit plus tard. C'est une réponse pratique à la saisie manuelle de longs messages.
La voix des agents via MCP
Un seul appel d'outil, voicebox.speak, permet à tout agent compatible MCP de parler avec une voix que vous avez clonée. Claude Code, Cursor, Cline et tout ce qui parle MCP peuvent se lier à un profil vocal, donc vous entendez quel agent répond sans regarder. Chaque clip lancé par un agent affiche la même pastille à l'écran, donc rien ne se joue en silence en arrière-plan. Le point d'accès convient aussi à d'autres protocoles d'appel d'outils, comme ACP et A2A, sur le même serveur local.
API REST locale
Chaque moteur téléchargé devient un point d'accès REST sur votre propre machine, au port 17493. Pas de clé d'API, pas de limite d'usage et pas de frais au caractère, parce que les requêtes ne quittent jamais votre ordinateur. Les développeurs s'en servent pour générer des dialogues de PNJ, localiser des personnages ou ajouter des réponses vocales à une application, le tout via une adresse localhost. Pour qui construit des fonctions vocales, cela supprime le compromis habituel entre prix et confidentialité.
Personnalités et éditeur Stories
Un profil vocal peut porter une personnalité libre, et le modèle local de l'application réécrit votre texte avec cette voix ou improvise une réplique inédite à la demande. Pratique pour les dialogues de jeu, les indications de narration ou pour garder un personnage cohérent sur un long projet. L'éditeur Stories dispose ensuite plusieurs voix sur une timeline multipiste, donc vous montez une scène ou un segment de podcast avec plusieurs intervenants. Il transforme des clips épars en une pièce finie. Sans studio.
Avantages et inconvénients
Avantages
- Entièrement local par défaut, donc les échantillons vocaux et l'audio généré restent sur votre machine.
- Gratuit et open source sous licence MIT, sans compte et sans facturation au caractère.
- Sept moteurs TTS et des dizaines de voix prédéfinies vous laissent de la marge pour adapter le modèle à la tâche.
- L'API REST et le serveur MCP intégrés facilitent le branchement de la voix aux applications et aux agents IA.
- La prise en charge multiplateforme couvre macOS, Windows, Linux et Docker.
Inconvénients
- Vous téléchargez vous-même les modèles de plusieurs gigaoctets, ce qui prend du temps et de l'espace disque avant le premier résultat.
- Les utilisateurs Linux n'ont pas encore de binaire prêt et doivent compiler depuis les sources.
- La qualité dépend de votre matériel, donc les machines anciennes sans GPU correct ni Apple Silicon seront lentes.
- La sauvegarde et la synchronisation cloud sont toujours annoncées comme à venir, donc l'usage multi-appareils n'est pas prêt.
Questions fréquentes
Oui. L'application complète est gratuite et open source pour toujours, y compris le clonage, la dictée, tous les moteurs TTS et la prise en charge MCP. Il n'y a ni compte ni plafond d'usage, parce que tout tourne en local. Les seules offres payantes sont la sauvegarde et la synchronisation cloud optionnelles, qui n'ont pas encore été lancées.
Contenus associés
Découvrez des outils, des compétences et des articles liés à Voicebox.
Alternatives à Voicebox
Prosp
Prosp · Rédaction · Voix et langage · MarketingProsp est un outil de prospection LinkedIn par IA, conçu pour les agences et les équipes commerciales. Il rédige le message et la note vocale avec votre propre voix pour chaque prospect, pour qu'ils répondent vraiment. Vous connectez vos comptes, trouvez des leads et laissez l'IA rédiger et envoyer des messages personnalisés à grande échelle, le tout depuis une seule boîte de réception. Il est fait pour qui prospecte en volume. C'est tout l'argument. Chaque contact doit quand même paraître humain.
Wordly AI Translation
Wordly · Voix et langage · ProductivitéWordly AI Translation est une plateforme de traduction et de sous-titrage par IA en temps réel conçue pour les réunions, les conférences et les événements. Elle fournit une traduction en direct, des sous-titres, des transcriptions et des résumés dans plus de 60 langues, et les participants rejoignent la session en scannant un QR code ou en ouvrant un lien, sans casque dédié. La plateforme fonctionne avec Zoom, Microsoft Teams, Google Meet et Webex, et elle vise les organisations qui veulent un accès multilingue sans embaucher d'interprètes humains pour chaque session. C'est aussi simple que ça.
Musicful
Musicful AI · Voix et langage · VidéoMusicful est un générateur de musique par IA et un créateur de clips musicaux par IA qui transforme un texte en musique en quelques minutes. Vous lui donnez un texte, des paroles ou une mélodie fredonnée, et il renvoie une piste finie avec voix et instruments. Il fait aussi office de générateur de chansons par IA, produit des clips musicaux à partir des chansons que vous créez et propose un outil de cover par IA ainsi qu'une API pour développeurs. La plateforme tourne dans un navigateur web et via une appli Android, donc vous pouvez commencer une chanson sur ordinateur et la reprendre sur votre téléphone.
