Voicebox
Jamie Pine · Stimme & Sprache
Voicebox ist ein kostenloses Open-Source-Studio zum Klonen von Stimmen für macOS und Windows, das eine Stimme in Sekunden klont, Sprache über sieben TTS-Engines erzeugt und die Daten lokal hält.

Über Voicebox
Was ist Voicebox
Voicebox ist ein lokales KI-Stimmstudio, das den gesamten Sprachkreislauf auf einem Rechner schließt. Fast alle Werkzeuge wählen eine Seite: Ein Cloud-Dienst übernimmt Text zu Sprache, ein anderer das Diktieren, und die Aufnahmen liegen auf dem Server von jemand anderem. Voicebox macht beide Enden lokal. Sie legen ein Stimmprofil aus einer kurzen Aufnahme an, nutzen es zum Sprechen und zum Zuhören, und jedes Modell und jede Aufnahme bleibt auf der Festplatte.
Der Reiz ist die Kontrolle. Stimmdaten sind sensibel. Stimmklonen in der Cloud bedeutet, die eigene Stimme und die Skripte an ein Unternehmen hochzuladen, das pro Zeichen abrechnet. Voicebox dreht das um: kein Konto, keine Gebühren pro Zeichen und keine Nutzungsgrenzen, weil die Modelle auf Ihrer Hardware laufen. Der Preis dafür ist die Einrichtung. Sie laden Modelle mit mehreren Gigabyte herunter, der erste Lauf ist langsamer als bei einem Web-Werkzeug, und die Ergebnisse hängen davon ab, wie viel GPU oder Unified Memory Ihr Rechner hat.
Sobald ein Profil existiert, funktioniert es außerdem als einfacher KI-Stimmgenerator. Trotzdem ist es ein offenes Projekt unter MIT-Lizenz, kein fertiges Verbraucherprodukt. Einige Teile, etwa die Cloud-Synchronisierung, sind noch als "demnächst" gekennzeichnet, und Linux-Nutzer müssen vorerst aus dem Quellcode bauen. Wer Komfort per Klick sucht, ist hier falsch. Als Software zum Klonen von Stimmen, die Ihnen wirklich gehört, ist es aber eine der wenigen ernsthaften Optionen.
Erste Schritte
- Laden Sie die App für macOS oder Windows von der offiziellen Seite herunter, oder starten Sie sie mit Docker beziehungsweise aus dem Quellcode unter Linux.
- Öffnen Sie den Tab Profiles und klicken Sie auf New Profile; fügen Sie dann eine Aufnahme hinzu, indem Sie einen Clip hochladen, über das Mikrofon aufnehmen oder den Systemton mitschneiden.
- Laden Sie die TTS-Engine herunter, die Sie nutzen wollen. Jede wird zu einem lokalen Stimmmodell auf Ihrem Rechner.
- Tippen Sie Ihren Text ein, wählen Sie Profil und Engine, und erzeugen Sie die Sprache. Zum Diktieren halten Sie die globale Tastenkombination gedrückt und sprechen in ein beliebiges Textfeld.
- Optional: Binden Sie eine Stimme an einen MCP-Client wie Claude Code oder Cursor, damit der Agent mit Ihrer geklonten Stimme spricht.
Produktinformationen
Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von Voicebox.
Am besten für
Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.
Nutzer
- Datenschutzbewusste Kreative
- Podcaster und Videoschaffende
- Entwickler und Nutzer von KI-Agenten
Aufgaben
- Stimmklonen aus einer kurzen Aufnahme
- Text zu Sprache im Stapel
- Diktieren in jede App
Szenarien
- Ein Skript in einen Dialog mit mehreren Figuren verwandeln
- KI-Agenten eine Stimme geben
- Offline oder im Flugzeug arbeiten
Wichtigste Funktionen
Stimmklonen aus wenigen Sekunden
Voicebox baut ein Stimmprofil aus einer kurzen Aufnahme statt aus einer langen Trainingssitzung. Sie können eine Audiodatei ablegen, bis zu 30 Sekunden über das Mikrofon aufnehmen oder den Ton mitschneiden, der auf Ihrem System läuft. So klonen Sie eine Stimme direkt aus einem Video oder Podcast. Profile sind wiederverwendbar. Sie können mehrere Aufnahmen kombinieren, um das Ergebnis zu schärfen. Für alle, die Open-Source-Stimmklonen ohne gemietete Cloud-Minuten wollen, ist das der Kern des Werkzeugs.
Sieben TTS-Engines in einer App
Statt auf ein einziges Modell zu setzen, bündelt Voicebox sieben Text-zu-Sprache-Engines und lässt Sie zwischen ihnen wechseln. Qwen3-TTS übernimmt mehrsprachiges Klonen, Chatterbox Multilingual deckt die größte Sprachspanne ab, Chatterbox Turbo ergänzt paralinguistische Tags wie Lachen und Seufzen, und Kokoro bleibt winzig und schnell auf der CPU. Es gibt keine beste Engine, nur die richtige für eine Aufgabe. Nach Bedarf zu wählen ist besser, als an das gebunden zu sein, was ein einzelner Anbieter liefert.
Diktieren, das überall einfügt
Eine globale Tastenkombination macht aus Ihrer Sprache Text in jeder App. Halten Sie die Tasten, sprechen Sie, lassen Sie los; das Transkript fällt ins aktive Feld oder in die Zwischenablage. Das ist der Teil, mit dem Sie unter macOS und Windows in jede App diktieren, und jedes Textfeld bekommt eine Mikrofon-Schaltfläche in der App. Transkript und Originalton bleiben zusammen in Captures, sodass Sie später nachvollziehen können, was Sie gesagt haben. Eine praktische Antwort auf das Tippen langer Nachrichten von Hand.
Agentenstimme über MCP
Ein einziger Werkzeugaufruf, voicebox.speak, lässt jeden MCP-fähigen Agenten mit einer Stimme sprechen, die Sie geklont haben. Claude Code, Cursor, Cline und alles andere, das MCP spricht, kann sich an ein Stimmprofil binden, sodass Sie hören, welcher Agent antwortet, ohne hinzusehen. Jeder vom Agenten gestartete Clip zeigt dieselbe Pille am Bildschirm, damit nichts stumm im Hintergrund läuft. Der Endpunkt passt auf demselben lokalen Server auch zu anderen Werkzeugaufruf-Protokollen wie ACP und A2A.
Lokale REST-API
Jede Engine, die Sie herunterladen, wird zu einem REST-Endpunkt auf Ihrem eigenen Rechner, auf Port 17493. Es gibt keine API-Schlüssel, keine Nutzungsgrenzen und keine Gebühren pro Zeichen, weil die Anfragen Ihren Computer nie verlassen. Entwickler nutzen sie, um NPC-Dialoge zu erzeugen, Figuren zu lokalisieren oder Sprachantworten in eine App einzubauen, alles gegen eine localhost-Adresse. Für alle, die Sprachfunktionen bauen, fällt damit der übliche Kompromiss zwischen Preis und Privatsphäre weg.
Persönlichkeiten und der Stories-Editor
Ein Stimmprofil kann eine freie Persönlichkeit tragen, und das lokale Modell der App schreibt Ihren Text in dieser Stimme um oder improvisiert auf Wunsch eine neue Zeile. Das hilft bei Spieldialogen, Erzählhinweisen oder dabei, eine Figur über ein langes Projekt hinweg konsistent zu halten. Der Stories-Editor legt dann mehrere Stimmen auf eine mehrspurige Zeitleiste, sodass Sie eine Szene oder ein Podcast-Segment mit mehreren Sprechenden schneiden. Er macht aus verstreuten Clips ein fertiges Stück. Ohne Studio.
Vor- und Nachteile
Vorteile
- Standardmäßig vollständig lokal, sodass Stimmaufnahmen und erzeugtes Audio auf Ihrem Rechner bleiben.
- Kostenlos und Open Source unter MIT-Lizenz, ohne Konto und ohne Abrechnung pro Zeichen.
- Sieben TTS-Engines und Dutzende voreingestellte Stimmen geben Ihnen Raum, das Modell an die Aufgabe anzupassen.
- Die integrierte REST-API und der MCP-Server machen es leicht, Stimme in Apps und KI-Agenten einzubinden.
- Die plattformübergreifende Unterstützung deckt macOS, Windows, Linux und Docker ab.
Nachteile
- Sie laden die Modelle mit mehreren Gigabyte selbst herunter, was vor dem ersten Ergebnis Zeit und Speicher kostet.
- Linux-Nutzer bekommen noch kein fertiges Binärpaket und müssen aus dem Quellcode bauen.
- Die Qualität hängt von Ihrer Hardware ab, ältere Rechner ohne ordentliche GPU oder Apple Silicon werden also langsam sein.
- Cloud-Backup und Sync sind weiterhin als "demnächst" gelistet, die Nutzung auf mehreren Geräten ist also noch nicht so weit.
Häufige Fragen
Ja. Die vollständige App ist dauerhaft kostenlos und Open Source, einschließlich Klonen, Diktieren, aller TTS-Engines und MCP-Unterstützung. Es gibt kein Konto und keine Nutzungsobergrenze, weil alles lokal läuft. Die einzigen Bezahltarife sind das optionale Cloud-Backup und die Synchronisierung, die noch nicht gestartet sind.
Ähnliche Inhalte
Entdecke passende Tools, Skills und Artikel zu Voicebox.
Alternativen zu Voicebox
Prosp
Prosp · Schreiben · Stimme & Sprache · MarketingProsp ist ein KI-Tool für LinkedIn-Ansprache, gebaut für Agenturen und Vertriebsteams, und es schreibt die Nachricht und die Sprachnachricht mit Ihrer eigenen Stimme für jeden Interessenten, damit sie wirklich antworten. Sie verbinden Ihre Konten, finden Leads und lassen die KI personalisierte Nachrichten in großem Umfang entwerfen und versenden, alles aus einem Posteingang. Es ist für Menschen gemacht, die Outbound in großem Stil betreiben. Das ist das ganze Versprechen. Jeder Kontaktpunkt muss trotzdem menschlich wirken.
Wordly AI Translation
Wordly · Stimme & Sprache · ProduktivitätWordly AI Translation ist eine KI-Echtzeitübersetzungs- und Untertitelungsplattform für Besprechungen, Konferenzen und Veranstaltungen. Sie liefert Live-Übersetzung, Untertitel, Transkripte und Zusammenfassungen in mehr als 60 Sprachen, und Teilnehmer treten per QR-Code-Scan oder über einen Link bei, statt eigene Kopfhörer zu nutzen. Die Plattform arbeitet mit Zoom, Microsoft Teams, Google Meet und Webex zusammen und richtet sich an Organisationen, die mehrsprachigen Zugang wollen, ohne für jede Sitzung menschliche Dolmetscher zu engagieren. So einfach ist das.
Musicful
Musicful AI · Stimme & Sprache · VideoMusicful ist ein KI-Musikgenerator und KI-Musikvideo-Ersteller, der Text in Minuten in Musik verwandelt. Du gibst einen Text, einen Songtext oder eine gesummte Melodie ein und erhältst einen fertigen Track mit Gesang und Instrumenten. Er dient außerdem als KI-Songgenerator, erstellt Musikvideos aus den Songs, die du machst, und bietet ein KI-Cover-Werkzeug plus eine Entwickler-API. Die Plattform läuft im Webbrowser und über eine Android-App, sodass du einen Song am Desktop beginnen und am Handy fortsetzen kannst.
