Voicebox

Voicebox

Jamie Pine · 音声・言語

VoiceboxはmacOSとWindows向けの無料・オープンソースの音声クローン制作スタジオ。数秒で声をクローンし、7種類のTTSエンジンで音声を生成し、データをローカルに保つ。

Voicebox の画面プレビュー

Voicebox について

Voiceboxとは何か

Voiceboxは、音声の流れを1台のコンピューターで完結させるローカルAI音声スタジオだ。ほとんどのツールは片側だけを担う。あるクラウドサービスはテキスト読み上げを、別のサービスはディクテーションを担当し、あなたのサンプルは他人のサーバーに置かれる。Voiceboxは両端をローカルで処理する。短いサンプルから声のプロファイルを作り、それを使って話し、聴く。モデルも録音もすべてディスク上に残る。

魅力は主導権だ。音声データは繊細だ。クラウドでの音声クローンは、声と台本を文字単位で課金する企業にアップロードすることを意味する。Voiceboxはそれを逆転させる。アカウントも、文字ごとの料金も、回数制限もない。モデルが自分のハードウェアで動くからだ。代償はセットアップにある。数ギガバイトのモデルを自分でダウンロードし、初回の実行はWebツールより遅く、結果はマシンのGPUやユニファイドメモリの量に左右される。

プロファイルさえあれば、単純なAI音声生成ツールとしても機能する。それでもMITライセンスのオープンなプロジェクトであり、完成した消費者向け製品ではない。クラウド同期など一部はまだ「近日公開」と表示され、Linuxユーザーは今のところソースからビルドする必要がある。ワンクリックの手軽さを求めるなら、これは向いていない。だが、本当に自分が所有できる音声クローンソフトとしては、数少ない本気の選択肢のひとつだ。

はじめかた

  1. 公式サイトからmacOSまたはWindows版をダウンロードする。LinuxではDockerで実行するか、ソースから起動する。
  2. Profilesタブを開いてNew Profileをクリックし、クリップをアップロードするか、マイクで録音するか、システム音声を取り込んでサンプルを追加する。
  3. 使いたいTTSエンジンをダウンロードする。それぞれがマシン上のローカル音声モデルになる。
  4. テキストを入力し、プロファイルとエンジンを選んで生成する。ディクテーションでは、グローバルショートカットを押しながら任意のテキスト欄に話しかける。
  5. 任意: Claude CodeやCursorのようなMCPクライアントに声を紐づけ、エージェントがクローンした声で話すようにする。

AIツール情報

Voiceboxの料金、対応プラットフォーム、性能を簡単に確認できます。

無料プランはい
有料プラン$0 - $48/yr
プラットフォームmacOS, Windows, Linux, Docker
開発元Jamie Pine
カテゴリ音声・言語
リリース日Jan 2025
最終更新Aug 2025
サイト訪問数435.4K
サイト世界ランキング117K
API提供状況はい

こんな人におすすめ

このツールが最も力を発揮するユーザー、タスク、シーン。

ユーザー

  • プライバシーを重視するクリエイター
  • ポッドキャスターや動画編集者
  • 開発者とAIエージェントの利用者

タスク

  • 短いサンプルからの音声クローン
  • バッチでのテキスト読み上げ
  • あらゆるアプリへのディクテーション

シーン

  • 台本を複数キャラクターの対話に変える
  • AIエージェントに声を与える
  • オフラインや機内で作業する

主な機能

数秒でできる音声クローン

Voiceboxは長い学習ではなく短いサンプルから声のプロファイルを組む。音声ファイルを放り込む、マイクから最大30秒録音する、システムで再生中の音声を取り込む、といった方法が使える。つまり動画やポッドキャストから直接声をクローンできる。プロファイルは再利用でき、複数のサンプルを組み合わせて精度を上げることも可能だ。クラウドの分数を借りずにオープンソースの音声クローンを使いたい人にとって、ここがツールの中核になる。

1つのアプリに7つのTTSエンジン

1つのモデルに賭けるのではなく、Voiceboxは7つのテキスト読み上げエンジンを同梱し、切り替えられるようにする。Qwen3-TTSは多言語クローンを担い、Chatterbox Multilingualは最も広い言語範囲をカバーし、Chatterbox Turboは笑いやため息といったパラ言語タグを加え、Kokoroは小さくCPUでも速いままだ。最良のエンジンはなく、その作業に合うものが1つあるだけだ。用途ごとに選ぶほうが、1つのベンダーの提供物に縛られるより良い。

どこにでも貼り付くディクテーション

グローバルショートカットが、あなたの話し言葉をどのアプリでもテキストに変える。キーを押しながら話して離すと、書き起こしが入力中の欄やクリップボードに入る。macOSとWindowsであらゆるアプリにディクテーションできるのはこの部分で、どのテキスト欄にもアプリ内マイクボタンが付く。書き起こしと元の音声はCapturesに一緒に保存されるので、後から話した内容を振り返れる。長いメッセージを手で打つことへの実用的な答えだ。

MCP経由のエージェント音声

1回のツール呼び出しvoicebox.speakで、MCP対応のあらゆるエージェントが、あなたがクローンした声で話せる。Claude Code、Cursor、Cline、そしてMCPを話すものなら何でも声のプロファイルに紐づけられるので、画面を見なくてもどのエージェントが応答しているか分かる。エージェントが起こしたクリップはどれも同じ画面上のピルを表示するため、バックグラウンドで無音のまま再生されることはない。このエンドポイントは同じローカルサーバー上でACPやA2Aなど他のツール呼び出しプロトコルにも対応する。

ローカルREST API

ダウンロードしたエンジンはそれぞれ、自分のマシンのポート17493でRESTエンドポイントになる。APIキーも、回数制限も、文字ごとの料金もない。リクエストが自分のコンピューターから出ないからだ。開発者はNPCの台詞の生成、キャラクターのローカライズ、アプリへの音声返信の追加などに、localhostアドレスに対して使う。音声機能を作る人にとって、料金とプライバシーのいつものトレードオフを取り除いてくれる。

パーソナリティとStoriesエディター

声のプロファイルには自由なパーソナリティを持たせられ、アプリのローカルモデルがその声でテキストを書き換えたり、要求に応じて新しい台詞を即興で作ったりする。ゲームの対話、ナレーションのキュー、長いプロジェクトでキャラクターを一貫させるのに便利だ。さらにStoriesエディターは複数の声をマルチトラックのタイムラインに並べるので、複数の話者でシーンやポッドキャストの一区切りを切れる。散らばったクリップが1つの作品になる。スタジオは要らない。

メリットとデメリット

メリット

  • 既定で完全にローカルなので、声のサンプルと生成した音声は自分のマシンに残る。
  • MITライセンスで無料かつオープンソース。アカウントも文字ごとの課金もない。
  • 7つのTTSエンジンと数十のプリセット音声があり、作業に合わせてモデルを選ぶ余地がある。
  • REST APIとMCPサーバーを内蔵し、音声をアプリやAIエージェントに組み込みやすい。
  • クロスプラットフォーム対応でmacOS、Windows、Linux、Dockerをカバーする。

デメリット

  • 数ギガバイトのモデルは自分でダウンロードするため、最初の結果までに時間とディスク容量がかかる。
  • Linuxユーザーはビルド済みバイナリをまだ入手できず、ソースからビルドする必要がある。
  • 品質はハードウェア次第で、まともなGPUもApple Siliconもない古いマシンでは遅く感じる。
  • クラウドのバックアップと同期はまだ「近日公開」とされており、複数デバイスでの利用は整っていない。

よくある質問

はい。アプリ全体が永久に無料でオープンソースで、クローン、ディクテーション、すべてのTTSエンジン、MCP対応を含む。すべてローカルで動くため、アカウントも利用上限もない。有料なのは任意のクラウドバックアップと同期だけで、これはまだ提供が始まっていない。

関連コンテンツ

Voiceboxに関連するツール、スキル、記事を探す。

Voiceboxの代替ツール

Prosp

Prosp

Prosp · ライティング · 音声・言語 · マーケティング

Prospは、代理店や営業チーム向けに作られたAI LinkedInアプローチツールだ。見込み客ごとに自分の声でメッセージとボイスメッセージを書き、相手が本当に返信するように仕向ける。アカウントをつなぎ、リードを見つけ、AIにパーソナライズされたメッセージを大量に下書きさせて送信させる。すべて1つの受信トレイから行える。大量のアウトバウンドを回す人向けにできている。それがこの製品の売り込みのすべてだ。それでも各接点は人間らしく感じられなければならない。

有料 / $30.99 - $79.99 per account/mo詳細を見る
Wordly AI Translation

Wordly AI Translation

Wordly · 音声・言語 · 生産性向上

Wordly AI Translationは、会議・カンファレンス・イベント向けに作られたリアルタイムAI翻訳・字幕プラットフォームだ。60以上の言語でライブ翻訳、字幕、文字起こし、要約を提供し、参加者は専用ヘッドセットを使わず、QRコードを読み取るかリンクを開くだけで参加できる。Zoom、Microsoft Teams、Google Meet、Webexと連携し、セッションごとに人間の通訳を雇わずに多言語対応したい組織に向く。それだけのことだ。

有料 / $0 - $150/mo詳細を見る
Musicful

Musicful

Musicful AI · 音声・言語 · 動画

Musicfulは、テキストを数分で音楽に変えるAI音楽ジェネレーター兼AIミュージックビデオ作成ツール。テキストの指示、歌詞、あるいは口ずさんだメロディーを渡すと、ボーカルと楽器が入った完成したトラックを返す。AI楽曲ジェネレーターとしても機能し、自分が作った曲からミュージックビデオを生成し、AIカバーツールと開発者向けAPIも備える。ウェブブラウザとAndroidアプリで動くので、パソコンで曲を始めてスマホで続きを進められる。

無料 / $0 - $20/mo詳細を見る