
SKI
SKI · 音声・言語 · コーディング
SKIは、あなたとAIコーディングエージェントの間に双方向の音声ループを作る無料のオンデバイス音声アシスタントだ。AIコーディングエージェント向けの音声アシスタントと考えるとよい。望む結果を声に出すと、Claude Code、Cursor、Codex、Gemini CLI、OpenClawといったツールが作業をこなし、SKIが結果を自然な声で読み上げる。音声認識と声そのものが自分のマシン上で動くため、音声と文字起こしは誰かのクラウドではなく自分のディスクに残る。音声コーディングが会話になる。

SKI について
SKIとは
SKIは、macOS、Windows、Linux向けのデスクトップウィジェットで、一つの考えを軸に作られている。コーディングエージェントとの対話は、書き取りではなく会話のように感じられるべきだ、という考えだ。プロンプトを打ち込んで応答を読む代わりに、欲しいものを声に出して説明すれば、エージェントが声で答える。入力側の音声認識と出力側の読み上げ音声は、アプリが処理する。
魅力は速さとプライバシーにある。声での依頼は打ち込むより速く、ループ全体がローカルで動くため音声がアップロードされることはない。SKIは永久無料で、ローカルモデルを用意すればオフラインでも動く。反復性疲労を抱える開発者や、キーボードとターミナルを行き来するのに疲れた人にとって、この組み合わせこそが要点だ。打つ代わりに話す。
制限は先に知っておく価値がある。すべてはローカルの音声モデルとローカルの声に依存し、快適に動かすにはそれなりのハードウェアが要る。対応するエージェントの一覧も限定的だ。使いたいツールがそこになければ、SKIはまだ役に立たない。会議の文字起こしやカレンダーへの自動参加は要素が増え、こうした領域が最も調整を要する。
はじめかた
- 公式サイトからインストーラーをダウンロードする。MacならDMG、WindowsならEXEだ。セットアップウィザードがマイク、声、ホットキーの選択を案内する。カードは不要。
- コーディングエージェント(Claude Code、Cursor、Codex、または対応するもの)を開き、セッションで
skiと入力してウィジェットに接続する。 - ステータスドットが緑になるのを待つ。これでエージェントがあなたの声を聞き、話し返せる状態になる。
- 依頼を声に出す。あなたの言葉はテキストとしてエージェントに届き、作業が始まる。
- 終わると、エージェントが声で答える。ホバーの操作でマイクをミュートし、テキストのみの応答に切り替え、次の発話にスクリーンショットを添付できる。
AIツール情報
SKIの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- 打つより話すほうが速い開発者。音声ループはプロンプトを一文に変え、キーボードを要らない。
- 反復性疲労や手の痛みを抱えるコーダー。音声操作はタイピングの多くを置き換えるが、ローカルモデルにはそれなりの性能のマシンが要る。
- 機密性の高いコードベースを扱うプライバシー重視のチーム。音声と文字起こしはマシンから出ないため、機密がどこかへ送られることはない。
タスク
- 機能を説明してエージェントに作らせる。望む結果を平易な言葉で示せば、エージェントがファイルを読み、コードを書き、テストを実行する。
- ハンズフリーで変更を確認する。エージェントが声で答えるため、目はコードに、手はキーボードから離しておける。
- 会議をローカルで文字起こしする。Zoom、Meet、Teamsのマイクとシステム音声を録音し、発言者ごとにタグ付けする。通話にボットは入らない。
シーン
- 複数のリポジトリを同時に扱う。複数のプロジェクトを束ねれば、それぞれが自分の声で答えるので、誰が話しているか常に分かる。
- エージェントをスタンドアップに参加させる。Google Calendarを接続すれば、SKIが参加者または静かな議事録係を時間どおりに会議へ送り込む。
- オフラインや閉鎖されたネットワークで作業する。モデルはローカルで動くため、インターネット接続なしでも音声ループは動き続ける。
主な機能
完全オンデバイスの音声と声
会話の両半分があなたのコンピューター上で動く。音声認識が聞き取り、ニューラル音声が話す。送り先のクラウドが存在しないため、何もアップロードされない。実質的な効果として、音声と文字起こしはディスクに残り、ローカル音声認識がループをオフラインで動かし続ける。私的なコードや顧客データを扱う人にとって、これは懸念をまるごと一つ取り除く。
書き取りではなく本物の会話
書き取りツールは入力テキストで止まる。SKIはエージェントの応答を読み上げて、ループを閉じる。全二重のエコーキャンセリングにより、スピーカーを開いたまま文の途中で割り込んでも声が届く。プッシュトゥトークもヘッドセットも要らない。話し終わりを察知して考えを丸ごと送るので、やり取りが自然に感じられる。覚える文法はない。話すだけだ。
リアルタイムのエージェント状態とマルチプロジェクトの振り分け
緑のドットは、エージェントが実際に聞いていることを示す。ポーリングではなくリアルタイムだ。複数のリポジトリを同時に束ね、異なるエージェントをまたぐこともでき、プロジェクト名をクリックして切り替える。各プロジェクトは自分の声で答える。三つのタスクを同時にこなすセッションでも、どれが答えたか一目で分かる。
送信前に承認するレビューモード
これをオンにすると、文字起こしはまず編集可能な吹き出しに入る。チェックマークを押すまでエージェントには何も届かず、聞き間違えた語を直したり、悪い依頼を実行前に止めたりできる。エージェントが自力でファイルを書き、消せるだけに、こうした安全装置は重要だ。早めに入れておく価値がある。
オンデマンドのスクリーンショット
ホットキーで画面を取り込み、その画像が次の音声依頼に添えられる。エージェントは、あなたが見ているものを見る必要があるとき、自分でスクリーンショットを撮ることもできる。レイアウトの不具合や表示の乱れを声で説明するのは、見せるよりずっと遅いからだ。なぜ重要か。絵はいつでも段落に勝るからだ。
ローカルの会議レコーダーと文字起こし
SKIはマイクと室内音声を取り込み、デバイス上で文字起こしする。発言者タグ付きのトラックと、通話中のライブ文字起こし付きだ。録音時間と保持期間は無制限で、Markdownかプレーンテキストに書き出せる。通話にボットが入らないため、他の参加者には録音機器ではなく、あなた自身が見える。
通話の中のエージェント
会議のURLをウィジェットに貼ると、コーディングエージェントがライブ参加者として入る。発言し、聞き、発表し、あるいは静かにメモを取る。画面を見て、画面共有でき、チャットを読み、送信もする。Google Meet、Teams、Zoomに対応し、ウィジェットから会議を立ち上げることもできる。
エージェントスタック全体で機能する
一つのskillが、開発者がすでに使っているエージェントをカバーする。Claude Code、Cursor、Codex、Gemini CLI、OpenClaw、その他もろもろだ。接続はエージェントごとにワンクリックなので、プロジェクト間でツールを替えても音声ループを失わない。この広さが、単一ツールの小技ではなく習慣にする。
メリットとデメリット
メリット
- 永久無料で、始めるのにアカウントもクレジットカードも要らない。インストールしてすぐ使える。
- 音声と声がどちらもオンデバイスで動くため、音声と文字起こしがマシンから出ない。
- Claude Code、Cursor、Codex、Gemini CLIを含む幅広いコーディングエージェントに対応する。
- 全二重の割り込みで、プッシュトゥトークなしにエージェントへ割り込み、声が届く。
- ローカルの会議録音と保持が無制限で、Markdownかテキストに書き出せる。
デメリット
- ローカルの音声・声モデルを快適に動かすにはそれなりの性能のマシンが要り、古いハードウェアはもたつくことがある。
- 公開APIがなく、SKI流の音声を自作ツールやパイプラインに組み込む道が閉ざされている。
- エージェント対応は固定リストで、使うコーディングツールが含まれなければ代替がない。
- カレンダー自動参加などの会議機能は追加設定と、接続された稼働中のプロジェクトが要る。
よくある質問
AIコーディングエージェントに双方向の音声ループを加える。欲しいものを言えば、エージェントがあなたのプロジェクトで作業し、SKIが自然な声で応答を読み上げる。すべて自分のコンピューター上で動く。
関連コンテンツ
SKIに関連するツール、スキル、記事を探す。
SKIの代替ツール
Prosp
Prosp · ライティング · 音声・言語 · マーケティングProspは、代理店や営業チーム向けに作られたAI LinkedInアプローチツールだ。見込み客ごとに自分の声でメッセージとボイスメッセージを書き、相手が本当に返信するように仕向ける。アカウントをつなぎ、リードを見つけ、AIにパーソナライズされたメッセージを大量に下書きさせて送信させる。すべて1つの受信トレイから行える。大量のアウトバウンドを回す人向けにできている。それがこの製品の売り込みのすべてだ。それでも各接点は人間らしく感じられなければならない。
Wordly AI Translation
Wordly · 音声・言語 · 生産性向上Wordly AI Translationは、会議・カンファレンス・イベント向けに作られたリアルタイムAI翻訳・字幕プラットフォームだ。60以上の言語でライブ翻訳、字幕、文字起こし、要約を提供し、参加者は専用ヘッドセットを使わず、QRコードを読み取るかリンクを開くだけで参加できる。Zoom、Microsoft Teams、Google Meet、Webexと連携し、セッションごとに人間の通訳を雇わずに多言語対応したい組織に向く。それだけのことだ。
Musicful
Musicful AI · 音声・言語 · 動画Musicfulは、テキストを数分で音楽に変えるAI音楽ジェネレーター兼AIミュージックビデオ作成ツール。テキストの指示、歌詞、あるいは口ずさんだメロディーを渡すと、ボーカルと楽器が入った完成したトラックを返す。AI楽曲ジェネレーターとしても機能し、自分が作った曲からミュージックビデオを生成し、AIカバーツールと開発者向けAPIも備える。ウェブブラウザとAndroidアプリで動くので、パソコンで曲を始めてスマホで続きを進められる。
