
MulmoChat
receptron · その他 · チャットボット
MulmoChatは、会話を見て触れられるものに変えるオープンソースのマルチモーダルAIチャットインターフェースだ。テキストだけをやり取りする代わりに、AIと話し続けている間ずっと、画像、探索できる地図、遊べるミニゲームをキャンバス上に落としていく。だから一つの返答が、文字の壁ではなく、つついて遊べる小さな場面になる。receptronのチームが開発したもので、チャットインターフェースの次の行き先を試したい開発者と好奇心旺盛なユーザーに向けた研究用プロトタイプとして登場した。

MulmoChat について
MulmoChatとは
MulmoChatは、マルチモーダルAIチャットの新しい形を探る研究用プロトタイプだ。従来のチャットツールはテキストが主体で、メッセージを打てばテキストが返ってくる。MulmoChatはそれをひっくり返し、視覚的でインタラクティブなコンテンツを会話のすぐ隣に住まわせる。すべてが一つの共有キャンバス上にある。
内部はフルスタックのプロジェクトだ。クライアントはVue 3とTypeScript、Viteで動き、小さなNodeサーバーがモデル呼び出しを担う。これでブラウザ側は薄く保たれ、プロバイダのロジックは監査できる一箇所にまとまる。OpenAI、Anthropic、Google Gemini、さらにローカルのOllamaインスタンスなど複数のプロバイダに対応するので、一社に縛られない。すべてを自分のマシンに置きたいなら、画像生成はFLUXモデルを使ったローカルのComfyUIで動かせる。
最大の制約はセットアップだ。サインインするだけのホスト型製品ではない。リポジトリをクローンし、依存関係をインストールし、自分のAPIキーを、時には複数用意しないと、プロンプト一つ動かない。登録フォームではなく、ターミナルでの作業時間を見込んでおこう。
はじめ方
- GitHubからリポジトリをクローンし、
yarn installを実行して依存関係を取得する。 .envファイルを作成し、OPENAI_API_KEYやGEMINI_API_KEYなどのAPIキーを追加する。地図、検索、HTML生成のキーは任意だ。yarn devで開発サーバーを起動し、ブラウザを開いてマイクへのアクセスを許可する。- Start Voice Chatをクリックして話し始める。画像を頼めば、キャンバスに現れるのを確認できる。
- ローカルで画像を生成するには、ComfyUI Desktopをインストールし、FLUXモデルをダウンロードして、
COMFYUI_BASE_URLをそこに向ける。
AIツール情報
MulmoChatの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- 開発者:ソースを読み、プラグインを拡張し、マルチモーダルなチャットアーキテクチャを自分の手で試したいエンジニアに最も合う。Node.jsとTypeScriptへの慣れが要る。
- AIプロダクトデザイナー:視覚的な出力を会話を壊さずにチャットの流れの中へどう置けるかを研究しているなら役立つ。ローカルの開発環境を用意しよう。
- ローカルモデルを動かす遊び好き:OllamaやComfyUIをすでに手元に置いていて、クラウドAPIの請求を避けたいなら好相性だ。
タスク
- 音声主体のチャットアプリを試作する:このコードベースがあれば、音声入力とリッチなキャンバス出力を組み合わせる動く参考例が手に入る。
- ローカルの画像生成を試す:ComfyUIをチャットインターフェースにつなげば、完全オフラインの画像ワークフローがどんなものか分かる。
- モデルプロバイダを比較する:統一されたテキストAPIを使えば、同じプロンプトをOpenAI、Anthropic、Gemini、Ollamaに通して結果を見比べられる。
シーン
- 新しいインタラクションモデルに本腰を入れる前に、ちょっと触ってみたい研究セッション。
- 自分のマシンでの週末の実験。最初に一時間セットアップへ使うのも気にしないとき。
- チャットはテキストだけであるべきか議論しているチームへのデモ。
主な機能
会話がキャンバスと出会う
これが核心のアイデアだ。AIの出力はメッセージの吹き出しに閉じ込められない。キャンバス型AIチャットでは、文の途中で画像が実体化し、地図がパンやズームのできるものになる。返答が読む一文ではなく探索する空間になるのだから、チャットの感触が変わる。この転換こそプロジェクトの狙いそのものだ。
音声主体のインタラクション
MulmoChatはタイピングではなく話すことを軸に作られている。マイクへのアクセスを許可し、Start Voice Chatを押して、自然に話す。ここの音声チャットAIのループは、テキストツールに無理やり足した追加機能ではない。それがセッションの始まり方に表れている。狙いは、送信ボタン付きのテキスト欄よりも、人との会話に近いやり取りだ。キーボードは要らない。
マルチプロバイダのテキストAPI
プロバイダに依存しないエンドポイントがテキスト側を支える。GET /api/text/providersが設定済みの項目を一覧表示し、POST /api/text/generateがプロンプトとmodel、maxTokens、temperature、topPといったパラメータを受け取り、どのベンダーが処理したかに関係なく正規化した応答を返す。対応範囲はOpenAI、Anthropic、Google Gemini、Ollamaをカバーする。
ComfyUIによるローカル画像生成
クラウドの画像ツールが好みでないなら、MulmoChatはローカルのComfyUI Desktopインスタンスと会話する。リモートサーバーに一切触れない画像生成付きAIチャットを探している人にとって、これがその道だ。プロンプト、ネガティブプロンプト、モデル名を送り、base64の画像データを返す。APIはFLUXとStable Diffusionのモデルを自動判別し、解像度、サンプリングステップ、サンプラーなど、それぞれに妥当な既定値を選ぶ。どれでも上書きできる。
プラグインアーキテクチャ
MulmoChatは成長する前提で作られている。専用のツールプラグインガイドが、TypeScriptのインターフェースからVueのビュー、設定まで、契約全体を開発者に案内する。だから新しいキャンバス機能を足すのにアプリの核へ触る必要はない。この分離がプロジェクトを拡張可能に保つ。
AGPL-3.0でのオープンソース
プロジェクト全体が公開され、AGPL-3.0-onlyでライセンスされている。すべての行を読み、フォークし、自分の実験に合わせてアーキテクチャを変えられる。代償は、商用で何かを出す前に読むべきコピーレフト条項がライセンスに含まれることだ。
メリットとデメリット
メリット
- マルチモーダルキャンバスという概念は、多くの人が使うテキスト専用のチャットツールとは本当に違う。一度もデプロイしなくても、見る価値はある。
- OpenAI、Anthropic、Gemini、Ollamaにまたがるプロバイダの柔軟性のおかげで、単一のモデルベンダーに縛られずに済む。
- ローカルのComfyUI画像生成は、ハードウェアさえあれば完全オフラインの構成を動かせるということだ。クラウドアカウントを前提とするチャットツールの中では珍しい選択肢だ。
- プラグインアーキテクチャとドキュメントが、開発者に本物の出発点を与える。
- オープンソースなので、プロンプトやキーをどう扱うかを正確に確かめられる。
デメリット
- ホスト版がないので、始めるにはリポジトリをクローンし、複数のAPIキーを設定する必要がある。ただチャットアプリを試したいだけなら、これは現実的な壁だ。
- 研究用プロトタイプと銘打たれている。つまり粗さや変わりやすいAPIは驚きではなく想定内だ。
- AGPL-3.0ライセンスは商用利用を複雑にしうる。上に製品を作るつもりなら条件を確認しよう。
よくある質問
無料だ。コードはAGPL-3.0-onlyでオープンソースであり、サブスクリプションはない。実際のコストは接続するモデルプロバイダから生じる。それらのAPI請求は自分で直接支払う。
関連コンテンツ
MulmoChatに関連するツール、スキル、記事を探す。
MulmoChatの代替ツール
BinkBink
BinkBink · その他BinkBinkは無料のオンラインゲームプラットフォームであり、AIゲームメーカーでもある。短いテキストの説明を、誰でも遊べるブラウザゲームに変えられる。コミュニティが作った数百本のゲームにすぐ飛び込める。あるいは自分のアイデアを説明すれば、数秒で遊べて、そのまま友達と共有できる。自分のゲームを作りたい?プログラミングは要らない。エンジンの設定も、ダウンロードも、面倒なこともない。

Audiogen
Audiogen Inc. · その他Audiogenは、Audiogen Inc.が開発したAI音楽生成ツールだ。小さな研究チームが約2年半かけて自社の生成型音楽モデルを訓練し、その周りにWebインターフェースを設計した。このAI音楽ツールは単なるテキストボックスではなく、タイムラインを初心者に優しい生成型オーディオワークステーション(Generative Audio Workstation、略してGAW)へと変える。そこではインペインティング、延長、リミックス、ステム編集が、キャンバスに絵を描くように機能する。製品はまだベータ版で、アクセスは順番待ちリストか招待で行う。有料プランはまだ公開されていない。
Aiml API
AIMLAPI OÜ · その他Aiml APIは、OpenAI、Google、Anthropicなどの1000以上のモデルを1つのエンドポイントと1つの請求にまとめる統合AIモデルAPIだ。単一のOpenAI互換スキーマに対してコードを書き、モデル文字列を変えるだけでチャット、画像、動画、音声のモデルを切り替えられる。十数の事業者アカウントを使い分けずにマルチモデルへアクセスしたい開発者や小規模チームに向き、複数ベンダーを試すときに付きまとう請求の手間もなくす。1つの鍵ですべてをまかなえる。
