MulmoChat

MulmoChat

receptron · 其他 · 聊天機器人

MulmoChat 是一款開源的多模態 AI 聊天介面,把對話變成看得見、摸得到的東西。它不只交換文字,而是在你繼續跟 AI 說話的同時,把圖片、可探索的地圖和可玩的小遊戲丟到畫布上,於是每一則回覆都像一個能戳弄的小場景,而不是一整面文字牆。這款工具由 receptron 團隊打造,以研究原型的形式推出,對象是開發者以及想測試聊天介面下一步會往哪走的好奇使用者。

MulmoChat 的介面預覽

關於 MulmoChat

MulmoChat 是什麼

MulmoChat 是一個研究原型,探索多模態 AI 聊天的新樣貌。傳統聊天工具以文字為先:你輸入訊息,拿回文字。MulmoChat 把它翻了過來,讓視覺與互動內容直接和對話並存在同一塊畫布上。

在底層,它是個全端專案。前端跑在 Vue 3 與 TypeScript 上,搭配 Vite,而一台小型 Node 伺服器負責處理模型呼叫,讓瀏覽器那一側保持輕薄,也把各家供應商的邏輯集中在單一位置方便稽核。它支援多家供應商,包括 OpenAI、Anthropic、Google Gemini,以及本機的 Ollama 實例,所以你不會被綁在單一廠商上。如果你想把一切留在自己的機器上,圖片生成也能透過本機的 ComfyUI 搭配 FLUX 模型來跑。

最大的限制在於安裝設定。這不是一款登入就能用的託管產品。你得先複製儲存庫、安裝相依套件、提供自己的 API 金鑰,有時還不只一把,都弄完才有辦法送出第一個提示。請預留一段終端機作業時間,而不是填一張註冊表。

開始使用

  1. 從 GitHub 複製儲存庫,執行 yarn install 拉取相依套件。
  2. 建立 .env 檔並加入你的 API 金鑰,例如 OPENAI_API_KEY 與 GEMINI_API_KEY。地圖、搜尋與 HTML 生成的金鑰則是選用。
  3. 用 yarn dev 啟動開發伺服器,接著開啟瀏覽器並允許麥克風存取。
  4. 點擊 Start Voice Chat 開始說話。請它給一張圖片,看它出現在畫布上。
  5. 若要本機生成圖片,安裝 ComfyUI Desktop、下載 FLUX 模型,並把 COMFYUI_BASE_URL 指向它。

產品資訊

快速了解 MulmoChat 的定價、支援平台與效能。

免費方案是
付費方案$0
平台Web (self-hosted), Node.js server
開發者receptron
類別其他 · 聊天機器人
發布日期Sep 2025
最近更新Sep 2026
網站訪問量649.3M
網站全球排名50
API 提供狀態是

適合對象

這項工具最適合的使用者、任務與情境。

使用者

  • 開發者:最適合想讀原始碼、擴充外掛,並親自測試多模態聊天架構的工程師。你需要對 Node.js 與 TypeScript 有一定熟悉度。
  • AI 產品設計師:如果你在研究視覺輸出如何在不打斷對話的前提下坐進聊天流程,這款很實用。請自備本機開發環境。
  • 玩本機模型的玩家:如果你本來就常備 Ollama 或 ComfyUI,又想避開雲端 API 帳單,這是個好選擇。

任務

  • 打造語音優先聊天 App 的原型:這份程式碼提供可運作的參考,讓你把語音輸入與豐富的畫布輸出配在一起。
  • 測試本機圖片生成:把 ComfyUI 接到聊天介面上,就能體會全離線的圖片工作流是什麼感覺。
  • 比較各家模型供應商:統一的文字 API 讓你把同一段提示送進 OpenAI、Anthropic、Gemini 或 Ollama,再比較結果。

情境

  • 研究階段的測試,想在正式投入某個新互動模型前先摸一摸。
  • 在自己機器上進行的週末實驗,而且你願意先花一小時處理安裝。
  • 給正在爭論聊天該不該維持純文字的團隊做示範。

主要功能

對話遇上畫布

這是核心概念。AI 的輸出不會被困在訊息泡泡裡。畫布式 AI 聊天讓圖片在句子說到一半時浮現,讓地圖變成能平移與縮放的東西。這改變了聊天的感受,因為回覆成了你探索的空間,而不是你讀過就忘的句子。這個轉變正是整個專案的重點。

語音優先的互動

MulmoChat 是圍繞「說話」而不是「打字」打造的。你授權麥克風、點下 Start Voice Chat,然後自然開口。這裡的語音聊天 AI 迴路不是硬鎖在文字工具上的附加品,從工作階段怎麼開始就看得出來。它想要的是一種像在跟人對話的你來我往,而不是一個附帶傳送鈕的文字框。不用鍵盤。

多供應商文字 API

文字這一側由一個不綁定供應商的端點驅動。GET /api/text/providers 會列出目前已設定的項目,POST /api/text/generate 則接收提示與 model、maxTokens、temperature、topP 等參數,然後不管實際處理的是哪一家廠商,都回傳正規化後的結果。支援的陣容涵蓋 OpenAI、Anthropic、Google Gemini 與 Ollama。

透過 ComfyUI 進行本機圖片生成

如果雲端圖片工具不合你的胃口,MulmoChat 能跟本機的 ComfyUI Desktop 實例溝通。對於想找一款完全不碰遠端伺服器的圖片生成 AI 聊天的人來說,這就是那條路。它送出提示、負向提示與模型名稱,接著回傳 base64 圖片資料。API 會自動辨識 FLUX 與 Stable Diffusion 模型,並為各自挑選合理的預設值,包括解析度、取樣步數與 sampler。你可以覆寫其中任何一項。

外掛架構

MulmoChat 生來就是要長大的。一份專門的工具外掛指南會帶開發者走過整個契約,從 TypeScript 介面到 Vue 檢視與設定,因此新增一項畫布能力並不需要動到 App 核心。正是這層切分讓專案保持可擴充。

以 AGPL-3.0 開源

整個專案公開,並以 AGPL-3.0-only 授權。你可以逐行閱讀、分支,並改動架構以配合自己的實驗。代價是這份授權帶有 copyleft 條款,在推出任何商業用途前你應該先讀過。

優缺點

優點

  • 多模態畫布的概念確實和多數人使用的純文字聊天工具不同,即使你從不部署它,也值得看一眼。
  • OpenAI、Anthropic、Gemini 與 Ollama 之間的供應商彈性,讓你不用被綁在單一模型廠商上。
  • 本機 ComfyUI 圖片生成意味著只要你手上已有硬體,就能跑全離線的環境,這在預設要有雲端帳號的聊天工具裡是罕見選項。
  • 外掛架構與文件給了開發者真正能往上蓋的起點。
  • 因為開源,你可以確切檢視它如何處理你的提示與金鑰。

缺點

  • 沒有託管版本,所以起步就代表要複製儲存庫、設定好幾把 API 金鑰。如果你只是想試一款聊天 App,這是一道真實的門檻。
  • 它被標為研究原型,意味著粗糙邊緣與變動的 API 是預期中的事,而不是意外。
  • AGPL-3.0 授權可能讓商業使用變複雜,如果你打算在上面做產品,請先確認條款。

常見問題

是。程式碼以 AGPL-3.0-only 開源,也沒有訂閱制。你真正的成本來自你連接的模型供應商,因為那些 API 帳單是你直接付的。

相關內容

探索與 MulmoChat 相關的工具、技能與文章。

MulmoChat 替代方案

BinkBink

BinkBink

BinkBink · 其他
編輯精選

BinkBink 是一個免費的線上遊戲平台與 AI 遊戲製作工具,讓任何人都能把一段簡短的文字描述變成可玩的瀏覽器遊戲。你可以直接跳進數百款社群自製的遊戲。或者描述自己的想法,幾秒內就能玩,再分享給朋友。想建立自己的遊戲嗎?你不需要寫程式。不用設定引擎、不用下載、不必費心。

免費 / $0查看詳情
Audiogen

Audiogen

Audiogen Inc. · 其他

Audiogen 是一款由 Audiogen Inc. 打造的 AI 音樂生成器。這支小型研究團隊花了約 2.5 年訓練自家生成式音樂模型,並圍繞它設計網頁介面。這款 AI 音樂工具捨棄單純的文字框,把時間軸變成對新手友善的生成式音訊工作站(Generative Audio Workstation,簡稱 GAW),其中的補繪、延伸、混音與音軌編輯,操作起來更像在畫布上彩繪。產品仍在 beta 階段,因此取用管道是候補名單或邀請碼。付費方案尚未公布。

免費 / Free (beta)查看詳情
Aiml API

Aiml API

AIMLAPI OÜ · 其他

Aiml API 是一套統一的 AI 模型 API,把 OpenAI、Google、Anthropic 等超過 1000 個模型放在同一個端點與同一張帳單之後。你只要依照單一相容 OpenAI 的結構撰寫程式碼,接著改一個模型字串,就能在聊天、圖像、影片與音訊模型之間切換。它適合想取得多模型存取、又不想管理十幾個供應商帳號的開發者與小型團隊,也省去了測試多家廠商時常見的帳務麻煩。一組金鑰就能涵蓋全部。

免費 / $0 - $200/mo查看詳情