
MulmoChat
receptron · Autres · Chatbot
MulmoChat est une interface de chat IA multimodale open source qui transforme une conversation en quelque chose que vous pouvez voir et toucher. Au lieu d'échanger uniquement du texte, elle fait surgir des images, des cartes explorables et des mini-jeux jouables sur un canevas pendant que vous continuez à parler à l'IA, et chaque réponse devient une petite scène que vous pouvez toucher plutôt qu'un mur de prose. Développée par l'équipe de receptron, elle arrive comme prototype de recherche destiné aux développeurs et aux utilisateurs curieux qui veulent tester où mènent les interfaces de chat.

À propos de MulmoChat
Qu'est-ce que MulmoChat
MulmoChat est un prototype de recherche qui explore une nouvelle forme de chat IA multimodal. Les outils de chat classiques sont d'abord textuels : vous tapez un message, vous recevez du texte. MulmoChat inverse cela en laissant le contenu visuel et interactif vivre à côté de la conversation, le tout sur un canevas partagé.
Sous le capot, c'est un projet full-stack. Le client tourne sur Vue 3 et TypeScript avec Vite, et un petit serveur Node gère les appels aux modèles, ce qui garde le côté navigateur léger et la logique des fournisseurs à un seul endroit que vous pouvez auditer. Il fonctionne avec plusieurs fournisseurs, dont OpenAI, Anthropic, Google Gemini et une instance locale d'Ollama, donc vous n'êtes pas enfermé chez un seul fournisseur. Si vous préférez tout garder sur votre machine, la génération d'images peut passer par une installation locale de ComfyUI avec des modèles FLUX.
La principale limite, c'est l'installation. Ce n'est pas un produit hébergé où vous vous connectez. Vous clonez le dépôt, installez les dépendances et fournissez vos propres clés API, parfois plusieurs, avant qu'un seul prompt ne tourne. Prévoyez une session de terminal, pas un formulaire d'inscription.
Premiers pas
- Clonez le dépôt depuis GitHub et lancez
yarn installpour récupérer les dépendances. - Créez un fichier
.envet ajoutez vos clés API, commeOPENAI_API_KEYetGEMINI_API_KEY. Les clés pour les cartes, la recherche et la génération HTML sont facultatives. - Démarrez le serveur de développement avec
yarn dev, puis ouvrez le navigateur et autorisez l'accès au microphone. - Cliquez sur Start Voice Chat et commencez à parler. Demandez une image et regardez-la apparaître sur le canevas.
- Pour la génération d'images en local, installez ComfyUI Desktop, téléchargez un modèle FLUX et pointez
COMFYUI_BASE_URLvers lui.
Informations sur le produit
Aperçu des tarifs, des plateformes compatibles et des performances de MulmoChat.
Idéal pour
Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.
Utilisateurs
- Développeurs
- Concepteurs de produits IA
- Bricoleurs qui font tourner des modèles locaux
Tâches
- Prototyper une application de chat pilotée par la voix
- Tester la génération d'images en local
- Comparer des fournisseurs de modèles
Cas d'usage
- Des sessions de recherche où vous voulez tâter un nouveau modèle d'interaction avant de vous engager.
- Des expérimentations du week-end sur votre propre machine, quand cela ne vous dérange pas de passer une heure sur l'installation d'abord.
- Des démos pour une équipe qui débat de l'opportunité de garder le chat purement textuel.
Fonctionnalités clés
La conversation rencontre le canevas
Voilà l'idée centrale. La sortie de l'IA n'est pas piégée dans une bulle de message. Un chat IA avec canevas laisse une image se matérialiser en pleine phrase et une carte devenir quelque chose que vous faites défiler et zoomez. Cela change la sensation d'un chat, parce que la réponse devient un espace que vous explorez plutôt qu'une phrase que vous lisez. Ce basculement est tout l'objet du projet.
Interaction pilotée par la voix
MulmoChat est construit autour de la parole, pas du clavier. Vous accordez l'accès au microphone, vous cliquez sur Start Voice Chat et vous parlez naturellement. La boucle de chat IA vocal ici n'est pas un ajout greffé à un outil textuel, et cela se voit dans la façon dont la session démarre. L'intention est un échange qui ressemble davantage à une conversation avec une personne qu'à une zone de texte avec un bouton d'envoi. Aucun clavier requis.
API de texte multi-fournisseurs
Un point d'accès indépendant du fournisseur alimente le côté texte. GET /api/text/providers liste ce qui est configuré, et POST /api/text/generate prend un prompt accompagné de paramètres comme model, maxTokens, temperature et topP, puis renvoie une réponse normalisée quel que soit le fournisseur qui l'a traitée. L'ensemble pris en charge couvre OpenAI, Anthropic, Google Gemini et Ollama.
Génération d'images en local via ComfyUI
Si les outils d'images cloud ne sont pas votre truc, MulmoChat dialogue avec une instance locale de ComfyUI Desktop. Pour qui cherche un chat IA avec génération d'images qui ne touche jamais un serveur distant, c'est la voie à suivre. Il envoie un prompt, un prompt négatif et un nom de modèle, puis renvoie des données d'image en base64. L'API détecte automatiquement les modèles FLUX ou Stable Diffusion et choisit des valeurs par défaut sensées pour chacun, y compris la résolution, les étapes d'échantillonnage et le sampler. Vous pouvez les remplacer toutes.
Architecture de plugins
MulmoChat est fait pour grandir. Un guide dédié aux plugins d'outils accompagne les développeurs dans le contrat, des interfaces TypeScript aux vues Vue et à la configuration, donc ajouter une nouvelle capacité au canevas ne veut pas dire toucher au cœur de l'application. Cette séparation est ce qui garde le projet extensible.
Open source sous AGPL-3.0
Tout le projet est public et sous licence AGPL-3.0-only. Vous pouvez lire chaque ligne, le forker et modifier l'architecture à votre guise pour vos propres expérimentations. La contrepartie, c'est que la licence comporte des termes de copyleft que vous devriez lire avant de livrer quoi que ce soit de commercial.
Avantages et inconvénients
Avantages
- Le concept de canevas multimodal est réellement différent des outils de chat purement textuels que la plupart des gens utilisent, donc cela vaut le coup d'œil même si vous ne le déployez jamais.
- La souplesse des fournisseurs entre OpenAI, Anthropic, Gemini et Ollama vous évite d'être lié à un seul fournisseur de modèles.
- La génération d'images locale via ComfyUI signifie que vous pouvez monter une installation entièrement hors ligne si vous avez déjà le matériel, une option rare parmi les outils de chat qui présupposent un compte cloud.
- L'architecture de plugins et la documentation donnent aux développeurs un vrai point de départ pour construire dessus.
- Comme c'est open source, vous pouvez inspecter exactement comment il gère vos prompts et vos clés.
Inconvénients
- Il n'existe pas de version hébergée, donc démarrer signifie cloner un dépôt et configurer plusieurs clés API. C'est un vrai obstacle si vous voulez juste essayer une application de chat.
- Il est étiqueté prototype de recherche, ce qui veut dire que des aspérités et des API mouvantes sont attendues plutôt que surprenantes.
- La licence AGPL-3.0 peut compliquer l'usage commercial, donc vérifiez les termes si vous comptez bâtir un produit dessus.
Questions fréquentes
Oui. Le code est open source sous AGPL-3.0-only, et il n'y a pas d'abonnement. Vos coûts réels viennent des fournisseurs de modèles que vous connectez, puisque vous payez ces factures d'API directement.
Contenus associés
Découvrez des outils, des compétences et des articles liés à MulmoChat.
Alternatives à MulmoChat
BinkBink
BinkBink · AutresBinkBink est une plateforme de jeux en ligne gratuite et un créateur de jeux par IA qui permet à n'importe qui de transformer une courte description textuelle en un jeu de navigateur jouable. Vous pouvez plonger dans des centaines de jeux créés par la communauté. Ou décrivez votre propre idée, jouez-y en quelques secondes, puis partagez-la avec vos amis. Vous voulez créer votre propre jeu ? Pas besoin de coder. Aucun moteur à installer, aucun téléchargement, aucune prise de tête.

Audiogen
Audiogen Inc. · AutresAudiogen est un générateur de musique par IA conçu par Audiogen Inc., une petite équipe de recherche qui a passé environ deux ans et demi à entraîner son propre modèle de musique générative et à bâtir une interface web autour. Au lieu d'une simple zone de texte, cet outil de musique par IA transforme la timeline en une Station de Travail Audio Générative (GAW), pensée pour les débutants, où l'inpainting, l'extension, le remix et l'édition de pistes fonctionnent davantage comme de la peinture sur une toile. Le produit est encore en bêta, l'accès passe donc par une liste d'attente ou une invitation. Les formules payantes ne sont pas encore publiées.
Aiml API
AIMLAPI OÜ · AutresAiml API est une API unifiée de modèles d'IA qui place plus de 1000 modèles d'OpenAI, Google, Anthropic et d'autres derrière un seul point d'accès et une seule facture. Vous écrivez du code contre un unique schéma compatible OpenAI, puis vous passez d'un modèle de chat, d'image, de vidéo ou d'audio à un autre en changeant une chaîne de modèle. Elle convient aux développeurs et aux petites équipes qui veulent un accès multimodèle sans jongler avec une douzaine de comptes de fournisseurs distincts, et elle supprime le casse-tête habituel de la facturation quand on teste plusieurs prestataires. Une seule clé couvre tout.
