
Cognitora
Cognitora · Programmation
Cognitora est une plateforme d'orchestration d'inférence open source qui coordonne plusieurs moteurs de grands modèles de langage en un seul cluster distribué. Au lieu de remplacer votre moteur, elle se place au-dessus de vLLM, SGLang, llama.cpp, MLX et de tout serveur compatible OpenAI, puis achemine les requêtes vers les nœuds où le bon cache KV réside déjà. Elle vise les équipes qui exploitent leurs propres GPU, d'une paire de machines posées sur un bureau à une flotte mixte de datacenter, et se distribue sous forme de six binaires statiques avec une seule installation via curl.

À propos de Cognitora
Qu'est-ce que Cognitora
Cognitora est un plan de contrôle auto-hébergé pour l'orchestration d'inférence LLM. Vous gardez le moteur auquel vous faites déjà confiance et laissez Cognitora gérer les parties difficiles : routage, placement du cache, santé, consommation et observabilité sur de nombreuses machines. Le projet est écrit en Rust et se présente comme une alternative directe à des orchestrateurs comme NVIDIA Dynamo, avec une couverture de moteurs plus large et un déploiement pensé d'abord pour le bare metal. Six binaires. Un plan de contrôle.
Le principal problème qu'il résout est la fragmentation. Une flotte finit souvent par faire tourner des moteurs différents sur du matériel différent, et un simple répartiteur de charge envoie les requêtes vers des nœuds au hasard même quand une machine détient déjà le cache pertinent. Cognitora ajoute un routage conscient du KV pour que les requêtes atterrissent là où vit la mémoire. Cela réduit le travail de prefill redondant et maintient la latence de queue sous contrôle. Il suit aussi l'énergie par token, un détail que la plupart des orchestrateurs ignorent.
Voyez-le comme un orchestrateur vLLM qui ne vous enferme jamais dans vLLM. La principale limite à anticiper est l'échelle. Cognitora reconnaît volontiers qu'il excelle dans l'inférence hétérogène, sobre en énergie et légère à exploiter, plutôt que dans les très grands déploiements de classe NVL72, et certaines fonctions avancées de cache à plusieurs niveaux et de topologie restent sur la feuille de route. Si vous avez besoin aujourd'hui de migration de requêtes en vol ou de streaming de poids de GPU à GPU, une pile plus lourde conviendra peut-être mieux. Pour tous les autres, l'empreinte légère est justement l'atout.
Premiers pas
- Installez les binaires avec une seule commande curl sous Linux, ou compilez depuis les sources avec cargo si vous êtes sous macOS.
- Initialisez les fichiers PKI locaux avec
cgn-ctl pki bootstrap, puis décidez si vous voulez exiger mTLS. - Émettez une clé d'API aux permissions restreintes avec
cgn-ctl key create. - Écrivez un court
cognitora.tomlqui nomme le cluster, pointe vers vos modèles et fixe les ports HTTP et gRPC du routeur. - Lancez
cgn-router, pointez le driver de votre moteur vers un backend réel et interrogez-le avec le SDK OpenAI pour confirmer que les tokens circulent de bout en bout.
Informations sur le produit
Aperçu des tarifs, des plateformes compatibles et des performances de Cognitora.
Idéal pour
Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.
Utilisateurs
- Ingénieurs plateforme ML
- Équipes infrastructure de startups
- Laboratoires de recherche au matériel mixte
Tâches
- Faire tourner un modèle sur plusieurs moteurs
- Réduire les coûts de prefill
- Suivre la puissance par token
- Monter un cluster de démonstration rapide
Cas d'usage
- Une flotte mixte de 16 nœuds sous charge
- Expériences à l'échelle d'un bureau
- Déploiements Kubernetes en production
- Séparation prefill/decode
Fonctionnalités clés
Orchestration indépendante du moteur
Cognitora ne remplace pas votre moteur d'inférence, il en coordonne plusieurs en un seul cluster. Tout backend exposant la surface HTTP d'OpenAI peut rejoindre la flotte, et le projet fournit des drivers pour vLLM, SGLang, llama.cpp, MLX et TensorRT-LLM. Le matériel mixte est la norme. Vous pouvez donc faire tourner un nœud NVIDIA sous vLLM à côté d'un Mac Studio sous MLX et continuer à les traiter comme une seule flotte.
Routage conscient du KV
Le routeur suit l'emplacement des caches KV et place chaque requête en conséquence. Si un nœud détient déjà le contexte d'un prompt répété, la requête y va au lieu de déclencher un nouveau prefill ailleurs. C'est toute l'astuce. Pourquoi est-ce important ? Pour les charges de chat et d'agents avec de longs prompts système partagés, c'est la fonction qui réduit le plus directement le calcul gaspillé. Et cela s'accumule vite.
Décomposition prefill/decode
Cognitora est bâti autour de la séparation du prefill et du decode sur des pools différents. Vous pouvez dédier certaines machines au traitement des prompts et d'autres à la génération de tokens, puis laisser le routeur et le cache KV déplacer le travail entre elles. Séparez les phases. Le projet prend aussi en charge un stockage KV à plusieurs niveaux, en RAM et sur SSD, pour de plus grands caches.
Déploiement pensé d'abord pour le bare metal
Tout le système s'installe sous forme de six binaires statiques avec une seule ligne curl et tourne sous systemd, sans aucun plan de contrôle Python dans la boucle. Voilà le cluster LLM bare metal en une phrase. Vous n'ajoutez l'opérateur Kubernetes que lorsque vous voulez vraiment une orchestration au niveau des pods, donc deux machines de bureau constituent une cible légitime.
Tableau de bord de flotte sans dépendances
Le dépôt livre un tableau de bord autonome sous forme d'un seul fichier HTML statique qui lit directement les endpoints /metrics de Prometheus. Il affiche les requêtes par seconde en direct, les tokens par seconde, la latence et les percentiles de TTFT, la profondeur de file, l'état de chaque nœud, l'utilisation du cache KV, la puissance de la flotte et l'énergie par token. Pas de Grafana. Pas de backend.
Ordonnancement sensible à l'énergie
Cognitora intègre la puissance dans les décisions de placement et rapporte l'énergie par token pour toute la flotte. Sur un ensemble mixte de GPU, cela permet à l'opérateur de voir quels nœuds fournissent le plus de tokens par watt et d'y orienter le travail. La puissance, c'est de l'argent. Cela compte quand vous payez vous-même la facture d'électricité.
Open source et inspectable
Le projet vit sur GitHub dans un dépôt actif, donc chaque décision de routage, chaque driver et chaque option de configuration reste ouvert à l'examen. Il fonctionne comme un serveur d'inférence entièrement open source. Les équipes qui ne peuvent pas faire passer leur trafic d'inférence par un service tiers fermé peuvent lire le code, le forker et exploiter tout le plan de contrôle comme une flotte IA auto-hébergée.
Avantages et inconvénients
Avantages
- La conception indépendante du moteur vous laisse conserver vos configurations vLLM, SGLang ou llama.cpp existantes plutôt que de les réécrire.
- Le routage conscient du KV réduit le travail de prefill redondant, ce qui se traduit par un coût plus bas et une latence de queue plus régulière.
- L'installation pensée pour le bare metal rend réaliste une configuration à deux machines, et non une démo dégradée d'un produit Kubernetes.
- Le tableau de bord intégré couvre la latence, les tokens par seconde, l'utilisation du KV et l'énergie par token sans outillage supplémentaire.
- Il est écrit en Rust et sans plan de contrôle Python, ce qui garde l'empreinte d'exécution réduite.
Inconvénients
- Certaines fonctions avancées, comme les gestionnaires de blocs à plusieurs niveaux natifs et l'ordonnancement de gang sensible à la topologie, ne sont pas encore là, si bien que les très grandes flottes de classe NVL72 ont besoin d'une autre pile.
- L'installation suppose une certaine aisance avec les fichiers de configuration, l'initialisation PKI et systemd, ce qui exclut les utilisateurs non techniques.
- macOS ne fonctionne que via la compilation depuis les sources, donc la plupart des utilisateurs de Mac ne peuvent pas utiliser l'installateur en une ligne.
- La prise en charge de TensorRT-LLM reste un driver de type spawn sans recette par défaut, ce chemin demande donc plus de travail manuel.
Questions fréquentes
Cognitora coordonne plusieurs moteurs d'inférence LLM en un seul cluster distribué. Vous l'utilisez pour acheminer les requêtes entre les nœuds, placer le travail là où les caches KV résident déjà et surveiller la santé et la consommation d'énergie de toute une flotte de GPU depuis un seul plan de contrôle.
Contenus associés
Découvrez des outils, des compétences et des articles liés à Cognitora.
Alternatives à Cognitora
Forefront
Forefront · ProgrammationForefront est une plateforme web pour construire avec de l'IA open source. Elle vous laisse affiner les principaux modèles de langage open source sur vos propres données, évaluer leurs performances et les exécuter via une API ou les exporter pour les héberger vous-même. Les développeurs qui veulent le confort d'une plateforme fermée mais tiennent à rester propriétaires de leurs modèles et de leurs données sont le public visé ici.
Startkit
StartKit.AI · ProgrammationStartkit est un boilerplate pour créer des produits SaaS d'IA et des wrappers d'IA. Voyez-le comme un boilerplate de startup IA avec les parties ennuyeuses déjà branchées : authentification, paiements Stripe et Lemon Squeezy, limites d'usage, e-mail transactionnel et un kit de démarrage d'API IA qui parle à OpenAI, Anthropic, Groq ou Llama. Vous clonez le dépôt, fixez votre prix et attaquez la partie du produit pour laquelle les gens paient vraiment. Il repose sur Next.js au-dessus de React et Tailwind, donc une bonne partie du code boilerplate vous semble déjà familière.
Testim
Tricentis · ProgrammationTestim est une plateforme d'automatisation des tests dopée à l'IA, qui sert à créer et exécuter des tests de bout en bout sur des applications web, mobiles et Salesforce. Elle s'appuie sur l'apprentissage automatique pour garder les tests stables quand une interface change, alors les équipes passent moins de temps à réparer des sélecteurs cassés. Pas mal pour un outil de tests automatisés que vous pouvez utiliser dès aujourd'hui. Vous créez des tests en enregistrant des actions dans un navigateur, puis vous ajoutez du JavaScript quand vous avez besoin de plus de contrôle. C'est un choix solide pour une équipe QA bien occupée.
