
Cognitora
Cognitora · Programación
Cognitora es una plataforma de orquestación de inferencia de código abierto que coordina varios motores de modelos de lenguaje grandes en un único clúster distribuido. En lugar de reemplazar tu motor, se coloca por encima de vLLM, SGLang, llama.cpp, MLX y cualquier servidor compatible con OpenAI, y luego dirige las peticiones a los nodos donde ya reside la caché KV adecuada. Está pensada para equipos que ejecutan sus propias GPU, desde un par de máquinas sobre un escritorio hasta una flota mixta de centro de datos, y se distribuye como seis binarios estáticos con una sola instalación por curl.

Acerca de Cognitora
Qué es Cognitora
Cognitora es un plano de control autoalojado para la orquestación de inferencia LLM. Conservas el motor en el que ya confías y dejas que Cognitora se ocupe de las partes difíciles: enrutamiento, ubicación de caché, estado, energía y observabilidad en muchas máquinas. El proyecto está escrito en Rust y se presenta como alternativa directa a orquestadores como NVIDIA Dynamo, con una cobertura de motores más amplia y un enfoque de despliegue centrado en bare metal. Seis binarios. Un plano de control.
El problema principal que resuelve es la fragmentación. Una flota suele acabar ejecutando motores distintos sobre hardware distinto, y un balanceador de carga simple envía peticiones a nodos aleatorios aunque una máquina ya tenga la caché relevante. Cognitora añade enrutamiento con reconocimiento de KV para que las peticiones lleguen allí donde vive la memoria. Eso recorta el trabajo de prefill redundante y mantiene a raya la latencia de cola. También registra la energía por token, un detalle que la mayoría de los orquestadores ignora.
Piensa en él como un orquestador de vLLM que nunca te ata a vLLM. La mayor limitación con la que hay que contar es la escala. Cognitora admite con franqueza que destaca en inferencia heterogénea, consciente de la energía y con poca carga operativa, más que en despliegues enormes de clase NVL72, y algunas funciones avanzadas de caché por niveles y de topología siguen en la hoja de ruta. Si necesitas migración de peticiones en vuelo o streaming de pesos de GPU a GPU hoy mismo, quizá te encaje mejor una pila más pesada. Para todos los demás, la huella ligera es justamente el punto.
Primeros pasos
- Instala los binarios con un solo comando curl en Linux, o compila desde el código fuente con cargo si usas macOS.
- Arranca los archivos locales de PKI con
cgn-ctl pki bootstrapy luego decide si quieres exigir mTLS. - Emite una clave de API con permisos acotados mediante
cgn-ctl key create. - Escribe un breve
cognitora.tomlque nombre el clúster, apunte a tus modelos y fije los puertos HTTP y gRPC del enrutador. - Arranca
cgn-router, apunta el driver de tu motor a un backend real y consúltalo con el SDK de OpenAI para confirmar que los tokens fluyen de extremo a extremo.
Información del producto
Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de Cognitora.
Ideal para
Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.
Usuarios
- Ingenieros de plataformas de ML
- Equipos de infraestructura de startups
- Laboratorios de investigación con hardware mixto
Tareas
- Ejecutar un modelo en varios motores
- Recortar costes de prefill
- Registrar la potencia por token
- Levantar un clúster de demostración rápido
Casos de uso
- Una flota mixta de 16 nodos bajo carga
- Experimentos a escala de escritorio
- Despliegues de Kubernetes en producción
- Separación de prefill y decode
Funciones clave
Orquestación agnóstica del motor
Cognitora no reemplaza tu motor de inferencia, coordina varios en un solo clúster. Cualquier backend que exponga la superficie HTTP de OpenAI puede unirse, y el proyecto incluye drivers para vLLM, SGLang, llama.cpp, MLX y TensorRT-LLM. El hardware mixto es lo normal. Eso significa que puedes ejecutar un nodo NVIDIA con vLLM junto a un Mac Studio con MLX y seguir tratándolos como una sola flota.
Enrutamiento con reconocimiento de KV
El enrutador rastrea dónde viven las cachés KV y coloca cada petición en consecuencia. Si un nodo ya tiene el contexto de un prompt repetido, la petición va allí en lugar de provocar un prefill nuevo en otro sitio. Ese es todo el truco. ¿Por qué importa? Para cargas de chat y de agentes con prompts de sistema largos y compartidos, esta es la función que reduce de forma más directa el cómputo desperdiciado. Y se acumula rápido.
Desagregación de prefill y decode
Cognitora se construye en torno a separar el prefill y el decode en grupos distintos. Puedes dedicar unas máquinas a procesar prompts y otras a generar tokens, y dejar que el enrutador y la caché KV muevan el trabajo entre ellas. Divide las fases. El proyecto también admite almacenamiento KV multinivel en RAM y SSD para cachés más grandes.
Despliegue centrado en bare metal
Todo el sistema se instala como seis binarios estáticos con una sola línea curl y se ejecuta bajo systemd, sin ningún plano de control en Python de por medio. Ese es el clúster LLM en bare metal en una frase. Solo añades el operador de Kubernetes cuando de verdad quieres orquestación a nivel de pod, así que un par de máquinas de escritorio son un objetivo legítimo.
Panel de flota sin dependencias
En el repositorio se incluye un panel independiente como un único archivo HTML estático que lee directamente los endpoints /metrics de Prometheus. Muestra peticiones por segundo en vivo, tokens por segundo, latencia y percentiles de TTFT, profundidad de cola, estado por nodo, uso de la caché KV, potencia de la flota y energía por token. Sin Grafana. Sin backend.
Programación consciente de la energía
Cognitora incorpora la potencia a las decisiones de ubicación e informa de la energía por token para toda la flota. Sobre un conjunto mixto de GPU, eso deja que un operador vea qué nodos entregan más tokens por vatio y oriente el trabajo hacia ellos. La potencia es dinero. Importa cuando pagas tú la factura de la luz.
Código abierto e inspeccionable
El proyecto vive en GitHub en un repositorio activo, así que cada decisión de enrutamiento, driver y opción de configuración queda abierta a revisión. Funciona como un servidor de inferencia totalmente de código abierto. Los equipos que no pueden enviar tráfico de inferencia a través de un servicio cerrado de terceros pueden leer el código, bifurcarlo y ejecutar todo el plano de control como una flota de IA autoalojada.
Ventajas y desventajas
Ventajas
- El diseño agnóstico del motor te deja conservar tus configuraciones actuales de vLLM, SGLang o llama.cpp en lugar de reescribirlas.
- El enrutamiento con reconocimiento de KV reduce el trabajo de prefill redundante, y eso se traduce en menor coste y una latencia de cola más estable.
- La instalación centrada en bare metal hace realista una configuración de dos máquinas, no una demo degradada de un producto Kubernetes.
- El panel integrado cubre latencia, tokens por segundo, uso de KV y energía por token sin herramientas adicionales.
- Está escrito en Rust y sin plano de control en Python, así que la huella de ejecución se mantiene pequeña.
Desventajas
- Algunas funciones avanzadas como gestores de bloques por niveles nativos y programación de gang consciente de la topología aún no están, así que las flotas muy grandes de clase NVL72 necesitan otra pila.
- La configuración da por hecho que te manejas con archivos de configuración, arranque de PKI y systemd, lo que excluye a usuarios no técnicos.
- macOS solo funciona mediante la compilación desde el código fuente, así que la mayoría de usuarios de Mac no pueden usar el instalador de una línea.
- El soporte de TensorRT-LLM sigue siendo un driver de tipo spawn sin receta por defecto, así que esa vía requiere más trabajo manual.
Preguntas frecuentes
Cognitora coordina varios motores de inferencia LLM en un único clúster distribuido. Lo usas para enrutar peticiones entre nodos, colocar el trabajo donde ya viven las cachés KV y vigilar el estado y el consumo de energía de toda una flota de GPU desde un solo plano de control.
Contenido relacionado
Explora herramientas, habilidades y artículos relacionados con Cognitora.
Alternativas a Cognitora
Forefront
Forefront · ProgramaciónForefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.
Startkit
StartKit.AI · ProgramaciónStartkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.
Testim
Tricentis · ProgramaciónTestim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.
