
Cognitora
Cognitora · Programação
O Cognitora é uma plataforma de orquestração de inferência de código aberto que coordena vários motores de modelos de linguagem grandes em um único cluster distribuído. Em vez de substituir o seu motor, ele fica acima do vLLM, SGLang, llama.cpp, MLX e de qualquer servidor compatível com OpenAI, e depois encaminha as requisições para os nós onde o cache KV certo já está. Ele mira equipes que rodam as próprias GPUs, de um par de máquinas sobre a mesa a uma frota mista de datacenter, e chega como seis binários estáticos com uma instalação única via curl.

Sobre Cognitora
O que é o Cognitora
O Cognitora é um plano de controle auto-hospedado para orquestração de inferência LLM. Você mantém o motor em que já confia e deixa o Cognitora cuidar das partes difíceis: roteamento, posicionamento de cache, integridade, energia e observabilidade em muitas máquinas. O projeto é escrito em Rust e se coloca como alternativa direta a orquestradores como o NVIDIA Dynamo, com cobertura de motores mais ampla e uma proposta de implantação em bare metal. Seis binários. Um plano de controle.
O problema principal que ele resolve é a fragmentação. Uma frota costuma acabar rodando motores diferentes em hardwares diferentes, e um balanceador de carga comum manda requisições para nós aleatórios mesmo quando uma máquina já tem o cache relevante. O Cognitora adiciona roteamento ciente de KV para que as requisições caiam onde a memória vive. Isso corta o trabalho de prefill redundante e mantém a latência de cauda sob controle. Ele também registra a energia por token, um detalhe que a maioria dos orquestradores ignora.
Pense nele como um orquestrador de vLLM que nunca te prende ao vLLM. A maior limitação a considerar é a escala. O Cognitora admite com franqueza que se sobressai em inferência heterogênea, ciente de energia e com pouca carga operacional, mais do que em implantações enormes de classe NVL72, e alguns recursos avançados de cache em camadas e de topologia ainda estão no roteiro. Se você precisa hoje de migração de requisições em voo ou streaming de pesos de GPU para GPU, uma pilha mais pesada pode servir melhor. Para todo o resto, o pé leve é justamente o ponto.
Primeiros passos
- Instale os binários com um único comando curl no Linux, ou compile a partir do código-fonte com cargo se estiver no macOS.
- Inicialize os arquivos locais de PKI com
cgn-ctl pki bootstrape depois decida se vai exigir mTLS. - Emita uma chave de API com permissões restritas usando
cgn-ctl key create. - Escreva um breve
cognitora.tomlque nomeie o cluster, aponte para os seus modelos e defina as portas HTTP e gRPC do roteador. - Inicie o
cgn-router, aponte o driver do seu motor para um backend real e consulte-o com o SDK da OpenAI para confirmar que os tokens fluem de ponta a ponta.
Informações do produto
Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de Cognitora.
Ideal para
Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.
Usuários
- Engenheiros de plataforma de ML
- Equipes de infraestrutura de startups
- Laboratórios de pesquisa com hardware misto
Tarefas
- Rodar um modelo em vários motores
- Cortar custos de prefill
- Registrar a potência por token
- Levantar um cluster de demonstração rápido
Cenários
- Uma frota mista de 16 nós sob carga
- Experimentos em escala de mesa
- Implantações de Kubernetes em produção
- Separação de prefill e decode
Principais recursos
Orquestração agnóstica de motor
O Cognitora não substitui o seu motor de inferência, ele coordena vários em um único cluster. Qualquer backend que exponha a superfície HTTP da OpenAI pode entrar, e o projeto traz drivers para vLLM, SGLang, llama.cpp, MLX e TensorRT-LLM. Hardware misto é o normal. Isso significa que você pode rodar um nó NVIDIA com vLLM ao lado de um Mac Studio com MLX e ainda tratá-los como uma só frota.
Roteamento ciente de KV
O roteador rastreia onde os caches KV vivem e coloca cada requisição de acordo. Se um nó já tem o contexto de um prompt repetido, a requisição vai para lá em vez de disparar um prefill novo em outro lugar. É esse o truque inteiro. Por que isso importa? Para cargas de chat e de agentes com prompts de sistema longos e compartilhados, esse é o recurso que reduz de forma mais direta o cálculo desperdiçado. E isso se acumula rápido.
Desagregação de prefill e decode
O Cognitora foi construído em torno de separar prefill e decode em pools diferentes. Você pode dedicar algumas máquinas a processar prompts e outras a gerar tokens, e deixar o roteador e o cache KV mover o trabalho entre elas. Divida as fases. O projeto também dá suporte a armazenamento KV em várias camadas, em RAM e SSD, para caches maiores.
Implantação em bare metal
O sistema inteiro se instala como seis binários estáticos com uma única linha curl e roda sob systemd, sem nenhum plano de controle em Python no meio. Esse é o cluster LLM em bare metal em uma frase. Você só adiciona o operador de Kubernetes quando realmente quer orquestração no nível do pod, então um par de máquinas de mesa é um alvo legítimo.
Painel de frota sem dependências
O repositório traz um painel autônomo como um único arquivo HTML estático que lê diretamente os endpoints /metrics do Prometheus. Ele mostra requisições por segundo ao vivo, tokens por segundo, latência e percentis de TTFT, profundidade da fila, status por nó, uso do cache KV, potência da frota e energia por token. Sem Grafana. Sem backend.
Agendamento ciente de energia
O Cognitora coloca a potência nas decisões de posicionamento e informa a energia por token para toda a frota. Em um conjunto misto de GPUs, isso deixa o operador ver quais nós entregam mais tokens por watt e direcionar o trabalho para eles. Potência é dinheiro. Importa quando você paga a conta de luz.
Código aberto e inspecionável
O projeto vive no GitHub em um repositório ativo, então cada decisão de roteamento, driver e opção de configuração fica aberta à revisão. Ele funciona como um servidor de inferência totalmente de código aberto. Equipes que não podem enviar tráfego de inferência por um serviço fechado de terceiros podem ler o código, fazer um fork e rodar todo o plano de controle como uma frota de IA auto-hospedada.
Prós e contras
Prós
- O design agnóstico de motor deixa você manter as configurações atuais de vLLM, SGLang ou llama.cpp em vez de reescrevê-las.
- O roteamento ciente de KV reduz o trabalho de prefill redundante, o que aparece como menor custo e latência de cauda mais estável.
- A instalação em bare metal torna realista uma configuração de duas máquinas, não uma demo degradada de um produto Kubernetes.
- O painel integrado cobre latência, tokens por segundo, uso de KV e energia por token sem ferramentas extras.
- É escrito em Rust e sem plano de controle em Python, então o consumo em execução fica pequeno.
Contras
- Alguns recursos avançados, como gerenciadores de blocos em camadas nativos e agendamento de gang ciente de topologia, ainda não estão lá, então frotas muito grandes de classe NVL72 precisam de outra pilha.
- A configuração pressupõe que você se sinta à vontade com arquivos de configuração, inicialização de PKI e systemd, o que exclui usuários não técnicos.
- O macOS só funciona pela compilação a partir do código-fonte, então a maioria dos usuários de Mac não pode usar o instalador de uma linha.
- O suporte a TensorRT-LLM ainda é um driver do tipo spawn sem receita padrão, então esse caminho exige mais trabalho manual.
Perguntas frequentes
O Cognitora coordena vários motores de inferência LLM em um único cluster distribuído. Você o usa para rotear requisições entre nós, colocar o trabalho onde os caches KV já vivem e acompanhar a integridade e o consumo de energia de toda uma frota de GPU a partir de um só plano de controle.
Conteúdo relacionado
Explore ferramentas, skills e artigos relacionados a Cognitora.
Alternativas a Cognitora
Forefront
Forefront · ProgramaçãoO Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.
Startkit
StartKit.AI · ProgramaçãoStartkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.
Testim
Tricentis · ProgramaçãoO Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.
