Cognitora

Cognitora

Cognitora · Coding

Cognitora ist eine Open-Source-Plattform für LLM-Inferenz-Orchestrierung, die mehrere Motoren für große Sprachmodelle zu einem einzigen verteilten Cluster zusammenführt. Statt Ihre Engine zu ersetzen, sitzt sie über vLLM, SGLang, llama.cpp, MLX und jedem OpenAI-kompatiblen Server und leitet Anfragen an die Knoten, auf denen der passende KV-Cache bereits liegt. Sie richtet sich an Teams, die ihre eigenen GPUs betreiben, von ein paar Rechnern auf dem Schreibtisch bis zu einer gemischten Datacenter-Flotte, und kommt als sechs statische Binärdateien mit einer einzigen curl-Installation.

Vorschau der Oberfläche von Cognitora

Über Cognitora

Was ist Cognitora

Cognitora ist eine selbst gehostete Steuerungsebene für LLM-Inferenz-Orchestrierung. Sie behalten die Engine, der Sie bereits vertrauen, und überlassen Cognitora die schwierigen Teile: Routing, Cache-Platzierung, Zustand, Leistung und Beobachtbarkeit über viele Maschinen hinweg. Das Projekt ist in Rust geschrieben und positioniert sich als direkte Alternative zu Orchestratoren wie NVIDIA Dynamo, mit breiterer Engine-Abdeckung und einem Deployment, das Bare Metal an die erste Stelle setzt. Sechs Binärdateien. Eine Steuerungsebene.

Das Hauptproblem, das es löst, ist Fragmentierung. Eine Flotte läuft am Ende meist mit verschiedenen Engines auf verschiedener Hardware, und ein einfacher Lastverteiler schickt Anfragen an zufällige Knoten, selbst wenn eine Maschine den relevanten Cache bereits hält. Cognitora ergänzt KV-bewusstes Routing, damit Anfragen dort landen, wo der Speicher lebt. Das senkt redundante Prefill-Arbeit und hält die Tail-Latenz im Zaum. Außerdem erfasst es die Energie pro Token, ein Detail, das die meisten Orchestratoren ignorieren.

Betrachten Sie es als vLLM-Orchestrator, der Sie nie auf vLLM festlegt. Die größte Einschränkung, mit der Sie planen sollten, ist die Skalierung. Cognitora räumt offen ein, dass es bei heterogener, energiebewusster und betriebsleichter Inferenz führt und nicht bei riesigen Bereitstellungen der NVL72-Klasse, und einige fortgeschrittene Funktionen für mehrstufige Caches und Topologie stehen noch auf der Roadmap. Wenn Sie heute die Migration laufender Anfragen oder das Streaming von Gewichten von GPU zu GPU brauchen, passt ein schwereres Paket besser. Für alle anderen ist der geringe Fußabdruck genau der Punkt.

Erste Schritte

  1. Installieren Sie die Binärdateien mit einem einzigen curl-Befehl unter Linux, oder bauen Sie unter macOS mit cargo aus dem Quellcode.
  2. Initialisieren Sie die lokalen PKI-Dateien mit cgn-ctl pki bootstrap und entscheiden Sie dann, ob Sie mTLS verlangen.
  3. Stellen Sie mit cgn-ctl key create einen API-Schlüssel mit eingeschränkten Rechten aus.
  4. Schreiben Sie eine kurze cognitora.toml, die den Cluster benennt, auf Ihre Modelle zeigt und die HTTP- und gRPC-Ports des Routers festlegt.
  5. Starten Sie cgn-router, richten Sie den Treiber Ihrer Engine auf ein echtes Backend und fragen Sie es mit dem OpenAI SDK ab, um zu bestätigen, dass die Token von Ende zu Ende fließen.

Produktinformationen

Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von Cognitora.

Kostenloser TarifJa
Bezahlte Tarife$0
PlattformLinux (x86_64, aarch64), macOS (from source); bare metal, Kubernetes, cloud
EntwicklerCognitora
KategorieCoding
VeröffentlichungsdatumJan 2025
Zuletzt aktualisiertSep 2025
Website-Besuche531
Globales Website-RankingN/A
API-VerfügbarkeitJa

Am besten für

Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.

Nutzer

  • ML-Plattformingenieure
  • Infrastrukturteams von Startups
  • Forschungslabore mit gemischter Hardware

Aufgaben

  • Ein Modell über mehrere Engines betreiben
  • Prefill-Kosten senken
  • Leistung pro Token verfolgen
  • Schnell einen Demo-Cluster aufbauen

Szenarien

  • Eine gemischte Flotte aus 16 Knoten unter Last
  • Experimente im Schreibtischmaßstab
  • Produktive Kubernetes-Bereitstellungen
  • Trennung von Prefill und Decode

Wichtigste Funktionen

Engine-unabhängige Orchestrierung

Cognitora ersetzt Ihre Inferenz-Engine nicht, es koordiniert mehrere davon zu einem Cluster. Jedes Backend, das die HTTP-Oberfläche von OpenAI bereitstellt, kann beitreten, und das Projekt liefert Treiber für vLLM, SGLang, llama.cpp, MLX und TensorRT-LLM. Gemischte Hardware ist normal. Sie können also einen NVIDIA-Knoten mit vLLM neben einem Mac Studio mit MLX betreiben und beide weiterhin als eine Flotte behandeln.

KV-bewusstes Routing

Der Router verfolgt, wo die KV-Caches liegen, und platziert jede Anfrage entsprechend. Hält ein Knoten den Kontext für einen wiederholten Prompt bereits, geht die Anfrage dorthin, statt anderswo ein neues Prefill auszulösen. Das ist der ganze Trick. Warum ist das wichtig? Bei Chat- und Agentenlasten mit langen, geteilten System-Prompts ist dies die Funktion, die verschwendete Rechenleistung am direktesten senkt. Und das summiert sich schnell.

Entflechtung von Prefill und Decode

Cognitora ist darum herum gebaut, Prefill und Decode auf verschiedene Pools zu trennen. Sie können einige Maschinen der Verarbeitung von Prompts und andere der Generierung von Token widmen und dann Router und KV-Cache die Arbeit zwischen ihnen verschieben lassen. Trennen Sie die Phasen. Das Projekt unterstützt außerdem mehrstufigen KV-Speicher in RAM und SSD für größere Caches.

Bare-Metal-first-Deployment

Das gesamte System installiert sich als sechs statische Binärdateien mit einer einzigen curl-Zeile und läuft unter systemd, ohne Python-Steuerungsebene im Ablauf. Das ist die Geschichte vom Bare-Metal-LLM-Cluster in einem Satz. Sie fügen den Kubernetes-Operator erst hinzu, wenn Sie wirklich Orchestrierung auf Pod-Ebene wollen, also sind ein paar Desktop-Rechner ein legitimes Ziel.

Abhängigkeitsfreies Flotten-Dashboard

Im Repository liegt ein eigenständiges Dashboard als eine einzige statische HTML-Datei, die Prometheus-/metrics-Endpunkte direkt liest. Es zeigt Live-Anfragen pro Sekunde, Token pro Sekunde, Latenz- und TTFT-Perzentile, Warteschlangentiefe, Status pro Knoten, KV-Cache-Auslastung, Flottenleistung und Energie pro Token. Kein Grafana. Kein Backend.

Energiebewusste Planung

Cognitora bezieht die Leistung in Platzierungsentscheidungen ein und meldet die Energie pro Token für die gesamte Flotte. Auf einer gemischten Gruppe von GPUs sieht ein Operator damit, welche Knoten die meisten Token pro Watt liefern, und lenkt die Arbeit dorthin. Leistung ist Geld. Das zählt, wenn Sie die Stromrechnung selbst bezahlen.

Open Source und überprüfbar

Das Projekt lebt auf GitHub in einem aktiven Repository, sodass jede Routing-Entscheidung, jeder Treiber und jede Konfigurationsoption offen für eine Überprüfung ist. Es funktioniert als vollständig quelloffener Inferenzserver. Teams, die ihren Inferenzverkehr nicht durch einen geschlossenen Drittanbieterdienst schicken können, können den Code lesen, ihn forken und die gesamte Steuerungsebene als selbst gehostete KI-Flotte betreiben.

Vor- und Nachteile

Vorteile

  • Das engine-unabhängige Design lässt Sie Ihre bestehenden vLLM-, SGLang- oder llama.cpp-Setups behalten, statt sie neu zu schreiben.
  • KV-bewusstes Routing senkt redundante Prefill-Arbeit, was sich in geringeren Kosten und gleichmäßigerer Tail-Latenz zeigt.
  • Die Bare-Metal-first-Installation macht ein Zwei-Maschinen-Setup realistisch, kein abgespecktes Demo eines Kubernetes-Produkts.
  • Das integrierte Dashboard deckt Latenz, Token pro Sekunde, KV-Auslastung und Energie pro Token ohne zusätzliche Werkzeuge ab.
  • Es ist in Rust und ohne Python-Steuerungsebene geschrieben, sodass der Laufzeit-Fußabdruck klein bleibt.

Nachteile

  • Einige fortgeschrittene Funktionen wie native mehrstufige Blockmanager und topologiebewusste Gang-Planung fehlen noch, sodass sehr große Flotten der NVL72-Klasse ein anderes Paket brauchen.
  • Das Setup setzt Vertrautheit mit Konfigurationsdateien, PKI-Bootstrapping und systemd voraus, was nicht technische Nutzer ausschließt.
  • macOS funktioniert nur über den Build aus dem Quellcode, sodass die meisten Mac-Nutzer den Ein-Zeilen-Installer nicht verwenden können.
  • Die Unterstützung für TensorRT-LLM ist noch ein Spawn-Treiber ohne Standardrezept, dieser Weg erfordert also mehr Handarbeit.

Häufige Fragen

Cognitora koordiniert mehrere LLM-Inferenz-Engines zu einem einzigen verteilten Cluster. Sie nutzen es, um Anfragen über Knoten zu routen, Arbeit dorthin zu legen, wo KV-Caches bereits liegen, und den Zustand und den Stromverbrauch einer ganzen GPU-Flotte von einer einzigen Steuerungsebene aus zu beobachten.

Ähnliche Inhalte

Entdecke passende Tools, Skills und Artikel zu Cognitora.

Alternativen zu Cognitora

Forefront

Forefront

Forefront · Coding

Forefront ist eine Webplattform zum Bauen mit Open-Source-KI. Sie lassen sich führende Open-Source-Sprachmodelle mit eigenen Daten feintunen, ihre Leistung bewerten und sie über eine API ausführen oder exportieren, um sie selbst zu hosten. Entwickler, die den Komfort einer geschlossenen Plattform wollen, aber darauf bestehen, ihre Modelle und Daten zu besitzen, sind hier die Zielgruppe.

Kostenlos / $0 - $99/moDetails ansehen
Startkit

Startkit

StartKit.AI · Coding

Startkit ist ein Boilerplate zum Bauen von KI-SaaS-Produkten und KI-Wrappern. Man kann es sich als KI-Startup-Boilerplate vorstellen, bei dem die langweiligen Teile schon verdrahtet sind: Authentifizierung, Zahlungen über Stripe und Lemon Squeezy, Nutzungslimits, transaktionale E-Mail und ein KI-API-Starter-Kit, das mit OpenAI, Anthropic, Groq oder Llama spricht. Man klont das Repository, setzt seinen Preis und kümmert sich um den Teil des Produkts, für den Menschen wirklich bezahlen. Es basiert auf Next.js über React und Tailwind, deshalb fühlt sich ein Großteil des Boilerplate-Codes schon vertraut an.

Kostenpflichtig / $99 - $499 one-timeDetails ansehen
Testim

Testim

Tricentis · Coding

Testim ist eine KI-gestützte Plattform für Testautomatisierung, mit der man End-to-End-Tests für Web-, Mobile- und Salesforce-Anwendungen baut und ausführt. Sie setzt auf maschinelles Lernen, um Tests stabil zu halten, wenn sich eine Oberfläche ändert, sodass Teams weniger Zeit mit der Reparatur kaputter Selektoren verbringen. Nicht schlecht für ein Tool für automatisierte Tests, das Sie heute schon nutzen können. Sie erstellen Tests, indem Sie Aktionen im Browser aufzeichnen, und fügen danach JavaScript hinzu, wenn Sie mehr Kontrolle brauchen. Für ein beschäftigtes QA-Team eine solide Wahl.

Kostenlos / Custom pricing on requestDetails ansehen