
Cognitora
Cognitora · コーディング
Cognitoraは、複数の大規模言語モデルエンジンをひとつの分散クラスタにまとめるオープンソースの推論オーケストレーションプラットフォームだ。既存のエンジンを置き換えるのではなく、vLLM、SGLang、llama.cpp、MLX、そしてOpenAI互換の任意のサーバーの上に立ち、適切なKVキャッシュがすでにあるノードへリクエストを振り分ける。対象は自前のGPUを運用するチームで、机の上の数台から混在したデータセンターのフリートまで幅広くカバーする。配布形態は6つの静的バイナリで、curl 1行でインストールできる。

Cognitora について
Cognitoraとは
CognitoraはLLM推論オーケストレーション向けのセルフホスト型コントロールプレーンだ。すでに信頼しているエンジンはそのまま残し、難しい部分をCognitoraに任せる。ルーティング、キャッシュ配置、ヘルス、電力、そして多数のマシンにまたがる可観測性だ。プロジェクトはRustで書かれ、NVIDIA Dynamoのようなオーケストレータの直接の代替として位置づけられている。エンジンの対応範囲はより広く、デプロイはベアメタルを最優先にする。6つのバイナリ。1つのコントロールプレーン。
これが解く最大の問題は断片化だ。フリートはたいてい異なるハードウェアで異なるエンジンを動かすことになり、単純なロードバランサは、あるマシンが該当するキャッシュをすでに保持していても、リクエストを無作為なノードへ送ってしまう。CognitoraはKV認識ルーティングを加え、メモリがある場所へリクエストを届ける。これにより重複したprefillの処理を削り、テールレイテンシを抑える。トークンあたりのエネルギーも記録するが、これはほとんどのオーケストレータが無視する点だ。
vLLMに縛られないvLLMオーケストレータだと考えればいい。事前に計画すべき最大の制約は規模だ。Cognitoraは、NVL72クラスの巨大なデプロイよりも、異種混在で省エネかつ運用負荷の軽い推論で優位に立つと率直に認めており、階層キャッシュやトポロジの一部の高度な機能はまだロードマップ上にある。機内のリクエスト移行やGPU間のウェイトストリーミングが今すぐ必要な場合は、より重いスタックのほうが合う。それ以外のチームにとっては、軽さそのものが利点だ。
はじめかた
- Linuxではcurlの1コマンドでバイナリをインストールする。macOSならcargoでソースからビルドする。
cgn-ctl pki bootstrapでローカルのPKIファイルを初期化し、mTLSを要求するかどうかを決める。cgn-ctl key createで権限を絞ったAPIキーを発行する。- クラスタ名、モデルの場所、ルータのHTTPポートとgRPCポートを記した短い
cognitora.tomlを書く。 cgn-routerを起動し、エンジンドライバを実際のバックエンドに向け、OpenAI SDKで問い合わせてトークンが端から端まで流れることを確認する。
AIツール情報
Cognitoraの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- MLプラットフォームエンジニア:すでにGPUフリートを運用し、自作スケジューラではなく単一のコントロールプレーンを求める人。設定ファイルとsystemdに抵抗がないことが前提だ。
- スタートアップのインフラチーム:専任のオーケストレーション担当を抱える余裕はないが、数台のマシンにまたがるKV認識ルーティングは必要な小規模チーム。
- 混在ハードウェアの研究ラボ:NVIDIAとApple Siliconを並行して使うグループ。Cognitoraはどちらも一級のノードとして扱う。
タスク
- 1つのモデルを複数エンジンで動かす:同じモデルをvLLM、SGLang、llama.cppで配信し、キャッシュが温かいノードへトラフィックを寄せられる。
- prefillコストの削減:KV認識ルーティングは繰り返しのリクエストをすでにコンテキストを持つノードへ送るため、同じプロンプトを再計算しなくて済む。
- トークンあたりの電力追跡:内蔵ダッシュボードはフリートの電力とトークンあたりのエネルギーを報告する。電気代が実際の経費になっているときに役立つ。
- 手早いデモクラスタの構築:偽エンジンによるスモークテストで、1台のホスト上でゼロからトークンのストリーミングまで約5分で到達できる。
シーン
- 負荷のかかる16ノードの混在フリート:プロジェクト自身の例では、H100、H200、A100、MI300X、L40S、A10のカードが5つのモデルを同時に配信する。
- 机の上の実験:DGX SparkやAMDのマシン、Mac Studioを2、3台、1つのラックにまとめる。Kubernetesは不要だ。
- 本番のKubernetesデプロイ:systemdユニットではなくPodをCognitoraに管理させたいときにオペレータを追加する。
- prefillとdecodeの分離:同じGPUからより多くを引き出したいとき、2つのフェーズを別々のプールに分ける。
主な機能
エンジン非依存のオーケストレーション
Cognitoraは推論エンジンを置き換えず、複数のエンジンを1つのクラスタにまとめる。OpenAIのHTTPインターフェースを公開するバックエンドならどれでも参加でき、vLLM、SGLang、llama.cpp、MLX、TensorRT-LLM向けのドライバを同梱する。混在ハードウェアは当然の前提だ。つまり、vLLMのNVIDIAノードとMLXのMac Studioを隣り合わせで動かし、なおかつ1つのフリートとして扱える。
KV認識ルーティング
ルータはKVキャッシュがどこにあるかを追跡し、それに応じて各リクエストを配置する。あるノードが繰り返しのプロンプトのコンテキストをすでに持っていれば、別の場所で新たなprefillを起こさず、そのノードへリクエストを送る。仕組みはこれだけだ。なぜ重要か。長い共有システムプロンプトを持つチャットやエージェントのワークロードでは、無駄な計算を最も直接的に減らす機能になる。しかも効果はすぐに積み上がる。
prefillとdecodeの分離
Cognitoraはprefillとdecodeを別々のプールに分けることを前提に設計されている。一部のマシンをプロンプト処理に、別のマシンをトークン生成に充て、ルータとKVキャッシュに両者の間で作業を移させる。フェーズを分ければいい。より大きなキャッシュのために、RAMとSSDにまたがる多層KVストレージもサポートする。
ベアメタル最優先のデプロイ
システム全体は6つの静的バイナリとしてcurl 1行でインストールされ、systemdの下で動く。Pythonのコントロールプレーンは介在しない。ベアメタルLLMクラスタを一言でいえばこれだ。Podレベルのオーケストレーションが本当に必要になったときだけKubernetesオペレータを加えるので、デスクトップ数台でも十分に正しい対象になる。
依存ゼロのフリートダッシュボード
リポジトリには、Prometheusの /metrics エンドポイントを直接読む単一の静的HTMLファイルのダッシュボードが同梱されている。毎秒リクエスト数、毎秒トークン数、レイテンシとTTFTのパーセンタイル、キューの深さ、ノードごとの状態、KVキャッシュ使用率、フリートの電力、トークンあたりのエネルギーを表示する。Grafanaもバックエンドも要らない。
エネルギーを意識したスケジューリング
Cognitoraは電力を配置判断に組み込み、フリート全体のトークンあたりのエネルギーを報告する。混在したGPU群では、どのノードがワットあたり最も多くのトークンを出すかをオペレータが把握でき、作業をそちらへ寄せられる。電力はコストだ。電気代を自分で払う立場では、この点が効いてくる。
オープンソースで検証可能
プロジェクトはGitHubの活発なリポジトリで公開されており、ルーティングの判断、ドライバ、設定オプションのすべてがレビューに開かれている。完全にオープンソースの推論サーバーとして機能する。推論トラフィックを閉じた第三者サービスに通せないチームでも、コードを読み、フォークし、コントロールプレーン全体をセルフホストのAIフリートとして運用できる。
メリットとデメリット
メリット
- エンジン非依存の設計により、既存のvLLM、SGLang、llama.cppの構成を書き直さずに維持できる。
- KV認識ルーティングが重複したprefillの処理を減らし、コスト低下と安定したテールレイテンシにつながる。
- ベアメタル最優先のインストールにより、2台構成が現実的になる。Kubernetes製品の劣化したデモではない。
- 内蔵ダッシュボードがレイテンシ、毎秒トークン数、KV使用率、トークンあたりのエネルギーを追加ツールなしでカバーする。
- Rustで書かれPythonのコントロールプレーンがないため、実行時のフットプリントが小さいままになる。
デメリット
- ネイティブの階層ブロックマネージャやトポロジ認識のギャングスケジューリングといった一部の高度な機能はまだなく、NVL72クラスの超大規模フリートには別のスタックが必要になる。
- 設定には設定ファイル、PKI初期化、systemdへの習熟が前提となり、非技術系のユーザーは対象外になる。
- macOSはソースからのビルドでしか動かないため、ほとんどのMacユーザーは1行インストーラを使えない。
- TensorRT-LLMのサポートは既定のレシピがないspawnドライバのままで、この経路には手作業がより多く要る。
よくある質問
Cognitoraは複数のLLM推論エンジンをひとつの分散クラスタにまとめる。ノードをまたいでリクエストをルーティングし、KVキャッシュがすでにある場所へ作業を配置し、GPUフリート全体のヘルスと消費電力を単一のコントロールプレーンから監視するために使う。
関連コンテンツ
Cognitoraに関連するツール、スキル、記事を探す。
Cognitoraの代替ツール
Forefront
Forefront · コーディングForefrontはオープンソースAIで構築するためのウェブプラットフォームだ。主要なオープンソース言語モデルを自分のデータで微調整し、性能を評価し、API経由で実行したり、エクスポートして自分でホストしたりできる。クローズドなプラットフォームの手軽さを求めつつ、モデルとデータの所有権にはこだわる開発者が対象だ。
Startkit
StartKit.AI · コーディングStartkitは、AI SaaSとAIラッパー製品を作るためのボイラープレートだ。面倒な部分をあらかじめ配線済みにしたAIスタートアップボイラープレートと考えればいい。認証、StripeとLemon Squeezyの決済、利用制限、トランザクションメール、そしてOpenAI、Anthropic、Groq、Llamaと通信するAI APIスターターキットが含まれる。リポジトリをクローンして価格を設定し、ユーザーが実際にお金を払う部分に取りかかれる。ReactとTailwind上のNext.jsで作られているため、ボイラープレートコードの多くはすでに見慣れたものだ。
Testim
Tricentis · コーディングTestimは、Web・モバイル・Salesforceアプリ向けにエンドツーエンドテストを構築して実行するAIテスト自動化プラットフォームだ。機械学習を頼りに、インターフェースが変わってもテストを安定させ、チームが壊れたセレクターの修正に費やす時間を減らす。今日から使い始められる自動テストツールとしては悪くない。ブラウザで操作を録画してテストを作り、より細かい制御が必要なときはJavaScriptを足す。忙しいQAチームにとって堅実な選択肢である。
