
Cognitora
Cognitora · 코딩
Cognitora는 여러 대규모 언어 모델 엔진을 하나의 분산 클러스터로 조율하는 오픈소스 추론 오케스트레이션 플랫폼이다. 기존 엔진을 대체하는 대신 vLLM, SGLang, llama.cpp, MLX는 물론 OpenAI 호환 서버 위에 자리 잡고, 올바른 KV 캐시가 이미 있는 노드로 요청을 보낸다. 자체 GPU를 운영하는 팀을 겨냥하며, 책상 위 두세 대의 장비부터 혼합된 데이터센터 플릿까지 대상으로 한다. 배포 형태는 6개의 정적 바이너리이며 curl 한 줄로 설치한다.

Cognitora 소개
Cognitora란 무엇인가
Cognitora는 LLM 추론 오케스트레이션을 위한 자체 호스팅 컨트롤 플레인이다. 이미 신뢰하는 엔진은 그대로 두고 어려운 부분을 Cognitora에 맡긴다. 라우팅, 캐시 배치, 상태, 전력, 그리고 여러 장비에 걸친 관측성이다. 프로젝트는 Rust로 작성됐으며 NVIDIA Dynamo 같은 오케스트레이터의 직접적인 대안으로 자리매김한다. 엔진 지원 범위는 더 넓고 배포는 베어메탈을 우선한다. 바이너리 6개. 컨트롤 플레인 하나.
이것이 해결하는 핵심 문제는 파편화다. 플릿은 대개 서로 다른 하드웨어에서 서로 다른 엔진을 돌리게 되고, 단순한 로드 밸런서는 어떤 장비가 이미 관련 캐시를 들고 있어도 요청을 무작위 노드로 보낸다. Cognitora는 KV 인식 라우팅을 더해 요청이 메모리가 있는 곳에 도착하게 한다. 이는 중복된 prefill 작업을 줄이고 꼬리 지연을 억제한다. 토큰당 에너지도 기록하는데, 대부분의 오케스트레이터가 무시하는 부분이다.
vLLM에 절대 묶이지 않는 vLLM 오케스트레이터라고 생각하면 된다. 미리 감안해야 할 가장 큰 제약은 규모다. Cognitora는 NVL72급의 거대한 배포보다 이기종·에너지 인식·운영 부담이 적은 추론에서 앞선다고 솔직히 밝히며, 계층형 캐시와 토폴로지 관련 고급 기능 일부는 아직 로드맵에 있다. 진행 중인 요청 마이그레이션이나 GPU 간 가중치 스트리밍이 당장 필요하다면 더 무거운 스택이 맞을 수 있다. 나머지 팀에게는 가벼운 발자취 자체가 장점이다.
시작하기
- Linux에서는 curl 명령 하나로 바이너리를 설치하고, macOS라면 cargo로 소스에서 빌드한다.
cgn-ctl pki bootstrap으로 로컬 PKI 파일을 초기화한 뒤 mTLS를 요구할지 결정한다.cgn-ctl key create로 권한을 좁힌 API 키를 발급한다.- 클러스터 이름을 정하고 모델 위치와 라우터의 HTTP·gRPC 포트를 지정하는 짧은
cognitora.toml을 작성한다. cgn-router를 실행하고 엔진 드라이버를 실제 백엔드로 향하게 한 뒤 OpenAI SDK로 질의해 토큰이 끝에서 끝까지 흐르는지 확인한다.
제품 정보
Cognitora의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.
추천 대상
이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.
사용자
- ML 플랫폼 엔지니어
- 스타트업 인프라 팀
- 하드웨어가 혼합된 연구실
작업
- 하나의 모델을 여러 엔진에서 실행
- prefill 비용 절감
- 토큰당 전력 추적
- 빠른 데모 클러스터 구축
활용 상황
- 부하가 걸린 16노드 혼합 플릿
- 책상 규모 실험
- 운영 환경 Kubernetes 배포
- prefill과 decode 분리
주요 기능
엔진 독립적 오케스트레이션
Cognitora는 추론 엔진을 대체하지 않고 여러 엔진을 하나의 클러스터로 조율한다. OpenAI의 HTTP 인터페이스를 노출하는 백엔드라면 무엇이든 합류할 수 있고, vLLM, SGLang, llama.cpp, MLX, TensorRT-LLM용 드라이버를 제공한다. 혼합 하드웨어는 당연한 전제다. 즉 vLLM을 쓰는 NVIDIA 노드와 MLX를 쓰는 Mac Studio를 나란히 두고도 하나의 플릿으로 다룰 수 있다.
KV 인식 라우팅
라우터는 KV 캐시가 어디 있는지 추적하고 그에 맞춰 각 요청을 배치한다. 어떤 노드가 반복 프롬프트의 컨텍스트를 이미 가지고 있다면, 다른 곳에서 새로운 prefill을 일으키지 않고 그 노드로 요청을 보낸다. 핵심은 이것뿐이다. 왜 중요한가. 긴 공유 시스템 프롬프트를 쓰는 채팅과 에이전트 워크로드에서 낭비되는 연산을 가장 직접적으로 줄이는 기능이기 때문이다. 그리고 효과는 빠르게 쌓인다.
prefill과 decode 분리
Cognitora는 prefill과 decode를 서로 다른 풀로 나누는 것을 중심으로 설계됐다. 일부 장비는 프롬프트 처리에, 다른 장비는 토큰 생성에 전담시키고 라우터와 KV 캐시가 둘 사이에서 작업을 옮기게 한다. 단계를 분리하면 된다. 더 큰 캐시를 위해 RAM과 SSD에 걸친 다계층 KV 스토리지도 지원한다.
베어메탈 우선 배포
시스템 전체가 6개의 정적 바이너리로 curl 한 줄에 설치되고 systemd 아래에서 실행되며 Python 컨트롤 플레인은 개입하지 않는다. 베어메탈 LLM 클러스터를 한 문장으로 요약하면 이렇다. 파드 수준 오케스트레이션이 정말 필요할 때만 Kubernetes 오퍼레이터를 더하므로, 데스크톱 두어 대도 충분히 정당한 대상이다.
의존성 없는 플릿 대시보드
저장소에는 Prometheus /metrics 엔드포인트를 직접 읽는 단일 정적 HTML 파일 형태의 독립 대시보드가 들어 있다. 초당 요청 수, 초당 토큰 수, 지연과 TTFT 백분위, 큐 깊이, 노드별 상태, KV 캐시 사용률, 플릿 전력, 토큰당 에너지를 보여준다. Grafana도 백엔드도 필요 없다.
에너지 인식 스케줄링
Cognitora는 전력을 배치 결정에 반영하고 플릿 전체의 토큰당 에너지를 보고한다. 혼합된 GPU 구성에서 운영자는 어느 노드가 와트당 가장 많은 토큰을 내는지 파악하고 작업을 그쪽으로 유도할 수 있다. 전력은 돈이다. 전기요금을 직접 내는 입장에서는 중요한 문제다.
오픈소스이며 검증 가능
프로젝트는 GitHub의 활발한 저장소에서 운영되므로 모든 라우팅 결정과 드라이버, 설정 옵션이 검토에 열려 있다. 완전한 오픈소스 추론 서버로 동작한다. 추론 트래픽을 폐쇄된 제3자 서비스로 보낼 수 없는 팀도 코드를 읽고 포크해 컨트롤 플레인 전체를 자체 호스팅 AI 플릿으로 운영할 수 있다.
장단점
장점
- 엔진 독립적 설계 덕분에 기존 vLLM, SGLang, llama.cpp 구성을 다시 작성하지 않고 유지할 수 있다.
- KV 인식 라우팅이 중복된 prefill 작업을 줄여 비용 절감과 안정적인 꼬리 지연으로 나타난다.
- 베어메탈 우선 설치라 두 대 구성이 현실적이다. Kubernetes 제품의 축소된 데모가 아니다.
- 내장 대시보드가 지연, 초당 토큰 수, KV 사용률, 토큰당 에너지를 추가 도구 없이 다룬다.
- Rust로 작성되고 Python 컨트롤 플레인이 없어 실행 시 발자취가 작게 유지된다.
단점
- 네이티브 계층형 블록 매니저와 토폴로지 인식 갱 스케줄링 같은 고급 기능은 아직 없어, NVL72급 초대형 플릿에는 다른 스택이 필요하다.
- 설정에 설정 파일, PKI 초기화, systemd에 대한 익숙함을 전제로 하므로 비기술 사용자는 배제된다.
- macOS는 소스 빌드로만 동작하므로 대부분의 Mac 사용자는 한 줄 설치 프로그램을 쓸 수 없다.
- TensorRT-LLM 지원은 기본 레시피가 없는 spawn 드라이버에 머물러 있어 이 경로에는 수작업이 더 필요하다.
자주 묻는 질문
Cognitora는 여러 LLM 추론 엔진을 하나의 분산 클러스터로 조율한다. 노드 간에 요청을 라우팅하고, KV 캐시가 이미 있는 곳에 작업을 배치하며, GPU 플릿 전체의 상태와 전력 소비를 단일 컨트롤 플레인에서 지켜보는 데 쓴다.
관련 콘텐츠
Cognitora와 관련된 도구, 스킬, 아티클을 살펴보세요.
Cognitora 대안
Forefront
Forefront · 코딩Forefront는 오픈소스 AI로 무언가를 만드는 웹 플랫폼이다. 대표적인 오픈소스 언어 모델을 자신의 데이터로 미세 조정하고, 성능을 평가하고, API로 실행하거나 내보내 직접 호스팅할 수 있다. 폐쇄형 플랫폼의 편의를 원하면서도 모델과 데이터의 소유권은 놓지 않으려는 개발자가 대상이다.
Startkit
StartKit.AI · 코딩Startkit은 AI SaaS와 AI 래퍼 제품을 만들기 위한 보일러플레이트다. 지루한 부분을 미리 연결해 둔 AI 스타트업 보일러플레이트라고 생각하면 된다. 인증, Stripe와 Lemon Squeezy 결제, 사용량 제한, 트랜잭션 이메일, 그리고 OpenAI, Anthropic, Groq, Llama와 통신하는 AI API 스타터 키트가 포함된다. 저장소를 복제하고 가격을 정한 뒤 사용자가 실제로 돈을 내는 부분에 착수하면 된다. React와 Tailwind 위의 Next.js로 만들어졌기 때문에 보일러플레이트 코드의 상당 부분이 이미 익숙하게 느껴진다.
Testim
Tricentis · 코딩Testim은 웹, 모바일, Salesforce 애플리케이션 전반에 걸쳐 엔드투엔드 테스트를 만들고 실행하는 AI 기반 테스트 자동화 플랫폼이다. 머신러닝에 기대어 인터페이스가 바뀌어도 테스트를 안정적으로 유지하므로, 팀은 깨진 셀렉터를 고치는 데 쓰는 시간을 줄인다. 오늘부터 쓸 수 있는 자동화 테스트 도구치고 나쁘지 않다. 브라우저에서 동작을 녹화해 테스트를 만들고, 더 세밀한 제어가 필요하면 JavaScript를 더한다. 바쁜 QA 팀에게 탄탄한 선택이다.
