
TraceLLM
TraceLLM · 코딩
TraceLLM은 프로덕션에서 AI 앱을 운영하는 팀을 위한 로컬 우선 LLM 옵저버빌리티 플랫폼이다. 세션, 스팬, 프롬프트와 출력(허용한 경우), 토큰 사용량, 지연 시간, 오류를 챗봇, 에이전트, RAG 파이프라인 전반에서 기록하고, 모든 것을 하나의 트레이스 타임라인에 보여준다. 정책 계층이 무엇을 수집하고, 가리고, 버릴지 결정하며, OpenTelemetry 내보내기 경로가 선택한 트레이스를 SigNoz나 Honeycomb 같은 백엔드로 전달한다. 그럼 그걸로 무엇을 얻는가. 어떤 답변이 왜 잘못됐는지 답할 수 있는 단 하나의 장소다.

TraceLLM 소개
TraceLLM이란 무엇인가
TraceLLM은 AI 앱을 위해 전용으로 만든 옵저버빌리티 플랫폼이다. 단서를 각 공급자 대시보드, 앱 로그, 사용자 버그 리포트에 흩뿌리는 대신, 각 AI 워크플로에 하나의 트레이스 타임라인을 준다. 무엇이 그것을 촉발했는지, 어떤 모델 호출이 실행됐는지, 각 단계가 얼마나 걸렸는지, 토큰을 얼마나 태웠는지, 어디서 실패했는지 알 수 있다.
이 프로젝트는 MIT 라이선스 오픈소스이며 코드는 GitHub에, 호스팅 앱은 tracellm.in에 있다. 흔한 문제에서 나왔다. 잘못된 답변이 프로덕션에서 나타나는데, 앱 코드와 벡터 저장소, 모델 공급자는 각각 이야기의 조각만 쥐고 있다. TraceLLM은 그 조각들을 하나의 검증 가능한 기록으로 다시 꿰맨다.
주요 한계는 성숙도다. TraceLLM은 어리다. Node SDK는 npm에 공개된 릴리스가 아니라 워크스페이스 패키지이고, 문서도 아직 로컬 퀵스타트로 설정을 안내한다. 통합 사례가 풍부한 검증된 도구가 지금 필요하다면, 아직 그것은 아니다. 코드를 읽고 직접 호스팅하고 싶다면 잘 맞는다.
시작하기
- tracellm.in에서 계정을 만들거나,
pnpm install,pnpm infra:build,pnpm infra:up으로 스택을 로컬에서 실행한다. - 프로젝트를 만들고 프로젝트 범위 API 키(
trllm_...)를 복사한다. - 앱에 Node SDK를 설치하고 엔드포인트, API 키, 서비스 이름으로 세션을 시작한다.
- 모델 호출을 스팬으로 감싼 뒤 이벤트, 토큰 수, 오류를 진행하며 기록한다.
- Trace Explorer를 열어 각 세션을 살펴보고, 원하면 OTLP 엔드포인트를 추가해 트레이스를 자체 백엔드로 전달한다.
제품 정보
TraceLLM의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.
추천 대상
이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.
사용자
- AI 엔지니어와 백엔드 개발자
- 플랫폼 예산이 없는 소규모 제품 팀
- 디버깅에 집중하는 지원 담당자
작업
- 잘못된 챗봇 답변 추적
- 토큰 지출 관찰
- 오류를 실제 세션에 붙여 유지
- 기존 APM으로 내보내기
활용 상황
- 에이전트를 프로덕션에 출시하고 실패한 대화를 재생할 방법이 필요하다
- 프롬프트에 개인 데이터가 담기는 콘텐츠 규칙 아래에서 작업한다
- 여러 AI 서비스에 걸쳐 옵저버빌리티를 표준화한다
주요 기능
세션 및 스팬 트레이싱
TraceLLM은 AI 워크플로를 중첩된 스팬을 가진 세션으로 구성한다. 세션은 사용자 턴을 담는다. 각 스팬은 공급자 호출, 검색 단계, 도구 실행 같은 하나의 작업 단위를 담는다. 이것이 LLM 트레이싱의 핵심이다. 세션을 시작하고, 그 안에서 스팬을 열고, 이벤트가 일어나는 대로 기록하고, 둘 다 상태로 닫는다. 이 구조가 어지러운 로그 줄 더미를 재생 가능한 하나의 실행으로 바꾼다.
수집 정책 제어
모든 것을 저장해서는 안 된다. 프로젝트별로 정책을 정한다. 프롬프트와 출력 내용을 수집할지, 메타데이터와 사용량을 얼마나 보관할지, 마스킹이 API 키와 bearer 토큰을 데이터베이스에 닿기 전에 가릴지. 여기서 프롬프트 트레이싱이 안전장치를 얻는다. 샘플링은 세션의 0%에서 100%까지 수집할 수 있고, 특정 스팬 종류는 통째로 건너뛸 수 있다.
토큰 사용량 및 지연 시간 추적
각 스팬은 속성과 나란히 토큰 수와 시간을 실을 수 있다. 비용과 속도가 호출 자체와 같은 뷰에 놓인다. 어느 단계가 느리고 어느 것이 비싼지 보인다. 두 대시보드를 합칠 필요가 없다. 이것이 청구서가 올랐다는 것과 어떤 프롬프트가 원인인지를 아는 것의 차이다.
OpenTelemetry 및 OTLP 내보내기
TraceLLM은 자체 제품 타임라인을 유지하면서 선택한 트레이스를 고객 소유 OTLP HTTP 수집기로 전달할 수 있다. 엔드포인트를 붙여 넣고 전달할 신호를 고르면 데이터가 SigNoz, Honeycomb, Tempo, Datadog 또는 OTLP 호환 백엔드로 흐른다. 이미 APM을 운영하는 팀은 기존 스택을 유지하고 TraceLLM을 그 위의 AI 전용 계층으로 다룰 수 있다.
공급자 비종속 계측
한 공급자에 묶지 않는 AI 디버깅 도구라고 보면 된다. 스팬은 어떤 모델을 호출하는지 신경 쓰지 않는다. TraceLLM은 OpenAI, Claude, Gemini, 자체 라우터, 내부 서비스, MCP 형태 워크플로와 동작한다. 공급자 전용 플러그인에 의존하지 않고 호출을 직접 감싸기 때문이다. 모델이나 게이트웨이를 바꿔도 트레이싱 설정은 깨지지 않는다.
프로젝트 범위 API 키
각 API 키는 요청을 하나의 프로젝트에 대응시키고 그 프로젝트의 수집 정책을 SDK 런타임으로 가져간다. 여러 키를 만든다. 이름을 붙인다. 서비스가 쓰지 않게 되면 옛 키를 폐기한다. 이렇게 하면 공유 정책이 무관한 앱으로 새지 않고, 키 교체가 간단한 두 단계 작업이 된다.
장단점
장점
- MIT 라이선스 오픈소스라 구독이 없고 코드를 읽을 수 있다.
- 로컬 우선 설계 덕에 셀프 호스팅하고 트레이스 데이터를 자체 인프라에 둘 수 있다.
- 수집 정책이 내용, 메타데이터, 사용량, 오류를 분리해 민감한 프롬프트에 도움이 된다.
- OTLP 내보내기 덕에 기존 SigNoz나 Datadog 설정을 버리지 않아도 된다.
- 공급자 비종속 스팬이 플러그인 없이 OpenAI, Claude, Gemini, 자체 게이트웨이를 포괄한다.
단점
- Node SDK가 아직 npm에 공개되지 않아 초기 사용자는 저장소나 워크스페이스 패키지에서 설치한다.
- 어린 프로젝트라 기성 통합과 커뮤니티 예시가 성숙한 도구보다 적다고 예상해야 한다.
- 셀프 호스팅은 배포, 업그레이드, 저장소 용량 산정을 직접 감당한다는 뜻이다.
- 문서가 아직 채워지는 중이라 일부 설정 단계는 소스 코드를 읽어야 한다.
자주 묻는 질문
TraceLLM은 프로덕션의 AI 앱을 디버깅하고 모니터링하는 데 쓴다. 챗봇, 에이전트, RAG 파이프라인의 세션, 스팬, 토큰 사용량, 지연 시간, 오류를 기록하고 하나의 타임라인에 보여주므로 특정 답변이 왜 잘못됐는지 찾을 수 있다.
관련 콘텐츠
TraceLLM와 관련된 도구, 스킬, 아티클을 살펴보세요.
TraceLLM 대안
Forefront
Forefront · 코딩Forefront는 오픈소스 AI로 무언가를 만드는 웹 플랫폼이다. 대표적인 오픈소스 언어 모델을 자신의 데이터로 미세 조정하고, 성능을 평가하고, API로 실행하거나 내보내 직접 호스팅할 수 있다. 폐쇄형 플랫폼의 편의를 원하면서도 모델과 데이터의 소유권은 놓지 않으려는 개발자가 대상이다.
Startkit
StartKit.AI · 코딩Startkit은 AI SaaS와 AI 래퍼 제품을 만들기 위한 보일러플레이트다. 지루한 부분을 미리 연결해 둔 AI 스타트업 보일러플레이트라고 생각하면 된다. 인증, Stripe와 Lemon Squeezy 결제, 사용량 제한, 트랜잭션 이메일, 그리고 OpenAI, Anthropic, Groq, Llama와 통신하는 AI API 스타터 키트가 포함된다. 저장소를 복제하고 가격을 정한 뒤 사용자가 실제로 돈을 내는 부분에 착수하면 된다. React와 Tailwind 위의 Next.js로 만들어졌기 때문에 보일러플레이트 코드의 상당 부분이 이미 익숙하게 느껴진다.
Testim
Tricentis · 코딩Testim은 웹, 모바일, Salesforce 애플리케이션 전반에 걸쳐 엔드투엔드 테스트를 만들고 실행하는 AI 기반 테스트 자동화 플랫폼이다. 머신러닝에 기대어 인터페이스가 바뀌어도 테스트를 안정적으로 유지하므로, 팀은 깨진 셀렉터를 고치는 데 쓰는 시간을 줄인다. 오늘부터 쓸 수 있는 자동화 테스트 도구치고 나쁘지 않다. 브라우저에서 동작을 녹화해 테스트를 만들고, 더 세밀한 제어가 필요하면 JavaScript를 더한다. 바쁜 QA 팀에게 탄탄한 선택이다.
