Retrace

Retrace

Retrace · 코딩

Retrace는 AI 에이전트를 위한 실행 리플레이 엔진이다. 에이전트 실행 안의 모든 모델 호출, 도구 호출, 검색, 오류를 기록하고, 엔지니어가 그 실행을 한 단계씩 리플레이하게 해준다. 뭔가 망가지면 문제가 생긴 정확한 span에서 실행을 분기한다. 입력 하나나 모델 하나를 바꾼다. 그다음 하위의 모든 것을 다시 실행해 그 수정이 실제로 무엇을 하는지 본다.

Retrace 미리보기

Retrace 소개

Retrace란

Retrace는 AI 에이전트를 출시하는 팀을 위해 만든 디버깅과 검증 플랫폼이다. 로그를 읽고 에이전트가 왜 나쁜 답을 냈는지 추측하는 대신, 기록된 실행을 span 트리로 연다. 그다음 실패했거나 어긋났거나 근거 없는 결과를 반환한 첫 단계를 찾을 때까지 따라간다.

이 제품은 특정한 통증을 겨냥한다. 에이전트는 비결정적으로 동작하므로, 운영 환경에서 한 번 나타나는 버그는 재현하기 어렵다. Retrace는 실행을 리플레이 가능하게 만들어 이 문제를 푼다. 실행을 한 번 캡처한다. 그다음 필요한 만큼 여러 번 다시 실행한다.

가장 큰 한계는 범위다. Retrace는 개발자 도구이며 노코드 제품이 아니고, 당신의 에이전트가 지원 SDK에서 돌거나 OpenAI, Anthropic, Gemini와 통신한다고 가정한다. 특이한 스택을 쓰는 팀은 호출을 직접 계측해야 할 수도 있다. 또한 가격은 트레이스 양을 기준으로 한다. 양이 매우 많은 에이전트는 상위 플랜으로 빠르게 밀어 올린다.

시작하기

  1. Python은 pip install retrace-sdk, TypeScript는 npm install retrace-sdk로 SDK를 설치한다.
  2. retrace.configure(api_key="rt_...")로 API 키를 설정한다.
  3. 에이전트 함수를 @retrace.record 데코레이터로 감싸고, 나중에 캐스케이드 분기 리플레이를 쓰려면 resumable=True를 설정한다.
  4. 에이전트를 한 번 실행한다. OpenAI, Anthropic, Gemini로 가는 제공자 호출은 자동으로 계측되므로 트레이스는 추가 작업 없이 그것들을 포착한다.
  5. 기록된 트레이스를 열고 span 트리를 살피고, 처음 갈라진 단계에서 분기해 수정을 시험한다.

제품 정보

Retrace의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.

무료 플랜예
유료 플랜$0 - $2000/mo
플랫폼Web, Python SDK, TypeScript SDK
개발사Retrace
카테고리코딩
출시일Aug 2025
최근 업데이트Aug 2025
웹사이트 방문 수N/A
웹사이트 글로벌 순위N/A
API 제공 여부예

추천 대상

이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.

사용자

  • 운영 환경의 에이전트 실패를 디버깅하는 AI 엔지니어
  • 에이전트 동작에 CI 검사를 추가하는 플랫폼 팀
  • 에이전트가 운영 준비가 됐는지 평가하는 창업자

작업

  • 비결정적 실패 재현
  • 프롬프트나 모델 변경 시험
  • 출시 전 수정 검증
  • 통제를 벗어난 지출 차단

활용 상황

  • 고객이 잘못된 답을 신고했고 어느 도구 호출이 원인인지 찾아야 한다
  • 프롬프트 미세 조정이 하위 단계를 조용히 망가뜨린다
  • 팀이 버그의 정제된 예시를 공유하려 한다

주요 기능

실행 기록

Retrace는 모든 모델 호출, 도구 호출, 검색, 오류를 입력, 출력, 비용, 타이밍과 함께 span으로 포착한다. OpenAI, Anthropic, Gemini로 가는 제공자 호출은 자동으로 계측되므로 하나하나 손으로 연결할 필요가 없다. 결과는 에이전트가 실제로 한 일에 대한 완전하고 구조화된 기록이다. 부분적인 로그가 아니다. 추측도 아니다.

분기와 캐스케이드 리플레이

이것이 Retrace를 단순한 AI 에이전트 모니터링 도구와 구분하는 기능이다. 기록된 실행을 수정한 입력을 가진 단일 span에서 분기한 뒤, 하위의 모든 단계를 캐스케이드 리플레이해 에이전트 전체가 새 경로로 다시 실행되게 한다. 로그가 답할 수 없는 질문에 답한다. 이 하나를 바꾸면 더 아래에서 무엇이 망가지는가.

수정 증명

프롬프트, 도구, 모델을 바꾼 뒤 수정-증명이 실패한 실행을 다시 돌려 판정을 돌려준다. 개선, 퇴행, 변화 없음 중 하나와 처음 갈라진 span을 얻는다. "이게 고친 것 같다"를 검증 가능한 결과로 바꾼다.

CI/CD용 평가 게이트

평가와 게이트 기능이 기록된 실행을 행동 기준에 따라 채점하고 파이프라인을 위한 통과 또는 실패 게이트 결정을 반환한다. 팀은 CI에서 일반 테스트와 나란히 행동 검사를 돌릴 수 있다. 어긋난 에이전트는 사용자에게 닿기 전에 잡힌다. 다중 에이전트 심사 감지기는 Pro 플랜부터 제공된다.

예산과 가드레일 강제

에이전트가 다음 모델이나 도구 호출을 하기 전에, 예산-강제가 그 호출이 허용되는지 묻는다. 비용 예산, 루프 감지, 지연 상한에 따라 허용, 차단, 보류를 반환한다. 통제를 벗어난 루프나 값비싼 지출 급증을 일어나기 전에 멈추는 방법이다. 청구서가 온 뒤가 아니다.

트레이스 전반의 의미 검색

span-검색이 기록된 span과 에이전트 기억에 대해 의미 검색을 실행해, 어떤 동작, 프롬프트, 실패의 이전 발생을 정확한 문자열이 아니라 의미로 찾는다. 비슷한 버그가 3주 전에 나타났다면 정확한 표현을 기억하지 못해도 끌어낼 수 있다.

에이전트 기억

Retrace는 MCP 기반의 기억 저장소를 제공해 이전 에이전트 실행에서 추출한 지속적인 사실, 선호, 수정, 패턴을 보관한다. 에이전트는 그것들을 의미로 떠올릴 수 있고, 이는 매번 같은 수정을 다시 배우는 대신 세션을 넘어 동작을 일관되게 유지하는 데 도움이 된다.

게시된 테이프

테이프-게시가 정리된 실행을 대화형이고 공유 가능한 테이프로 바꾼다. 버그 리포트, 데모, 사후 분석에 쓸모가 있고, 개인정보 마스킹은 모든 플랜에 포함된다. 무료 등급은 월 10건의 게시 테이프를 허용한다.

장단점

장점

  • 단계별 리플레이가 비결정적 에이전트 실패를 재현 가능하게 만든다. 이는 대부분의 로그 도구가 풀지 못한 채 남기는 핵심 문제다.
  • 분기와 캐스케이드 리플레이가 단일 변경을 하위 경로 전체에 시험하므로, 부작용이 운영 환경에 닿기 전에 보인다.
  • OpenAI, Anthropic, Gemini용 자동 계측이 설정 작업을 데코레이터 하나와 API 키로 줄인다.
  • 무료 플랜은 진짜이며 체험이 아니다. 1,000건의 트레이스, 10회의 분기 리플레이, 개인정보 마스킹이 모두 포함된다.
  • CI 평가 게이트가 에이전트 동작을 일반 코드처럼 시험하게 해주고, 파이프라인이 행동할 수 있는 통과 또는 실패 결과를 준다.

단점

  • 결정적 카세트 리플레이를 위한 $29/mo 미만의 셀프서비스 진입이 없어, 1인 개발자는 무료 플랜에서 리플레이 깊이가 제한된다.
  • 무료 플랜은 트레이스를 7일 보관하고 좌석을 하나만 주므로, 트레이스를 공유하는 팀에는 부족하다.
  • 지원이 OpenAI, Anthropic, Gemini 제공자로 제한되어, 다른 모델 제공자의 에이전트는 수동 계측이 필요하다.

자주 묻는 질문

Retrace는 AI 에이전트 실행을 기록하고 리플레이 가능하게 만든다. 실행을 한 번 캡처한 뒤 리플레이하고, 어느 단계에서든 분기하고, 원래 실패가 다시 일어나지 않아도 변경을 시험한다.

관련 콘텐츠

Retrace와 관련된 도구, 스킬, 아티클을 살펴보세요.

Retrace 대안

Forefront

Forefront

Forefront · 코딩

Forefront는 오픈소스 AI로 무언가를 만드는 웹 플랫폼이다. 대표적인 오픈소스 언어 모델을 자신의 데이터로 미세 조정하고, 성능을 평가하고, API로 실행하거나 내보내 직접 호스팅할 수 있다. 폐쇄형 플랫폼의 편의를 원하면서도 모델과 데이터의 소유권은 놓지 않으려는 개발자가 대상이다.

무료 / $0 - $99/mo자세히 보기
Startkit

Startkit

StartKit.AI · 코딩

Startkit은 AI SaaS와 AI 래퍼 제품을 만들기 위한 보일러플레이트다. 지루한 부분을 미리 연결해 둔 AI 스타트업 보일러플레이트라고 생각하면 된다. 인증, Stripe와 Lemon Squeezy 결제, 사용량 제한, 트랜잭션 이메일, 그리고 OpenAI, Anthropic, Groq, Llama와 통신하는 AI API 스타터 키트가 포함된다. 저장소를 복제하고 가격을 정한 뒤 사용자가 실제로 돈을 내는 부분에 착수하면 된다. React와 Tailwind 위의 Next.js로 만들어졌기 때문에 보일러플레이트 코드의 상당 부분이 이미 익숙하게 느껴진다.

유료 / $99 - $499 one-time자세히 보기
Testim

Testim

Tricentis · 코딩

Testim은 웹, 모바일, Salesforce 애플리케이션 전반에 걸쳐 엔드투엔드 테스트를 만들고 실행하는 AI 기반 테스트 자동화 플랫폼이다. 머신러닝에 기대어 인터페이스가 바뀌어도 테스트를 안정적으로 유지하므로, 팀은 깨진 셀렉터를 고치는 데 쓰는 시간을 줄인다. 오늘부터 쓸 수 있는 자동화 테스트 도구치고 나쁘지 않다. 브라우저에서 동작을 녹화해 테스트를 만들고, 더 세밀한 제어가 필요하면 JavaScript를 더한다. 바쁜 QA 팀에게 탄탄한 선택이다.

무료 / Custom pricing on request자세히 보기