
Retrace
Retrace · Programação
O Retrace é um motor de repetição de execução para agentes de IA. Ele grava cada chamada ao modelo, cada invocação de ferramenta, cada recuperação e cada erro dentro da execução de um agente, e então deixa os engenheiros repetirem essa execução passo a passo. Quando algo quebra, você bifurca a execução a partir do span exato onde deu errado. Muda uma entrada ou um modelo. Depois roda tudo de novo a jusante para ver o que a correção realmente faz.

Sobre Retrace
O que é o Retrace
O Retrace é uma plataforma de depuração e verificação feita para equipes que colocam agentes de IA em produção. Em vez de ler logs e adivinhar por que um agente deu uma resposta ruim, você abre a execução gravada como uma árvore de spans. Depois a percorre até achar o primeiro passo que falhou, desviou ou devolveu um resultado sem base.
O produto mira uma dor específica. Agentes se comportam de forma não determinística, então um bug que aparece uma vez em produção é difícil de reproduzir. O Retrace resolve isso tornando as execuções repetíveis. Você captura a execução uma vez. Depois a reexecuta quantas vezes precisar.
A principal limitação é o escopo. O Retrace é uma ferramenta para desenvolvedores, não um produto sem código, e presume que seu agente roda nos SDKs compatíveis ou conversa com OpenAI, Anthropic ou Gemini. Equipes com stacks incomuns talvez precisem instrumentar as chamadas à mão. Além disso, o preço é por volume de traces. Agentes de volume muito alto empurram você rápido para planos superiores.
Primeiros passos
- Instale o SDK com
pip install retrace-sdkpara Python ounpm install retrace-sdkpara TypeScript. - Configure sua chave de API com
retrace.configure(api_key="rt_..."). - Envolva a função do seu agente no decorador
@retrace.recorde definaresumable=Truese quiser a repetição em cascata com bifurcação depois. - Rode seu agente uma vez. Chamadas aos provedores OpenAI, Anthropic e Gemini são instrumentadas automaticamente, então o trace as captura sem trabalho extra.
- Abra o trace gravado, inspecione a árvore de spans e bifurque a partir do primeiro passo divergente para testar uma correção.
Informações do produto
Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de Retrace.
Ideal para
Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.
Usuários
- Engenheiros de IA que depuram falhas de agentes em produção
- Equipes de plataforma que adicionam checagens de CI para o comportamento de agentes
- Fundadores avaliando se um agente está pronto para produção
Tarefas
- Reproduzir uma falha não determinística
- Testar uma mudança de prompt ou de modelo
- Verificar uma correção antes de publicar
- Conter gastos descontrolados
Cenários
- Um cliente relata uma resposta errada e você precisa achar qual chamada de ferramenta a causou
- Um ajuste de prompt quebra em silêncio um passo a jusante
- Uma equipe quer compartilhar um exemplo higienizado de um bug
Principais recursos
Gravação de execuções
O Retrace captura cada chamada ao modelo, cada invocação de ferramenta, cada recuperação e cada erro como um span com sua entrada, saída, custo e tempo. Chamadas aos provedores OpenAI, Anthropic e Gemini são instrumentadas automaticamente, então você não precisa conectar cada uma à mão. O resultado é um registro completo e estruturado do que seu agente de fato fez. Não um log parcial. Não um palpite.
Bifurcação e repetição em cascata
Este é o recurso que separa o Retrace das ferramentas simples de monitoramento de agentes de IA. Você ramifica uma execução gravada em um único span com uma entrada modificada e depois repete em cascata cada passo a jusante para que o agente inteiro reexecute pelo novo caminho. Ele responde uma pergunta que os logs não conseguem. Se eu mudar esta única coisa, o que quebra mais abaixo?
Provar a correção
Depois de mudar um prompt, uma ferramenta ou um modelo, provar-a-correção reexecuta a execução que falhou e devolve um veredito. Você recebe um de três resultados: melhorou, regrediu ou inalterado, mais o primeiro span divergente. Isso vira "acho que consertei" em um resultado verificável.
Portões de avaliação para CI/CD
O recurso de avaliar e aplicar portões pontua execuções gravadas contra critérios de comportamento e devolve uma decisão de portão passa ou falha para um pipeline. Equipes podem rodar checagens de comportamento no CI junto aos testes normais. Um agente que desvia é pego antes de chegar aos usuários. Detectores de juiz multiagente estão disponíveis a partir do plano Pro.
Aplicação de orçamentos e barreiras
Antes de seu agente fazer a próxima chamada ao modelo ou à ferramenta, aplicar-orçamento pergunta se essa chamada é permitida. Ele devolve permitir, bloquear ou segurar com base em orçamentos de custo, detecção de loops e tetos de latência. É assim que você para um loop descontrolado ou um pico caro de gasto antes que aconteça. Não depois que a conta chega.
Busca semântica nos traces
Buscar-spans roda uma busca semântica nos spans gravados e nas memórias do agente para achar ocorrências anteriores de um comportamento, prompt ou falha por significado em vez de texto exato. Se um bug parecido apareceu três semanas atrás, você consegue trazê-lo à tona sem lembrar a frase exata.
Memória do agente
O Retrace traz um armazenamento de memória baseado em MCP que guarda fatos persistentes, preferências, correções e padrões extraídos de execuções anteriores do agente. Os agentes podem recordá-los por significado, o que ajuda a manter o comportamento consistente entre sessões em vez de reaprender as mesmas correções toda vez.
Fitas publicadas
Publicar-fita transforma uma execução depurada em uma fita interativa e compartilhável. Serve para relatórios de bug, demos e análises posteriores, e a remoção de dados pessoais vem incluída em todos os planos. O nível gratuito permite 10 fitas publicadas por mês.
Prós e contras
Prós
- A repetição passo a passo torna reproduzíveis as falhas não determinísticas dos agentes, que é o problema central que a maioria das ferramentas de log deixa sem resolver.
- A bifurcação e a repetição em cascata testam uma única mudança contra todo o caminho a jusante, então você vê os efeitos colaterais antes de chegarem à produção.
- A instrumentação automática para OpenAI, Anthropic e Gemini reduz a configuração a um decorador e uma chave de API.
- O plano gratuito é real, não uma avaliação: 1.000 traces, 10 repetições com bifurcação e remoção de dados pessoais incluídos.
- Os portões de avaliação de CI permitem testar o comportamento do agente como código normal, com um resultado de passa ou falha sobre o qual um pipeline pode agir.
Contras
- Não há entrada autoatendimento abaixo de $29/mo para a repetição determinística com cassetes, então desenvolvedores solo têm pouca profundidade de repetição no plano gratuito.
- O plano gratuito guarda os traces por 7 dias e dá um único assento, o que não cobre uma equipe que compartilha traces.
- O suporte se limita aos provedores OpenAI, Anthropic e Gemini, então agentes em outros provedores de modelo precisam de instrumentação manual.
Perguntas frequentes
O Retrace grava execuções de agentes de IA e as torna repetíveis. Você captura uma execução uma vez e depois a repete, a bifurca em qualquer passo e testa mudanças sem precisar que a falha original aconteça de novo.
Conteúdo relacionado
Explore ferramentas, skills e artigos relacionados a Retrace.
Alternativas a Retrace
Forefront
Forefront · ProgramaçãoO Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.
Startkit
StartKit.AI · ProgramaçãoStartkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.
Testim
Tricentis · ProgramaçãoO Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.
