Retrace

Retrace

Retrace · Programación

Retrace es un motor de repetición de ejecución para agentes de IA. Graba cada llamada al modelo, cada invocación de herramienta, cada recuperación y cada error dentro de la ejecución de un agente, y luego deja que los ingenieros repitan esa ejecución paso a paso. Cuando algo se rompe, bifurcas la ejecución desde el span exacto donde falló. Cambias una entrada o un modelo. Después vuelves a correr todo lo que va aguas abajo para ver qué hace realmente la corrección.

Vista previa de la interfaz de Retrace

Acerca de Retrace

Qué es Retrace

Retrace es una plataforma de depuración y verificación pensada para equipos que publican agentes de IA. En vez de leer registros y adivinar por qué un agente dio una mala respuesta, abres la ejecución grabada como un árbol de spans. Luego la recorres hasta encontrar el primer paso que falló, se desvió o devolvió un resultado sin fundamento.

El producto apunta a un dolor concreto. Los agentes se comportan de forma no determinista, así que un error que aparece una vez en producción cuesta reproducir. Retrace lo resuelve haciendo que las ejecuciones se puedan repetir. Capturas la ejecución una vez. Después la vuelves a ejecutar tantas veces como necesites.

La limitación principal es el alcance. Retrace es una herramienta para desarrolladores, no un producto sin código, y da por hecho que tu agente corre sobre los SDK compatibles o habla con OpenAI, Anthropic o Gemini. Los equipos con stacks poco habituales quizá tengan que instrumentar las llamadas a mano. Además, el precio va por volumen de trazas. Los agentes de volumen muy alto te empujan rápido hacia planes superiores.

Primeros pasos

  1. Instala el SDK con pip install retrace-sdk para Python o npm install retrace-sdk para TypeScript.
  2. Configura tu clave de API con retrace.configure(api_key="rt_...").
  3. Envuelve la función de tu agente en el decorador @retrace.record y activa resumable=True si luego quieres la repetición en cascada con bifurcación.
  4. Corre tu agente una vez. Las llamadas a OpenAI, Anthropic y Gemini se instrumentan solas, así que la traza las captura sin trabajo extra.
  5. Abre la traza grabada, inspecciona el árbol de spans y bifurca desde el primer paso divergente para probar una corrección.

Información del producto

Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de Retrace.

Plan gratuitoSí
Planes de pago$0 - $2000/mo
PlataformaWeb, Python SDK, TypeScript SDK
DesarrolladorRetrace
CategoríaProgramación
Fecha de lanzamientoAug 2025
Última actualizaciónAug 2025
Visitas al sitio webN/A
Ranking global del sitioN/A
Disponibilidad de la APISí

Ideal para

Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.

Usuarios

  • Ingenieros de IA que depuran fallos de agentes en producción
  • Equipos de plataforma que añaden comprobaciones de CI para el comportamiento de agentes
  • Fundadores que evalúan si un agente está listo para producción

Tareas

  • Reproducir un fallo no determinista
  • Probar un cambio de prompt o de modelo
  • Verificar una corrección antes de publicar
  • Frenar el gasto descontrolado

Casos de uso

  • Un cliente reporta una respuesta errónea y necesitas encontrar qué llamada de herramienta la causó
  • Un retoque de prompt rompe en silencio un paso aguas abajo
  • Un equipo quiere compartir un ejemplo saneado de un error

Funciones clave

Grabación de ejecuciones

Retrace captura cada llamada al modelo, cada invocación de herramienta, cada recuperación y cada error como un span con su entrada, salida, coste y tiempo. Las llamadas a OpenAI, Anthropic y Gemini se instrumentan solas, así que no tienes que conectar cada una a mano. El resultado es un registro completo y estructurado de lo que tu agente hizo de verdad. No un registro parcial. No una suposición.

Bifurcación y repetición en cascada

Esta es la capacidad que separa a Retrace de las herramientas simples de monitoreo de agentes de IA. Ramificas una ejecución grabada en un solo span con una entrada modificada y luego repites en cascada cada paso aguas abajo para que todo el agente se vuelva a ejecutar por la nueva ruta. Responde una pregunta que los registros no pueden. Si cambio esta única cosa, ¿qué se rompe más abajo?

Demostrar la corrección

Después de cambiar un prompt, una herramienta o un modelo, demostrar-la-corrección vuelve a correr la ejecución fallida y devuelve un veredicto. Obtienes uno de tres resultados: mejoró, empeoró o sin cambios, más el primer span divergente. Convierte "creo que eso lo arregló" en un resultado comprobable.

Puertas de evaluación para CI/CD

La capacidad de evaluar y aplicar puertas puntúa las ejecuciones grabadas contra criterios de comportamiento y devuelve una decisión de puerta pasa o falla para un pipeline. Los equipos pueden correr comprobaciones de comportamiento en CI junto a sus pruebas normales. Un agente que se desvía queda atrapado antes de llegar a los usuarios. Los detectores de juez multiagente están disponibles desde el plan Pro en adelante.

Aplicación de presupuestos y barandillas

Antes de que tu agente haga su siguiente llamada al modelo o a la herramienta, aplicar-presupuesto pregunta si esa llamada está permitida. Devuelve permitir, bloquear o retener según presupuestos de coste, detección de bucles y techos de latencia. Así detienes un bucle descontrolado o un pico de gasto caro antes de que ocurra. No después de que llegue la factura.

Búsqueda semántica en las trazas

Buscar-spans corre una búsqueda semántica entre los spans grabados y las memorias del agente para encontrar apariciones previas de un comportamiento, un prompt o un fallo por significado en vez de por texto exacto. Si un error parecido apareció hace tres semanas, puedes sacarlo a la luz sin recordar la frase exacta.

Memoria del agente

Retrace incluye un almacén de memoria basado en MCP que guarda hechos persistentes, preferencias, correcciones y patrones extraídos de ejecuciones previas del agente. Los agentes pueden recordarlos por significado, lo que ayuda a mantener un comportamiento coherente entre sesiones en lugar de reaprender las mismas correcciones cada vez.

Cintas publicadas

Publicar-cinta convierte una ejecución depurada en una cinta interactiva y compartible. Sirve para informes de errores, demos y análisis posteriores, y el borrado de datos personales viene incluido en todos los planes. El nivel gratuito permite 10 cintas publicadas al mes.

Ventajas y desventajas

Ventajas

  • La repetición paso a paso hace reproducibles los fallos no deterministas de los agentes, que es el problema central que la mayoría de herramientas de registro deja sin resolver.
  • La bifurcación y la repetición en cascada prueban un solo cambio contra toda la ruta aguas abajo, así ves los efectos secundarios antes de que lleguen a producción.
  • La instrumentación automática para OpenAI, Anthropic y Gemini reduce la configuración a un decorador y una clave de API.
  • El plan gratuito es real, no una prueba: 1.000 trazas, 10 repeticiones con bifurcación y borrado de datos personales incluidos.
  • Las puertas de evaluación de CI permiten probar el comportamiento del agente como código normal, con un resultado de pasa o falla sobre el que un pipeline puede actuar.

Desventajas

  • No hay entrada autoservicio por debajo de $29/mo para la repetición determinista con casetes, así que los desarrolladores en solitario tienen poca profundidad de repetición en el plan gratuito.
  • El plan gratuito guarda las trazas 7 días y da un solo asiento, lo que no cubre a un equipo que comparte trazas.
  • El soporte se limita a los proveedores OpenAI, Anthropic y Gemini, así que los agentes con otros proveedores de modelo necesitan instrumentación manual.

Preguntas frecuentes

Retrace graba las ejecuciones de agentes de IA y las hace repetibles. Capturas una ejecución una vez y luego la repites, la bifurcas en cualquier paso y pruebas cambios sin que el fallo original tenga que ocurrir otra vez.

Contenido relacionado

Explora herramientas, habilidades y artículos relacionados con Retrace.

Alternativas a Retrace

Forefront

Forefront

Forefront · Programación

Forefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.

Gratis / $0 - $99/moVer detalles
Startkit

Startkit

StartKit.AI · Programación

Startkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.

De pago / $99 - $499 one-timeVer detalles
Testim

Testim

Tricentis · Programación

Testim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.

Gratis / Custom pricing on requestVer detalles