
Retrace
Retrace · Programación
Retrace es un motor de repetición de ejecución para agentes de IA. Graba cada llamada al modelo, cada invocación de herramienta, cada recuperación y cada error dentro de la ejecución de un agente, y luego deja que los ingenieros repitan esa ejecución paso a paso. Cuando algo se rompe, bifurcas la ejecución desde el span exacto donde falló. Cambias una entrada o un modelo. Después vuelves a correr todo lo que va aguas abajo para ver qué hace realmente la corrección.

Acerca de Retrace
Qué es Retrace
Retrace es una plataforma de depuración y verificación pensada para equipos que publican agentes de IA. En vez de leer registros y adivinar por qué un agente dio una mala respuesta, abres la ejecución grabada como un árbol de spans. Luego la recorres hasta encontrar el primer paso que falló, se desvió o devolvió un resultado sin fundamento.
El producto apunta a un dolor concreto. Los agentes se comportan de forma no determinista, así que un error que aparece una vez en producción cuesta reproducir. Retrace lo resuelve haciendo que las ejecuciones se puedan repetir. Capturas la ejecución una vez. Después la vuelves a ejecutar tantas veces como necesites.
La limitación principal es el alcance. Retrace es una herramienta para desarrolladores, no un producto sin código, y da por hecho que tu agente corre sobre los SDK compatibles o habla con OpenAI, Anthropic o Gemini. Los equipos con stacks poco habituales quizá tengan que instrumentar las llamadas a mano. Además, el precio va por volumen de trazas. Los agentes de volumen muy alto te empujan rápido hacia planes superiores.
Primeros pasos
- Instala el SDK con
pip install retrace-sdkpara Python onpm install retrace-sdkpara TypeScript. - Configura tu clave de API con
retrace.configure(api_key="rt_..."). - Envuelve la función de tu agente en el decorador
@retrace.recordy activaresumable=Truesi luego quieres la repetición en cascada con bifurcación. - Corre tu agente una vez. Las llamadas a OpenAI, Anthropic y Gemini se instrumentan solas, así que la traza las captura sin trabajo extra.
- Abre la traza grabada, inspecciona el árbol de spans y bifurca desde el primer paso divergente para probar una corrección.
Información del producto
Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de Retrace.
Ideal para
Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.
Usuarios
- Ingenieros de IA que depuran fallos de agentes en producción
- Equipos de plataforma que añaden comprobaciones de CI para el comportamiento de agentes
- Fundadores que evalúan si un agente está listo para producción
Tareas
- Reproducir un fallo no determinista
- Probar un cambio de prompt o de modelo
- Verificar una corrección antes de publicar
- Frenar el gasto descontrolado
Casos de uso
- Un cliente reporta una respuesta errónea y necesitas encontrar qué llamada de herramienta la causó
- Un retoque de prompt rompe en silencio un paso aguas abajo
- Un equipo quiere compartir un ejemplo saneado de un error
Funciones clave
Grabación de ejecuciones
Retrace captura cada llamada al modelo, cada invocación de herramienta, cada recuperación y cada error como un span con su entrada, salida, coste y tiempo. Las llamadas a OpenAI, Anthropic y Gemini se instrumentan solas, así que no tienes que conectar cada una a mano. El resultado es un registro completo y estructurado de lo que tu agente hizo de verdad. No un registro parcial. No una suposición.
Bifurcación y repetición en cascada
Esta es la capacidad que separa a Retrace de las herramientas simples de monitoreo de agentes de IA. Ramificas una ejecución grabada en un solo span con una entrada modificada y luego repites en cascada cada paso aguas abajo para que todo el agente se vuelva a ejecutar por la nueva ruta. Responde una pregunta que los registros no pueden. Si cambio esta única cosa, ¿qué se rompe más abajo?
Demostrar la corrección
Después de cambiar un prompt, una herramienta o un modelo, demostrar-la-corrección vuelve a correr la ejecución fallida y devuelve un veredicto. Obtienes uno de tres resultados: mejoró, empeoró o sin cambios, más el primer span divergente. Convierte "creo que eso lo arregló" en un resultado comprobable.
Puertas de evaluación para CI/CD
La capacidad de evaluar y aplicar puertas puntúa las ejecuciones grabadas contra criterios de comportamiento y devuelve una decisión de puerta pasa o falla para un pipeline. Los equipos pueden correr comprobaciones de comportamiento en CI junto a sus pruebas normales. Un agente que se desvía queda atrapado antes de llegar a los usuarios. Los detectores de juez multiagente están disponibles desde el plan Pro en adelante.
Aplicación de presupuestos y barandillas
Antes de que tu agente haga su siguiente llamada al modelo o a la herramienta, aplicar-presupuesto pregunta si esa llamada está permitida. Devuelve permitir, bloquear o retener según presupuestos de coste, detección de bucles y techos de latencia. Así detienes un bucle descontrolado o un pico de gasto caro antes de que ocurra. No después de que llegue la factura.
Búsqueda semántica en las trazas
Buscar-spans corre una búsqueda semántica entre los spans grabados y las memorias del agente para encontrar apariciones previas de un comportamiento, un prompt o un fallo por significado en vez de por texto exacto. Si un error parecido apareció hace tres semanas, puedes sacarlo a la luz sin recordar la frase exacta.
Memoria del agente
Retrace incluye un almacén de memoria basado en MCP que guarda hechos persistentes, preferencias, correcciones y patrones extraídos de ejecuciones previas del agente. Los agentes pueden recordarlos por significado, lo que ayuda a mantener un comportamiento coherente entre sesiones en lugar de reaprender las mismas correcciones cada vez.
Cintas publicadas
Publicar-cinta convierte una ejecución depurada en una cinta interactiva y compartible. Sirve para informes de errores, demos y análisis posteriores, y el borrado de datos personales viene incluido en todos los planes. El nivel gratuito permite 10 cintas publicadas al mes.
Ventajas y desventajas
Ventajas
- La repetición paso a paso hace reproducibles los fallos no deterministas de los agentes, que es el problema central que la mayoría de herramientas de registro deja sin resolver.
- La bifurcación y la repetición en cascada prueban un solo cambio contra toda la ruta aguas abajo, así ves los efectos secundarios antes de que lleguen a producción.
- La instrumentación automática para OpenAI, Anthropic y Gemini reduce la configuración a un decorador y una clave de API.
- El plan gratuito es real, no una prueba: 1.000 trazas, 10 repeticiones con bifurcación y borrado de datos personales incluidos.
- Las puertas de evaluación de CI permiten probar el comportamiento del agente como código normal, con un resultado de pasa o falla sobre el que un pipeline puede actuar.
Desventajas
- No hay entrada autoservicio por debajo de $29/mo para la repetición determinista con casetes, así que los desarrolladores en solitario tienen poca profundidad de repetición en el plan gratuito.
- El plan gratuito guarda las trazas 7 días y da un solo asiento, lo que no cubre a un equipo que comparte trazas.
- El soporte se limita a los proveedores OpenAI, Anthropic y Gemini, así que los agentes con otros proveedores de modelo necesitan instrumentación manual.
Preguntas frecuentes
Retrace graba las ejecuciones de agentes de IA y las hace repetibles. Capturas una ejecución una vez y luego la repites, la bifurcas en cualquier paso y pruebas cambios sin que el fallo original tenga que ocurrir otra vez.
Contenido relacionado
Explora herramientas, habilidades y artículos relacionados con Retrace.
Alternativas a Retrace
Forefront
Forefront · ProgramaciónForefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.
Startkit
StartKit.AI · ProgramaciónStartkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.
Testim
Tricentis · ProgramaciónTestim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.
