Retrace

Retrace

Retrace · Coding

Retrace ist eine Ausführungsreplay-Engine für KI-Agenten. Sie zeichnet jeden Modellaufruf, jede Werkzeugausführung, jede Retrieval-Aktion und jeden Fehler in einem Agentenlauf auf und lässt Ingenieure diesen Lauf dann Schritt für Schritt wiederholen. Wenn etwas kaputtgeht, zweigt man die Ausführung ab dem exakten Span ab, an dem es schiefging. Man ändert eine Eingabe oder ein Modell. Dann lässt man alles Nachgelagerte erneut laufen, um zu sehen, was die Korrektur wirklich bewirkt.

Vorschau der Oberfläche von Retrace

Über Retrace

Was ist Retrace

Retrace ist eine Plattform zum Debuggen und Verifizieren, gebaut für Teams, die KI-Agenten in Produktion bringen. Statt Protokolle zu lesen und zu raten, warum ein Agent eine schlechte Antwort geliefert hat, öffnet man den aufgezeichneten Lauf als Span-Baum. Dann geht man ihn durch, bis man den ersten Schritt findet, der fehlgeschlagen ist, abgedriftet ist oder ein unbegründetes Ergebnis zurückgegeben hat.

Das Produkt zielt auf einen konkreten Schmerz. Agenten verhalten sich nicht deterministisch, ein Fehler, der einmal in Produktion auftaucht, ist also schwer zu reproduzieren. Retrace löst das, indem es Läufe wiederholbar macht. Man erfasst die Ausführung einmal. Dann führt man sie so oft aus wie nötig.

Die größte Einschränkung ist der Umfang. Retrace ist ein Entwicklerwerkzeug, kein No-Code-Produkt, und es setzt voraus, dass der eigene Agent auf den unterstützten SDKs läuft oder mit OpenAI, Anthropic oder Gemini spricht. Teams mit ungewöhnlichen Stacks müssen Aufrufe womöglich von Hand instrumentieren. Außerdem richtet sich der Preis nach dem Trace-Volumen. Agenten mit sehr hohem Volumen treiben einen schnell die Planleiter hinauf.

Erste Schritte

  1. Installiere das SDK mit pip install retrace-sdk für Python oder npm install retrace-sdk für TypeScript.
  2. Konfiguriere deinen API-Schlüssel mit retrace.configure(api_key="rt_...").
  3. Hülle die Agenten-Funktion in den Decorator @retrace.record und setze resumable=True, wenn du später das Kaskaden-Replay mit Abzweigung willst.
  4. Lass deinen Agenten einmal laufen. Anbieteraufrufe zu OpenAI, Anthropic und Gemini werden automatisch instrumentiert, der Trace erfasst sie also ohne Zusatzarbeit.
  5. Öffne den aufgezeichneten Trace, prüfe den Span-Baum und zweige vom ersten abweichenden Schritt ab, um eine Korrektur zu testen.

Produktinformationen

Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von Retrace.

Kostenloser TarifJa
Bezahlte Tarife$0 - $2000/mo
PlattformWeb, Python SDK, TypeScript SDK
EntwicklerRetrace
KategorieCoding
VeröffentlichungsdatumAug 2025
Zuletzt aktualisiertAug 2025
Website-BesucheN/A
Globales Website-RankingN/A
API-VerfügbarkeitJa

Am besten für

Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.

Nutzer

  • KI-Ingenieure, die Fehler von Agenten in Produktion debuggen
  • Plattform-Teams, die CI-Prüfungen für Agentenverhalten ergänzen
  • Gründer, die prüfen, ob ein Agent produktionsreif ist

Aufgaben

  • Einen nicht deterministischen Fehler reproduzieren
  • Eine Änderung an Prompt oder Modell testen
  • Eine Korrektur vor dem Ausliefern prüfen
  • Ausufernde Kosten stoppen

Szenarien

  • Ein Kunde meldet eine falsche Antwort und man muss finden, welcher Werkzeugaufruf sie verursacht hat
  • Eine Prompt-Anpassung bricht still einen nachgelagerten Schritt
  • Ein Team will ein bereinigtes Beispiel eines Fehlers teilen

Wichtigste Funktionen

Aufzeichnung der Ausführung

Retrace erfasst jeden Modellaufruf, jede Werkzeugausführung, jede Retrieval-Aktion und jeden Fehler als Span mit Eingabe, Ausgabe, Kosten und Zeit. Anbieteraufrufe zu OpenAI, Anthropic und Gemini werden automatisch instrumentiert, man muss also nicht jeden einzeln von Hand verdrahten. Das Ergebnis ist eine vollständige, strukturierte Aufzeichnung dessen, was der Agent wirklich getan hat. Kein Teilprotokoll. Keine Vermutung.

Abzweigen und Kaskaden-Replay

Das ist die Fähigkeit, die Retrace von einfachen Monitoring-Werkzeugen für KI-Agenten trennt. Man verzweigt einen aufgezeichneten Lauf an einem einzigen Span mit geänderter Eingabe und wiederholt dann jeden nachgelagerten Schritt im Kaskaden-Replay, sodass der ganze Agent den neuen Pfad erneut durchläuft. Es beantwortet eine Frage, die Protokolle nicht können. Wenn ich diese eine Sache ändere, was bricht weiter unten?

Korrektur beweisen

Nach einer Änderung an Prompt, Werkzeug oder Modell führt Korrektur-beweisen den fehlgeschlagenen Lauf erneut aus und gibt ein Urteil zurück. Man erhält eines von drei Ergebnissen: verbessert, verschlechtert oder unverändert, plus den ersten abweichenden Span. Aus „ich glaube, das hat es behoben" wird ein prüfbares Ergebnis.

Evaluierungs-Gates für CI/CD

Die Fähigkeit zum Bewerten und Freigeben bewertet aufgezeichnete Läufe anhand von Verhaltenskriterien und liefert eine Bestanden/Durchgefallen-Gate-Entscheidung für eine Pipeline. Teams können Verhaltensprüfungen in der CI neben ihren normalen Tests laufen lassen. Ein Agent, der abdriftet, wird abgefangen, bevor er Nutzer erreicht. Multi-Agent-Judge-Detektoren gibt es ab dem Pro-Plan.

Durchsetzung von Budgets und Leitplanken

Bevor dein Agent seinen nächsten Modell- oder Werkzeugaufruf macht, fragt Budget-durchsetzen, ob dieser Aufruf erlaubt ist. Es liefert erlauben, blockieren oder anhalten je nach Kostenbudgets, Schleifenerkennung und Latenzobergrenzen. So stoppst du eine ausufernde Schleife oder einen teuren Kostenausschlag, bevor er passiert. Nicht erst, wenn die Rechnung kommt.

Semantische Suche über Traces

Span-suchen führt eine semantische Suche über aufgezeichnete Spans und Agenten-Erinnerungen aus, um frühere Vorkommen eines Verhaltens, Prompts oder Fehlers nach Bedeutung statt nach exaktem Text zu finden. Ist ein ähnlicher Fehler vor drei Wochen aufgetreten, kann man ihn hervorholen, ohne die genaue Formulierung zu erinnern.

Agenten-Gedächtnis

Retrace liefert einen MCP-basierten Speicher für Erinnerungen, der dauerhafte Fakten, Präferenzen, Korrekturen und Muster aus früheren Agentenläufen hält. Agenten können sie nach Bedeutung abrufen, was hilft, das Verhalten über Sitzungen hinweg konsistent zu halten, statt dieselben Korrekturen jedes Mal neu zu lernen.

Veröffentlichte Tapes

Tape-veröffentlichen macht aus einer gesäuberten Ausführung ein interaktives, teilbares Tape. Nützlich für Fehlerberichte, Demos und Nachbetrachtungen, und die Schwärzung personenbezogener Daten ist in jedem Plan enthalten. Der Gratis-Tarif erlaubt 10 veröffentlichte Tapes pro Monat.

Vor- und Nachteile

Vorteile

  • Das schrittweise Replay macht nicht deterministische Agentenfehler reproduzierbar, das Kernproblem, das die meisten Logging-Werkzeuge ungelöst lassen.
  • Abzweigen und Kaskaden-Replay testen eine einzelne Änderung gegen den ganzen nachgelagerten Pfad, man sieht Nebenwirkungen also, bevor sie die Produktion erreichen.
  • Die automatische Instrumentierung für OpenAI, Anthropic und Gemini reduziert die Einrichtung auf einen Decorator und einen API-Schlüssel.
  • Der Gratis-Plan ist echt, kein Test: 1.000 Traces, 10 Abzweig-Replays und die Schwärzung personenbezogener Daten sind enthalten.
  • CI-Evaluierungs-Gates lassen Agentenverhalten wie normaler Code testen, mit einem Bestanden/Durchgefallen-Ergebnis, auf das eine Pipeline reagieren kann.

Nachteile

  • Kein Self-Service-Einstieg unter $29/mo für deterministisches Kassetten-Replay, Solo-Entwickler haben im Gratis-Plan also begrenzte Replay-Tiefe.
  • Der Gratis-Plan hält Traces 7 Tage und gibt einen einzigen Platz, was ein Team, das Traces teilt, nicht abdeckt.
  • Der Support beschränkt sich auf die Anbieter OpenAI, Anthropic und Gemini, Agenten auf anderen Modellanbietern brauchen also manuelle Instrumentierung.

Häufige Fragen

Retrace zeichnet Läufe von KI-Agenten auf und macht sie wiederholbar. Man erfasst eine Ausführung einmal, wiederholt sie dann, zweigt sie an jedem Schritt ab und testet Änderungen, ohne dass der ursprüngliche Fehler erneut auftreten muss.

Ähnliche Inhalte

Entdecke passende Tools, Skills und Artikel zu Retrace.

Alternativen zu Retrace

Forefront

Forefront

Forefront · Coding

Forefront ist eine Webplattform zum Bauen mit Open-Source-KI. Sie lassen sich führende Open-Source-Sprachmodelle mit eigenen Daten feintunen, ihre Leistung bewerten und sie über eine API ausführen oder exportieren, um sie selbst zu hosten. Entwickler, die den Komfort einer geschlossenen Plattform wollen, aber darauf bestehen, ihre Modelle und Daten zu besitzen, sind hier die Zielgruppe.

Kostenlos / $0 - $99/moDetails ansehen
Startkit

Startkit

StartKit.AI · Coding

Startkit ist ein Boilerplate zum Bauen von KI-SaaS-Produkten und KI-Wrappern. Man kann es sich als KI-Startup-Boilerplate vorstellen, bei dem die langweiligen Teile schon verdrahtet sind: Authentifizierung, Zahlungen über Stripe und Lemon Squeezy, Nutzungslimits, transaktionale E-Mail und ein KI-API-Starter-Kit, das mit OpenAI, Anthropic, Groq oder Llama spricht. Man klont das Repository, setzt seinen Preis und kümmert sich um den Teil des Produkts, für den Menschen wirklich bezahlen. Es basiert auf Next.js über React und Tailwind, deshalb fühlt sich ein Großteil des Boilerplate-Codes schon vertraut an.

Kostenpflichtig / $99 - $499 one-timeDetails ansehen
Testim

Testim

Tricentis · Coding

Testim ist eine KI-gestützte Plattform für Testautomatisierung, mit der man End-to-End-Tests für Web-, Mobile- und Salesforce-Anwendungen baut und ausführt. Sie setzt auf maschinelles Lernen, um Tests stabil zu halten, wenn sich eine Oberfläche ändert, sodass Teams weniger Zeit mit der Reparatur kaputter Selektoren verbringen. Nicht schlecht für ein Tool für automatisierte Tests, das Sie heute schon nutzen können. Sie erstellen Tests, indem Sie Aktionen im Browser aufzeichnen, und fügen danach JavaScript hinzu, wenn Sie mehr Kontrolle brauchen. Für ein beschäftigtes QA-Team eine solide Wahl.

Kostenlos / Custom pricing on requestDetails ansehen