Retrace

Retrace

Retrace · コーディング

RetraceはAIエージェント向けの実行リプレイエンジンだ。エージェントの実行内にあるすべてのモデル呼び出し、ツール呼び出し、検索、エラーを記録し、エンジニアがその実行を一歩ずつリプレイできるようにする。何かが壊れたときは、問題が起きた正確なspanから実行を分岐させる。入力かモデルを1つ変える。そして下流のすべてを再実行して、その修正が実際に何をするのかを見る。

Retrace の画面プレビュー

Retrace について

Retraceとは

Retraceは、AIエージェントを本番環境に出すチーム向けに作られたデバッグと検証のプラットフォームだ。ログを読んでエージェントがなぜ悪い答えを出したのかを推測する代わりに、記録された実行をspanツリーとして開く。そして失敗した、ずれた、根拠のない結果を返した最初のステップを見つけるまで辿っていく。

この製品は特定の痛みに狙いを定めている。エージェントは非決定的に振る舞うため、本番で一度だけ出るバグは再現しにくい。Retraceは実行をリプレイ可能にすることでこれを解決する。実行を一度取り込む。あとは必要なだけ何度でも再実行できる。

主な制約は適用範囲だ。Retraceは開発者向けツールであり、ノーコード製品ではない。そして、自分のエージェントが対応SDK上で動くか、OpenAI、Anthropic、Geminiと通信することを前提としている。特殊なスタックを使うチームは呼び出しを手動で計測する必要があるかもしれない。また、料金はトレース量に応じた設定だ。量が非常に多いエージェントは、すぐに上位プランへ押し上げられる。

はじめかた

  1. Pythonならpip install retrace-sdk、TypeScriptならnpm install retrace-sdkでSDKをインストールする。
  2. retrace.configure(api_key="rt_...")でAPIキーを設定する。
  3. エージェント関数を@retrace.recordデコレータで包み、後でカスケード分岐リプレイを使いたいならresumable=Trueを設定する。
  4. エージェントを一度実行する。OpenAI、Anthropic、Geminiへのプロバイダ呼び出しは自動で計測されるので、トレースは追加作業なしでそれらを取り込む。
  5. 記録されたトレースを開き、spanツリーを調べ、最初に分岐したステップから分岐させて修正を試す。

AIツール情報

Retraceの料金、対応プラットフォーム、性能を簡単に確認できます。

無料プランはい
有料プラン$0 - $2000/mo
プラットフォームWeb, Python SDK, TypeScript SDK
開発元Retrace
カテゴリコーディング
リリース日Aug 2025
最終更新Aug 2025
サイト訪問数N/A
サイト世界ランキングN/A
API提供状況はい

こんな人におすすめ

このツールが最も力を発揮するユーザー、タスク、シーン。

ユーザー

  • 本番環境のエージェント障害をデバッグするAIエンジニア
  • エージェントの挙動にCIチェックを加えるプラットフォームチーム
  • エージェントが本番導入できるかを見極める創業者

タスク

  • 非決定的な障害を再現する
  • プロンプトかモデルの変更を試す
  • 出荷前に修正を検証する
  • 暴走する支出を止める

シーン

  • 顧客が誤った回答を報告し、どのツール呼び出しが原因かを突き止める必要がある
  • プロンプトの微調整が下流のステップを静かに壊す
  • チームがバグの無害化した例を共有したい

主な機能

実行の記録

Retraceはすべてのモデル呼び出し、ツール呼び出し、検索、エラーを、入力、出力、コスト、タイミングを伴うspanとして取り込む。OpenAI、Anthropic、Geminiへのプロバイダ呼び出しは自動で計測されるので、1つずつ手作業で配線する必要はない。結果として得られるのは、エージェントが実際に行ったことの完全で構造化された記録だ。部分的なログではない。推測でもない。

分岐とカスケードリプレイ

これがRetraceを単なるAIエージェント監視ツールから分ける機能だ。記録された実行を、変更した入力を持つ1つのspanで分岐させ、下流のすべてのステップをカスケードリプレイしてエージェント全体を新しい経路で再実行させる。ログには答えられない問いに答える。この1点を変えたら、その先のどこが壊れるのか。

修正の証明

プロンプト、ツール、モデルを変えた後、修正の証明が失敗した実行を再実行し、判定を返す。得られるのは、改善、退行、変化なしの3つのうち1つと、最初に分岐したspanだ。「これで直ったと思う」を検証可能な結果に変える。

CI/CD向けの評価ゲート

評価とゲートの機能が、記録された実行を行動基準に対して採点し、パイプライン向けに合否のゲート判定を返す。チームはCIで通常のテストと並べて行動チェックを走らせられる。ずれたエージェントはユーザーに届く前に捕まる。マルチエージェント審査の検出器はProプランから利用できる。

予算とガードレールの強制

エージェントが次のモデル呼び出しやツール呼び出しを行う前に、予算の強制がその呼び出しが許可されるかを問う。コスト予算、ループ検出、レイテンシ上限に基づいて許可、ブロック、保留を返す。暴走ループや高額な支出の急増を、起きる前に止める方法だ。請求書が来てからではない。

トレース横断の意味検索

span検索が、記録されたspanとエージェントの記憶に対して意味検索を実行し、ある挙動、プロンプト、障害の過去の発生を、正確な文字列ではなく意味で見つける。似たバグが3週間前に出ていれば、正確な言い回しを覚えていなくても掘り起こせる。

エージェントの記憶

RetraceはMCPベースの記憶ストアを備え、過去のエージェント実行から抽出した持続的な事実、好み、修正、パターンを保持する。エージェントはそれらを意味で想起できる。これにより、毎回同じ修正を学び直す代わりに、セッションをまたいで挙動を一貫させやすくなる。

公開テープ

テープの公開が、清掃済みの実行を対話的で共有可能なテープに変える。バグ報告、デモ、事後検証に役立ち、個人情報の伏せ字化はすべてのプランに含まれる。無料枠では月10本の公開テープが使える。

メリットとデメリット

メリット

  • 一歩ずつのリプレイが、非決定的なエージェント障害を再現可能にする。これは多くのログツールが未解決のままにする中核的な問題だ。
  • 分岐とカスケードリプレイが、1つの変更を下流の経路全体に対して試すので、副作用が本番に届く前に見える。
  • OpenAI、Anthropic、Gemini向けの自動計測が、セットアップ作業をデコレータ1つとAPIキーに縮める。
  • 無料プランは本物で、試用ではない。1,000トレース、10回の分岐リプレイ、個人情報の伏せ字化がすべて含まれる。
  • CI評価ゲートにより、エージェントの挙動を通常のコードのようにテストでき、パイプラインが行動に移せる合否結果が得られる。

デメリット

  • 決定論的なカセットリプレイには$29/mo未満のセルフサービス入口がないため、個人開発者は無料プランでリプレイの深さが限られる。
  • 無料プランはトレースを7日間保持し、席は1つだけなので、トレースを共有するチームには足りない。
  • サポートはOpenAI、Anthropic、Geminiのプロバイダに限られ、他のモデルプロバイダのエージェントは手動計測が必要だ。

よくある質問

RetraceはAIエージェントの実行を記録し、リプレイ可能にする。実行を一度取り込んだら、それをリプレイし、どのステップでも分岐させ、元の障害が再発しなくても変更を試せる。

関連コンテンツ

Retraceに関連するツール、スキル、記事を探す。

Retraceの代替ツール

Forefront

Forefront

Forefront · コーディング

ForefrontはオープンソースAIで構築するためのウェブプラットフォームだ。主要なオープンソース言語モデルを自分のデータで微調整し、性能を評価し、API経由で実行したり、エクスポートして自分でホストしたりできる。クローズドなプラットフォームの手軽さを求めつつ、モデルとデータの所有権にはこだわる開発者が対象だ。

無料 / $0 - $99/mo詳細を見る
Startkit

Startkit

StartKit.AI · コーディング

Startkitは、AI SaaSとAIラッパー製品を作るためのボイラープレートだ。面倒な部分をあらかじめ配線済みにしたAIスタートアップボイラープレートと考えればいい。認証、StripeとLemon Squeezyの決済、利用制限、トランザクションメール、そしてOpenAI、Anthropic、Groq、Llamaと通信するAI APIスターターキットが含まれる。リポジトリをクローンして価格を設定し、ユーザーが実際にお金を払う部分に取りかかれる。ReactとTailwind上のNext.jsで作られているため、ボイラープレートコードの多くはすでに見慣れたものだ。

有料 / $99 - $499 one-time詳細を見る
Testim

Testim

Tricentis · コーディング

Testimは、Web・モバイル・Salesforceアプリ向けにエンドツーエンドテストを構築して実行するAIテスト自動化プラットフォームだ。機械学習を頼りに、インターフェースが変わってもテストを安定させ、チームが壊れたセレクターの修正に費やす時間を減らす。今日から使い始められる自動テストツールとしては悪くない。ブラウザで操作を録画してテストを作り、より細かい制御が必要なときはJavaScriptを足す。忙しいQAチームにとって堅実な選択肢である。

無料 / Custom pricing on request詳細を見る