Heron
Netis · コーディング
Heronはオープンソースのエージェント可観測性ツールだ。コードからではなくネットワークパケットから、AIエージェントのターンとLLM APIのトラフィックを再構築する。.pcapファイル、ライブインターフェース、eBPFプローブを読み取り、プランナーの各ステップ、ツール呼び出し、モデル応答をローカルダッシュボードに表示する。インストールするSDKはなく、経由させるプロキシもなく、監視対象のアプリケーション側の協力も要らない。数秒とエラーが実際どこへ消えているのか知りたいなら、Heronはまさにそのために作られている。計装したくないホストでのLLM API監視に向く。

Heron について
Heronとは何か
HeronはAIエージェント向けの受動的な可観測性ツールだ。平文のHTTPトラフィックをキャプチャし、エージェントのレベルで起きたことを再構築する。そのため、生のリクエストの山ではなく、完全なターン(プランナー → ツール → 結果 → 次のステップ)が見える。ベンダーのNetisはこれを「AIエージェントのWireshark」と呼び、そのたとえは的確だ。トラフィックに向ければ、そのトラフィックが何を意味するかを教えてくれる。それだけのことだ。
中心にある考え方はゼロ侵入だ。多くの監視ツールは、ライブラリを追加させ、クライアントをラップさせ、あるいは呼び出しをゲートウェイ経由で流させる。Heronは脇に座って回線を読む。再ビルドできないクローズドなバイナリが対象だったり、本番の近くに計装コードを置きたくなかったりする場合、この違いは大きい。
代償はパケット系ツールが常に抱えるものと同じだ。Heronが見るのは平文HTTPなので、トラフィックがすでに復号されている場所で動かす必要がある。推論ホスト上、TLSターミネータの背後、あるいは信頼できるパケットソースから流し込む場所だ。暗号化されたトラフィックに向けても、役に立つものは何も見えない。ここが落とし穴である。
はじめかた
- ワンラインのインストーラで単一バイナリを導入する。システム全体でも、sudo不要のユーザーローカル導入でもよい。
- パケットへのアクセス権を与える。Linuxならキャプチャ権限を一度付与するか、ライブトラフィックに触れたくなければ.pcapファイルを渡す。
- 取得元に対して実行する。Linuxなら
heron -i eth0、保存済みファイルを再生するならheron --pcap-file capture.pcapといった具合だ。 - ポート3000のローカルコンソールを開き、エージェントのターン、タイムライン、メトリクスを見る。
- ファインチューニング用のデータが欲しければ、任意のターンまたはセッション全体をOpenAI形式のmessages JSONLとして出力する。
AIツール情報
Heronの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- 推論フリートを運用し、アプリケーションコードに触れずにレイテンシとエラーの可視性を必要とするプラットフォームエンジニアやSRE。
- エージェントのワークフローをデバッグするAIチーム。とくに、エージェントが計装できないクローズドなバイナリである場合。
- 合成例ではなく実際のエージェントトラフィックからファインチューニング用データセットを組みたい開発者。
タスク
- 保存した.pcapを再生し、失敗した実行でエージェントが何をしたのかを正確に再構築する。
- エージェント種別とモデルごとに、初回トークンまでの時間、レイテンシ、スループット、エラー率をライブで見る。
- 推論のトポロジー(クライアント → プロキシ → バックエンド)を描き、どのコンポーネントがどのトラフィックを扱うかを把握する。
- エージェントセッションを教師ありファインチューニング用にJSONLで出力する。
シーン
- リクエスト経路にSDK呼び出しを足す正当性が示せない本番の推論ホスト。
- パケットキャプチャはあるがアプリケーションログはない、インシデント後の振り返り。
- 意外な結果のあとで、自律エージェントが実際に何をどの順で呼んだかを監査する。
- 同梱の.pcapテストフィクスチャを使い、ラボやCI実行で監視を立ち上げる。
主な機能
ゼロ侵入キャプチャ
Heronは回線から、ホストのTLS境界で、あるいはSSLの読み書き境界で平文を捉える実験的なeBPFプローブを通じてトラフィックを読む。SDKもプロキシもコード変更もなく、監視対象のワークロードの協力も要らない。クローズドなバイナリや厳格な変更管理を抱えるチームにとって、エージェント監視が後回しにされる最大の理由が消える。
エージェントターンの再構築
生のHTTP呼び出しは解釈しにくい。Heronは複数呼び出しのやり取りを単一のアドレス可能なターンに縫い合わせる。プランナーのステップ、そのツール呼び出し、ツールの結果、続く呼び出しが一続きの物語として読める。得られるのはエージェントの物語であり、無関係なリクエストのログではない。ここが違いだ。汎用のAPIモニタと一線を画す機能である。
ライブメトリクスダッシュボード
コマンド一つで、初回トークンまでの時間、レイテンシ、スループット、エラー率、エージェントごとの内訳がライブで手に入る。すべてトラフィックから再構築され、ローカルのWebコンソールに表示される。Claude CodeとOpenAI Codex CLI用の名前付きプロファイルが同梱され、それ以外向けに汎用プロファイルもある。メトリクスパイプラインなしでフリート単位の数値が欲しかったことがあるなら、これが近道だ。パイプラインは要らない。
サービスの分類とトポロジー
Heronは、設定ファイルを読むのではなく回線上のバイトを調べて、各エンドポイントが何を提供しているか(vLLM、SGLang、Ollama、llama.cpp、LiteLLMなど)を見極める。その後、推論フリートを有向グラフとして描き、辺の太さはターン数に応じて変える。設定ミスのあるルーティングは、絵として見ればすぐに浮かび上がる。
ファインチューニング用データの出力
任意のターンやセッションはOpenAI形式のmessages JSONLとして出力でき、ツール呼び出し、結果、推論が保たれ、引数はオブジェクトに復元される。詳細ビューから単一のターンを出力するか、ターン一覧から現在のフィルタで一括出力できる。手作業でラベル付けするはずだった本物の本番トラフィックが、訓練データに変わる。
権限なしのPcap再生
ライブキャプチャは不要だ。LLMトラフィックを含む.pcapをHeronに渡せば、特別な権限なしで全体を再生し、その後もコンソールを開いたままにして閲覧できる。リポジトリにはフィクスチャが同梱され、実システムに触れる前に試せる。評価のコストが下がる。そして安全だ。
メリットとデメリット
メリット
- 真にゼロ侵入。SDKもプロキシもコード変更もなく、再ビルドできないバイナリでも動く。
- 生のHTTPを吐き出すのではなくエージェントレベルのターンを再構築する。デバッグに本当に必要なのはこれだ。
- Webコンソールを内蔵した単一の静的バイナリで、インストーラやパッケージマネージャの痕跡を残さない。
- Pcap再生と同梱フィクスチャにより、権限も本番リスクもなしに評価できる。
- ファインチューニング用のJSONL出力は、ツール呼び出しと推論を保ったまま本物のトラフィックを訓練データに変える。
デメリット
- 平文HTTPしか見えないため、TLSがすでに終端された場所で動かす必要がある。暗号化トラフィックに向けても何も得られない。
- eBPFのキャプチャ経路は実験的でLinux専用、CAP_BPFが要るため、まだ設定して放置できる選択肢ではない。
- Linuxでのライブキャプチャにはパケット権限の付与が必要で、セキュリティチームによっては先に確認したがる。
よくある質問
ネットワークトラフィックをキャプチャし、そこからAIエージェントのターンとLLM APIのやり取りを再構築する。コードを計装する代わりに、トラフィックが見える場所でHeronを動かすと、プランナーの各ステップ、ツール呼び出し、モデル応答を閲覧可能なダッシュボードへ再構築する。
関連コンテンツ
Heronに関連するツール、スキル、記事を探す。
Heronの代替ツール
Forefront
Forefront · コーディングForefrontはオープンソースAIで構築するためのウェブプラットフォームだ。主要なオープンソース言語モデルを自分のデータで微調整し、性能を評価し、API経由で実行したり、エクスポートして自分でホストしたりできる。クローズドなプラットフォームの手軽さを求めつつ、モデルとデータの所有権にはこだわる開発者が対象だ。
Startkit
StartKit.AI · コーディングStartkitは、AI SaaSとAIラッパー製品を作るためのボイラープレートだ。面倒な部分をあらかじめ配線済みにしたAIスタートアップボイラープレートと考えればいい。認証、StripeとLemon Squeezyの決済、利用制限、トランザクションメール、そしてOpenAI、Anthropic、Groq、Llamaと通信するAI APIスターターキットが含まれる。リポジトリをクローンして価格を設定し、ユーザーが実際にお金を払う部分に取りかかれる。ReactとTailwind上のNext.jsで作られているため、ボイラープレートコードの多くはすでに見慣れたものだ。
Testim
Tricentis · コーディングTestimは、Web・モバイル・Salesforceアプリ向けにエンドツーエンドテストを構築して実行するAIテスト自動化プラットフォームだ。機械学習を頼りに、インターフェースが変わってもテストを安定させ、チームが壊れたセレクターの修正に費やす時間を減らす。今日から使い始められる自動テストツールとしては悪くない。ブラウザで操作を録画してテストを作り、より細かい制御が必要なときはJavaScriptを足す。忙しいQAチームにとって堅実な選択肢である。
