Heron

Heron

Netis · Programmation

Heron est un outil d'observabilité d'agents open source qui reconstitue les tours des agents d'IA et le trafic des API LLM à partir des paquets réseau plutôt que depuis votre code. Il lit un fichier .pcap, une interface en direct ou une sonde eBPF et affiche chaque étape du planificateur, chaque appel d'outil et chaque réponse du modèle dans un tableau de bord local. Pas de SDK à installer, pas de proxy par lequel faire passer le trafic, et aucune coopération demandée aux applications que vous surveillez. Vous voulez savoir où passent réellement les secondes et les erreurs ? Heron est fait exactement pour ça. Il convient à la surveillance des API LLM sur des hôtes que vous préférez ne pas instrumenter.

Aperçu de l'interface de Heron

À propos de Heron

Qu'est-ce que Heron

Heron est un outil d'observabilité passif pour les agents d'IA. Il capture le trafic HTTP en clair et reconstitue ce qui s'est passé au niveau de l'agent, si bien que vous voyez des tours complets (planificateur → outil → résultat → étape suivante) au lieu d'un amas de requêtes brutes. L'éditeur, Netis, le présente comme « le Wireshark des agents d'IA », et la comparaison tient : vous le pointez vers le trafic et il vous dit ce que ce trafic signifie. C'est aussi simple que ça.

L'idée centrale, c'est l'absence totale d'intrusion. La plupart des outils de surveillance vous obligent à ajouter une bibliothèque, à encapsuler un client ou à faire passer les appels par une passerelle. Heron se place à côté et lit le fil. Cela compte quand la charge de travail est un binaire fermé que vous ne pouvez pas recompiler, ou quand vous ne voulez aucun code d'instrumentation près de la production.

La contrepartie est celle que les outils à base de paquets ont toujours. Heron voit le HTTP en clair, il doit donc tourner là où le trafic est déjà déchiffré : sur l'hôte d'inférence, derrière le terminateur TLS, ou alimenté depuis une source de paquets à laquelle vous faites confiance. Pointez-le vers du trafic chiffré et il ne voit rien d'utile. C'est le piège.

Pour commencer

  1. Installez le binaire unique avec l'installateur en une ligne, soit pour tout le système, soit en installation locale à l'utilisateur qui ne demande pas sudo.
  2. Donnez-lui accès aux paquets. Sous Linux, cela signifie accorder les capacités de capture une fois pour toutes, ou lui fournir un fichier .pcap si vous préférez ne pas toucher au trafic en direct.
  3. Lancez-le sur votre source, par exemple heron -i eth0 sous Linux ou heron --pcap-file capture.pcap pour rejouer un fichier enregistré.
  4. Ouvrez la console locale sur le port 3000 pour parcourir les tours d'agents, les chronologies et les métriques.
  5. Exportez n'importe quel tour ou la session complète en JSONL de messages au format OpenAI si vous voulez des données d'affinage.

Informations sur le produit

Aperçu des tarifs, des plateformes compatibles et des performances de Heron.

Offre gratuiteOui
Offres payantes$0
PlateformeLinux, macOS
DéveloppeurNetis
CatégorieProgrammation
Date de lancementApr 2026
Dernière mise à jourSep 2026
Visites du site649.3M
Classement mondial du site50
Disponibilité de l’APIN/A

Idéal pour

Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.

Utilisateurs

  • Les ingénieurs plateforme et SRE qui exploitent des parcs d'inférence et ont besoin de visibilité sur la latence et les erreurs sans toucher au code applicatif.
  • Les équipes IA qui déboguent des flux d'agents, surtout quand l'agent est un binaire fermé qu'elles ne peuvent pas instrumenter.
  • Les développeurs qui veulent constituer des jeux de données d'affinage à partir du trafic réel des agents plutôt que d'exemples synthétiques.

Tâches

  • Rejouer un .pcap enregistré pour reconstituer exactement ce qu'un agent a fait lors d'une exécution échouée.
  • Suivre en direct le temps jusqu'au premier token, la latence, le débit et le taux d'erreur par type d'agent et par modèle.
  • Cartographier une topologie d'inférence (clients → proxies → backends) pour voir quels composants gèrent quel trafic.
  • Exporter des sessions d'agents en JSONL pour un affinage supervisé.

Cas d'usage

  • Un hôte d'inférence en production où vous ne pouvez pas justifier l'ajout d'appels SDK dans le chemin des requêtes.
  • Une revue après incident, où vous disposez d'une capture de paquets mais d'aucun journal applicatif.
  • L'audit de ce qu'un agent autonome a réellement appelé, et dans quel ordre, après un résultat surprenant.
  • La mise en place d'une surveillance en laboratoire ou dans une exécution CI avec les fixtures .pcap de test fournies.

Fonctionnalités clés

Capture sans intrusion

Heron lit le trafic depuis le fil, à la frontière TLS de l'hôte, ou via une sonde eBPF expérimentale qui intercepte le clair à la limite de lecture/écriture SSL. Pas de SDK, pas de proxy, pas de modification du code et aucune coopération de la charge de travail observée. Pour les équipes qui ont des binaires fermés ou des contrôles de changement stricts, cela supprime la principale raison pour laquelle la surveillance des agents est reportée.

Reconstitution des tours d'agents

Les appels HTTP bruts sont difficiles à interpréter. Heron assemble les interactions à plusieurs appels en tours uniques et adressables, si bien qu'une étape du planificateur, son appel d'outil, le résultat de l'outil et l'appel suivant se lisent comme un seul récit. Vous obtenez l'histoire de l'agent, pas un journal de requêtes déconnectées. C'est là toute la différence. C'est la fonctionnalité qui le distingue des moniteurs d'API génériques.

Tableau de bord des métriques en direct

Une seule commande vous donne en direct le temps jusqu'au premier token, la latence, le débit, le taux d'erreur et une répartition par agent, le tout reconstitué à partir du trafic et affiché dans une console web locale. Des profils nommés sont fournis pour Claude Code et OpenAI Codex CLI, avec un profil générique pour tout le reste. Si vous avez toujours voulu des chiffres à l'échelle du parc sans pipeline de métriques, c'est le raccourci. Aucun pipeline nécessaire.

Classification des services et topologie

Heron détermine ce que sert chaque point de terminaison, comme vLLM, SGLang, Ollama, llama.cpp ou LiteLLM, en inspectant les octets sur le fil plutôt qu'en lisant un fichier de configuration. Il représente ensuite votre parc d'inférence sous forme de graphe orienté, l'épaisseur des arêtes variant selon le nombre de tours. Un routage mal configuré saute aux yeux vite quand vous pouvez le voir en image.

Export de données d'affinage

N'importe quel tour ou session s'exporte en JSONL de messages au format OpenAI, avec les appels d'outils, les résultats et le raisonnement conservés et les arguments réhydratés en objets. Exportez un seul tour depuis sa vue détaillée ou faites un export par lots depuis la liste des tours avec le filtre en cours. Cela transforme le trafic de production réel en données d'entraînement que vous auriez sinon dû étiqueter à la main.

Rejeu de pcap sans privilèges

Aucune capture en direct nécessaire. Donnez à Heron un .pcap contenant du trafic LLM et il rejoue le tout sans privilèges particuliers, en gardant la console ouverte ensuite pour que vous puissiez parcourir. Le dépôt fournit des fixtures que vous pouvez essayer avant de toucher au moindre système réel. L'évaluation devient bon marché. Et sûre.

Avantages et inconvénients

Avantages

  • Vraiment sans intrusion : pas de SDK, de proxy ni de modification du code, donc il fonctionne sur des binaires que vous ne pouvez pas recompiler.
  • Il reconstitue les tours au niveau de l'agent au lieu de déverser du HTTP brut, ce dont vous avez réellement besoin pour déboguer.
  • Un seul binaire statique avec la console web intégrée, donc aucune trace d'installateur ni de gestionnaire de paquets.
  • Le rejeu de pcap et les fixtures fournies permettent de l'évaluer sans privilèges et sans risque en production.
  • L'export JSONL pour l'affinage transforme le trafic réel en données d'entraînement, appels d'outils et raisonnement intacts.

Inconvénients

  • Il ne voit que le HTTP en clair, il doit donc tourner là où le TLS est déjà terminé. Pointez-le vers du trafic chiffré et vous n'obtenez rien.
  • La voie de capture eBPF est expérimentale, réservée à Linux et nécessite CAP_BPF, ce n'est donc pas encore une option à configurer et oublier.
  • La capture en direct sous Linux exige d'accorder des capacités de paquets, ce que certaines équipes de sécurité voudront examiner d'abord.

Questions fréquentes

Il capture le trafic réseau et en reconstitue les tours des agents d'IA et les interactions avec les API LLM. Au lieu d'instrumenter votre code, vous lancez Heron là où le trafic est visible, et il reconstitue chaque étape du planificateur, chaque appel d'outil et chaque réponse du modèle dans un tableau de bord explorable.

Contenus associés

Découvrez des outils, des compétences et des articles liés à Heron.

Alternatives à Heron

Forefront

Forefront

Forefront · Programmation

Forefront est une plateforme web pour construire avec de l'IA open source. Elle vous laisse affiner les principaux modèles de langage open source sur vos propres données, évaluer leurs performances et les exécuter via une API ou les exporter pour les héberger vous-même. Les développeurs qui veulent le confort d'une plateforme fermée mais tiennent à rester propriétaires de leurs modèles et de leurs données sont le public visé ici.

Gratuit / $0 - $99/moVoir les détails
Startkit

Startkit

StartKit.AI · Programmation

Startkit est un boilerplate pour créer des produits SaaS d'IA et des wrappers d'IA. Voyez-le comme un boilerplate de startup IA avec les parties ennuyeuses déjà branchées : authentification, paiements Stripe et Lemon Squeezy, limites d'usage, e-mail transactionnel et un kit de démarrage d'API IA qui parle à OpenAI, Anthropic, Groq ou Llama. Vous clonez le dépôt, fixez votre prix et attaquez la partie du produit pour laquelle les gens paient vraiment. Il repose sur Next.js au-dessus de React et Tailwind, donc une bonne partie du code boilerplate vous semble déjà familière.

Payant / $99 - $499 one-timeVoir les détails
Testim

Testim

Tricentis · Programmation

Testim est une plateforme d'automatisation des tests dopée à l'IA, qui sert à créer et exécuter des tests de bout en bout sur des applications web, mobiles et Salesforce. Elle s'appuie sur l'apprentissage automatique pour garder les tests stables quand une interface change, alors les équipes passent moins de temps à réparer des sélecteurs cassés. Pas mal pour un outil de tests automatisés que vous pouvez utiliser dès aujourd'hui. Vous créez des tests en enregistrant des actions dans un navigateur, puis vous ajoutez du JavaScript quand vous avez besoin de plus de contrôle. C'est un choix solide pour une équipe QA bien occupée.

Gratuit / Custom pricing on requestVoir les détails