Heron
Netis · Programação
O Heron é uma ferramenta de observabilidade de agentes de código aberto que reconstrói os turnos dos agentes de IA e o tráfego da API de LLM a partir de pacotes de rede, e não do seu código. Ele lê um arquivo .pcap, uma interface ativa ou uma sonda eBPF e mostra cada passo do planejador, cada chamada de ferramenta e cada resposta do modelo em um painel local. Não há SDK a instalar, nem proxy por onde rotear, nem cooperação necessária dos aplicativos que você observa. Quer saber onde os segundos e os erros realmente se perdem? O Heron foi feito exatamente para isso. Ele serve para o monitoramento de API de LLM em hosts que você preferiria não instrumentar.

Sobre Heron
O que é o Heron
O Heron é uma ferramenta de observabilidade passiva para agentes de IA. Ele captura tráfego HTTP em texto puro e reconstrói o que aconteceu no nível do agente, então você vê turnos completos (planejador → ferramenta → resultado → próximo passo) em vez de um monte de requisições brutas. O fornecedor, Netis, o chama de "o Wireshark dos agentes de IA", e a comparação se sustenta: você aponta a ferramenta para o tráfego e ela diz o que o tráfego significa. Simples assim.
A ideia central é a intrusão zero. A maioria das ferramentas de monitoramento obriga você a adicionar uma biblioteca, envolver um cliente ou rotear chamadas por um gateway. O Heron fica de lado e lê o fio. Isso importa quando a carga de trabalho é um binário fechado que você não consegue recompilar, ou quando você não quer código de instrumentação perto da produção.
O custo dessa escolha é o mesmo que as ferramentas de pacote sempre têm. O Heron enxerga HTTP em texto puro, então precisa rodar onde o tráfego já está descriptografado: no host de inferência, atrás do terminador TLS, ou alimentado por uma fonte de pacotes em que você confia. Aponte-o para tráfego criptografado e ele não vê nada útil. Essa é a pegadinha.
Como começar
- Instale o único binário com o instalador de uma linha, seja em todo o sistema ou como instalação local do usuário, que dispensa sudo.
- Dê a ele acesso aos pacotes. No Linux, isso significa conceder as capacidades de captura uma vez, ou alimentá-lo com um arquivo .pcap se você preferir não mexer no tráfego ativo.
- Execute-o contra a sua fonte, por exemplo
heron -i eth0no Linux ouheron --pcap-file capture.pcappara reproduzir um arquivo salvo. - Abra o console local na porta 3000 para navegar pelos turnos dos agentes, linhas do tempo e métricas.
- Exporte qualquer turno ou sessão completa como JSONL de mensagens no estilo OpenAI se quiser dados de ajuste fino.
Informações do produto
Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de Heron.
Ideal para
Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.
Usuários
- Engenheiros de plataforma e SRE que administram frotas de inferência e precisam de visibilidade de latência e erros sem tocar no código do aplicativo.
- Equipes de IA que depuram fluxos de trabalho de agentes, sobretudo quando o agente é um binário fechado que não pode ser instrumentado.
- Desenvolvedores que querem montar conjuntos de dados de ajuste fino a partir do tráfego real dos agentes em vez de exemplos sintéticos.
Tarefas
- Reproduzir um .pcap salvo para reconstruir exatamente o que um agente fez durante uma execução falha.
- Acompanhar ao vivo o tempo até o primeiro token, a latência, a taxa de transferência e a taxa de erros por tipo de agente e modelo.
- Mapear uma topologia de inferência (clientes → proxies → backends) para ver quais componentes cuidam de qual tráfego.
- Exportar sessões de agentes como JSONL para ajuste fino supervisionado.
Cenários
- Um host de inferência em produção onde você não consegue justificar a adição de chamadas de SDK no caminho das requisições.
- Revisão pós-incidente, quando você tem uma captura de pacotes mas nenhum registro do aplicativo.
- Auditar o que um agente autônomo realmente chamou, e em que ordem, depois de um resultado surpreendente.
- Montar monitoramento em um laboratório ou em uma execução de CI usando os fixtures .pcap de teste incluídos.
Principais recursos
Captura de intrusão zero
O Heron lê o tráfego do fio, no limite TLS do host, ou por meio de uma sonda eBPF experimental que captura o texto puro no limite de leitura/gravação do SSL. Sem SDK, sem proxy, sem mudanças no código e sem cooperação da carga de trabalho observada. Para equipes com binários fechados ou controles de mudança rígidos, isso elimina o principal motivo pelo qual o monitoramento de agentes é adiado.
Reconstrução de turnos de agentes
As chamadas HTTP brutas são difíceis de interpretar. O Heron costura interações de várias chamadas em turnos únicos e endereçáveis, então um passo do planejador, sua chamada de ferramenta, o resultado da ferramenta e a chamada seguinte são lidos como uma só narrativa. Você recebe a história do agente, não um registro de requisições desconexas. Essa é a diferença. É o recurso que o separa dos monitores de API genéricos.
Painel de métricas ao vivo
Um único comando entrega, ao vivo, o tempo até o primeiro token, a latência, a taxa de transferência, a taxa de erros e uma mistura por agente, tudo reconstruído a partir do tráfego e exibido em um console web local. Há perfis nomeados para o Claude Code e o OpenAI Codex CLI, com um perfil genérico para todo o resto. Se você sempre quis números no nível da frota sem um pipeline de métricas, este é o atalho. Nenhum pipeline é necessário.
Classificação de serviços e topologia
O Heron descobre o que cada endpoint serve, como vLLM, SGLang, Ollama, llama.cpp ou LiteLLM, inspecionando os bytes no fio em vez de ler um arquivo de configuração. Depois ele desenha a sua frota de inferência como um grafo direcionado, com a espessura das arestas dimensionada pelo número de turnos. Um roteamento mal configurado aparece rápido quando você pode vê-lo como imagem.
Exportação de dados para ajuste fino
Qualquer turno ou sessão é exportado como JSONL de mensagens no estilo OpenAI, com as chamadas de ferramenta, os resultados e o raciocínio preservados e os argumentos reidratados em objetos. Exporte um único turno pela sua visão de detalhe ou faça uma exportação em lote pela lista de turnos usando o filtro atual. Isso transforma o tráfego real de produção em dados de treinamento que você teria de rotular à mão de outra forma.
Reprodução de pcap sem privilégios
Não é preciso captura ao vivo. Entregue ao Heron um .pcap com tráfego de LLM e ele reproduz tudo sem privilégios especiais, mantendo o console aberto depois para você navegar. O repositório traz fixtures que você pode testar antes de tocar em qualquer sistema real. Isso deixa a avaliação barata. E segura.
Prós e contras
Prós
- Intrusão zero de verdade: sem SDK, proxy ou mudanças no código, então funciona em binários que você não consegue recompilar.
- Reconstrói turnos no nível do agente em vez de despejar HTTP bruto, que é o que você realmente precisa para depurar.
- Um único binário estático com o console web embutido, então não deixa rastro de instalador nem de gerenciador de pacotes.
- A reprodução de pcap e os fixtures incluídos permitem avaliá-lo sem privilégios e sem risco em produção.
- A exportação em JSONL para ajuste fino transforma o tráfego real em dados de treinamento com as chamadas de ferramenta e o raciocínio intactos.
Contras
- Ele só enxerga HTTP em texto puro, então precisa rodar onde o TLS já está terminado. Aponte-o para tráfego criptografado e você não obtém nada.
- O caminho de captura eBPF é experimental, só para Linux e exige CAP_BPF, então ainda não é uma opção de configurar e esquecer.
- A captura ao vivo no Linux exige conceder capacidades de pacotes, algo que algumas equipes de segurança vão querer revisar antes.
Perguntas frequentes
Ele captura tráfego de rede e reconstrói a partir dele os turnos dos agentes de IA e as interações com a API de LLM. Em vez de instrumentar o seu código, você roda o Heron onde o tráfego é visível, e ele reconstrói cada passo do planejador, cada chamada de ferramenta e cada resposta do modelo em um painel navegável.
Conteúdo relacionado
Explore ferramentas, skills e artigos relacionados a Heron.
Alternativas a Heron
Forefront
Forefront · ProgramaçãoO Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.
Startkit
StartKit.AI · ProgramaçãoStartkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.
Testim
Tricentis · ProgramaçãoO Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.
