Heron
Netis · Programación
Heron es una herramienta de observabilidad de agentes de código abierto que reconstruye los turnos de los agentes de IA y el tráfico de la API de LLM a partir de paquetes de red en lugar de tu código. Lee un archivo .pcap, una interfaz en vivo o una sonda eBPF y muestra cada paso del planificador, cada llamada a herramientas y cada respuesta del modelo en un panel local. No hay SDK que instalar, ni proxy por el que enrutar, ni cooperación alguna por parte de las aplicaciones que observas. ¿Quieres saber dónde se van realmente los segundos y los errores? Heron está hecho exactamente para eso. Sirve para el monitoreo de API de LLM en hosts que preferirías no instrumentar.

Acerca de Heron
Qué es Heron
Heron es una herramienta de observabilidad pasiva para agentes de IA. Captura tráfico HTTP en texto plano y reconstruye lo que ocurrió a nivel del agente, así que ves turnos completos (planificador → herramienta → resultado → siguiente paso) en lugar de un montón de peticiones en bruto. El proveedor, Netis, la llama "el Wireshark de los agentes de IA", y la comparación se sostiene: la apuntas al tráfico y te dice qué significa ese tráfico. Así de simple.
La idea central es la cero intrusión. La mayoría de las herramientas de monitoreo te obligan a añadir una librería, envolver un cliente o enrutar las llamadas a través de una pasarela. Heron se queda a un lado y lee el cable. Eso importa cuando la carga de trabajo es un binario cerrado que no puedes recompilar, o cuando no quieres código de instrumentación cerca de producción.
La contrapartida es la misma que siempre tienen las herramientas de paquetes. Heron ve HTTP en texto plano, así que necesita ejecutarse donde el tráfico ya está descifrado: en el host de inferencia, detrás del terminador TLS, o alimentado desde una fuente de paquetes en la que confíes. Si la apuntas a tráfico cifrado, no ve nada útil. Ese es el problema.
Cómo empezar
- Instala el único binario con el instalador de una línea, ya sea en todo el sistema o como instalación local de usuario que no necesita sudo.
- Dale acceso a los paquetes. En Linux eso significa conceder las capacidades de captura una vez, o alimentarlo con un archivo .pcap si prefieres no tocar el tráfico en vivo.
- Ejecútalo contra tu fuente, por ejemplo
heron -i eth0en Linux oheron --pcap-file capture.pcappara reproducir un archivo guardado. - Abre la consola local en el puerto 3000 para explorar los turnos de los agentes, las líneas de tiempo y las métricas.
- Exporta cualquier turno o sesión completa como JSONL de mensajes al estilo OpenAI si quieres datos de ajuste fino.
Información del producto
Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de Heron.
Ideal para
Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.
Usuarios
- Ingenieros de plataforma y SRE que gestionan flotas de inferencia y necesitan visibilidad de latencia y errores sin tocar el código de la aplicación.
- Equipos de IA que depuran flujos de trabajo de agentes, sobre todo cuando el agente es un binario cerrado que no pueden instrumentar.
- Desarrolladores que quieren construir conjuntos de datos de ajuste fino a partir del tráfico real de los agentes en lugar de ejemplos sintéticos.
Tareas
- Reproducir un .pcap guardado para reconstruir exactamente qué hizo un agente durante una ejecución fallida.
- Vigilar en vivo el tiempo hasta el primer token, la latencia, el rendimiento y la tasa de errores por tipo de agente y modelo.
- Mapear una topología de inferencia (clientes → proxies → backends) para ver qué componentes gestionan qué tráfico.
- Exportar sesiones de agentes como JSONL para ajuste fino supervisado.
Casos de uso
- Un host de inferencia en producción donde no puedes justificar añadir llamadas a SDK en la ruta de las peticiones.
- Revisión posterior a un incidente, donde tienes una captura de paquetes pero ningún registro de la aplicación.
- Auditar qué llamó realmente un agente autónomo, y en qué orden, tras un resultado sorprendente.
- Montar monitoreo en un laboratorio o en una ejecución de CI usando los fixtures .pcap de prueba incluidos.
Funciones clave
Captura de cero intrusión
Heron lee el tráfico del cable, en el límite TLS del host, o a través de una sonda eBPF experimental que captura el texto plano en el límite de lectura/escritura de SSL. Sin SDK, sin proxy, sin cambios en el código y sin cooperación de la carga de trabajo observada. Para los equipos con binarios cerrados o controles de cambio estrictos, esto elimina el principal motivo por el que se pospone el monitoreo de agentes.
Reconstrucción de turnos de agentes
Las llamadas HTTP en bruto son difíciles de interpretar. Heron enlaza interacciones de varias llamadas en turnos únicos y direccionables, así que un paso del planificador, su llamada a herramientas, el resultado de la herramienta y la llamada de seguimiento se leen como una sola narración. Obtienes la historia del agente, no un registro de peticiones desconectadas. Esa es la diferencia. Es la función que lo separa de los monitores de API genéricos.
Panel de métricas en vivo
Un solo comando te da en vivo el tiempo hasta el primer token, la latencia, el rendimiento, la tasa de errores y una mezcla por agente, todo reconstruido a partir del tráfico y mostrado en una consola web local. Se incluyen perfiles con nombre para Claude Code y OpenAI Codex CLI, con un perfil genérico para todo lo demás. Si alguna vez has querido cifras a nivel de flota sin una canalización de métricas, este es el atajo. No hace falta canalización.
Clasificación de servicios y topología
Heron averigua qué sirve cada endpoint, como vLLM, SGLang, Ollama, llama.cpp o LiteLLM, inspeccionando los bytes del cable en lugar de leer un archivo de configuración. Después representa tu flota de inferencia como un grafo dirigido, con el grosor de las aristas escalado según el número de turnos. Un enrutamiento mal configurado salta a la vista rápido cuando puedes verlo como una imagen.
Exportación de datos para ajuste fino
Cualquier turno o sesión se exporta como JSONL de mensajes al estilo OpenAI, con las llamadas a herramientas, los resultados y el razonamiento conservados y los argumentos rehidratados en objetos. Exporta un solo turno desde su vista de detalle o haz una exportación por lotes desde la lista de turnos usando el filtro actual. Convierte el tráfico real de producción en datos de entrenamiento que de otro modo tendrías que etiquetar a mano.
Reproducción de pcap sin privilegios
No hace falta captura en vivo. Dale a Heron un .pcap con tráfico de LLM y reproduce todo sin privilegios especiales, manteniendo la consola abierta después para que puedas explorar. El repositorio incluye fixtures que puedes probar antes de tocar cualquier sistema real. Eso abarata la evaluación. Y la hace segura.
Ventajas y desventajas
Ventajas
- Cero intrusión de verdad: sin SDK, proxy ni cambios en el código, así que funciona con binarios que no puedes recompilar.
- Reconstruye turnos a nivel de agente en lugar de volcar HTTP en bruto, que es lo que realmente necesitas para depurar.
- Un único binario estático con la consola web integrada, así que no deja rastro de instalador ni de gestor de paquetes.
- La reproducción de pcap y los fixtures incluidos te dejan evaluarlo sin privilegios y sin riesgo en producción.
- La exportación a JSONL para ajuste fino convierte el tráfico real en datos de entrenamiento con las llamadas a herramientas y el razonamiento intactos.
Desventajas
- Solo ve HTTP en texto plano, así que tiene que ejecutarse donde el TLS ya está terminado. Si lo apuntas a tráfico cifrado, no obtienes nada.
- La ruta de captura eBPF es experimental, solo para Linux y necesita CAP_BPF, así que todavía no es una opción de configurar y olvidarse.
- La captura en vivo en Linux requiere conceder capacidades de paquetes, algo que algunos equipos de seguridad querrán revisar antes.
Preguntas frecuentes
Captura tráfico de red y reconstruye a partir de él los turnos de los agentes de IA y las interacciones con la API de LLM. En lugar de instrumentar tu código, ejecutas Heron donde el tráfico es visible y reconstruye cada paso del planificador, cada llamada a herramientas y cada respuesta del modelo en un panel explorable.
Contenido relacionado
Explora herramientas, habilidades y artículos relacionados con Heron.
Alternativas a Heron
Forefront
Forefront · ProgramaciónForefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.
Startkit
StartKit.AI · ProgramaciónStartkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.
Testim
Tricentis · ProgramaciónTestim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.
