Heron
Netis · 코딩
Heron은 오픈소스 에이전트 관측성 도구로, 코드가 아니라 네트워크 패킷에서 AI 에이전트 턴과 LLM API 트래픽을 재구성한다. .pcap 파일, 라이브 인터페이스, eBPF 프로브를 읽고 모든 플래너 단계와 도구 호출, 모델 응답을 로컬 대시보드에 보여준다. 설치할 SDK도, 경유시킬 프록시도, 관찰 대상 애플리케이션의 협조도 필요 없다. 몇 초와 오류가 실제로 어디로 사라지는지 알고 싶은가? Heron은 바로 그 목적을 위해 만들어졌다. 계측하고 싶지 않은 호스트에서의 LLM API 모니터링에 어울린다.

Heron 소개
Heron이란 무엇인가
Heron은 AI 에이전트를 위한 수동적 관측성 도구다. 평문 HTTP 트래픽을 캡처하고 에이전트 수준에서 벌어진 일을 재구성한다. 그래서 원시 요청 더미가 아니라 완전한 턴(플래너 → 도구 → 결과 → 다음 단계)을 보게 된다. 공급업체 Netis는 이를 "AI 에이전트를 위한 Wireshark"라고 부르는데, 그 비유는 들어맞는다. 트래픽 쪽으로 향하게 하면 그 트래픽이 무엇을 뜻하는지 알려준다. 그게 전부다.
핵심 발상은 무침투다. 대부분의 모니터링 도구는 라이브러리를 추가하거나, 클라이언트를 감싸거나, 호출을 게이트웨이로 우회시킨다. Heron은 옆에 앉아 회선을 읽는다. 재빌드할 수 없는 닫힌 바이너리가 작업 부하일 때, 혹은 운영 환경 근처에 계측 코드를 두고 싶지 않을 때 이 차이가 중요하다.
대가는 패킷 도구가 늘 지는 것과 같다. Heron은 평문 HTTP를 보므로 트래픽이 이미 복호화된 곳에서 실행해야 한다. 추론 호스트 위, TLS 종단기 뒤, 또는 신뢰하는 패킷 소스에서 공급되는 위치다. 암호화된 트래픽으로 향하게 하면 쓸모 있는 걸 아무것도 보지 못한다. 그게 함정이다.
시작하기
- 한 줄 설치기로 단일 바이너리를 설치한다. 시스템 전체든 sudo가 필요 없는 사용자 로컬 설치든 상관없다.
- 패킷 접근 권한을 준다. 리눅스에서는 캡처 권한을 한 번 부여하거나, 라이브 트래픽을 건드리고 싶지 않다면 .pcap 파일을 넘겨준다.
- 소스에 대해 실행한다. 예를 들어 리눅스에서는
heron -i eth0, 저장한 파일을 재생하려면heron --pcap-file capture.pcap을 쓴다. - 3000번 포트의 로컬 콘솔을 열어 에이전트 턴과 타임라인, 지표를 살핀다.
- 파인튜닝 데이터를 원한다면 아무 턴이나 세션 전체를 OpenAI 형식 messages JSONL로 내보낸다.
제품 정보
Heron의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.
추천 대상
이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.
사용자
- 추론 플릿을 운영하면서 애플리케이션 코드를 건드리지 않고 지연 시간과 오류 가시성을 확보해야 하는 플랫폼 엔지니어와 SRE.
- 에이전트 워크플로를 디버깅하는 AI 팀, 특히 에이전트가 계측할 수 없는 닫힌 바이너리일 때.
- 합성 예제가 아니라 실제 에이전트 트래픽에서 파인튜닝 데이터셋을 만들려는 개발자.
작업
- 저장한 .pcap을 재생해 실패한 실행에서 에이전트가 정확히 무엇을 했는지 재구성한다.
- 에이전트 종류와 모델별로 첫 토큰까지의 시간, 지연 시간, 처리량, 오류율을 실시간으로 본다.
- 추론 토폴로지(클라이언트 → 프록시 → 백엔드)를 그려 어떤 컴포넌트가 어떤 트래픽을 맡는지 파악한다.
- 에이전트 세션을 지도 파인튜닝용 JSONL로 내보낸다.
활용 상황
- 요청 경로에 SDK 호출을 넣는 걸 정당화할 수 없는 운영 환경의 추론 호스트.
- 패킷 캡처는 있지만 애플리케이션 로그는 없는 사후 검토.
- 뜻밖의 결과 뒤에 자율 에이전트가 실제로 무엇을 어떤 순서로 호출했는지 감사하는 경우.
- 딸려 오는 .pcap 테스트 픽스처를 써서 실험실이나 CI 실행에서 모니터링을 세우는 경우.
주요 기능
무침투 캡처
Heron은 회선에서, 호스트의 TLS 경계에서, 또는 SSL 읽기/쓰기 경계에서 평문을 잡아내는 실험적 eBPF 프로브를 통해 트래픽을 읽는다. SDK도, 프록시도, 코드 변경도 없고 관찰 대상 작업 부하의 협조도 필요 없다. 닫힌 바이너리나 엄격한 변경 통제를 가진 팀에게는 에이전트 모니터링이 미뤄지는 주된 이유가 사라진다.
에이전트 턴 재구성
원시 HTTP 호출은 해석하기 어렵다. Heron은 여러 호출로 이뤄진 상호작용을 하나의 주소 지정 가능한 턴으로 꿰맨다. 그래서 플래너 단계와 그 도구 호출, 도구 결과, 후속 호출이 하나의 이야기로 읽힌다. 얻는 것은 에이전트의 이야기지, 뚝뚝 끊긴 요청의 로그가 아니다. 그게 차이다. 범용 API 모니터와 갈라놓는 기능이다.
실시간 지표 대시보드
명령 하나로 첫 토큰까지의 시간, 지연 시간, 처리량, 오류율, 에이전트별 구성이 실시간으로 나온다. 모두 트래픽에서 재구성되어 로컬 웹 콘솔에 표시된다. Claude Code와 OpenAI Codex CLI용 이름 붙은 프로파일이 함께 오고, 나머지 전반을 위한 범용 프로파일도 있다. 지표 파이프라인 없이 플릿 수준 수치를 원한 적이 있다면 이게 지름길이다. 파이프라인은 필요 없다.
서비스 분류와 토폴로지
Heron은 설정 파일을 읽는 대신 회선 위 바이트를 살펴 각 엔드포인트가 무엇을 제공하는지(vLLM, SGLang, Ollama, llama.cpp, LiteLLM 등) 알아낸다. 이어서 추론 플릿을 방향 그래프로 그리는데, 간선 두께는 턴 수에 따라 조정된다. 잘못 설정된 라우팅은 그림으로 보면 금방 드러난다.
파인튜닝 데이터 내보내기
아무 턴이나 세션을 OpenAI 형식 messages JSONL로 내보낼 수 있고, 도구 호출과 결과, 추론이 보존되며 인자는 객체로 복원된다. 상세 보기에서 한 턴을 내보내거나, 턴 목록에서 현재 필터로 일괄 내보낸다. 손으로 라벨링해야 했을 실제 운영 트래픽이 훈련 데이터로 바뀐다.
권한 없는 Pcap 재생
라이브 캡처는 필요 없다. LLM 트래픽이 담긴 .pcap을 Heron에 넘기면 특별한 권한 없이 전체를 재생하고, 이후에도 콘솔을 열어 둬 살펴볼 수 있다. 저장소에는 실제 시스템을 건드리기 전에 시험해 볼 수 있는 픽스처가 들어 있다. 평가가 저렴해진다. 그리고 안전해진다.
장단점
장점
- 진짜 무침투다. SDK도 프록시도 코드 변경도 없어 재빌드할 수 없는 바이너리에서도 작동한다.
- 원시 HTTP를 쏟아내는 대신 에이전트 수준 턴을 재구성한다. 디버깅에 정말 필요한 것이 이것이다.
- 웹 콘솔이 내장된 단일 정적 바이너리라 설치기나 패키지 관리자의 흔적을 남기지 않는다.
- Pcap 재생과 딸린 픽스처 덕에 권한도 운영 리스크도 없이 평가할 수 있다.
- 파인튜닝용 JSONL 내보내기는 도구 호출과 추론을 그대로 둔 채 실제 트래픽을 훈련 데이터로 바꾼다.
단점
- 평문 HTTP만 보므로 TLS가 이미 종단된 곳에서 실행해야 한다. 암호화된 트래픽으로 향하게 하면 아무것도 얻지 못한다.
- eBPF 캡처 경로는 실험적이고 리눅스 전용이며 CAP_BPF가 필요해 아직 설정하고 잊어버릴 수 있는 선택지가 아니다.
- 리눅스의 라이브 캡처는 패킷 권한 부여를 요구하며, 일부 보안 팀은 먼저 검토하고 싶어한다.
자주 묻는 질문
네트워크 트래픽을 캡처해 그로부터 AI 에이전트 턴과 LLM API 상호작용을 재구성한다. 코드를 계측하는 대신 트래픽이 보이는 곳에서 Heron을 실행하면, 모든 플래너 단계와 도구 호출, 모델 응답을 둘러볼 수 있는 대시보드로 재구성한다.
관련 콘텐츠
Heron와 관련된 도구, 스킬, 아티클을 살펴보세요.
Heron 대안
Forefront
Forefront · 코딩Forefront는 오픈소스 AI로 무언가를 만드는 웹 플랫폼이다. 대표적인 오픈소스 언어 모델을 자신의 데이터로 미세 조정하고, 성능을 평가하고, API로 실행하거나 내보내 직접 호스팅할 수 있다. 폐쇄형 플랫폼의 편의를 원하면서도 모델과 데이터의 소유권은 놓지 않으려는 개발자가 대상이다.
Startkit
StartKit.AI · 코딩Startkit은 AI SaaS와 AI 래퍼 제품을 만들기 위한 보일러플레이트다. 지루한 부분을 미리 연결해 둔 AI 스타트업 보일러플레이트라고 생각하면 된다. 인증, Stripe와 Lemon Squeezy 결제, 사용량 제한, 트랜잭션 이메일, 그리고 OpenAI, Anthropic, Groq, Llama와 통신하는 AI API 스타터 키트가 포함된다. 저장소를 복제하고 가격을 정한 뒤 사용자가 실제로 돈을 내는 부분에 착수하면 된다. React와 Tailwind 위의 Next.js로 만들어졌기 때문에 보일러플레이트 코드의 상당 부분이 이미 익숙하게 느껴진다.
Testim
Tricentis · 코딩Testim은 웹, 모바일, Salesforce 애플리케이션 전반에 걸쳐 엔드투엔드 테스트를 만들고 실행하는 AI 기반 테스트 자동화 플랫폼이다. 머신러닝에 기대어 인터페이스가 바뀌어도 테스트를 안정적으로 유지하므로, 팀은 깨진 셀렉터를 고치는 데 쓰는 시간을 줄인다. 오늘부터 쓸 수 있는 자동화 테스트 도구치고 나쁘지 않다. 브라우저에서 동작을 녹화해 테스트를 만들고, 더 세밀한 제어가 필요하면 JavaScript를 더한다. 바쁜 QA 팀에게 탄탄한 선택이다.
