
Agent Browser
agent-browser-io · 코딩
Agent Browser는 AI 에이전트가 사람처럼 실제 웹 브라우저를 조작하게 해 주는 브라우저 자동화 도구다. 페이지를 압축된 ASCII 와이어프레임으로 바꾸므로, 모델은 날것의 HTML을 통째로 분석하는 대신 링크와 버튼을 번호가 붙은 텍스트로 읽는다. Cursor나 Claude Desktop 같은 MCP 클라이언트 안에서 쓰고, Vercel AI SDK로 Node 앱에 연결하고, 명령줄에서 시험해 볼 수도 있다.

Agent Browser 소개
Agent Browser란 무엇인가
Agent Browser는 agent-browser-io가 내놓은 실험적 패키지로, AI 에이전트에게 웹에서 쓸 손과 눈을 준다. 정적인 HTML을 긁어오는 대신, 에이전트는 Playwright를 통해 살아 있는 브라우저를 열고 와이어프레임을 요청한다. 클릭 가능한 요소마다 번호가 붙은, 군더더기 없는 텍스트 지도다. 에이전트가 번호를 고르면 도구가 대신 클릭하고 입력하고 스크롤한다.
핵심은 토큰 비용이다. 완전한 웹 페이지는 모델에 필요 없는 마크업으로 수천 토큰을 태울 수 있다. 그게 문제다. 그럼 에이전트는 실제로 무엇을 보는가. 페이지 전체가 아니라 짧은 텍스트 지도다. 와이어프레임은 그것을 중요한 부분만 남기고 잘라내, 긴 작업에서도 에이전트가 컨텍스트 윈도 안에 머물게 한다. 아직 초기 소프트웨어다. 프로젝트 스스로 실험적이라고 밝히고, 마지막 공개는 버전 0.3.0이었다. 거친 부분은 각오하는 편이 좋다.
가장 큰 한계는 유지보수와 완성도다. 저장소는 공개되어 있고 규모가 작아, 대상 사이트가 레이아웃을 바꿔 흐름을 깨도 지원 창구가 없다. 실행하려면 Node 18 이상도 필요하다. 취미 프로젝트와 도구 제작에는 괜찮다. 실서비스라면 두 번 생각하라.
시작하기
- Node 18+ 프로젝트에서
npm install @agent-browser-io/browser로 패키지를 설치한다. - AI 어시스턴트에서 쓰려면 MCP 서버를 클라이언트 설정에 추가한다. 명령은
npx, 인자는["-y", "@agent-browser-io/browser", "mcp"]이며, 그다음 클라이언트를 재시작한다. - navigate, click 등 나머지는 실행 중인 브라우저에 의존하므로, 에이전트가 먼저
launch도구를 호출하게 한다. - 와이어프레임을 요청하면 페이지가 번호 붙은 요소로 보이므로, 어떤 번호를 클릭할지 무엇을 입력할지 에이전트에게 알려 준다.
- 코드로 쓸 때는
new AgentBrowser(new PlaywrightBrowserBackend())로 브라우저를 만들고createBrowserTools(browser)를generateText호출에 넘긴다.
제품 정보
Agent Browser의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.
추천 대상
이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.
사용자
- AI 에이전트를 만드는 개발자
- Cursor와 Claude Desktop 사용자
- QA와 자동화를 만지작거리는 사람
작업
- 페이지 읽기와 요약
- 폼 작성과 흐름 통과
- 여러 단계의 조사
활용 상황
- 몇 개 사이트를 훑고 보고하는 사내 조사 봇을 만든다.
- 웹 흐름을 손으로 클릭하는 대신 스크립트로 시험한다.
- 헤드리스 요청이 아니라 실제 브라우저 제어가 필요한 에이전트 기능을 시제품으로 만든다.
주요 기능
토큰 효율적인 와이어프레임
Agent Browser는 페이지를 번호 붙은 요소가 있는 ASCII 지도로 그린다. 이것이 토큰 절약의 핵심이다. 에이전트는 [11]upvote 같은 라벨을 읽고 DOM 전체를 불러오는 대신 번호를 고른다. 정보가 많은 페이지에서 이는 수백 토큰과 수천 토큰의 차이이며, 그 여유가 긴 작업을 중간에 끊기지 않고 끝내게 한다.
Playwright를 통한 실제 브라우저 제어
이 도구는 Playwright를 통해 실제 브라우저를 조작한다. 테스트 스크립트가 아니라 에이전트를 향한, 이른바 고전적인 Playwright 브라우저 자동화다. JavaScript, 쿠키, 살아 있는 세션이 필요한 페이지에서 작동한다. 사람이 클릭할 수 있는 것은 에이전트도 클릭할 수 있다. 브라우저인 척하는 헤드리스 스크래퍼가 아니며, 사이트가 단순 요청을 막을 때 이 점이 중요하다.
MCP 통합
패키지에는 Cursor, Claude Desktop, 또는 stdio 기반의 어떤 MCP 클라이언트에도 넣을 수 있는 MCP 서버가 들어 있다. 설정 한 항목이 MCP 브라우저 도구 전체를 노출하고, 서버는 별도 환경 변수 없이 stdin과 stdout으로 JSON-RPC를 주고받는다. 어시스턴트가 이미 MCP를 쓴다면 이것이 브라우저를 붙이는 가장 짧은 길이다.
Vercel AI SDK 도구
코드에서는 createBrowserTools(browser)가 도구 묶음을 돌려주고, 그것을 그대로 generateText에 넘긴다. 묶음은 launch, navigate, getWireframe, click, type, fill, dblclick, hover, press, select, check, uncheck, scroll, screenshot, close를 아우른다. MCP 서버와 일치하므로 어떻게 호출하든 동작이 같다.
대화형 CLI
수동 시험용으로 npx @agent-browser-io/browser, 또는 설치 후 agent-browser-cli 바이너리로 CLI를 실행할 수 있다. 왜 굳이 쓰는가. 와이어프레임이 제대로 나오는지 확인하는 가장 빠른 방법이기 때문이다. 스크립트로 넘어가기 전에 선택자가 예상한 자리에 닿는지 확인하라.
와이어프레임과 나란한 스크린샷
실제 픽셀을 봐야 할 때는 스크린샷 도구가 페이지를 이미지로 담는다. 그뿐이다. 구조는 와이어프레임이, 시각적 세부는 스크린샷이 맡으므로, 에이전트가 읽어야 하는지 봐야 하는지에 따라 바꿔 쓴다.
장단점
장점
- 와이어프레임이 페이지가 많은 작업에서 토큰 사용을 줄여, 에이전트를 컨텍스트 윈도 안에 붙잡아 둔다.
- 설정 블록 하나로 Cursor와 Claude Desktop 같은 MCP 클라이언트와 연동한다.
- 오픈 소스에 무료이며, 코드 전체가 GitHub에 있어 누구나 살펴보거나 포크할 수 있다.
- 진짜 Playwright 브라우저를 조작하므로 JavaScript가 많은 사이트도 사람에게 그러하듯 동작한다.
- 같은 도구 묶음이 MCP 서버와 코드 경로를 모두 움직여 결과가 일관된다.
단점
- 실험적이라고 표시되어 있고 마지막 릴리스가 0.3.0이라, API가 아직 발밑에서 바뀔 수 있다.
- 호스팅 서비스도 지원도 없어, 문제는 스스로 디버깅해야 한다.
- Node 18+와 어느 정도 설정이 필요해, 비개발자에게는 한 번에 되는 도구가 아니다.
- 레이아웃을 바꾸는 페이지는 저장한 흐름을 깨뜨릴 수 있고, 단계를 다시 짜야 한다.
자주 묻는 질문
AI 에이전트가 실제 브라우저를 제어해 페이지를 탐색하고 클릭하고 입력하고 읽게 한다. 조사 봇을 만들고, 웹 흐름을 자동화하고, MCP 어시스턴트에 브라우징 능력을 주는 데 쓴다.
관련 콘텐츠
Agent Browser와 관련된 도구, 스킬, 아티클을 살펴보세요.
Agent Browser 대안
Forefront
Forefront · 코딩Forefront는 오픈소스 AI로 무언가를 만드는 웹 플랫폼이다. 대표적인 오픈소스 언어 모델을 자신의 데이터로 미세 조정하고, 성능을 평가하고, API로 실행하거나 내보내 직접 호스팅할 수 있다. 폐쇄형 플랫폼의 편의를 원하면서도 모델과 데이터의 소유권은 놓지 않으려는 개발자가 대상이다.
Startkit
StartKit.AI · 코딩Startkit은 AI SaaS와 AI 래퍼 제품을 만들기 위한 보일러플레이트다. 지루한 부분을 미리 연결해 둔 AI 스타트업 보일러플레이트라고 생각하면 된다. 인증, Stripe와 Lemon Squeezy 결제, 사용량 제한, 트랜잭션 이메일, 그리고 OpenAI, Anthropic, Groq, Llama와 통신하는 AI API 스타터 키트가 포함된다. 저장소를 복제하고 가격을 정한 뒤 사용자가 실제로 돈을 내는 부분에 착수하면 된다. React와 Tailwind 위의 Next.js로 만들어졌기 때문에 보일러플레이트 코드의 상당 부분이 이미 익숙하게 느껴진다.
Testim
Tricentis · 코딩Testim은 웹, 모바일, Salesforce 애플리케이션 전반에 걸쳐 엔드투엔드 테스트를 만들고 실행하는 AI 기반 테스트 자동화 플랫폼이다. 머신러닝에 기대어 인터페이스가 바뀌어도 테스트를 안정적으로 유지하므로, 팀은 깨진 셀렉터를 고치는 데 쓰는 시간을 줄인다. 오늘부터 쓸 수 있는 자동화 테스트 도구치고 나쁘지 않다. 브라우저에서 동작을 녹화해 테스트를 만들고, 더 세밀한 제어가 필요하면 JavaScript를 더한다. 바쁜 QA 팀에게 탄탄한 선택이다.
