Open Browser Use

Open Browser Use

iFurySt · Programação

O Open Browser Use é uma camada de automação de navegador gratuita e de código aberto que permite que agentes de IA conduzam o Chrome real em vez de um clone sem interface. Ele combina uma extensão do Chrome com uma CLI, além de SDKs para JavaScript, Python e Go, então você programa abas, navegação e ações no nível do DOM a partir do runtime de agente que já usa. É voltado para desenvolvedores que querem que seus assistentes realmente cliquem, leiam e preencham coisas em páginas ao vivo.

Prévia da interface de Open Browser Use

Sobre Open Browser Use

O que é o Open Browser Use

O Open Browser Use é automação de navegador para agentes de IA que se mantém neutra entre runtimes. Esse palavrão significa algo simples. Ele não se importa com qual ferramenta de agente você roda, do Codex ao Claude Code ou à sua própria stack. Você aponta para uma janela real do Chrome e o seu agente ganha controle de abas, navegação e ações de página.

Ele se apresenta como uma alternativa de código aberto ao recurso Chrome Browser Use que vinha dentro do Codex.app. Por baixo, uma extensão de navegador conversa com a CLI open-browser-use por meio de um host de mensagens nativo que fica registrado na sua máquina. A partir daí, você integra pelo SDK de JavaScript, pelo SDK de Python, pelo SDK de Go ou diretamente pela CLI.

A maior limitação é a instalação. Você precisa do Chrome e do Node instalados, e registra um host nativo antes que qualquer coisa funcione. Se prefere não rodar o Chrome real, esta não é a ferramenta para você. Essa é toda a barreira. Sem Chrome, sem acordo.

Como começar

  1. Instale a CLI com npm i -g open-browser-use (ou via Homebrew no macOS e no Linux).
  2. Rode open-browser-use setup para registrar o host nativo. Isso também abre a página da Chrome Web Store da extensão correspondente.
  3. Instale ou ative a extensão no Chrome e reinicie o navegador se a instalação pedir.
  4. Adicione o SDK da sua linguagem, ou conecte o servidor MCP com npx add-mcp "obu mcp", e comece a emitir ações de abas e navegação.

Informações do produto

Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de Open Browser Use.

Plano gratuitoSim
Planos pagos$0
PlataformaChrome extension, CLI (macOS, Linux, Windows), JavaScript / Python / Go SDKs, MCP server
DesenvolvedoriFurySt
CategoriaProgramação
Data de lançamentoApr 2026
Última atualizaçãoSep 2026
Visitas ao site649.3M
Ranking global do site50
Disponibilidade da APISim

Ideal para

Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.

Usuários

  • Desenvolvedores que criam agentes de IA e precisam tocar páginas web reais, desde que se sintam à vontade para instalar uma CLI e uma extensão do Chrome.
  • Equipes que padronizam uma camada de browser use de código aberto e querem evitar amarrar os agentes ao runtime de um único fornecedor.

Tarefas

  • Deixar um agente listar as abas abertas, reivindicar uma e levá-la a uma URL quando você pedir.
  • Disparar ações conscientes do DOM pelo Chrome DevTools Protocol, como ler a estrutura da página ou executar planos de ação passo a passo.
  • Conectar o controle do navegador a um agente de programação existente por meio do servidor MCP stdio.

Cenários

  • Uma sessão do Codex ou do Claude Code que precisa checar um site ao vivo e resumir o que encontra.
  • Automatizar tarefas web repetitivas, como extrair um resumo diário de uma página de notícias.
  • Prototipar fluxos web de várias etapas antes de entregá-los a um pipeline de agentes maior.

Principais recursos

Neutro por design entre runtimes

O ponto central é que o Open Browser Use não prende você a um único framework de agentes. A mesma camada funciona tanto se o seu agente roda no Codex, no Claude Code ou numa configuração própria, porque o lado do navegador é desacoplado do lado do agente. Esse desacoplamento é o argumento de venda. Se você trocar de runtime depois, sua automação de navegador não precisa ser reescrita. Troque o motor e mantenha as rodas.

Chrome real, não um clone sem interface

Ele automatiza uma janela real do Chrome por meio de uma extensão de navegador, então o controle do Chrome por agentes de IA funciona contra páginas que se comportam como fazem para um usuário normal, cookies e logins incluídos. Sites que bloqueiam ou quebram em navegadores sem interface dão aqui muito menos dor de cabeça. A contrapartida é que o Chrome precisa estar aberto e a extensão precisa estar instalada.

SDKs em três linguagens

Você tem bibliotecas cliente de verdade em vez de um wrapper fino. Existe o open-browser-use-sdk tanto no npm quanto no PyPI, além de um pacote de Go. O código Python o importa como open_browser_use; o Go o importa como obu. Isso cobre boa parte das linguagens de backend e scripting com que agentes são construídos. Escolha sua linguagem e siga.

Servidor MCP para ferramentas de agente

Instalar o servidor MCP é uma linha só: npx add-mcp "obu mcp". Ele expõe ferramentas de navegador para listar, abrir e reivindicar abas, navegar, acessar o CDP, executar planos de ação e limpar. Se o seu agente já fala MCP, o navegador vira mais um conjunto de ferramentas que ele pode chamar. Não precisa de nada exótico.

Controle com a CLI em primeiro lugar

Tudo é acessível por uma CLI de automação de navegador, o comando open-browser-use. A configuração, o registro do host e as ações do dia a dia rodam pelo terminal, então uma CLI de automação de navegador facilita programar ou depurar sem antes escrever uma linha de código de SDK. A CLI e a extensão são as duas peças móveis que fazem o resto funcionar.

Ações conscientes do DOM e CDP

As ações são conscientes do DOM e alimentadas pelo Chrome DevTools Protocol, então um agente raciocina sobre a estrutura da página em vez de clicar às cegas em coordenadas. Isso importa para formulários, listas e qualquer coisa em que a identidade dos elementos muda entre carregamentos. É um passo além das abordagens de capturar tela e adivinhar. Funciona sempre? Não. Mas é melhor do que adivinhar para onde o botão se moveu.

Prós e contras

Prós

  • Gratuito e com licença MIT, com todo o código-fonte no GitHub. Sem pegadinha.
  • Funciona entre runtimes de agente, então você não fica preso a um único fornecedor.
  • SDKs para JavaScript, Python e Go, além de uma CLI e um servidor MCP.
  • Conduz o Chrome real, o que contorna muitos problemas de bloqueio de navegadores sem interface.
  • Pode ser instalado como skill direto no Codex ou no Claude Code.

Contras

  • A instalação não é trivial: você precisa do Node, do Chrome, de um registro de host nativo e da extensão antes de rodar. Não é o ideal.
  • Só funciona com o Chrome, então usuários de Firefox e Safari ficam de fora.
  • Por ser um projeto jovem, espere arestas ocasionais e correções manuais quando o anúncio na Chrome Web Store estiver indisponível.

Perguntas frequentes

Sim. É de código aberto sob a licença MIT, então não há plano pago nem preço algum. Você pode ler e modificar o código no GitHub.

Conteúdo relacionado

Explore ferramentas, skills e artigos relacionados a Open Browser Use.

Alternativas a Open Browser Use

Forefront

Forefront

Forefront · Programação

O Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.

Grátis / $0 - $99/moVer detalhes
Startkit

Startkit

StartKit.AI · Programação

Startkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.

Pago / $99 - $499 one-timeVer detalhes
Testim

Testim

Tricentis · Programação

O Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.

Grátis / Custom pricing on requestVer detalhes