Open Browser Use

Open Browser Use

iFurySt · Programación

Open Browser Use es una capa de automatización de navegador gratuita y de código abierto que permite a los agentes de IA manejar Chrome real en lugar de un clon sin interfaz. Combina una extensión de Chrome con una CLI, además de SDK para JavaScript, Python y Go, así que puedes programar pestañas, navegación y acciones a nivel de DOM desde el runtime de agente que ya uses. Está pensado para desarrolladores que quieren que sus asistentes de verdad hagan clic, lean y rellenen cosas en páginas en vivo.

Vista previa de la interfaz de Open Browser Use

Acerca de Open Browser Use

Qué es Open Browser Use

Open Browser Use es automatización del navegador para agentes de IA que se mantiene neutral entre distintos runtimes. Ese trabalenguas significa algo simple. No le importa qué herramienta de agente uses, desde Codex hasta Claude Code o tu propio stack. Apuntas a una ventana de Chrome real y tu agente obtiene control de pestañas, navegación y acciones de página.

Se presenta como una alternativa de código abierto a la capacidad Chrome Browser Use que venía dentro de Codex.app. Por debajo, una extensión de navegador habla con la CLI open-browser-use a través de un host de mensajería nativo que queda registrado en tu máquina. Desde ahí, puedes integrarte mediante el SDK de JavaScript, el SDK de Python, el SDK de Go o la CLI directamente.

La mayor limitación es la instalación. Necesitas Chrome y Node instalados, y registras un host nativo antes de que funcione cualquier cosa. Si prefieres no ejecutar Chrome real, esta no es tu herramienta. Esa es toda la barrera. Sin Chrome, no hay trato.

Cómo empezar

  1. Instala la CLI con npm i -g open-browser-use (o mediante Homebrew en macOS y Linux).
  2. Ejecuta open-browser-use setup para registrar el host nativo. Esto también abre la página de Chrome Web Store de la extensión correspondiente.
  3. Instala o activa la extensión en Chrome y luego reinicia el navegador si la instalación te lo pide.
  4. Añade el SDK de tu lenguaje, o conecta el servidor MCP con npx add-mcp "obu mcp", y empieza a lanzar acciones de pestañas y navegación.

Información del producto

Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de Open Browser Use.

Plan gratuitoSí
Planes de pago$0
PlataformaChrome extension, CLI (macOS, Linux, Windows), JavaScript / Python / Go SDKs, MCP server
DesarrolladoriFurySt
CategoríaProgramación
Fecha de lanzamientoApr 2026
Última actualizaciónSep 2026
Visitas al sitio web649.3M
Ranking global del sitio50
Disponibilidad de la APISí

Ideal para

Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.

Usuarios

  • Desarrolladores que crean agentes de IA y necesitan tocar páginas web reales, siempre que les resulte cómodo instalar una CLI y una extensión de Chrome.
  • Equipos que se estandarizan en una capa de browser use de código abierto y quieren evitar atar los agentes al runtime de un solo proveedor.

Tareas

  • Dejar que un agente liste las pestañas abiertas, reclame una y la lleve a una URL cuando se lo pidas.
  • Lanzar acciones conscientes del DOM mediante el Chrome DevTools Protocol, como leer la estructura de la página o ejecutar planes de acción paso a paso.
  • Conectar el control del navegador a un agente de programación existente a través del servidor MCP stdio.

Casos de uso

  • Una sesión de Codex o Claude Code que necesita revisar un sitio en vivo y resumir lo que encuentra.
  • Automatizar tareas web repetitivas, como sacar un resumen diario de una página de noticias.
  • Prototipar flujos web de varios pasos antes de entregarlos a una pipeline de agentes más grande.

Funciones clave

Neutral por diseño entre runtimes

El punto central es que Open Browser Use no te encierra en un único framework de agentes. La misma capa funciona tanto si tu agente corre en Codex, en Claude Code o en una configuración propia, porque el lado del navegador está desacoplado del lado del agente. Ese desacople es el argumento de venta. Si más adelante cambias de runtime, tu automatización del navegador no necesita reescribirse. Cambia el motor y conserva las ruedas.

Chrome real, no un clon sin interfaz

Automatiza una ventana real de Chrome mediante una extensión de navegador, así que el control de Chrome por agentes de IA funciona contra páginas que se comportan como lo hacen para un usuario normal, cookies e inicios de sesión incluidos. Los sitios que bloquean o fallan bajo navegadores sin interfaz dan aquí muchos menos dolores de cabeza. La contrapartida es que Chrome tiene que estar abierto y la extensión tiene que estar instalada.

SDK en tres lenguajes

Tienes bibliotecas cliente reales en lugar de un envoltorio fino. Existe open-browser-use-sdk tanto en npm como en PyPI, y un paquete de Go. El código Python lo importa como open_browser_use; Go lo importa como obu. Eso cubre buena parte de los lenguajes de backend y scripting con los que se construyen agentes. Elige tu lenguaje y listo.

Servidor MCP para herramientas de agente

Instalar el servidor MCP es una sola línea: npx add-mcp "obu mcp". Expone herramientas de navegador para listar, abrir y reclamar pestañas, navegar, acceder al CDP, ejecutar planes de acción y limpiar. Si tu agente ya habla MCP, el navegador se convierte en un conjunto de herramientas más que puede llamar. No hace falta nada exótico.

Control con la CLI por delante

Todo es accesible mediante una CLI de automatización del navegador, el comando open-browser-use. La configuración, el registro del host y las acciones del día a día se ejecutan desde la terminal, así que una CLI de automatización del navegador facilita programar o depurar sin escribir primero ni una línea de código de SDK. La CLI y la extensión son las dos piezas móviles que hacen funcionar el resto.

Acciones conscientes del DOM y CDP

Las acciones son conscientes del DOM y funcionan con el Chrome DevTools Protocol, así que un agente puede razonar sobre la estructura de la página en lugar de hacer clic a ciegas sobre coordenadas. Eso importa para formularios, listas y cualquier cosa donde la identidad de los elementos cambia entre cargas. Es un paso más allá de los enfoques de captura y adivinar. ¿Funciona siempre? No. Pero es mejor que adivinar dónde se movió el botón.

Ventajas y desventajas

Ventajas

  • Gratis y con licencia MIT, con todo el código fuente en GitHub. Sin trucos.
  • Funciona entre runtimes de agente, así que no te encierra en un solo proveedor.
  • SDK para JavaScript, Python y Go, además de una CLI y un servidor MCP.
  • Maneja Chrome real, lo que esquiva muchos problemas de bloqueo de los navegadores sin interfaz.
  • Instalable como skill directamente en Codex o Claude Code.

Desventajas

  • La instalación no es trivial: necesitas Node, Chrome, un registro de host nativo y la extensión antes de que arranque. No es lo ideal.
  • Solo funciona con Chrome, así que los usuarios de Firefox y Safari se quedan fuera.
  • Al ser un proyecto joven, cabe esperar asperezas ocasionales y arreglos manuales cuando el listado en Chrome Web Store no está disponible.

Preguntas frecuentes

Sí. Es de código abierto bajo la licencia MIT, así que no hay nivel de pago ni precio alguno. Puedes leer y modificar el código en GitHub.

Contenido relacionado

Explora herramientas, habilidades y artículos relacionados con Open Browser Use.

Alternativas a Open Browser Use

Forefront

Forefront

Forefront · Programación

Forefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.

Gratis / $0 - $99/moVer detalles
Startkit

Startkit

StartKit.AI · Programación

Startkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.

De pago / $99 - $499 one-timeVer detalles
Testim

Testim

Tricentis · Programación

Testim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.

Gratis / Custom pricing on requestVer detalles