Open Browser Use

Open Browser Use

iFurySt · Programmation

Open Browser Use est une couche d'automatisation de navigateur gratuite et open source qui permet aux agents d'IA de piloter un vrai Chrome plutôt qu'un clone sans interface. Elle associe une extension Chrome à une CLI, plus des SDK en JavaScript, Python et Go, pour scripter les onglets, la navigation et les actions au niveau du DOM depuis le runtime d'agent que vous utilisez déjà. Elle vise les développeurs qui veulent que leurs assistants cliquent, lisent et remplissent réellement des éléments sur des pages en direct.

Aperçu de l'interface de Open Browser Use

À propos de Open Browser Use

Qu'est-ce qu'Open Browser Use

Open Browser Use est une automatisation du navigateur pour les agents d'IA qui reste neutre entre les runtimes. Ce nom à rallonge veut dire quelque chose de simple. Peu importe l'outil d'agent que vous utilisez, de Codex à Claude Code jusqu'à votre propre stack. Vous le pointez vers une vraie fenêtre Chrome et votre agent obtient le contrôle des onglets, la navigation et les actions de page.

Il se présente comme une alternative open source à la capacité Chrome Browser Use livrée dans Codex.app. Sous le capot, une extension de navigateur dialogue avec la CLI open-browser-use via un hôte de messagerie natif qui reste enregistré sur votre machine. À partir de là, vous intégrez avec le SDK JavaScript, le SDK Python, le SDK Go ou directement la CLI.

La plus grande limite, c'est l'installation. Il faut Chrome et Node installés, et vous enregistrez un hôte natif avant que quoi que ce soit fonctionne. Si vous préférez ne pas exécuter un vrai Chrome, cet outil n'est pas pour vous. Voilà toute la barrière. Pas de Chrome, pas d'affaire.

Pour commencer

  1. Installez la CLI avec npm i -g open-browser-use (ou via Homebrew sur macOS et Linux).
  2. Lancez open-browser-use setup pour enregistrer l'hôte natif. Cela ouvre aussi la page Chrome Web Store de l'extension correspondante.
  3. Installez ou activez l'extension dans Chrome, puis redémarrez le navigateur si l'installation vous le demande.
  4. Ajoutez le SDK de votre langage, ou branchez le serveur MCP avec npx add-mcp "obu mcp", puis commencez à émettre des actions d'onglets et de navigation.

Informations sur le produit

Aperçu des tarifs, des plateformes compatibles et des performances de Open Browser Use.

Offre gratuiteOui
Offres payantes$0
PlateformeChrome extension, CLI (macOS, Linux, Windows), JavaScript / Python / Go SDKs, MCP server
DéveloppeuriFurySt
CatégorieProgrammation
Date de lancementApr 2026
Dernière mise à jourSep 2026
Visites du site649.3M
Classement mondial du site50
Disponibilité de l’APIOui

Idéal pour

Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.

Utilisateurs

  • Développeurs qui construisent des agents d'IA devant toucher de vraies pages web, à condition d'être à l'aise pour installer une CLI et une extension Chrome.
  • Équipes qui standardisent une couche de browser use open source et veulent éviter de lier leurs agents au runtime d'un seul fournisseur.

Tâches

  • Laisser un agent lister les onglets ouverts, en réclamer un et le diriger vers une URL sur demande.
  • Lancer des actions conscientes du DOM via le Chrome DevTools Protocol, comme lire la structure de la page ou exécuter des plans d'action étape par étape.
  • Brancher le contrôle du navigateur sur un agent de codage existant via le serveur MCP stdio.

Cas d'usage

  • Une session Codex ou Claude Code qui doit consulter un site en direct et résumer ce qu'elle y trouve.
  • Automatiser des corvées web répétitives, comme extraire une synthèse quotidienne d'une page d'actualités.
  • Prototyper des workflows web en plusieurs étapes avant de les confier à un pipeline d'agents plus large.

Fonctionnalités clés

Neutre par conception entre runtimes

Tout l'intérêt, c'est qu'Open Browser Use ne vous enferme pas dans un seul framework d'agents. La même couche fonctionne que votre agent tourne dans Codex, Claude Code ou une configuration maison, parce que le côté navigateur est découplé du côté agent. Ce découplage est l'argument de vente. Si vous changez de runtime plus tard, votre automatisation du navigateur n'a pas besoin d'être réécrite. Changez le moteur, gardez les roues.

Un vrai Chrome, pas un clone sans interface

Il automatise une véritable fenêtre Chrome via une extension de navigateur, donc le contrôle de Chrome par les agents d'IA s'applique à des pages qui se comportent comme pour un utilisateur normal, cookies et connexions compris. Les sites qui bloquent ou cassent sous les navigateurs sans interface posent ici bien moins de soucis. La contrepartie : Chrome doit tourner et l'extension doit être installée.

Des SDK dans trois langages

Vous disposez de vraies bibliothèques clientes plutôt que d'une fine surcouche. Il y a open-browser-use-sdk à la fois sur npm et PyPI, plus un paquet Go. Le code Python l'importe sous open_browser_use ; Go l'importe sous obu. Cela couvre la plupart des langages de backend et de scripting avec lesquels on construit des agents. Choisissez votre langage et avancez.

Un serveur MCP pour les outils d'agent

Installer le serveur MCP tient en une ligne : npx add-mcp "obu mcp". Il expose des outils de navigateur pour lister, ouvrir et réclamer des onglets, naviguer, accéder au CDP, exécuter des plans d'action et nettoyer. Si votre agent parle déjà MCP, le navigateur devient simplement un jeu d'outils de plus qu'il peut appeler. Rien d'exotique n'est requis.

Le contrôle par la CLI d'abord

Tout est accessible via une CLI d'automatisation du navigateur, la commande open-browser-use. L'installation, l'enregistrement de l'hôte et les actions du quotidien passent par le terminal, donc une CLI d'automatisation du navigateur facilite le scripting ou le débogage sans écrire d'abord une ligne de code SDK. La CLI et l'extension sont les deux pièces mobiles qui font marcher le reste.

Actions conscientes du DOM et CDP

Les actions sont conscientes du DOM et propulsées par le Chrome DevTools Protocol, donc un agent raisonne sur la structure de la page au lieu de cliquer aveuglément sur des coordonnées. Cela compte pour les formulaires, les listes et tout ce dont l'identité des éléments change d'un chargement à l'autre. C'est un cran au-dessus des approches par capture d'écran et devinette. Est-ce toujours efficace ? Non. Mais c'est mieux que deviner où le bouton s'est déplacé.

Avantages et inconvénients

Avantages

  • Gratuit et sous licence MIT, avec tout le code source sur GitHub. Sans piège.
  • Fonctionne entre les runtimes d'agents, donc vous n'êtes pas enfermé chez un seul fournisseur.
  • Des SDK pour JavaScript, Python et Go, plus une CLI et un serveur MCP.
  • Pilote un vrai Chrome, ce qui contourne bien des blocages des navigateurs sans interface.
  • Installable comme skill directement dans Codex ou Claude Code.

Inconvénients

  • L'installation n'est pas triviale : il faut Node, Chrome, un enregistrement d'hôte natif et l'extension avant que ça tourne. Pas l'idéal.
  • Il ne fonctionne qu'avec Chrome, donc les utilisateurs de Firefox et Safari restent sur le carreau.
  • Comme le projet est jeune, attendez-vous à quelques aspérités et correctifs manuels quand la fiche Chrome Web Store est indisponible.

Questions fréquentes

Oui. Il est open source sous licence MIT, donc il n'y a ni palier payant ni tarif. Vous pouvez lire et modifier le code sur GitHub.

Contenus associés

Découvrez des outils, des compétences et des articles liés à Open Browser Use.

Alternatives à Open Browser Use

Forefront

Forefront

Forefront · Programmation

Forefront est une plateforme web pour construire avec de l'IA open source. Elle vous laisse affiner les principaux modèles de langage open source sur vos propres données, évaluer leurs performances et les exécuter via une API ou les exporter pour les héberger vous-même. Les développeurs qui veulent le confort d'une plateforme fermée mais tiennent à rester propriétaires de leurs modèles et de leurs données sont le public visé ici.

Gratuit / $0 - $99/moVoir les détails
Startkit

Startkit

StartKit.AI · Programmation

Startkit est un boilerplate pour créer des produits SaaS d'IA et des wrappers d'IA. Voyez-le comme un boilerplate de startup IA avec les parties ennuyeuses déjà branchées : authentification, paiements Stripe et Lemon Squeezy, limites d'usage, e-mail transactionnel et un kit de démarrage d'API IA qui parle à OpenAI, Anthropic, Groq ou Llama. Vous clonez le dépôt, fixez votre prix et attaquez la partie du produit pour laquelle les gens paient vraiment. Il repose sur Next.js au-dessus de React et Tailwind, donc une bonne partie du code boilerplate vous semble déjà familière.

Payant / $99 - $499 one-timeVoir les détails
Testim

Testim

Tricentis · Programmation

Testim est une plateforme d'automatisation des tests dopée à l'IA, qui sert à créer et exécuter des tests de bout en bout sur des applications web, mobiles et Salesforce. Elle s'appuie sur l'apprentissage automatique pour garder les tests stables quand une interface change, alors les équipes passent moins de temps à réparer des sélecteurs cassés. Pas mal pour un outil de tests automatisés que vous pouvez utiliser dès aujourd'hui. Vous créez des tests en enregistrant des actions dans un navigateur, puis vous ajoutez du JavaScript quand vous avez besoin de plus de contrôle. C'est un choix solide pour une équipe QA bien occupée.

Gratuit / Custom pricing on requestVoir les détails