
Open Browser Use
iFurySt · コーディング
Open Browser Useは、AIエージェントがヘッドレスの複製ではなく本物のChromeを動かせるようにする、無料でオープンソースのブラウザ自動化レイヤーだ。Chrome拡張機能とCLIを組み合わせ、さらにJavaScript、Python、GoのSDKを備える。すでに使っているエージェントランタイムから、タブ、ナビゲーション、DOMレベルの操作をスクリプト化できる。実際のページでアシスタントにクリック、読み取り、入力までさせたい開発者向けのツールだ。

Open Browser Use について
Open Browser Useとは
Open Browser Useは、ランタイムをまたいで中立を保つ、AIエージェント向けのブラウザ自動化だ。この回りくどい言い方は、実は単純なことを意味する。CodexでもClaude Codeでも自前のスタックでも、どのエージェントツールを使うかは問わない。本物のChromeウィンドウを指定すれば、エージェントはタブ制御、ナビゲーション、ページ操作を手に入れる。
Codex.appに同梱されていたChrome Browser Use機能に対する、オープンソースの代替として打ち出されている。内部では、ブラウザ拡張機能がネイティブメッセージングホストを通じてopen-browser-use CLIと通信し、そのホストはマシン上に登録されたままになる。そこからJavaScript SDK、Python SDK、Go SDK、あるいはCLIを直接使って統合する。
最大の制約はセットアップだ。ChromeとNodeがインストールされている必要があり、何かが動く前にネイティブホストを登録する。本物のChromeを動かしたくないなら、これは向いていない。それが唯一の関門だ。Chromeがなければ話にならない。
はじめ方
npm i -g open-browser-useでCLIをインストールする(macOSとLinuxではHomebrewでも可)。open-browser-use setupを実行してネイティブホストを登録する。対応する拡張機能のChrome Web Storeページも開く。- Chromeで拡張機能をインストールまたは有効化し、セットアップに促されたらブラウザを再起動する。
- 自分の言語のSDKを追加するか、
npx add-mcp "obu mcp"でMCPサーバーを接続し、タブとナビゲーションの操作を出し始める。
AIツール情報
Open Browser Useの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- 実際のWebページに触れる必要のあるAIエージェントを作る開発者。ただしCLIとChrome拡張機能のインストールを苦にしないことが条件だ。
- オープンソースのbrowser useレイヤーに標準化し、エージェントを単一ベンダーのランタイムに縛りたくないチーム。
タスク
- エージェントに開いているタブを一覧させ、1つを確保し、指示どおりにURLへ移動させる。
- Chrome DevTools Protocolを通じてDOMを認識した操作を駆動する。ページ構造の読み取りや、段階的なアクションプランの実行などだ。
- MCP stdioサーバーを通じて、ブラウザ制御を既存のコーディングエージェントに接続する。
シーン
- ライブサイトを確認し、見つけた内容を要約する必要があるCodexやClaude Codeのセッション。
- ニュースページから日次ダイジェストを取るような、繰り返しのWeb作業の自動化。
- より大きなエージェントパイプラインに渡す前に、複数段階のWebワークフローを試作する。
主な機能
設計からランタイム中立
要点は、Open Browser Useが単一のエージェントフレームワークに縛らないことだ。エージェントがCodex、Claude Code、独自構成のどこで動いていても同じレイヤーが機能する。ブラウザ側がエージェント側から切り離されているからだ。この分離が売りだ。後でランタイムを乗り換えても、ブラウザ自動化を書き直す必要はない。エンジンを替えて、車輪はそのまま残す。
ヘッドレスの複製ではなく本物のChrome
ブラウザ拡張機能を通じて実際のChromeウィンドウを自動化するので、AIエージェントによるChrome操作は、通常のユーザーと同じ挙動をするページに対して働く。Cookieもログインも含まれる。ヘッドレスブラウザでブロックされたり壊れたりするサイトでも、ここでは悩みがずっと少ない。代わりにChromeが起動していて、拡張機能が入っている必要がある。
3言語のSDK
薄いラッパーではなく、本物のクライアントライブラリが揃う。npmとPyPIの両方に open-browser-use-sdk があり、Goパッケージもある。Pythonコードは open_browser_use として、Goは obu として読み込む。エージェントを組むバックエンドやスクリプト言語の大半をカバーする。言語を選んで進めればいい。
エージェントツール向けMCPサーバー
MCPサーバーのインストールは一行だ。npx add-mcp "obu mcp"。タブの一覧、開封、確保、ナビゲーション、CDPアクセス、アクションプラン、クリーンアップのためのブラウザツールを公開する。エージェントがすでにMCPを話すなら、ブラウザは呼び出せるもう一つのツールセットになる。特別なものは何も要らない。
CLI優先の制御
すべてはブラウザ自動化CLI、つまり open-browser-use コマンドから到達できる。セットアップ、ホスト登録、日々の操作はターミナルで実行する。だからブラウザ自動化CLIがあれば、先にSDKコードを一行も書かずにスクリプト化やデバッグが楽になる。CLIと拡張機能が、残りを動かす2つの可動部品だ。
DOMを認識した操作とCDP
操作はDOMを認識し、Chrome DevTools Protocolで動く。だからエージェントは座標をやみくもにクリックするのではなく、ページ構造を推論できる。フォーム、リスト、そして読み込みごとに要素の同一性が変わるものすべてで効いてくる。スクリーンショットして推測するやり方より一歩先だ。常にうまくいくか? いや。だが、ボタンがどこへ動いたかを推測するよりはましだ。
メリットとデメリット
メリット
- 無料でMITライセンス、ソースコードはGitHubにすべて公開。裏はない。
- エージェントランタイムをまたいで動くので、単一ベンダーに縛られない。
- JavaScript、Python、GoのSDKに加え、CLIとMCPサーバーを備える。
- 本物のChromeを動かすため、ヘッドレスブラウザのブロック問題を多く回避できる。
- CodexやClaude Codeにスキルとして直接インストールできる。
デメリット
- セットアップが簡単ではない。動かす前にNode、Chrome、ネイティブホストの登録、拡張機能が必要だ。理想的とは言えない。
- Chrome専用なので、FirefoxやSafariのユーザーは使えない。
- 若いプロジェクトなので、Chrome Web Storeの掲載が利用できないときは、粗さや手作業の修正が時々あると覚悟しておくといい。
よくある質問
はい。MITライセンスのオープンソースなので、有料プランも価格も一切ない。GitHubでソースを読み、改変できる。
関連コンテンツ
Open Browser Useに関連するツール、スキル、記事を探す。
Open Browser Useの代替ツール
Forefront
Forefront · コーディングForefrontはオープンソースAIで構築するためのウェブプラットフォームだ。主要なオープンソース言語モデルを自分のデータで微調整し、性能を評価し、API経由で実行したり、エクスポートして自分でホストしたりできる。クローズドなプラットフォームの手軽さを求めつつ、モデルとデータの所有権にはこだわる開発者が対象だ。
Startkit
StartKit.AI · コーディングStartkitは、AI SaaSとAIラッパー製品を作るためのボイラープレートだ。面倒な部分をあらかじめ配線済みにしたAIスタートアップボイラープレートと考えればいい。認証、StripeとLemon Squeezyの決済、利用制限、トランザクションメール、そしてOpenAI、Anthropic、Groq、Llamaと通信するAI APIスターターキットが含まれる。リポジトリをクローンして価格を設定し、ユーザーが実際にお金を払う部分に取りかかれる。ReactとTailwind上のNext.jsで作られているため、ボイラープレートコードの多くはすでに見慣れたものだ。
Testim
Tricentis · コーディングTestimは、Web・モバイル・Salesforceアプリ向けにエンドツーエンドテストを構築して実行するAIテスト自動化プラットフォームだ。機械学習を頼りに、インターフェースが変わってもテストを安定させ、チームが壊れたセレクターの修正に費やす時間を減らす。今日から使い始められる自動テストツールとしては悪くない。ブラウザで操作を録画してテストを作り、より細かい制御が必要なときはJavaScriptを足す。忙しいQAチームにとって堅実な選択肢である。
