Open Browser Use

Open Browser Use

iFurySt · Coding

Open Browser Use ist eine kostenlose, quelloffene Browser-Automatisierungsschicht, mit der KI-Agenten echtes Chrome statt eines kopflosen Klons steuern. Sie verbindet eine Chrome-Erweiterung mit einer CLI, dazu SDKs für JavaScript, Python und Go, sodass Sie Tabs, Navigation und Aktionen auf DOM-Ebene aus der Agent-Runtime skripten, die Sie ohnehin nutzen. Sie richtet sich an Entwickler, deren Assistenten auf Live-Seiten wirklich klicken, lesen und ausfüllen sollen.

Vorschau der Oberfläche von Open Browser Use

Über Open Browser Use

Was ist Open Browser Use

Open Browser Use ist Browser-Automatisierung für KI-Agenten, die zwischen den Runtimes neutral bleibt. Dieser Zungenbrecher bedeutet etwas Einfaches. Es ist egal, welches Agent-Werkzeug Sie fahren, von Codex über Claude Code bis zum eigenen Stack. Sie zeigen auf ein echtes Chrome-Fenster, und Ihr Agent bekommt Tab-Steuerung, Navigation und Seitenaktionen.

Es wird als quelloffene Alternative zur Chrome-Browser-Use-Funktion positioniert, die in Codex.app steckte. Unter der Haube spricht eine Browser-Erweiterung über einen nativen Messaging-Host mit der open-browser-use-CLI, der auf Ihrem Rechner registriert bleibt. Von dort integrieren Sie über das JavaScript-SDK, das Python-SDK, das Go-SDK oder direkt die CLI.

Die größte Einschränkung ist das Setup. Sie brauchen installiertes Chrome und Node, und Sie registrieren einen nativen Host, bevor irgendetwas läuft. Wenn Sie lieber kein echtes Chrome betreiben, ist das nicht Ihr Werkzeug. Das ist die ganze Hürde. Kein Chrome, kein Deal.

Erste Schritte

  1. Installieren Sie die CLI mit npm i -g open-browser-use (oder über Homebrew unter macOS und Linux).
  2. Führen Sie open-browser-use setup aus, um den nativen Host zu registrieren. Das öffnet auch die Chrome-Web-Store-Seite der passenden Erweiterung.
  3. Installieren oder aktivieren Sie die Erweiterung in Chrome, und starten Sie den Browser neu, wenn das Setup es verlangt.
  4. Fügen Sie das SDK für Ihre Sprache hinzu oder binden Sie den MCP-Server mit npx add-mcp "obu mcp" ein, und beginnen Sie, Tab- und Navigationsaktionen auszugeben.

Produktinformationen

Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von Open Browser Use.

Kostenloser TarifJa
Bezahlte Tarife$0
PlattformChrome extension, CLI (macOS, Linux, Windows), JavaScript / Python / Go SDKs, MCP server
EntwickleriFurySt
KategorieCoding
VeröffentlichungsdatumApr 2026
Zuletzt aktualisiertSep 2026
Website-Besuche649.3M
Globales Website-Ranking50
API-VerfügbarkeitJa

Am besten für

Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.

Nutzer

  • Entwickler, die KI-Agenten bauen, die echte Webseiten berühren müssen, sofern sie mit der Installation einer CLI und einer Chrome-Erweiterung zurechtkommen.
  • Teams, die sich auf eine quelloffene Browser-Use-Schicht standardisieren und vermeiden wollen, ihre Agenten an die Runtime eines Anbieters zu binden.

Aufgaben

  • Einen Agenten offene Tabs auflisten, einen beanspruchen und ihn auf Befehl zu einer URL navigieren lassen.
  • DOM-bewusste Aktionen über das Chrome DevTools Protocol auslösen, etwa die Seitenstruktur lesen oder Schritt-für-Schritt-Aktionspläne ausführen.
  • Die Browser-Steuerung über den MCP-stdio-Server an einen bestehenden Coding-Agenten anbinden.

Szenarien

  • Eine Codex- oder Claude-Code-Sitzung, die eine Live-Seite prüfen und zusammenfassen muss, was sie findet.
  • Wiederkehrende Web-Arbeiten automatisieren, etwa eine tägliche Zusammenfassung von einer Nachrichtenseite ziehen.
  • Mehrstufige Web-Workflows prototypen, bevor sie an eine größere Agent-Pipeline gehen.

Wichtigste Funktionen

Von Grund auf runtime-neutral

Der ganze Punkt ist, dass Open Browser Use Sie nicht in ein Agent-Framework einsperrt. Dieselbe Schicht arbeitet, ob Ihr Agent in Codex, Claude Code oder einer eigenen Konfiguration läuft, weil die Browserseite von der Agentenseite entkoppelt ist. Diese Entkopplung ist das Verkaufsargument. Wenn Sie später die Runtime wechseln, muss Ihre Browser-Automatisierung nicht neu geschrieben werden. Tauschen Sie den Motor, behalten Sie die Räder.

Echtes Chrome, kein kopfloser Klon

Es automatisiert ein tatsächliches Chrome-Fenster über eine Browser-Erweiterung, sodass die Chrome-Steuerung durch KI-Agenten gegen Seiten arbeitet, die sich wie für einen normalen Nutzer verhalten, inklusive Cookies und Logins. Seiten, die unter kopflosen Browsern blockieren oder brechen, machen hier weit weniger Ärger. Der Kompromiss: Chrome muss laufen und die Erweiterung muss installiert sein.

SDKs in drei Sprachen

Sie bekommen echte Client-Bibliotheken statt eines dünnen Wrappers. Es gibt open-browser-use-sdk sowohl auf npm als auch auf PyPI, dazu ein Go-Paket. Python-Code importiert es als open_browser_use, Go als obu. Das deckt einen Großteil der Backend- und Skriptsprachen ab, in denen Agenten gebaut werden. Sprache wählen und loslegen.

MCP-Server für Agent-Werkzeuge

Der MCP-Server ist mit einer Zeile installiert: npx add-mcp "obu mcp". Er stellt Browser-Werkzeuge bereit zum Auflisten, Öffnen und Beanspruchen von Tabs, für Navigation, CDP-Zugriff, Aktionspläne und Aufräumen. Wenn Ihr Agent bereits MCP spricht, wird der Browser einfach ein weiteres Werkzeugset, das er aufrufen kann. Nichts Exotisches nötig.

Steuerung zuerst über die CLI

Alles ist über eine CLI für Browser-Automatisierung erreichbar, den Befehl open-browser-use. Setup, Host-Registrierung und Alltagsaktionen laufen im Terminal, sodass eine CLI für Browser-Automatisierung das Skripten oder Debuggen erleichtert, ohne zuerst eine Zeile SDK-Code zu schreiben. Die CLI und die Erweiterung sind die zwei beweglichen Teile, die den Rest zum Laufen bringen.

DOM-bewusste Aktionen und CDP

Die Aktionen sind DOM-bewusst und nutzen das Chrome DevTools Protocol, sodass ein Agent über die Seitenstruktur schlussfolgern kann, statt blind Koordinaten anzuklicken. Das zählt bei Formularen, Listen und allem, wo sich die Identität von Elementen zwischen Ladevorgängen ändert. Es ist ein Schritt über Screenshot-und-Raten-Ansätze hinaus. Klappt das immer? Nein. Aber es ist besser, als zu raten, wohin der Button gewandert ist.

Vor- und Nachteile

Vorteile

  • Kostenlos und MIT-lizenziert, mit vollständigem Quellcode auf GitHub. Kein Haken.
  • Läuft über Agent-Runtimes hinweg, sodass Sie nicht an einen Anbieter gebunden sind.
  • SDKs für JavaScript, Python und Go, dazu eine CLI und ein MCP-Server.
  • Steuert echtes Chrome, was viele Blockaden kopfloser Browser umgeht.
  • Direkt als Skill in Codex oder Claude Code installierbar.

Nachteile

  • Das Setup ist nicht trivial: Sie brauchen Node, Chrome, eine Registrierung des nativen Hosts und die Erweiterung, bevor es läuft. Nicht ideal.
  • Es funktioniert nur mit Chrome, Nutzer von Firefox und Safari bleiben außen vor.
  • Da das Projekt jung ist, sind gelegentliche Ecken und Kanten sowie manuelle Fixes zu erwarten, wenn der Chrome-Web-Store-Eintrag nicht verfügbar ist.

Häufige Fragen

Ja. Es ist quelloffen unter der MIT-Lizenz, es gibt also keine Bezahlstufe und keinen Preis. Sie können den Code auf GitHub lesen und ändern.

Ähnliche Inhalte

Entdecke passende Tools, Skills und Artikel zu Open Browser Use.

Alternativen zu Open Browser Use

Forefront

Forefront

Forefront · Coding

Forefront ist eine Webplattform zum Bauen mit Open-Source-KI. Sie lassen sich führende Open-Source-Sprachmodelle mit eigenen Daten feintunen, ihre Leistung bewerten und sie über eine API ausführen oder exportieren, um sie selbst zu hosten. Entwickler, die den Komfort einer geschlossenen Plattform wollen, aber darauf bestehen, ihre Modelle und Daten zu besitzen, sind hier die Zielgruppe.

Kostenlos / $0 - $99/moDetails ansehen
Startkit

Startkit

StartKit.AI · Coding

Startkit ist ein Boilerplate zum Bauen von KI-SaaS-Produkten und KI-Wrappern. Man kann es sich als KI-Startup-Boilerplate vorstellen, bei dem die langweiligen Teile schon verdrahtet sind: Authentifizierung, Zahlungen über Stripe und Lemon Squeezy, Nutzungslimits, transaktionale E-Mail und ein KI-API-Starter-Kit, das mit OpenAI, Anthropic, Groq oder Llama spricht. Man klont das Repository, setzt seinen Preis und kümmert sich um den Teil des Produkts, für den Menschen wirklich bezahlen. Es basiert auf Next.js über React und Tailwind, deshalb fühlt sich ein Großteil des Boilerplate-Codes schon vertraut an.

Kostenpflichtig / $99 - $499 one-timeDetails ansehen
Testim

Testim

Tricentis · Coding

Testim ist eine KI-gestützte Plattform für Testautomatisierung, mit der man End-to-End-Tests für Web-, Mobile- und Salesforce-Anwendungen baut und ausführt. Sie setzt auf maschinelles Lernen, um Tests stabil zu halten, wenn sich eine Oberfläche ändert, sodass Teams weniger Zeit mit der Reparatur kaputter Selektoren verbringen. Nicht schlecht für ein Tool für automatisierte Tests, das Sie heute schon nutzen können. Sie erstellen Tests, indem Sie Aktionen im Browser aufzeichnen, und fügen danach JavaScript hinzu, wenn Sie mehr Kontrolle brauchen. Für ein beschäftigtes QA-Team eine solide Wahl.

Kostenlos / Custom pricing on requestDetails ansehen