Agent Browser

Agent Browser

agent-browser-io · Coding

Agent Browser ist ein Tool zur Browser-Automatisierung, mit dem ein KI-Agent einen echten Webbrowser so steuert, wie es ein Mensch tun würde. Es verwandelt Seiten in kompakte ASCII-Wireframes, damit das Modell Links und Buttons als indexierten Text liest, statt ganze Seiten rohen HTML zu parsen. Sie können es in einem MCP-Client wie Cursor oder Claude Desktop nutzen, mit dem Vercel AI SDK in eine Node-App einbinden oder über die Kommandozeile testen.

Vorschau der Oberfläche von Agent Browser

Über Agent Browser

Was ist Agent Browser

Agent Browser ist ein experimentelles Paket von agent-browser-io, das KI-Agenten Hände und Augen im Web gibt. Statt statisches HTML zu scrapen, öffnet der Agent über Playwright einen lebenden Browser und fragt dann einen Wireframe an: eine abgespeckte Textkarte, in der jedes klickbare Element eine Nummer bekommt. Der Agent wählt eine Nummer, und das Tool klickt, tippt oder scrollt für ihn.

Der Kern ist der Token-Aufwand. Eine vollständige Webseite kann Tausende Tokens in Auszeichnung verbrennen, die das Modell nicht braucht. Das ist das Problem. Was sieht der Agent also wirklich? Eine kurze Textkarte, nicht die ganze Seite. Der Wireframe kürzt das auf die Teile zusammen, die zählen, was den Agenten bei längeren Aufgaben im Kontextfenster hält. Es ist frühe Software. Das Projekt nennt sich selbst experimentell, und die letzte Veröffentlichung war Version 0.3.0. Rechnen Sie mit rauen Kanten.

Die größte Grenze sind Wartung und Feinschliff. Das Repo ist öffentlich und klein, also gibt es keinen Support, wenn eine Zielseite ihr Layout ändert und Ihren Ablauf bricht. Zum Ausführen brauchen Sie außerdem Node 18 oder neuer. Für Hobby-Projekte und den Bau von Tools ist das in Ordnung. Für den Produktivbetrieb überlegen Sie zweimal.

Erste Schritte

  1. Installieren Sie das Paket mit npm install @agent-browser-io/browser in einem Projekt mit Node 18+.
  2. Um es aus einem KI-Assistenten zu nutzen, fügen Sie den MCP-Server Ihrer Client-Konfiguration mit dem Befehl npx und den Argumenten ["-y", "@agent-browser-io/browser", "mcp"] hinzu und starten Sie den Client neu.
  3. Lassen Sie den Agenten zuerst das Tool launch aufrufen, da navigate, click und der Rest einen laufenden Browser voraussetzen.
  4. Fragen Sie einen Wireframe an, um die Seite als nummerierte Elemente zu sehen, und sagen Sie dem Agenten dann, welche Nummer er klicken soll oder was er tippen soll.
  5. Für die Nutzung im Code erstellen Sie den Browser mit new AgentBrowser(new PlaywrightBrowserBackend()) und übergeben createBrowserTools(browser) an einen generateText-Aufruf.

Produktinformationen

Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von Agent Browser.

Kostenloser TarifJa
Bezahlte Tarife$0
PlattformNode.js 18+, MCP clients (Cursor, Claude Desktop), CLI
Entwickleragent-browser-io
KategorieCoding
VeröffentlichungsdatumFeb 2026
Zuletzt aktualisiertFeb 2026
Website-Besuche649.3M
Globales Website-Ranking50
API-VerfügbarkeitJa

Am besten für

Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.

Nutzer

  • Entwickler, die KI-Agenten bauen
  • Nutzer von Cursor und Claude Desktop
  • Bastler aus QA und Automatisierung

Aufgaben

  • Seiten lesen und zusammenfassen
  • Formulare ausfüllen und Abläufe durchklicken
  • Mehrstufige Rechercheläufe

Szenarien

  • Einen internen Recherche-Bot bauen, der ein paar Seiten scannt und Bericht erstattet.
  • Einen Web-Ablauf aus einem Skript testen, statt ihn von Hand durchzuklicken.
  • Eine Agenten-Funktion prototypen, bei der Sie echte Browser-Steuerung brauchen, keinen kopflosen Abruf.

Wichtigste Funktionen

Token-effiziente Wireframes

Agent Browser stellt eine Seite als ASCII-Karte mit nummerierten Elementen dar, was der Kern seiner Token-Ersparnis ist. Der Agent liest Beschriftungen wie [11]upvote und wählt die Nummer, statt das ganze DOM zu laden. Auf einer vollen Seite ist das der Unterschied zwischen ein paar Hundert Tokens und mehreren Tausend, und dieser Spielraum lässt längere Aufgaben zu Ende laufen, statt den Faden zu verlieren.

Echte Browser-Steuerung über Playwright

Das Tool steuert einen echten Browser über Playwright. Das ist klassische Playwright-Browser-Automatisierung, gerichtet auf einen Agenten statt auf ein Testskript. Es funktioniert auf Seiten, die JavaScript, Cookies oder eine lebende Sitzung brauchen. Alles, was ein Mensch klicken kann, kann der Agent klicken. Es ist kein kopfloser Scraper, der sich als Browser ausgibt, was zählt, wenn eine Seite einfache Anfragen blockt.

MCP-Integration

Das Paket liefert einen MCP-Server, den Sie in Cursor, Claude Desktop oder jeden stdio-basierten MCP-Client stecken können. Ein Konfigurationseintrag legt den vollen Satz an MCP-Browser-Tools frei, und der Server spricht JSON-RPC über stdin und stdout ohne zusätzliche Umgebungsvariablen. Wenn Ihr Assistent schon MCP nutzt, ist das der kürzeste Weg, ihm einen Browser zu geben.

Vercel AI SDK Tools

Im Code gibt createBrowserTools(browser) einen Satz Tools zurück, den Sie direkt an generateText übergeben. Der Satz deckt launch, navigate, getWireframe, click, type, fill, dblclick, hover, press, select, check, uncheck, scroll, screenshot und close ab. Er deckt sich mit dem MCP-Server, also bleibt das Verhalten gleich, egal wie Sie es aufrufen.

Interaktive CLI

Sie können die CLI für manuelle Tests mit npx @agent-browser-io/browser oder der Binärdatei agent-browser-cli nach der Installation ausführen. Warum sich die Mühe machen? Es ist der schnellste Weg zu prüfen, ob ein Wireframe stimmt. Bestätigen Sie, dass die Selektoren dort landen, wo Sie es erwarten, bevor Sie sich auf ein Skript festlegen.

Screenshots neben Wireframes

Wenn Sie die echten Pixel sehen müssen, nimmt das Screenshot-Tool die Seite als Bild auf. So einfach ist das. Der Wireframe kümmert sich um die Struktur und der Screenshot um das visuelle Detail, also wechseln Sie je nachdem, ob der Agent lesen oder schauen muss.

Vor- und Nachteile

Vorteile

  • Wireframes senken den Token-Verbrauch bei seitenlastigen Aufgaben, was Agenten im Kontextfenster hält.
  • Funktioniert mit MCP-Clients wie Cursor und Claude Desktop über einen einzigen Konfigurationsblock.
  • Open Source und kostenlos, mit dem ganzen Code auf GitHub, den jeder prüfen oder forken kann.
  • Steuert einen echten Playwright-Browser, also verhalten sich JavaScript-lastige Seiten wie für einen Menschen.
  • Derselbe Toolsatz treibt den MCP-Server und den Codepfad an, also bleiben die Ergebnisse gleich.

Nachteile

  • Als experimentell gekennzeichnet, und die letzte Version war 0.3.0, also können sich APIs noch unter Ihnen verschieben.
  • Kein gehosteter Dienst und kein Support, was bedeutet, dass Sie Probleme selbst debuggen.
  • Erfordert Node 18+ und etwas Einrichtung, also kein Ein-Klick-Tool für Nicht-Entwickler.
  • Seiten, die ihr Layout ändern, können einen gespeicherten Ablauf brechen, und Sie müssen die Schritte neu bauen.

Häufige Fragen

Es lässt einen KI-Agenten einen echten Browser steuern, um zu navigieren, zu klicken, zu tippen und Seiten zu lesen. Man nutzt es, um Recherche-Bots zu bauen, Web-Abläufe zu automatisieren und MCP-Assistenten die Fähigkeit zum Browsen zu geben.

Ähnliche Inhalte

Entdecke passende Tools, Skills und Artikel zu Agent Browser.

Alternativen zu Agent Browser

Forefront

Forefront

Forefront · Coding

Forefront ist eine Webplattform zum Bauen mit Open-Source-KI. Sie lassen sich führende Open-Source-Sprachmodelle mit eigenen Daten feintunen, ihre Leistung bewerten und sie über eine API ausführen oder exportieren, um sie selbst zu hosten. Entwickler, die den Komfort einer geschlossenen Plattform wollen, aber darauf bestehen, ihre Modelle und Daten zu besitzen, sind hier die Zielgruppe.

Kostenlos / $0 - $99/moDetails ansehen
Startkit

Startkit

StartKit.AI · Coding

Startkit ist ein Boilerplate zum Bauen von KI-SaaS-Produkten und KI-Wrappern. Man kann es sich als KI-Startup-Boilerplate vorstellen, bei dem die langweiligen Teile schon verdrahtet sind: Authentifizierung, Zahlungen über Stripe und Lemon Squeezy, Nutzungslimits, transaktionale E-Mail und ein KI-API-Starter-Kit, das mit OpenAI, Anthropic, Groq oder Llama spricht. Man klont das Repository, setzt seinen Preis und kümmert sich um den Teil des Produkts, für den Menschen wirklich bezahlen. Es basiert auf Next.js über React und Tailwind, deshalb fühlt sich ein Großteil des Boilerplate-Codes schon vertraut an.

Kostenpflichtig / $99 - $499 one-timeDetails ansehen
Testim

Testim

Tricentis · Coding

Testim ist eine KI-gestützte Plattform für Testautomatisierung, mit der man End-to-End-Tests für Web-, Mobile- und Salesforce-Anwendungen baut und ausführt. Sie setzt auf maschinelles Lernen, um Tests stabil zu halten, wenn sich eine Oberfläche ändert, sodass Teams weniger Zeit mit der Reparatur kaputter Selektoren verbringen. Nicht schlecht für ein Tool für automatisierte Tests, das Sie heute schon nutzen können. Sie erstellen Tests, indem Sie Aktionen im Browser aufzeichnen, und fügen danach JavaScript hinzu, wenn Sie mehr Kontrolle brauchen. Für ein beschäftigtes QA-Team eine solide Wahl.

Kostenlos / Custom pricing on requestDetails ansehen