Caesr AI

Caesr AI

AskUI GmbH · Produktivität

Caesr AI ist ein Agent, der den Computer nutzt und Aufgaben auf einem echten Bildschirm ausführt, so wie es ein Mensch tun würde: Er sieht, was angezeigt wird, bewegt dann die Maus, tippt auf der Tastatur und klickt sich durch alles, was auftaucht. Entstanden ist er bei AskUI GmbH in Karlsruhe, wo derselbe Motor heute bei Delivery-Teams läuft, die Software über Desktop-, Web-, Mobil- und Embedded-Bildschirme hinweg validieren und bedienen müssen. Sie beschreiben eine Aufgabe in natürlicher Sprache, und der Agent führt sie aus, ohne sich in den dahinterliegenden Code oder eine API einzuhängen.

Vorschau der Oberfläche von Caesr AI

Über Caesr AI

Was ist Caesr AI

Caesr AI ist ein KI-Automatisierungsagent, der über den Bildschirm selbst arbeitet statt über Integrationen. Fast alle Automatisierungstools brauchen eine API, ein Skript oder einen aufgezeichneten Pfad, und sie brechen in dem Moment, in dem sich eine Oberfläche ändert. Caesr AI geht einen anderen Weg: Er macht einen Screenshot, überlegt den nächsten Schritt und handelt. Pop-ups, langsame Ladezeiten und unerwartete Zustände bringen einen Lauf nicht aus dem Tritt, weil es keinen starren Pfad gibt, der brechen könnte.

Das Produkt stammt von AskUI GmbH, 2021 in Karlsruhe gegründet. Die Idee entstand in einer Vorlesung über Computer Vision am Karlsruher Institut für Technologie, wo sich die Gründer eine einfache Frage stellten: Wenn ein manueller Tester arbeitet, indem er auf den Bildschirm schaut, warum sollte Software das nicht genauso tun? Dieses Prinzip prägt die Plattform bis heute, und deshalb deckt eine einzige Laufzeitumgebung Bildschirme ab, für die das Team nie etwas programmiert hat.

Die größte Einschränkung ist der Zugang. Caesr AI wird über den Vertrieb verkauft. Tarife werden pro Organisation nach einem Gespräch zur Festlegung des Umfangs angeboten, es gibt keinen Self-Service-Kauf und keine öffentlichen Preise pro Arbeitsplatz. Wer es ausprobieren will, fordert eine Testversion an und betreibt sie in der eigenen Umgebung auf den eigenen Rechnern. Für jemanden, der nur ein wenig herumklicken möchte, ist das viel Reibung.

Erste Schritte

  1. Fordern Sie über die Website eine Testversion an. Legen Sie dann den Umfang mit dem Team fest: gegen welche Ziele Sie laufen und wo der Agent eingesetzt wird.
  2. Installieren Sie AskUI Desktop unter Windows oder macOS, oder richten Sie die CLI für headless-Läufe in einer Pipeline oder auf einer geplanten Maschine ein.
  3. Melden Sie sich an und lassen Sie den Onboarding-Assistenten die Berechtigungen und Ihr erstes Projekt einrichten.
  4. Schreiben Sie eine Aufgabe in einfachem Markdown. Nennen Sie die Schritte und das erwartete Ergebnis und versionieren Sie sie zusammen mit Ihrem Code.
  5. Führen Sie die Aufgabe gegen ein verbundenes Gerät aus und lesen Sie jeden Schritt nach, den der Agent gemacht hat, mit einem Screenshot und einem Protokoll pro Lauf.

Produktinformationen

Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von Caesr AI.

Kostenloser TarifNein
Bezahlte TarifeCustom quote
PlattformWindows, macOS, Linux, Android, iOS, web, embedded hardware
EntwicklerAskUI GmbH
KategorieProduktivität
VeröffentlichungsdatumJan 2021
Zuletzt aktualisiertAug 2026
Website-BesucheN/A
Globales Website-RankingN/A
API-VerfügbarkeitJa

Am besten für

Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.

Nutzer

  • QA- und Delivery-Teams
  • Doku- und Betriebspersonal
  • Unternehmens-IT in regulierten Branchen

Aufgaben

  • Regressionstests über mehrere Bildschirme
  • Smoke-Tests auf wiederkehrenden Abläufen
  • Oberflächen vor dem Start validieren
  • Einen Ablauf bei der Übergabe dokumentieren

Szenarien

  • Ein Delivery-Team, das häufig UI-Änderungen ausliefert und damit ältere Automatisierung zerstört
  • Ein wöchentlicher Smoke-Lauf auf einem Rechner in der Ecke
  • Eine regulierte Umgebung, in der Screenshots das Netz nicht verlassen dürfen

Wichtigste Funktionen

Ein Agent, der den Computer nutzt und den Bildschirm liest

Caesr AI arbeitet allein mit Screenshots. Der Agent erfasst, was angezeigt wird, ein Modell entscheidet über die nächste Aktion, und er klickt, tippt oder navigiert wie ein Mensch. Es gibt keine Einhängpunkte in den Anwendungscode, deshalb kommt er mit Apps zurecht, die gar keine API anbieten. Genau das ist der Punkt: Wenn ein Mensch damit arbeiten kann, kann der Agent es auch. Keine API nötig.

Aufgaben in natürlicher Sprache statt Skripte

Aufgaben werden in Markdown oder CSV geschrieben, nicht in Code. Jeder, der die Anwendung kennt, kann eine schreiben, und sie liegen in Ihrem Git-Repository neben allem anderen. Wenn sich die Oberfläche ändert, bearbeiten Sie einen Satz, statt einen Recorder zu debuggen. Das ist ein großer Unterschied. Herkömmliche Testwerkzeuge brechen bei einer kleinen Layout-Anpassung; hier kostet eine Anpassung eine Zeile.

Eine Laufzeitumgebung für jeden Bildschirm

AgentOS stellt dem Agenten ein Betriebssystem bereit, mit Tastatur-, Maus- und Bildschirmsteuerung in einer Schicht. Es läuft auf der Maschine, die die Arbeit macht, sodass der Agent das Gerät so bedient wie ein Mensch. Dieselbe Laufzeitumgebung deckt Windows, macOS und Linux ab, dazu Android, Browser und Prüfstand-Hardware, sodass ein Team nicht für jedes Ziel einen anderen Stack pflegt.

Desktop-App mit Aufzeichnungen pro Schritt

AskUI Desktop ist der Ort, an dem Arbeit geschrieben, beobachtet und wiedergegeben wird. Sie öffnen eine Aufgabe, führen sie gegen ein verbundenes Gerät aus und lesen jeden Schritt nach, den der Agent gemacht hat, mit einem Screenshot pro Schritt und einem Protokoll pro Lauf. Für Teams, die eine Prüfspur oder ein Übergabedokument brauchen, ist diese Aufzeichnung der Grund, es zu nutzen. Schluss mit Rätselraten. Das Debuggen eines fehlgeschlagenen Laufs ist keine Vermutung mehr.

CLI für headless- und geplante Läufe

Die CLI ist derselbe Motor ohne Fenster. Führen Sie askui run in einer Pipeline, geplant oder auf einem Rechner in der Ecke aus, und Sie erhalten den Bericht als Build-Artefakt. Sie braucht keine Anzeige. Jeder Lauf liefert einen Exit-Code plus einen Bericht, sie passt also in bestehende CI wie jede andere Prüfung.

Ihr eigenes Modell, auf Ihrer eigenen Infrastruktur

Sie können Anthropic, einen OpenAI-kompatiblen Endpunkt oder ein selbst gehostetes Modell in jedem Tarif verwenden. Die Inferenz berührt nie die Infrastruktur von AskUI, was zählt, wenn Screenshots sensible Daten enthalten. Bei Enterprise können Sie vor Ort oder in einer abgeschotteten Umgebung einsetzen und sogar Inferenzkosten sparen, indem Sie Ihr eigenes Modell nutzen.

Ergebnisse auf öffentlichen Benchmarks

Laut AskUI erreichte der Vision-Agent 66,2 im OSWorld-Benchmark und 94,8 % abgeschlossene Aufgaben in AndroidWorld, was ihn zum Zeitpunkt der Veröffentlichung in beiden öffentlichen Ranglisten platzierte. Benchmark-Zahlen sagen nicht, wie er mit Ihrer konkreten App umgeht, aber sie sind ein nützliches Signal beim Vergleich von Agenten, die den Computer nutzen, und sie sind veröffentlicht statt verborgen.

Vor- und Nachteile

Vorteile

  • Funktioniert ohne API-Zugang, kann also Apps automatisieren, die keine Integrationspunkte anbieten.
  • Aufgaben sind in natürlicher Sprache, sodass Leute, die die App kennen, sie ohne Programmieren schreiben können.
  • Eine Laufzeitumgebung deckt Desktop-, Web-, Mobil- und Embedded-Bildschirme ab, was Nacharbeit pro Plattform reduziert.
  • Aufzeichnungen pro Schritt geben eine klare Prüfspur und Übergabedokumentation.
  • Screenshots und Inferenz können im eigenen Netz bleiben, was in regulierten Umgebungen hilft.

Nachteile

  • Der Preis gibt es nur als Angebot ohne Self-Service-Tarif, Sie können die Kosten also nicht ohne ein Gespräch zur Umfangsbestimmung einschätzen.
  • Es gibt keinen kostenlosen Tarif, was Einzelpersonen und kleine Teams ausschließt, die es unverbindlich testen möchten.
  • Die Testversion und das Onboarding gehen davon aus, dass Sie gegen echte Umgebungen und CI laufen, was Einrichtungsaufwand bedeutet.
  • Ein vor allem auf Vision setzender Agent kann bei ungewöhnlichen Bildschirmen, die sich schnell ändern, noch stolpern, wo ein programmierter Pfad berechenbarer wäre.

Häufige Fragen

Er führt Aufgaben auf einem Gerät aus wie ein Mensch: Er liest den Bildschirm und klickt, tippt und navigiert dann. Sie beschreiben die Aufgabe in natürlicher Sprache, und der Agent führt sie aus. Das ist gar keine API-Automatisierung: Der Agent braucht nie Zugang zum Code der App oder zu einer API.

Ähnliche Inhalte

Entdecke passende Tools, Skills und Artikel zu Caesr AI.

Alternativen zu Caesr AI

Swms

Swms

Swms AI · Schreiben · Produktivität · Business

Swms ist ein KI-Tool für Sicherheits-Compliance, das eine einfache Beschreibung einer Arbeit in sofort nutzbare Sicherheitsdokumente verwandelt. Sie beschreiben Ihr Projekt, Ihr Gewerk und die bekannten Gefahren, und es schreibt in Sekunden eine Erklärung der sicheren Arbeitsmethode, eine Gefährdungsanalyse des Arbeitsplatzes, eine sichere Arbeitsanweisung, ein RAMS oder ein Sicherheitsdatenblatt. Mitgeliefert wird außerdem Oscar, ein Chat-Assistent, der Fragen zur Arbeitssicherheit in jeder Sprache beantwortet. Teams aus Bau, Bergbau, Transport und Lagerhaltung nutzen es, um den Papierkram zu kürzen, der sonst einen Arbeitstag auffrisst.

Kostenlos / $20/moDetails ansehen
Wordly AI Translation

Wordly AI Translation

Wordly · Stimme & Sprache · Produktivität

Wordly AI Translation ist eine KI-Echtzeitübersetzungs- und Untertitelungsplattform für Besprechungen, Konferenzen und Veranstaltungen. Sie liefert Live-Übersetzung, Untertitel, Transkripte und Zusammenfassungen in mehr als 60 Sprachen, und Teilnehmer treten per QR-Code-Scan oder über einen Link bei, statt eigene Kopfhörer zu nutzen. Die Plattform arbeitet mit Zoom, Microsoft Teams, Google Meet und Webex zusammen und richtet sich an Organisationen, die mehrsprachigen Zugang wollen, ohne für jede Sitzung menschliche Dolmetscher zu engagieren. So einfach ist das.

Kostenpflichtig / $0 - $150/moDetails ansehen
Rows

Rows

Rows (Superhuman) · Produktivität · Business

Rows ist eine KI-Tabelle und ein Werkzeug zur Datenanalyse, das Live-Daten aus mehr als 50 Quellen importiert und dich dann in klarer Sprache damit arbeiten lässt, statt mit SQL-Abfragen oder verschachtelten Formeln. Du ziehst Zahlen aus PDFs, verbindest Werbeplattformen, Datenbanken und Bankkonten und bittest die KI, Berichte zu bauen, Datensätze zusammenzuführen oder Modelle aufzusetzen, die sich selbst neu berechnen. Es läuft im Browser, funktioniert wie eine Tabelle und steht inzwischen unter dem Dach von Superhuman.

Kostenlos / $0 - $87/moDetails ansehen