
SlimSnap
SlimSnap · Bilder · Coding
SlimSnap ist ein kostenloses Screenshot-zu-JSON-Tool für das Programmieren mit KI. Man erfasst einen Bildschirmbereich, versieht ihn mit Pfeilen oder Hinweisen und kopiert strukturierten Text statt eines Bildes. OCR und deterministische Begrenzungsrahmen sind eingebaut, sodass ein Agent den genauen Text und die Position jedes Elements auf dem Bildschirm sieht. Es läuft lokal, kostet nichts und funktioniert überall dort, wo Text hinpasst. Warum also dazu greifen statt zu einem normalen Screenshot? Weil ein normaler Screenshot im Terminal eine Sackgasse ist.

Über SlimSnap
Was ist SlimSnap
SlimSnap ist ein Desktop-Werkzeug, das eine Lücke in KI-gestützten Programmierabläufen schließt. Tools wie Claude Code, Aider und Codex CLI können Ihre Dateien lesen und Ihre Tests ausführen, aber nicht auf Ihren Bildschirm schauen. Sobald Sie über einen UI-Fehler sprechen wollen, tippen Sie am Ende einen Absatz, um zu beschreiben, was ein Screenshot mit einem Blick zeigen würde. Terminals nehmen keine Bilder an, also verwandelt SlimSnap den Bildschirm in etwas, das sie annehmen: Text. Es ist ein strukturierter Screenshot für Agenten, keine weitere Bilddatei.
Die Grundidee ist einfach. Ein Screenshot sind Pixel, und Pixel verlieren Information, bevor ein Modell sie überhaupt liest. SlimSnap exportiert stattdessen ein strukturiertes Dokument. Jede Beschriftung, jeder Button und jede Fehlermeldung erscheint mit ihrem Text, ihrer Position in normalisierten Koordinaten und jeder Anmerkung, die Sie gezeichnet haben. Weil die Daten deterministisch sind, hört der Agent auf zu raten, wo die Dinge liegen, und beginnt, das zu beheben, was Sie markiert haben.
Die wichtigste Einschränkung ist der Umfang. SlimSnap deckt nur macOS und Windows ab und ist ein Begleiter für Coding-Agenten, kein allgemeiner Bildeditor. Linux-Nutzer müssen dem Team schreiben und warten. Es bearbeitet oder ersetzt auch nicht Ihre vorhandenen Screenshots, wer also ein aufpoliertes Bild für einen Fehlerbericht braucht, greift weiterhin zu einem anderen Tool. Fair genug.
Erste Schritte
- Laden Sie die kostenlose App von der offiziellen Seite für macOS (Apple Silicon) oder Windows 10/11 herunter.
- Drücken Sie ⌘⇧S auf dem Mac oder Ctrl+Shift+S auf Windows und ziehen Sie, um einen beliebigen Bildschirmbereich auszuwählen, oder ⌘⇧L / Ctrl+Shift+L für eine ganze Seite mit Bildlauf. Das ist der gesamte Erfassungsschritt.
- Fügen Sie Pfeile, Hinweise oder Hervorhebungen hinzu, um auf das gemeinte Element zu zeigen.
- Kopieren Sie die Aufnahme als JSON und fügen Sie sie in Claude Code, Aider oder jeden Agenten ein, der Text annimmt.
- Optional: Installieren Sie den Connector, damit Claude Aufnahmen direkt von Ihrem Rechner liest, ohne etwas einzufügen.
Produktinformationen
Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von SlimSnap.
Am besten für
Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.
Nutzer
- Entwickler, die KI-Coding-Agenten einsetzen
- QA- und Testingenieure
- Teams mit Blick auf Barrierefreiheit
Aufgaben
- UI-Fehler an einen Coding-Agenten melden
- Einen Bildschirmzustand in einem Terminal oder einer SSH-Sitzung beschreiben
- Lange Seiten mit Bildlauf erfassen
Szenarien
- Sie debuggen ein Layout-Problem, und „der Button unter der Kopfzeile links" zu tippen bringt Sie nicht weiter.
- Sie arbeiten über SSH auf einer entfernten Maschine und möchten einem Agenten zeigen, wie ein lokales Fenster aussieht.
- Sie fügen etwas in eine Commit-Nachricht oder ein CI-Log ein und brauchen den Bildschirm als Text, nicht als Anhang.
Wichtigste Funktionen
Screenshot zu strukturiertem JSON
Der ganze Sinn von SlimSnap liegt in seinem Ausgabeformat. Statt eines flachen Bildes erhalten Sie ein Dokument, in dem jedes Element eine id, einen Typ, seinen Textwert und einen Begrenzungsrahmen trägt. Diese Struktur lässt einen Coding-Agenten über den Bildschirm so nachdenken, wie er über Code nachdenkt. Es ist der eine Schritt, der einen Bildschirmbereich für Coding-Agenten in etwas verwandelt, worauf sie reagieren können.
Anmerkungen, die Absicht tragen
Ein Pfeil oder ein Hinweis ist Absicht, keine Verzierung. Wenn Sie auf einen Button zeigen, zeichnet SlimSnap per id auf, welches Element die Markierung anvisiert, sodass die exportierte Absicht „behebe e4" sagt, statt den Agenten raten zu lassen, was Sie meinten. Markieren wird zu einer präzisen Anweisung. Ein Pfeil. Ein Ziel. Keine Mehrdeutigkeit bleibt.
Integriertes OCR und deterministisches Layout
OCR ist fest eingebaut, jede Beschriftung, jeder Button und jede Fehlermeldung in der Aufnahme kommt also als echter Text an. Genau das kann Ihnen ein einfacher OCR-Screenshot nicht liefern. Begrenzungsrahmen liegen in normalisierten Koordinaten von 0 bis 1, was bedeutet, dass Positionen über Auflösungen hinweg stabil bleiben. Der Agent sieht die Wörter, die Sie sehen, an der Stelle, an der Sie sie sehen.
Ganzseitige Erfassung mit Bildlauf
Drücken Sie ⌘⇧L oder Ctrl+Shift+L für eine Ganzseitenaufnahme. Scrollen Sie selbst, oder lassen Sie Autoscroll lenken, und lange Seiten teilen sich in lesbare Einzelbilder, verpackt in einem einzigen JSON. Hohe Seiten sind das ganze Problem. Das zählt, weil ein KI-Tool ein sehr hohes Bild nicht lesen kann und eine skalierte hohe Seite oft ihren Fließtext völlig verliert.
Nur lokal, von Grund auf
Erfassung und OCR laufen auf Ihrem Rechner. Es gibt keinen Upload, kein Konto und keinen Server dazwischen, Ihre Bildschirme verlassen das Gerät also nie. Das ist selten. Für Menschen, die mit sensiblen Oberflächen arbeiten, ist das der Unterschied zwischen einem Tool, das sie nutzen können, und einem, das sie nicht nutzen können.
Offenes MIT-Schema
Das JSON-Schema ist auf GitHub unter MIT veröffentlicht. Sie können es lesen, dagegen validieren oder Ihren eigenen Exporter schreiben, ohne jemanden zu fragen. Kein Lock-in. Ein offenes Format heißt auch, dass Sie nicht festsitzen, wenn Sie Aufnahmen später in eine eigene Pipeline einbinden wollen.
Agenten-Connector, kein Einfügen
Installieren Sie den Connector, und Claude liest Ihre Aufnahmen direkt vom Rechner, sodass Sie erfassen, markieren und einfach fragen. Ganz ohne Einfügen. Er kommt als Bündel für Claude Desktop, als einzeiliger Befehl für Claude Code oder als Cursor-Deeplink.
Vor- und Nachteile
Vorteile
- Kostenlos und ohne Registrierung, und die Installation dauert Sekunden.
- Die strukturierte Ausgabe bewahrt Text und Positionen, die eine Bildskalierung zerstören würde. Nichts geht verloren.
- Anmerkungen werden per id bestimmten Elementen zugeordnet, die Absicht übersteht also den Weg zum Agenten.
- Lokale Verarbeitung hält Bildschirme auf dem Rechner, ohne Konto.
- Das offene MIT-Schema lässt Sie validieren, erweitern oder Ihren eigenen Exporter bauen.
Nachteile
- Nur macOS und Windows; Linux-Unterstützung ist nicht gebaut und hängt von E-Mail-Anfragen ab.
- Es ist ein Begleiter für Coding-Agenten, kein allgemeiner Screenshot-Editor, ersetzt also kein Tool für aufpolierte Bilder im Fehlerbericht.
- Der Connector-Weg dreht sich um Claude und Cursor, andere Agenten bleiben also bei Copy-Paste.
- Keine API, was die Automatisierung für Teams einschränkt, die Aufnahmen serverseitig skripten wollen.
Häufige Fragen
Es verwandelt einen Bildschirmbereich in strukturiertes JSON, das KI-Coding-Agenten lesen können. Sie erfassen, kommentieren und kopieren das JSON statt eines Bildes, sodass der Agent exakten Text und exakte Positionen bekommt statt eines Bildes, das er deuten muss. Es ist der sauberste Weg, einen Screenshot für Claude Code oder ein beliebiges Terminal-basiertes Tool zu erstellen.
Ähnliche Inhalte
Entdecke passende Tools, Skills und Artikel zu SlimSnap.
Alternativen zu SlimSnap
X Ray Interpreter
X-ray Interpreter · BilderX Ray Interpreter ist ein webbasiertes KI-Radiologie-Tool, das Röntgenbilder, CTs, MRTs, Ultraschallbilder und PET-Aufnahmen in Berichte in einfacher Sprache verwandelt. Sie laden eine Aufnahme hoch, erhalten in wenigen Augenblicken eine vorläufige Röntgenbild-Interpretation und stellen dann Rückfragen, wenn etwas erklärt werden muss. Es dient als zweite Meinung und als Lernhilfe, nicht als medizinische Diagnose.
Aieasypic
AIEasyPic · BilderAIEasyPic ist ein KI-Bildgenerator, der einfache Text-Prompts in Sekunden in fertige Kunstwerke verwandelt. Du kannst außerdem eigene Modelle mit persönlichen Fotos trainieren, Gesichter in vorhandenen Bildern tauschen und kurze Videoclips aus Text erstellen, alles im Browser. Er passt zu Gelegenheitskreativen, die schnelle Bilder wollen, und zu Hobbyisten, die ein persönliches Modell bauen möchten, ohne eine Zeile Code anzufassen.
Chargen
Chargen · BilderChargen ist ein KI-Charaktergenerator und ein Toolkit zum Worldbuilding für Dungeons & Dragons und andere Tisch-Rollenspiele. Es verwandelt eine einzeilige Idee in ein gemaltes Charakterporträt, erzeugt NSCs, Monster, Karten und Begegnungen in derselben Sitzung und hält die Details jeder Kreatur griffbereit. Der Bereich für Tisch-Rollenspiel-Kunst läuft über ein Creditsystem namens Gold, während die Textgeneratoren für alle kostenlos bleiben.
