Dinoer

Wahrnehmung

Was ein Sprachmodell tatsächlich von einer Webseite wahrnimmt, wenn überhaupt nichts als Bild dargestellt wird – allgemeines Wissen, das nützlich ist, selbst wenn Sie nie etwas installieren.

Ein Sprachmodell sieht keine Webseite. Geben Sie ihm einen Screenshot, und es erhält Pixel: es kann Ihnen sagen, dass die Seite falsch aussieht, aber es kann nichts damit tun, weil in einem Bild nichts adressierbar ist. Geben Sie ihm den rohen HTML-Code, und es erhält alles auf einmal – einschließlich hunderter Zeilen von Markup, die kein menschliches Auge jemals erfassen würde.

Dinoer liefert keines davon. Weder ein kleineres Bild noch eine komprimierte Version – überhaupt kein Bild, in keinem Modus und aus keinem Grund. Stattdessen liefert es die Struktur, die der Browser selbst bereits erstellt, aber als Text.

Zwei Ansichten, beide in Textform, und wo sie sich unterscheiden

Der Accessibility-Baum ist die Struktur, die der Browser für Screenreader erstellt – Titel, Rollen, Links, Zustände – zu einem Bruchteil der Token-Kosten eines Bildes. Extrahierter Text ist der bereinigte Dokumenteninhalte einer Seite, wobei unnötige Tags entfernt wurden, sodass im Vordergrund steht, was die Seite aussagt, anstatt wie sie strukturiert ist.

Weder ist eine Ausweichlösung für die andere. Der Baum zeigt Ihnen, was eine Seite ist; der extrahierte Text zeigt Ihnen, was sie sagt. Eine Seite kann einen umfangreichen, navigierbaren Baum und wenig Inhalt haben, oder umgekehrt.

Reproduzieren Sie es

Die Abbildungen in diesem Abschnitt sind echt und nicht inszeniert – aufgenommen vor https://example.com mit dem tatsächlichen Werkzeug, am 14. August 2026:

/opt/dinoer/venv/bin/python3 /opt/dinoer/shot.py \
  --url https://example.com --a11y --guide-version 1.6

Im Detail