Perception
Qu'est-ce qu'un modèle de langage perçoit réellement d'une page web lorsque rien n'est jamais rendu sous forme d'image ? Connaissances générales, utiles même si vous n'installez jamais quoi que ce soit.
Un modèle de langage ne voit pas une page web. Donnez-lui une capture d’écran et il reçoit des pixels : il peut vous dire que la page a l’air incorrecte, mais il ne peut rien faire, parce que rien dans une image n’est adressable. Donnez-lui le code HTML brut et il obtient tout en même temps, y compris des centaines de lignes de balisage qu’aucun œil humain ne pourrait jamais percevoir.
Dinoer ne fournit rien de tout cela. Ni une image plus petite, ni une image compressée, pas d’image du tout, dans aucun mode, pour aucune raison. Ce qu’il fournit à la place est la structure que le navigateur lui-même construit déjà, sous forme de texte.
Deux points de vue, tous deux en texte, et où ils diffèrent
L’arbre d’accessibilité est la structure que le navigateur crée pour les lecteurs d’écran : titres, rôles, liens, états, et ce, à une fraction du coût en ressources qu’une image. Le texte extrait est le contenu documentaire de la page, débarrassé des éléments superflus, afin de privilégier ce que dit la page plutôt que sa structure.
Ni l’un n’est une solution de secours pour l’autre. L’arborescence vous indique ce qu’une page est ; le texte extrait vous indique ce qu’elle dit. Une page peut avoir une arborescence riche et navigable, mais un contenu limité, ou vice versa.
Reproduisez-le
Les chiffres de cette section sont réels, et non mis en scène : ils ont été obtenus avec l’outil réel, le 14 août 2026, dans les conditions suivantes :
https://example.com
/opt/dinoer/venv/bin/python3 /opt/dinoer/shot.py \
--url https://example.com --a11y --guide-version 1.6