Percepción
¿Qué es lo que realmente percibe un modelo de lenguaje de una página web cuando nunca se renderiza nada en una imagen? Conocimiento general, útil incluso si nunca instalas nada.
Un modelo de lenguaje no ve una página web. Si le das una captura de pantalla, obtiene píxeles: puede decirte que la página se ve mal, pero no puede actuar sobre nada, porque nada en una imagen es direccionable. Si le das el código HTML sin procesar, obtiene todo a la vez, incluyendo cientos de líneas de marcado que ningún ojo humano podría registrar.
Dinoer no proporciona ninguna de las dos. Ni una imagen más pequeña, ni una comprimida; simplemente, no muestra ninguna imagen en absoluto, en ningún modo y por ninguna razón. Lo que ofrece en su lugar es la estructura que el propio navegador ya genera, pero en formato de texto.
Dos perspectivas, ambas en texto, y dónde difieren
El árbol de accesibilidad es la estructura que el navegador crea para los lectores de pantalla: títulos, roles, enlaces, estados; todo esto a una fracción del costo en términos de recursos que requiere una imagen. El texto extraído es el contenido documental limpio de la página, con las etiquetas innecesarias eliminadas, y se utiliza cuando lo importante es lo que dice la página, más que cómo está estructurada.
Ni uno es una alternativa para el otro. El árbol te dice qué es una página; el texto extraído te dice lo que dice. Una página puede tener un árbol rico y navegable con contenido escaso, o viceversa.
Reprodúcelo
Las imágenes de esta sección son reales, no escenificadas; fueron capturadas contra
https://example.com con la herramienta real, el 14 de agosto de 2026:
/opt/dinoer/venv/bin/python3 /opt/dinoer/shot.py \
--url https://example.com --a11y --guide-version 1.6