¿Por qué una captura de pantalla no es suficiente?
No hay una razón menor que la que moldeó a Diwall; una razón más fuerte. Tres cosas que una imagen habría ocultado, y por qué la vista de solo texto que Dinoer eligió tiene su propia limitación importante, algo que se afirma en lugar de ignorarse.
Darle a un modelo una captura de pantalla se siente como darle ojos. Es más parecido a entregarle a alguien una fotografía de una habitación y pedirle que abra el tercer cajón. La respuesta de Dinoer no fue dar una mejor fotografía; fue dejar de producir cualquier imagen, en ningún modo, por ninguna razón.
Uno: qué es un elemento y dónde va
En una captura de pantalla, un enlace y un botón con el mismo estilo son idénticos. Lo mismo ocurre con un control deshabilitado y uno habilitado, cuando el diseño elige un gris sutil.
La página conoce la diferencia. link "Learn more" /url: https://… indica
el rol y el destino, antes de que se haga clic en algo. No importa cuánta
inspección visual se realice, eso no se puede recuperar. Esta es la razón fundamental por la cual Dinoer lee
la estructura en lugar de renderizarla: la información que realmente necesita un clic
nunca fue visual desde el principio. El árbol de accesibilidad →
Dos: ¿Qué está en la página pero no se muestra?
Existe un <dialog> en el documento que no ha sido abierto. Sus botones son reales y direccionables, e invisibles para cualquiera que razone a partir de una imagen. Un menú colapsado contiene sus enlaces; un panel de pestañas contiene su contenido.
Esto no se resuelve leyendo texto en lugar de píxeles — es un punto ciego real, compartido por ambos enfoques. La propia página de inicio de este sitio, durante su desarrollo, lo demostró contra su propio autor: un menú <details> nativo estaba cerrado, y el árbol de accesibilidad informó un grupo sin nada legible dentro — la misma ausencia que habría mostrado una captura de pantalla, solo que más barata de producir. Lo que decide es si un elemento está renderizado, no si está presente en una u otra representación, y ninguna de las dos tiene una forma visual o textual de señalar esa diferencia por sí sola.
Tres: si el objetivo sigue siendo el objetivo
Una captura de pantalla es un instante. Entre el momento en que se toma y el momento en que se ejecuta una acción, un banner puede cerrarse, un modal puede abrirse, una lista puede ganar filas. Cualquier elemento identificado por su posición en ese momento ha cambiado silenciosamente; esta es la forma más común en que un clic automatizado termina apuntando al elemento incorrecto mientras informa de éxito.
Dinoer nunca identifica nada por posición; cada acción nombra un selector CSS, que apunta por identidad en lugar de por la ubicación de algo en una página que ya no existe cuando se ejecuta el clic. Esto no hace que los selectores sean inmunes a cambios (un selector puede coincidir con un elemento diferente después de un cambio en el DOM), pero elimina un modo de fallo completo que tiene un enfoque basado en la posición, por diseño.
Entonces, ¿qué hay para que lo examines?
Nada, deliberadamente.
Si necesita ver la página como lo haría una persona, ábrala; el mismo navegador, sin modificaciones, que utiliza Dinoer ya está instalado en la máquina. Lo que Dinoer devuelve no es una versión reducida de una imagen; es un tipo diferente de respuesta, diseñada para decidir qué leer o qué acción tomar a continuación, y no para ser vista.
En resumen
- Los roles y los destinos no tienen forma visual — la razón fundamental para leer la estructura en lugar de representarla.
- Presente en el documento no es lo mismo que representado, en texto o en una imagen — un límite real compartido, no resuelto por pasar a lo textual.
- Los selectores apuntan por identidad, no por posición — eliminando un modo de fallo que una superposición numerada habría implicado.
- No hay imagen, ni para el modelo ni para usted. Abra la página usted mismo si necesita una.