Rastrear un sitio web: métodos y técnicas

En materia de posicionamiento natural, se plantean varias preocupaciones. Se trata, entre otras, de la estructura, del entramado interno, de la volumetría o aún de la arborescencia del sitio web.
Así, el crawl de una plataforma sigue siendo una operación ineludible a fin de optimizar el SEO (Search engine optimization) de un sitio. ¿Cuáles son, entonces, los métodos y las técnicas de crawl de un sitio web?
Rastrear un sitio: ¿qué es?
Rastrear significa literalmente «escanear». Dicho de otro modo, se trata de extraer el máximo de informaciones posibles de un sitio web. Este análisis permite así conocer a la perfección la estructura de un sitio y resolver sus problemas eventuales. Por ejemplo, una arborescencia mal construida, un entramado interno inadecuado o aún etiquetas meta duplicadas.
En otros términos, el software de crawler (o robot de indexación) busca documentos en Internet. Así, eso designa la exploración de la red a fin de automatizar la navegación. Los motores de búsqueda están equipados de robots de exploración con vistas a asegurar la indexación; el más célebre sigue siendo Googlebot, el de Google. Durante la operación, Googlebot recorre el contenido del sitio así como los enlaces presentes. De esta manera, este programa informático crea Sitemaps. Estos últimos facilitan el trabajo de los crawlers. Además de la indexación de los motores de búsqueda, la búsqueda de otras informaciones, en particular los flujos RSS, la dirección de correo electrónico, figuran entre las tareas de los softwares de exploración.
Tras el análisis, el resultado se encamina al catálogo de Google, confirmando la presencia del sitio en el índice de los motores de búsqueda. En cambio, esa presencia no implica un mejor posicionamiento natural.
Estos procedimientos son indispensables a fin de asegurar la pertinencia de los contenidos de los sitios y, así, excluir las URL inútiles de las bases de datos. Por otra parte, la presencia de ciertas etiquetas, en particular la etiqueta «noindex», impide a los motores de búsqueda indexar la página del sitio. Indexar solo una parte de su sitio puede ser juicioso, en particular respecto a su estrategia de posicionamiento natural.

¿Qué es el presupuesto de crawl?
El presupuesto de crawl sirve para designar el número de páginas recorridas por Googlebot. Así, cada sitio dispone de su propio presupuesto, pero la cuota se apoya en el número total de páginas, así como en la salud del sitio web. Este presupuesto está disponible en la Google Search Console.
El número de análisis subraya la importancia de un archivo respecto a otros. Para ello, hay que investigar la frecuencia de análisis, identificar las páginas sin interés para el robot y los errores encontrados durante su recorrido. Le serán indispensables softwares para un análisis de este tipo, que forma parte de la auditoría SEO. Así, Botify es una herramienta de pago que ofrece excelentes informes. Cabe señalar que esta herramienta convendrá a los sitios de más de 10 000 páginas. Oncrawl es una solución menos cara y una herramienta en clara progresión. Por último, Screaming Frog, exclusivamente en inglés, es una herramienta muy completa y eficaz.
Los factores de influencia del crawl
La técnica de crawl funciona según varios factores distintos.
Los enlaces: los primeros factores de influencia del crawl
Los sitios web son particularmente numerosos en Internet. Sin embargo, algunos se benefician de un mejor posicionamiento respecto a otros. Además, lo que se llama el netlinking, la estrategia de enlaces, constituye en parte los factores responsables de ese posicionamiento. Se trata de:
-
Los backlinks, que ocupan un lugar fundamental en la colocación de una página; los backlinks o los enlaces entrantes son los enlaces que apuntan hacia ella. Proceden de sitios externos. No obstante, Google efectúa una selección de los backlinks válidos según la calidad y la confianza, la proximidad, el modo de redirección, así como la situación del enlace en el sitio fuente.
-
El entramado interno, que figura entre los factores de influencia del crawl. Son los enlaces que apuntan hacia el mismo sitio. Estos enlaces internos favorecen no solo el SEO de un sitio web, sino que también mantienen a los usuarios activos en el sitio redirigiéndolos hacia informaciones complementarias.

El contenido: un elemento mayor en la técnica de crawl
Es costumbre decir que el contenido es rey («Content is king»). En efecto, desempeña un papel mayor, tanto en el SEO como en el crawl. Varios elementos ocupan un lugar mayor en esta operación:
-
El nombre de dominio es capital, porque los nombres de dominio que se benefician de un mejor posicionamiento generan una tasa de crawl elevada. Es, por consiguiente, primordial elegir el buen nombre de dominio.
-
El Sitemap es un archivo XML que se encarga de indicar las listas de las URL que indexar. Este archivo se utiliza con todos los CMS para informar a Google de las actualizaciones del sitio.
-
El duplicate content figura entre los responsables de un mal crawl, e incluso de una penalización de los motores de búsqueda, como Google, que ha hecho de ello una de sus prioridades.
-
Las URL canónicas son indispensables a fin de asegurar un mejor crawl y un mejor posicionamiento del sitio. Se trata de la etiqueta «rel canonical», que precisa el contenido original de un sitio en caso de contenido duplicado.
-
Las meta-tags consisten en una etiqueta HTML utilizada para insertar palabras clave invisibles para los internautas, pero accesibles a los motores de búsqueda. Estas palabras clave optimizan el posicionamiento natural de un sitio.
¿Cómo rastrear un sitio web?
Para rastrear a la perfección un sitio web, es posible optar por varios métodos: el «Cell text» o el «Follow mode».
Primer método: el «Cell text»
En un primer tiempo, conéctese a su interfaz Google Search Console. A continuación, abra el Sitemap existente. En ausencia de un Sitemap preexistente, cree uno nuevo. Haga clic en la opción «Import/Export» encima del Sitemap. Elija la opción Import y luego introduzca la URL de su sitio en el campo vacío situado bajo la inscripción «Use an existing site». Haga clic a continuación en la pestaña «Use File/Directory» a fin de mostrar el nombre de un archivo y de un directorio en la etiqueta del Sitemap. Así, la URL se utilizará como una ruta de acceso en tanto que cell text. Luego, haga clic en «Use H1» a fin de incluir un encabezado en la etiqueta del Sitemap. Haga clic a continuación en «Use page title». Para terminar, marque la opción «Exlude common text pages on import» a fin de apartar las URL que contienen textos duplicados.
Segundo método: el «Follow mode»
Tras haberse conectado al Sitemap, haga clic en los dominios y subdominios que rastrear. Si desea rastrear únicamente los dominios más pertinentes, seleccione «Domain only». Haga clic a continuación en «Domain and directory path only» si desea restringir el acceso a ciertos dominios específicos. A continuación, haga clic en «Add link» a fin de integrar una URL y luego en «Add meta description note» para incluir algunas notas en la parte meta description.
Defina un número de URL que importar en el campo vacío situado bajo la inscripción «Limit number of pages». La opción Omit directory excluye los directorios específicos que hay que evitar durante el crawl. El directorio va acompañado de una estrella (*) si esos elementos incluyen subdirectorios. Para terminar, haga clic en Import.
La importancia del crawl en su estrategia
Rastrear su sitio web es particularmente útil, tanto para la indexación en los motores de búsqueda como para la estrategia SEO.
El papel del crawl en la indexación del sitio
El crawl de un sitio es un elemento determinante para su clasificación en los resultados naturales de Google. Así, impedir a los robots de exploración rastrear su sitio suprime las posibilidades de obtener una visibilidad dentro de la SERP (resultados de búsqueda de Google).
A este título, Google ha afirmado que Googlebot sigue en condiciones de explotar los archivos JavaScript y CSS y, así, de colocar su sitio en su índice. Por otra parte, la firma estadounidense es capaz de analizar el DOM o «Document object model» (modelo de un sitio interpretado por el navegador a partir del código fuente) de una URL. Las señales SEO en el DOM se rastrean y se indexan. En ciertos casos, esas señales pueden ser objeto de una contradicción en el HTML. Afortunadamente, este pequeño problema está en vías de resolución.
El papel del crawl en la estrategia SEO
Rastrear un sitio de Internet se revela hoy capital a fin de realizar una auditoría SEO. En efecto, el crawl permite poner de relieve las mejoras estructurales que hay que aportar a un sitio web. Esta operación confirma también las acciones que hay que emprender a fin de optimizar el sitio. El crawl desvela la estructura del sitio, el acceso a las páginas, las fuentes de los problemas, la volumetría (números y categorías de páginas), el número de enlaces de cada URL, la duración de carga, la profundidad de las páginas (definida por el entramado interno), los códigos fuente, las URL pertinentes e inútiles, así como la presencia y la tasa de duplicate content.
Así, descubrir esas principales fuentes de imperfecciones permite anticipar las soluciones. Además, un crawl regular asegura la salud del sitio web. Esta operación propuesta por nuestra agencia SEO ofrece informaciones útiles sobre los competidores y permite adaptar sus contenidos en consecuencia.