¿Cómo funciona Googlebot?

Googlebot es un robot de exploración (User-Agent). Estos robots, apodados «web crawlers» o «SEO spiders», analizan y recuperan recursos en páginas web. Aunque sea un simple programa informático, el conocimiento de su funcionamiento resulta crucial en materia de posicionamiento orgánico.
En español, «crawl» puede traducirse por «andar a gatas / reptar»; eso representa la forma en que Googlebot recorre las páginas de la World Wide Web.
El papel del spider SEO de Google
A partir de un directorio de URL ya recorrido (ya crawleado) y completado por los datos Sitemap de los webmasters (esquema de estructura de un sitio), su papel es:
-
Recorrer y descargar los datos de cada sitio web desplazándose de enlace en enlace, de una página a otra.
-
Determinar qué sitio visitar, cuándo y cuántas páginas están ligadas a este último.
-
Repertoriar todos los nuevos dominios que indexar en los motores de búsqueda, las actualizaciones de los sitios, los enlaces hacia las URL y hacia las imágenes, los enlaces muertos.
-
Usa a continuación estos datos para actualizar el índice de Google, además de añadirlos a la lista de URL vista anteriormente.
Cabe señalar que el índice del motor de búsqueda Google es el directorio de miles de millones de sitios web puestos a disposición de los usuarios. Todo contenido nuevo debe indexarse para ser visible desde la SERP (Search Engine Results Pages o página de resultados de búsqueda). La indexación es, por tanto, el hecho de volver un contenido (dominio, sitio web, página, artículo, etc.) accesible para los internautas desde los resultados de búsqueda. Googlebot solo pasa; no legitima en absoluto los contenidos que repertoria: ese es el papel del índice de Google.

Este programa informático representa el punto de partida del posicionamiento orgánico de los sitios web: es la primera etapa de la aparición de un contenido en un motor de búsqueda. El robot oficia de forma simultánea, y en el espacio de unos segundos, desde ordenadores próximos al servidor del sitio. Esta forma de operar permite no perder en prestación ni en alcance, y sobre todo no obstruir el ancho de banda de los servidores analizados. Son cerca de un millón de servidores empleados para recorrer (crawlear) internet; la IP de un robot no es, por tanto, fija.
Experiencia de usuario, frecuencia y presupuesto de crawl
El User-Agent pone un punto de honor en la experiencia de usuario
El robot explora un sitio a la manera de un usuario según una frecuencia que determina él mismo (según la popularidad de su sitio, según sus elecciones técnicas, etc.). Siempre hará de modo que no comprometa la experiencia de usuario. El robot probará entonces el sitio y determinará un límite a la «frecuencia de crawl» (es decir, cuántos PC efectuarán un crawl de forma simultánea y el tiempo de espera entre dos iteraciones) en función de:
-
La conexión del servidor: si el sitio responde rápido durante un período considerable, su límite aumentará. A la inversa, si el sitio tarda en responder o ante el menor error de servidor, su límite disminuirá.
-
El límite de crawl aplicado por los webmasters desde Search Console. Cabe señalar que si lo aumenta, el crawl no se intensificará necesariamente, dado que Googlebot parametriza él mismo sus acciones.

Un presupuesto de crawl que hay que tomar a la ligera
El presupuesto de crawl es la combinación entre la frecuencia de exploración y la cantidad de recursos de crawl. La cantidad de recursos puesta a disposición para una exploración representa el número de conexiones simultáneas hacia una URL y el tiempo de pausa entre dos visitas.
En muchos casos, un sitio web se observa el día de su puesta en línea. Google afirma que el presupuesto de crawl hay que tomarlo a la ligera.
Se pondrán más recursos a disposición de un sitio:
-
Popular, con el fin de mantenerlo actualizado en el índice de Google.
-
En migración, dado el número considerable de URL que indexar.
-
Susceptible de volverse obsoleto. Google defiende la experiencia de usuario y desea así desindexar los sitios abandonados.
Según Google, si su dominio comporta menos de varios miles de URL, entonces se crawleará de forma eficaz. A la inversa, para los sitios o páginas que no hayan estado implicados en ninguna solicitud de indexación, Googlebot restringirá sus capacidades de crawl, incluso si su límite no se ha alcanzado.
Si en su caso se trata de un sitio importante, entonces hay que medir su capacidad para ser recorrido (crawl), es decir, cuántas veces y qué recursos se ponen a disposición para el crawl. En efecto, según la frecuencia de crawl, Googlebot ocupará una porción más o menos importante del ancho de banda de su servidor web; es, por tanto, importante conocer su frecuencia en función de su tráfico.
Defina usted mismo las acciones de Googlebot
Google usa numerosos User-Agent como Googlebot para actuar en la web. Es posible indicarles la marcha a seguir; eche un ojo a la lista de los distintos User-Agent:



Fuente: https://support.google.com/webmasters/answer/1061943?hl=fr&ref_topic=4610900
Existen entonces tres formas de darles directrices:
Tome conocimiento del archivo robots.txt
Es posible indicar a un User-Agent que bloquee su paso por su sitio, pero el simple hecho de bloquear a Googlebot desde el archivo robots.txt equivale a bloquearlos a todos.

Estas dos primeras líneas le dan un acceso total, a la inversa de las dos siguientes.
Por último, le indica la ubicación de los datos Sitemap.
Se habló de ello anteriormente: Googlebot referencia todos los enlaces para seguirlos a continuación y repertoriar todo lo que se encuentra en la página. Dicho esto, puede indicarle si debe seguir un enlace o no.
¡Se impone una nota sobre el archivo robots.txt! Es el archivo leído en primer lugar por Google cuando recorre (crawlea) un sitio; este archivo está presente en lo alto de la carpeta del servidor y su ubicación es determinante: si no está exactamente en lo alto, entonces no existe a los ojos de Google.
Si el archivo robots.txt que contiene la información ligada al User-Agent está presente en su servidor, eso aumentará su credibilidad en materia de posicionamiento. Tanto más cuanto que Google le penaliza si no tiene este archivo, con la anotación: «robots.txt – file not found».
Nota importante: los enlaces atribuidos por «follow» o «nofollow» se repertoriarán y visitarán sin distinción si no existe un archivo robots.txt en el servidor.
Las instrucciones HTTP X-Robots-Tag

Indique a los robots que no indexen esta página al tiempo que les da acceso al contenido.
![]()
Puede combinar varias instrucciones.
Nota: si el atributo index está estipulado, se indexará la integridad del contenido, así como las imágenes.
Las etiquetas Meta
Como para el «X-Robots-Tag», estas etiquetas Meta dan la orden a los robots de recorrer e indexar o no su página.

Directrices para todos los User-Agent sin distinción.

No indexar las imágenes presentes en la página.
Desde Search Console, puede referirse a la página de error de crawl: es aquí donde se anota el menor error de crawl encontrado por Googlebot. Así podrá corregirlos y avanzar.
Sepa que el menor error penaliza su posicionamiento orgánico (SEO), y por tanto su visibilidad. Aunque sea imposible alcanzar cero errores, Google recomienda leer estos informes de forma regular. Por lo demás, su soporte abunda en información, consejos o herramientas sobre el «crawl».
Googlebot es, por tanto, el punto de partida de su posicionamiento orgánico; es así aconsejable y productivo interesarse por él para una buena estrategia SEO. Nuestra agencia SEO está constituida por expertos que analizan a diario el funcionamiento de Googlebot y que pueden acompañarle en sus proyectos SEO.