Semji

Hoe werkt de Googlebot?

Gids Googlebot SEO

Googlebot is een crawlrobot (User-Agent). Die robots, bijgenaamd „webcrawlers” of „SEO spiders”, analyseren en halen bronnen op van webpagina’s. Ook al is het een eenvoudig computerprogramma, de kennis van de werking ervan is cruciaal voor organische ranking.

In het Nederlands kan „crawl” worden vertaald als „kruipen”, wat de manier weergeeft waarop Googlebot de pagina’s van het World Wide Web doorloopt.

De rol van de SEO-spider van Google

Vanuit een map van al bezochte URL’s (al gecrawld) en aangevuld met de Sitemap-gegevens van webmasters (schema van de structuur van een site), is de rol:

  • De gegevens van elke website doorlopen en downloaden, van link naar link, van de ene pagina naar de andere.

  • Bepalen welke site te bezoeken, wanneer en hoeveel pagina’s daaraan gekoppeld zijn.

  • Alle nieuwe te indexeren domeinen in de zoekmachines inventariseren, de updates van sites, de links naar URL’s en naar beelden, de dode links.

  • Die gegevens vervolgens gebruiken om de Google-index bij te werken, naast ze toe te voegen aan de eerder genoemde URL-lijst.

Merk op dat de index van de zoekmachine Google de map is van miljarden websites die ter beschikking van gebruikers staan. Elke nieuwe content moet geïndexeerd worden om zichtbaar te zijn vanuit de SERP (Search Engine Results Pages of pagina met zoekresultaten). Indexatie is dus het toegankelijk maken van content (domein, website, pagina, artikel, enz.) voor internetgebruikers vanuit de zoekresultaten. Googlebot komt alleen langs; hij legitimeert de geïnventariseerde content niet, dat is de rol van de Google-index.

Index Google

Dit computerprogramma is het startpunt van de organische ranking van websites, de eerste stap van het verschijnen van content in een zoekmachine. De robot werkt gelijktijdig, en in enkele seconden, vanuit computers dicht bij de siteserver. Die werkwijze laat toe geen prestatie of bereik te verliezen, en vooral de bandbreedte van de geanalyseerde servers niet te verstoppen. Ongeveer een miljoen servers worden ingezet om internet te crawlen; het IP van een robot is dus niet vast.

Gebruikerservaring, frequentie en crawlbudget

De User-Agent hecht groot belang aan de gebruikerservaring

De robot verkent een site zoals een gebruiker, volgens een frequentie die hij zelf bepaalt (volgens de populariteit van uw site, volgens uw technische keuzes, enz.). Hij zal er altijd voor zorgen de gebruikerservaring niet in het gedrang te brengen. De robot test vervolgens de site en bepaalt een limiet voor de „crawlfrequentie” (hoeveel pc’s gelijktijdig een crawl uitvoeren en de wachttijd tussen twee iteraties) in functie van:

  • De serververbinding: als de site langere tijd snel antwoordt, stijgt de limiet. Omgekeerd, als de site traag antwoordt of bij de geringste serverfout, daalt de limiet.

  • De crawl-limiet die webmasters instellen vanuit de Search Console. Merk op dat als u die verhoogt, de crawl niet per se intensiever wordt, omdat Googlebot zelf de acties parametriseert.

Crawl Search Console

Een crawlbudget dat u licht mag opvatten

Het crawlbudget is de combinatie van de verkenningsfrequentie en de hoeveelheid crawlbronnen. De hoeveelheid bronnen die voor een verkenning beschikbaar is, staat voor het aantal gelijktijdige verbindingen naar een URL en de pauzetijd tussen twee bezoeken.

In veel gevallen wordt een website geobserveerd op de dag van de online plaatsing. Google stelt dat het crawlbudget licht mag worden opgevat.

Meer bronnen worden ter beschikking gesteld voor een site die:

  • Populair is, om die up-to-date te houden in de Google-index.

  • In migratie is, gezien het aanzienlijke aantal te indexeren URL’s.

  • Dreigt verouderd te worden. Google bepleit de gebruikerservaring en wil zo verlaten sites de-indexeren.

Volgens Google, als uw domein minder dan enkele duizenden URL’s telt, wordt het doeltreffend gecrawld. Omgekeerd, voor sites of pagina’s die bij geen enkele indexatieaanvraag betrokken waren, beperkt Googlebot de crawlcapaciteit, zelfs als de limiet niet is bereikt.

Als het in uw geval om een belangrijke site gaat, moet u de crawlbaarheid meten, namelijk hoe vaak en welke bronnen voor de crawl beschikbaar zijn. Volgens de crawlfrequentie zal Googlebot immers een groter of kleiner deel van de bandbreedte van uw webserver innemen; het is dus belangrijk die frequentie te kennen in functie van uw verkeer.

Bepaal zelf de acties van Googlebot

Google gebruikt veel User-Agents zoals Googlebot om op het web te handelen. U kunt hun de te volgen weg aangeven; bekijk de lijst van de verschillende User-Agents:

Verkenningsrobots

Verkenningsrobots

Verkenningsrobots

Bron: https://support.google.com/webmasters/answer/1061943?hl=fr&ref_topic=4610900

Er bestaan dan drie manieren om hun richtlijnen te geven:

Leer het bestand robots.txt kennen

U kunt een User-Agent aangeven de doorgang op uw site te blokkeren, maar Googlebot alleen blokkeren vanuit het bestand robots.txt komt erop neer ze allemaal te blokkeren.

Googlebot robots.txt

Die twee eerste regels geven hem volledige toegang, in tegenstelling tot de twee volgende.

Tot slot geeft u hem de locatie van de Sitemap-gegevens.

We zeiden het eerder: Googlebot inventariseert alle links om ze vervolgens te volgen en alles te catalogeren wat op de pagina staat. U kunt hem echter aangeven of hij een link moet volgen of niet.

Een nota over het bestand robots.txt is nodig! Het is het bestand dat Google als eerste leest wanneer het een site crawlt; dit bestand staat helemaal bovenaan in de servermap en de locatie is bepalend: als het niet exact bovenaan staat, bestaat het niet in de ogen van Google.

Als het bestand robots.txt met de informatie over de User-Agent op uw server aanwezig is, verhoogt dat uw geloofwaardigheid op het vlak van ranking. Google bestraft u bovendien als u dat bestand niet hebt, met de annotatie: „robots.txt – file not found”.

Belangrijke nota: de links die „follow” of „nofollow” krijgen, worden zonder onderscheid geïnventariseerd en bezocht als er geen robots.txt-bestand op de server bestaat.

De HTTP-instructies X-Robots-Tag

Instructie X-Robot

Geef de robots aan deze pagina niet te indexeren, terwijl u wel toegang tot de content geeft.

Instructie X-Robot

U kunt meerdere instructies combineren.

Nota: als het attribuut index erin staat, worden de volledige content en de beelden geïndexeerd.

De metatags

Net als bij de „X-Robots-Tag” geven deze metatags de robots de opdracht uw pagina wel of niet te doorlopen en te indexeren.

Metatags Robots

Richtlijnen voor alle User-Agents zonder onderscheid.

Metatags Robots

De beelden op de pagina niet indexeren.

Vanuit de Search Console kunt u zich richten tot de pagina met crawl-fouten; daar wordt de geringste crawl-fout die Googlebot tegenkomt geannoteerd. U kunt ze zo corrigeren en verder gaan.

Weet dat de geringste fout uw organische ranking (SEO) bestraft, en dus uw zichtbaarheid. Ook al is het onmogelijk tot nul fouten te komen, Google beveelt aan die rapporten regelmatig te lezen. Hun support wemelt trouwens van informatie, raad of tools over de „crawl”.

Googlebot is dus het startpunt van uw organische ranking; het is dan ook verstandig en productief er interesse voor te hebben voor een goede SEO-strategie. Ons SEO-bureau bestaat uit experts die dagelijks de werking van Googlebot analyseren en u op uw SEO-projecten kunnen begeleiden.

Gerelateerde gidsen