Semji
SEO

12 min leestijd

Wat is het SEO crawlbudget voor Google? - Semji

Wat is het SEO crawlbudget voor Google?

Het crawlbudget is een sleutelbegrip in SEO. Toch hebben veel mensen moeite om te begrijpen wat er werkelijk achter schuilt… En verwaarlozen het daarom. Nochtans is rekening houden met het bestaan ervan om uw website dienovereenkomstig te optimaliseren ZEER belangrijk, om niet te zeggen essentieel!

In dit artikel helpt ons SEO-bureau u het concept van het crawlbudget voor SEO te begrijpen: definitie van een crawler, hoe een Googlebot werkt, crawlreserve… Aan het einde van deze lezing weet u alles over crawling en hebt u alle sleutels in handen om uw crawlbudget te optimaliseren. Aan de slag!

Wat is een crawler?

Zoals de naam al doet vermoeden, is het de belangrijkste taak van een crawler, ook indexeringsrobot genoemd, om een website te crawlen. Maar wat betekent dat precies?

Alle sites die toegankelijk zijn via de Google-zoekmachine zijn vooraf gecrawld, dat wil zeggen dat een robot de site heeft doorlopen en de inhoud ervan heeft geanalyseerd. Zonder het bestaan van deze robots zou Google niet de onuitputtelijke bron van informatie zijn die we vandaag kennen en dagelijks gebruiken.

Terwijl ze van link naar link gaan, surfen de Googlebots voortdurend over het web, 24 uur per dag en 7 dagen per week. Deze kleine autonome programma’s zijn onophoudelijk op zoek naar nieuwe inhoud en updates. Hun doel? Nieuwe pagina’s indexeren en de zoekmachine helpen ze te ordenen op basis van hun kwaliteit en hun relevantie.

Er bestaan verschillende soorten Google-crawlers om elk gebied te bestrijken:

  • zoeken,
  • mobiel,
  • advertenties,
  • afbeeldingen,
  • video’s…

URL gecrawld door Google

Maak kennis met Googlebot

De indexeringsrobots van het bedrijf uit Mountain View worden gewoonlijk “ Googlebots “ genoemd. Elke zoekmachine heeft zijn eigen hulpmiddelen: Bingbot voor Bing, Slurp voor Yahoo!, Baiduspider voor Baïdu…

Met een marktaandeel van bijna 93% bevindt Google zich wereldwijd in een bijna volledige monopoliepositie.

Marktaandeel van zoekmachines

Bron: Webrankinfo

Begrijpen hoe Googlebot werkt is vandaag essentieel voor iedereen die zijn site geïndexeerd wil krijgen en zichtbaarheid op internet wil verwerven! Dus, hoe werkt het?

De belangrijkste taak van de Googlebot is het web doorlopen, hetzij vanuit een directory met al bekende URL’s, hetzij vanuit de gegevens in de sitemaps, hetzij door van link naar link te springen. Om te zien hoe Googlebot de verschillende delen van uw website bezoekt, kunt u het beroemde robots.txt-bestand gebruiken. Het is ook via dit bestand dat u kunt aangeven welke URL’s niet mogen worden geïndexeerd.

Na de doortocht van een Googlebot wordt de bezochte of gecrawlde pagina geïndexeerd, wat betekent dat ze in de SERP wordt geplaatst. Vanaf dat moment wordt ze zichtbaar en dus toegankelijk voor internetgebruikers via de zoekmachine. Let er echter op dat u indexering en ranking niet met elkaar verwart: de Googlebot bezoekt en inventariseert de pagina’s alleen, terwijl de ranking van die pagina’s in de SERP niet van hem afhangt, maar van een reeks SEO-positioneringscriteria die door Google zijn vastgelegd.

Wat is de crawllimiet?

Het crawlen van een website vergt een bepaalde hoeveelheid serverbronnen. Net zoals een groot aantal bezoekers dat gelijktijdig op een site aanwezig is de server overbelast en de prestaties van de site kan beïnvloeden, kan te veel crawling door de Googlebots een nadeel zijn. Daarom stelt Google voor elke site een crawllimiet vast: de robot bezoekt een bepaald aantal pagina’s tegelijk, niet meer. Dat dient om de laadprestaties, en bijgevolg de kwaliteit van de navigatie van de “ echte “ bezoekers, niet aan te tasten.

Wat is een crawlverzoek?

Een crawlverzoek indienen, ook wel een verzoek tot verkenning, kan nuttig zijn wanneer u recent een pagina hebt toegevoegd of nieuwe wijzigingen aan een site hebt aangebracht.

Als u geen crawlverzoek indient, betekent dit dat u geduldig moet wachten tot de Googlebot langskomt. En dat kan enkele dagen of enkele weken duren, afhankelijk van het type site en de gebruikelijke frequentie waarmee de robot langskomt.

Media, sites met actueel nieuws en marktplaatsen worden zeer vaak bijgewerkt en daarom meerdere keren per dag door de robots gecrawld. Maar dat is lang niet het geval voor alle sites!

Om zicht te krijgen op de stand van de verkenning van uw pagina’s, is de Search Console-tool een kostbare hulp. Er is ook een tool voor URL-inspectie beschikbaar.

Om een crawlverzoek bij Google in te dienen, hebt u twee mogelijkheden:

  • een URL rechtstreeks bij de index indienen, ideaal bij een klein aantal te verkennen links,
  • een volledige sitemap indienen, wat het beste alternatief is om de verkenning van een website of van een groot aantal URL’s aan te vragen.

URL-inspectie

Wat is een crawlbudgetreserve?

Om het concept van de “ crawlbudgetreserve “ beter te begrijpen, is het belangrijk te weten dat elke site over een bepaalde hoeveelheid middelen beschikt, afhankelijk van zijn bekendheid, zijn belang, zijn updatefrequentie, het aantal pagina’s dat hij bevat… Er spelen verschillende criteria mee.

Als uw site pagina’s met een 4XX-fout of veel verouderde inhoud bevat, moet u weten dat een deel van het crawlbudget dat aan uw site is toegewezen, wordt opgesoupeerd door het verkennen van die pagina’s. Dat betekent dat de Googlebots tijd besteden aan het verkennen van pagina’s die nutteloos blijken te zijn. En terwijl ze daarmee bezig zijn, bezoeken ze geen andere pagina’s, die ongetwijfeld interessanter en strategischer voor uw merk zijn. Er is geen betere manier om uw crawlbudget nutteloos te verspillen…

In plaats van te proberen het aantal door Google verkende URL’s te maximaliseren, kunt u zich beter richten op alle pagina’s die onnodig worden verkend. Samen vormen die URL’s zeker een aanzienlijke crawlbudgetreserve die het interessant zou zijn om te benutten!

Wat kan de crawl van Google vertragen?

Verschillende elementen beïnvloeden direct of indirect de crawlfrequentie van de robots van Google. De uitdaging bestaat erin snel die elementen te identificeren die uw site rechtstreeks treffen, zodat u snel kunt ingrijpen.

Tot de meest voorkomende behoren:

  • de crawler traps, of in het Nederlands “ crawlvallen “. Deze meer of minder omvangrijke problemen in de sitestructuur worden vaak als boosdoener aangewezen en kunnen uw SEO ernstig belemmeren. Ze vertragen het werk van de crawlers aanzienlijk, bijvoorbeeld wanneer er een oneindig aantal irrelevante URL’s bestaat. De robots verdwalen dan in de diepten van de architectuur en de pagina’s van uw site in plaats van naar uw strategische pagina’s toe te werken. Facetnavigatie of automatisch gegenereerde parameteriseerbare URL’s zijn goede voorbeelden. Dag crawlbudget!
  • de updatefrequentie van de site. Stel u voor dat de Googlebots gewend zijn uw site 4 keer per week te bezoeken en er altijd nieuwe inhoud vinden om te indexeren. Als u plots stopt met het bijwerken van uw site, blijven de robots ze bezoeken, maar stellen ze tijdens hun bezoeken geen enkele update meer vast. Na verschillende vergeefse bezoeken zullen ze de gewoonte aannemen om uw site minder vaak te crawlen. Omgekeerd kan het regelmatig verversen van de inhoud de crawl van uw site op die pagina in zekere zin “ aanzwengelen “.
  • de laadtijd van de site. Bij een trage site worden bij elke doortocht van een crawler slechts enkele pagina’s gecrawld, terwijl bij een goed presterende site de verkenningsgraad toeneemt.
  • de redirects en redirectlussen. Echte doodlopende wegen voor de robots; dit soort links verspilt veel crawlbudget voor niets!
  • een te complex en te diep architectuurniveau. Dit soort problemen leidt ertoe dat weinig relevante pagina’s worden bezocht, terwijl de interessantste dat niet worden…
  • een slechte paginering. Op een forum bijvoorbeeld is het bezoek van een robot aan pagina’s 2, 3, 4, 5 niet noodzakelijk nuttig!
  • een te groot aantal JavaScript-scripts dat moet worden geladen. Het crawlen van JavaScript-code is lang en omslachtig voor de servers, vereist het ophalen van alle bronnen en blijkt een echte bodemloze put voor uw crawlbudget te zijn…
  • gedupliceerde inhoud. Als uw site interne gedupliceerde inhoud bevat, verbruikt uw crawlbudget zichzelf, want de robot komt meerdere keren over dezelfde inhoud… Net zoals inhoud van lage kwaliteit, zoals FAQ’s, onnodig crawlbudget verbruikt…
  • Mobile First. Het is belangrijk om de doortocht van de Googlebot voor mobiel te vergelijken met die voor desktop. Meer dan ooit één devies: denk Mobile First!

Bezoeken per apparaat

Een onbestaande sitemap, of een sitemap die niet is bijgewerkt terwijl er wel wijzigingen op de site hebben plaatsgevonden, kan ook aan de oorsprong liggen van een vertraging van de crawl van Google.

Waarom moet u zich om uw crawlbudget bekommeren?

Voor sommige webmasters en SEO-experts verdient het crawlbudget niet dat men er lang bij stilstaat. Voor anderen vraagt dit element bijzondere aandacht. Dus, hoe zit het nu echt?

Gezien de astronomische hoeveelheid pagina’s die op internet aanwezig zijn, zijn de crawlers verplicht om aan elke website een vooraf bepaalde – en vooral niet uitbreidbare – verkenningsbron toe te kennen. Ja, er moet voor iedereen genoeg zijn! Wilt u dat uw site, en meer bepaald uw strategische pagina’s, snel worden geïndexeerd? Denk dan aan het optimaliseren van uw crawlbudget.

Om de gunstige effecten van de optimalisatie van uw crawlbudget vast te stellen, is de techniek eenvoudig: vergelijk het aantal nieuwe gecrawlde pagina’s vóór VS na de optimalisatie.

URL-crawl door Google

Hoeveel URL’s van mijn site worden er dagelijks verkend?

Om precies te weten hoeveel URL’s er door Google worden gecrawld, is de analyse van de logbestanden de meest onfeilbare methode, en dat is niet zonder reden: ze maakt duidelijk welk beeld van uw site aan de zoekmachines wordt teruggegeven. Met die analyse kunt u onder meer informatie verzamelen zoals de gecrawlde pagina’s, categorieën en delen van de site, de crawlfrequentie en de informatie die over die verschillende pagina’s is ontvangen.

Zoals zo vaak zal ook de beroemde Search Console u zeer belangrijke informatie over het crawlen van uw site verschaffen.

Crawlstatistieken

Gedownloade gegevens

Bestudeert u liever de crawl van uw pagina’s één voor één? Dan wordt de URL-inspecteur in Search Console uw beste vriend! De feedback van de tool over de betreffende pagina geeft u een overzicht van de verbeterpunten waaraan u kunt werken.

Hoe kunt u uw crawlbudget optimaliseren?

Gelet op alle elementen die eerder in dit artikel zijn genoemd, bestaan er verschillende technieken die, gecombineerd, het crawlbudget aanzienlijk kunnen verbeteren. Met het oog op SEO-optimalisatie is het raadzaam na te denken over hoe u die kostbare bron die het crawlbudget is, kunt sparen.

Identificeer de pagina’s die onnodig crawlbudget verbruiken

Op bijna elke site worden talrijke pagina’s door de robots gecrawld terwijl dat niet nodig zou zijn. Die verspilling van crawlbudget belemmert bovendien de SEO-prestaties van de site.

Via de Search Console kunt u zien hoeveel pagina’s er wel worden gecrawld, maar niet worden geïndexeerd. Die gegevens bieden een eerste overzicht van het crawlbudget dat aan andere, belangrijkere en strategischere pagina’s zou kunnen worden besteed. Maar het is echt dankzij de loganalyse dat u precies zult weten hoeveel crawlbudget er wordt verspild. De techniek bestaat erin het aantal gecrawlde pagina’s te vergelijken met het totale aantal pagina’s van de site om te bepalen:

  • welk percentage van de site wordt gecrawld?
  • welke pagina’s die strategisch zijn voor uw SEO worden niet gecrawld?
  • welke pagina’s verbruiken onnodig crawlbudget?

Crawlbudget Screaming Frog

Bron: Screamingfrog

Leid de Googlebot naar de strategische pagina’s

Hoewel de boomstructuur van uw site in de eerste plaats voor de gebruiker moet worden ontworpen, zou het een vergissing zijn om het gedrag en de verwachtingen van de verkenningsrobots te verwaarlozen.

Het de robots gemakkelijk maken om de pijlerpagina’s van uw site te bezoeken is een uitstekende manier om de indexering ervan te versnellen. Het aantal handelingen dat nodig is om op die pagina’s te komen, moet tot maximaal 3 beperkt blijven.

De kwaliteit van de interne linkstructuur zal ook bepalend zijn voor het traject van de robots. Om die reden mogen de pagina’s die van veel links profiteren, niet willekeurig worden gekozen.

Interne linkstructuur Oncrawl

Bron: Oncrawl

Waak over de nauwkeurigheid van het robots.txt-bestand

Om een onnodig verbruik van crawlbudget te vermijden, is het belangrijk om via het robots.txt-bestand alle URL’s aan te geven die niet mogen worden verkend. Door bepaalde URL’s te blokkeren, kunt u de crawl automatisch omleiden naar nuttige pagina’s.

Alle pagina’s die de tag bevatten, worden niet geïndexeerd, maar ze worden wel degelijk gecrawld. Aarzel niet om al die bewust niet-geïndexeerde pagina’s te bekijken en ze indien nodig aan het zicht van de verkenningsrobots te onttrekken.

Om uw crawlbudget te optimaliseren, moet u absoluut weten welke pagina’s door de robots worden bezocht en welke niet. Als uw site niet regelmatig door de Googlebots wordt gecrawld, betekent dat ongetwijfeld dat een groot deel van uw pagina’s niet wordt verkend en dus noch geïndexeerd noch gerangschikt wordt… Dus onzichtbaar voor internetgebruikers: een flink verlies aan verkeer! Uw positionering in de SERP wordt daardoor negatief beïnvloed.

Een veelvoorkomende situatie – en nogal vervelend voor uw SEO – is dat de robots een te groot aantal pagina’s van gemiddelde of lage kwaliteit indexeren.

Samengevat zijn de 3 gouden regels die u absoluut moet onthouden om uw crawlbudget te optimaliseren:

  • unieke, originele en relevante inhoud,
  • zeer regelmatige updates van uw site,
  • een optimale laadsnelheid van uw pagina’s.

Wilt u profiteren van de expertise van ons SEO-bureau om uw crawlbudget en uw natuurlijke vindbaarheid te optimaliseren? Aarzel niet om contact met ons op te nemen!

Met uw eigen merk

Zie waar AI-engines u noemen

Semji houdt bij welke prompts uw merk laten opduiken in ChatGPT, Google AI Overviews, Perplexity, Gemini, Claude en DeepSeek, en laat zien welke content de hiaten dicht.

ChatGPTGoogle AI OverviewsPerplexityGeminiClaudeDeepSeek

Door

  • Semji

Luister naar dit artikel

0:00 / ~16:16

Deel dit artikel