Semji

Een website crawlen: methodes en technieken

Website crawlen

Inzake organische ranking stellen zich meerdere bekommernissen. Het gaat onder meer om de structuur, de interne linking, de volumetrie of nog de boomstructuur van de website.

Het crawlen van een platform blijft dus een onmisbare operatie om de SEO (Search Engine Optimization) van een site te optimaliseren. Wat zijn dan de methodes en de technieken om een website te crawlen?

Een site crawlen: wat is dat?

Crawlen betekent letterlijk “scannen”. Anders gezegd, het gaat erom een maximum aan mogelijke informatie uit een website te extraheren. Die analyse laat toe de structuur van een site perfect te kennen en de eventuele problemen op te lossen. Bijvoorbeeld een slecht geconstrueerde boomstructuur, een inadequate interne linking of nog gedupliceerde meta-tags.

Met andere woorden, de crawlersoftware (of indexatierobot) zoekt documenten op internet. Dat duidt dus de verkenning van het web aan om de navigatie te automatiseren. Zoekmachines zijn uitgerust met verkenningsrobots om de indexering te verzekeren; de beroemdste blijft Googlebot, die van Google. Tijdens de operatie doorloopt Googlebot de content van de site alsook de aanwezige links. Op die manier maakt dit informaticaprogramma sitemaps. Die vergemakkelijken het werk van de crawlers. Naast de indexering van de zoekmachines behoren het zoeken van andere informatie, met name RSS-feeds en het e-mailadres, tot de taken van de verkenningssoftware.

Na de analyse wordt het resultaat naar de catalogus van Google gestuurd, wat de aanwezigheid van de site in de index van de zoekmachines bevestigt. Die aanwezigheid impliceert daarentegen geen betere organische ranking.

Deze procedures zijn onmisbaar om de relevantie van de content van de sites te verzekeren en zo nutteloze URL’s uit de databanken te sluiten. De aanwezigheid van bepaalde tags, met name de tag “noindex”, belet de zoekmachines de pagina van de site te indexeren. Slechts een deel van zijn site indexeren kan verstandig zijn, met name in het licht van de strategie van organische ranking.

Crawlbudget

Wat is het crawlbudget?

Het crawlbudget dient om het aantal pagina’s aan te duiden dat Googlebot doorloopt. Elke site beschikt dus over zijn eigen budget, maar het quotum berust op het totale aantal pagina’s alsook op de gezondheid van de website. Dit budget is beschikbaar in de Google Search Console.

Het aantal analyses onderstreept het belang van een bestand ten opzichte van andere. Daarvoor moet u de analysefrequentie onderzoeken, de pagina’s zonder belang voor de robot identificeren en de fouten die hij tijdens zijn parcours tegenkomt. Software is u onmisbaar voor een dergelijke analyse, die deel uitmaakt van de SEO-audit. Botify is dus een betalende tool die uitstekende rapporten biedt. Merk op dat deze tool past bij sites van meer dan 10.000 pagina’s. Oncrawl is een goedkopere oplossing en een tool in duidelijke vooruitgang. Tot slot is Screaming Frog, uitsluitend in het Engels, een zeer volledige en performante tool.

De invloedsfactoren van de crawl

De crawltechniek werkt volgens meerdere verschillende factoren.

De links: de eerste invloedsfactoren van de crawl

Websites zijn bijzonder talrijk op internet. Toch profiteren sommige van een betere positionering ten opzichte van andere. Wat men netlinking noemt, de linkstrategie, vormt deels de factoren die verantwoordelijk zijn voor die positionering. Het gaat om:

  • De backlinks die een fundamentele plaats innemen in de plaatsing van een pagina; de backlinks of de inkomende links zijn de links die ernaar wijzen. Ze komen van externe sites. Google voert echter een selectie van geldige backlinks uit volgens de kwaliteit en het vertrouwen, de nabijheid, de redirectiemodus alsook de situatie van de link in de bronsite.

  • De interne linking die tot de invloedsfactoren van de crawl behoort. Dat zijn de links die naar dezelfde site wijzen. Die interne links bevorderen niet alleen de SEO van een website, maar houden de gebruikers ook actief op de site door hen naar complementaire informatie te leiden.

Google-content

De content: een belangrijk element in de crawltechniek

Het is gebruikelijk te zeggen dat content koning is (“Content is king”). Effectief speelt hij een belangrijke rol, zowel in SEO als in de crawl. Meerdere elementen nemen een belangrijke plaats in bij deze operatie:

  • De domeinnaam is kapitaal, want domeinnamen die van een betere positionering profiteren, genereren een hoge crawlratio. Het is bijgevolg primordiaal om de juiste domeinnaam te kiezen.

  • De sitemap is een XML-bestand dat de lijsten van te indexeren URL’s aangeeft. Dit bestand wordt met alle CMS’en gebruikt om Google te informeren over de updates van de site.

  • Duplicate content behoort tot de verantwoordelijken van een slechte crawl, of zelfs van een penalty van de zoekmachines, zoals Google die er een van zijn prioriteiten van heeft gemaakt.

  • Canonieke URL’s zijn onmisbaar om een betere crawl en een betere positionering van de site te verzekeren. Het gaat om de tag “rel canonical” die de originele content van een site preciseert in geval van gedupliceerde content.

  • Meta-tags bestaan uit een HTML-tag die wordt gebruikt om zoekwoorden in te voegen die onzichtbaar zijn voor internetgebruikers, maar toegankelijk voor zoekmachines. Die zoekwoorden optimaliseren de organische ranking van een site.

Hoe crawlt u een website?

Om een website perfect te crawlen, kunt u voor meerdere methodes kiezen: de “Cell text” of de “Follow mode”.

Eerste methode: de “Cell text”

In een eerste tijd verbindt u zich met uw interface Google Search Console. Open vervolgens de bestaande sitemap. Bij afwezigheid van een vooraf bestaande sitemap maakt u er een nieuwe. Klik op de optie “Import/Export” boven de sitemap. Kies de optie Import en voer vervolgens de URL van uw site in in het lege veld onder de vermelding “Use an existing site”. Klik daarna op het tabblad “Use File/Directory” om de naam van een bestand en van een directory in het etiket van de sitemap te tonen. De URL wordt zo gebruikt als toegangspad in de vorm van cell text. Klik vervolgens op “Use H1” om een header in het etiket van de sitemap op te nemen. Klik daarna op “Use page title”. Vink tot slot de optie “Exclude common text pages on import” aan om de URL’s met gedupliceerde teksten uit te sluiten.

Tweede methode: de “Follow mode”

Nadat u verbonden bent met de sitemap, klikt u op de te crawlen domeinen en subdomeinen. Als u enkel de meest relevante domeinen wilt crawlen, selecteert u “Domain only”. Klik vervolgens op “Domain and directory path only” als u de toegang tot bepaalde specifieke domeinen wilt beperken. Klik daarna op “Add link” om een URL te integreren, en vervolgens op “Add meta description note” om enkele notities in het deel meta description op te nemen.

Definieer een aantal te importeren URL’s in het lege veld onder de vermelding “Limit number of pages”. De optie Omit directory sluit de specifieke directories uit die u tijdens de crawl wilt vermijden. De directory gaat vergezeld van een sterretje (*) als die elementen subdirectories bevatten. Klik tot slot op Import.

Het belang van de crawl in uw strategie

Uw website crawlen is bijzonder nuttig, zowel voor de indexering op de zoekmachines als voor de SEO-strategie.

De rol van de crawl in de indexering van de site

Het crawlen van een site is een bepalend element voor de ranking in de organische resultaten van Google. De verkenningsrobots beletten uw site te crawlen, schrapt de kansen om zichtbaarheid te krijgen binnen de SERP (zoekresultaten van Google).

Google heeft in dat verband bevestigd dat Googlebot in staat blijft JavaScript- en CSS-bestanden te exploiteren en zo uw site in zijn index te plaatsen. De Amerikaanse firma is bovendien in staat het DOM of “Document Object Model” (model van een site dat de browser interpreteert vanuit de broncode) van een URL te analyseren. De SEO-signalen in het DOM worden gecrawld en geïndexeerd. In bepaalde gevallen kunnen die signalen het voorwerp van een tegenstrijdigheid in de HTML zijn. Gelukkig is dit kleine probleem in oplossing.

De rol van de crawl in de SEO-strategie

Een website crawlen blijkt vandaag kapitaal om een SEO-audit uit te voeren. De crawl laat immers toe de structurele verbeteringen te belichten die aan een website moeten worden aangebracht. Deze operatie bevestigt ook de acties die moeten worden ondernomen om de site te optimaliseren. De crawl onthult de structuur van de site, de toegang tot de pagina’s, de bronnen van de problemen, de volumetrie (aantallen en categorieën van pagina’s), het aantal links van elke URL, de laadtijd, de diepte van de pagina’s (gedefinieerd door de interne linking), de broncodes, de relevante en nutteloze URL’s alsook de aanwezigheid en het percentage duplicate content.

Die voornaamste bronnen van imperfecties ontdekken laat dus toe de oplossingen te anticiperen. Bovendien verzekert een regelmatige crawl de gezondheid van de website. Deze operatie, voorgesteld door ons SEO-bureau, biedt nuttige inlichtingen over de concurrenten en laat toe de content daarop aan te passen.

Gerelateerde gidsen