Eine Website crawlen: Methoden und Techniken

Beim natürlichen Ranking stellen sich mehrere Fragen. Es geht unter anderem um Struktur, internes Linking, Volumetrie oder die Baumstruktur der Website.
Der Crawl einer Plattform bleibt daher eine unverzichtbare Operation, um das SEO (Search Engine Optimization) einer Website zu optimieren. Welche Methoden und Techniken gibt es, um eine Website zu crawlen?
Eine Website crawlen: Was ist das?
Crawlen bedeutet wörtlich „scannen“. Anders gesagt: möglichst viele Informationen von einer Website zu extrahieren. Diese Analyse erlaubt es, die Struktur einer Website genau zu kennen und mögliche Probleme zu lösen. Zum Beispiel eine schlecht gebaute Baumstruktur, ein unpassendes internes Linking oder doppelte Meta-Tags.
Mit anderen Worten: Die Crawler-Software (oder der Indexierungsroboter) sucht Dokumente im Internet. Das bezeichnet die Erkundung des Netzes, um die Navigation zu automatisieren. Suchmaschinen sind mit Erkundungsrobotern ausgestattet, um die Indexierung zu sichern; der bekannteste bleibt Googlebot, der von Google. Bei der Operation durchläuft Googlebot den Inhalt der Website sowie die vorhandenen Links. So erzeugt dieses Computerprogramm Sitemaps. Diese erleichtern die Arbeit der Crawler. Neben der Indexierung der Suchmaschinen gehören die Suche nach anderen Informationen, insbesondere RSS-Feeds und E-Mail-Adressen, zu den Aufgaben der Erkundungssoftware.
Nach der Analyse wird das Ergebnis in den Katalog von Google geleitet, was die Präsenz der Website im Index der Suchmaschinen bestätigt. Diese Präsenz impliziert jedoch kein besseres natürliches Ranking.
Diese Verfahren sind unverzichtbar, um die Relevanz der Inhalte der Websites zu sichern und so nutzlose URLs aus den Datenbanken auszuschließen. Das Vorhandensein bestimmter Tags, insbesondere des Tags „noindex“, hindert Suchmaschinen daran, die Seite der Website zu indexieren. Nur einen Teil der Website zu indexieren kann sinnvoll sein, insbesondere mit Blick auf die Strategie des natürlichen Rankings.

Was ist das Crawl-Budget?
Das Crawl-Budget bezeichnet die Zahl der von Googlebot durchlaufenen Seiten. Jede Website hat also ihr eigenes Budget, die Quote hängt jedoch von der Gesamtzahl der Seiten sowie von der Gesundheit der Website ab. Dieses Budget finden Sie in der Google Search Console.
Die Zahl der Analysen unterstreicht die Bedeutung einer Datei gegenüber anderen. Dafür müssen Sie die Analysehäufigkeit untersuchen, Seiten ohne Interesse für den Roboter und die auf seinem Weg angetroffenen Fehler identifizieren. Für eine solche Analyse, die Teil des SEO-Audits ist, brauchen Sie Software. Botify ist ein kostenpflichtiges Tool mit ausgezeichneten Berichten. Dieses Tool eignet sich für Websites mit mehr als 10.000 Seiten. Oncrawl ist eine günstigere Lösung und ein Tool im klaren Aufwind. Screaming Frog, ausschließlich auf Englisch, ist ein sehr vollständiges und leistungsfähiges Tool.
Die Einflussfaktoren des Crawls
Die Crawl-Technik funktioniert nach mehreren unterschiedlichen Faktoren.
Die Links: die ersten Einflussfaktoren des Crawls
Websites sind im Internet besonders zahlreich. Dennoch profitieren manche von einer besseren Positionierung als andere. Was man Netlinking nennt, die Linkstrategie, gehört zu den für diese Positionierung verantwortlichen Faktoren. Es handelt sich um:
-
Backlinks, die eine grundlegende Stellung in der Platzierung einer Seite einnehmen; Backlinks oder eingehende Links sind die Links, die auf sie zeigen. Sie stammen von externen Seiten. Google wählt gültige Backlinks jedoch nach Qualität und Vertrauen, Nähe, Weiterleitungsmodus sowie Lage des Links auf der Quellseite.
-
das interne Linking, das zu den Einflussfaktoren des Crawls gehört. Das sind Links, die auf dieselbe Website zeigen. Diese internen Links fördern nicht nur das SEO einer Website, sondern halten Nutzerinnen und Nutzer auch aktiv auf der Website, indem sie sie zu ergänzenden Informationen führen.

Der Inhalt: ein zentrales Element in der Crawl-Technik
Es ist üblich zu sagen, dass der Inhalt König ist („Content is king“). Tatsächlich spielt er eine zentrale Rolle, im SEO wie im Crawl. Mehrere Elemente nehmen in dieser Operation eine zentrale Stellung ein:
-
Der Domainname ist entscheidend, weil Domainnamen mit besserer Positionierung eine hohe Crawl-Rate erzeugen. Es ist daher wesentlich, den richtigen Domainnamen zu wählen.
-
Die Sitemap ist eine XML-Datei, die die Listen der zu indexierenden URLs angibt. Diese Datei wird mit allen CMS genutzt, um Google über Aktualisierungen der Website zu informieren.
-
Duplicate Content gehört zu den Ursachen eines schlechten Crawls oder sogar einer Strafe der Suchmaschinen, etwa von Google, das daraus eine seiner Prioritäten gemacht hat.
-
Kanonische URLs sind unverzichtbar, um einen besseren Crawl und eine bessere Positionierung der Website zu sichern. Es handelt sich um den Tag „rel canonical“, der bei doppeltem Inhalt den Originalinhalt einer Website angibt.
-
Meta-Tags bestehen aus einem HTML-Tag, der Keywords einfügt, die für Nutzerinnen und Nutzer unsichtbar, für Suchmaschinen jedoch zugänglich sind. Diese Keywords optimieren das natürliche Ranking einer Website.
Wie crawlen Sie eine Website?
Um eine Website einwandfrei zu crawlen, können Sie mehrere Methoden wählen: „Cell text“ oder „Follow mode“.
Erste Methode: „Cell text“
Melden Sie sich zunächst in Ihrer Oberfläche der Google Search Console an. Öffnen Sie danach die vorhandene Sitemap. Fehlt eine bestehende Sitemap, erstellen Sie eine neue. Klicken Sie oberhalb der Sitemap auf die Option „Import/Export“. Wählen Sie die Option Import und tragen Sie die URL Ihrer Website in das leere Feld unter der Angabe „Use an existing site“ ein. Klicken Sie danach auf den Tab „Use File/Directory“, um den Namen einer Datei und eines Verzeichnisses im Etikett der Sitemap anzuzeigen. So wird die URL als Pfad in Form von Cell text genutzt. Klicken Sie danach auf „Use H1“, um eine Überschrift ins Etikett der Sitemap aufzunehmen. Klicken Sie danach auf „Use page title“. Zum Schluss aktivieren Sie die Option „Exlude common text pages on import“, um URLs mit doppelten Texten auszuschließen.
Zweite Methode: „Follow mode“
Nachdem Sie sich an der Sitemap angemeldet haben, klicken Sie auf die zu crawlenden Domains und Subdomains. Wenn Sie nur die relevantesten Domains crawlen wollen, wählen Sie „Domain only“. Klicken Sie danach auf „Domain and directory path only“, wenn Sie den Zugang auf bestimmte Domains beschränken wollen. Klicken Sie danach auf „Add link“, um eine URL aufzunehmen, und auf „Add meta description note“, um einige Notizen im Teil Meta Description einzuschließen.
Legen Sie eine Zahl zu importierender URLs im leeren Feld unter der Angabe „Limit number of pages“ fest. Die Option Omit directory schließt bestimmte Verzeichnisse aus, die beim Crawl zu vermeiden sind. Das Verzeichnis wird von einem Stern (*) begleitet, wenn diese Elemente Unterverzeichnisse einschließen. Zum Schluss klicken Sie auf Import.
Die Bedeutung des Crawls in Ihrer Strategie
Eine Website zu crawlen ist besonders nützlich, sowohl für die Indexierung in den Suchmaschinen als auch für die SEO-Strategie.
Die Rolle des Crawls bei der Indexierung der Website
Der Crawl einer Website ist ein entscheidendes Element für ihre Platzierung in den natürlichen Ergebnissen von Google. Die Erkundungsroboter am Crawl Ihrer Website zu hindern, nimmt die Chancen auf Sichtbarkeit in der SERP (Google-Suchergebnisse).
Google hat dazu erklärt, dass Googlebot weiterhin in der Lage bleibt, JavaScript- und CSS-Dateien zu nutzen und Ihre Website so in seinen Index zu setzen. Die amerikanische Firma kann außerdem das DOM oder „Document Object Model“ (Modell einer Website, das der Browser aus dem Quellcode interpretiert) einer URL analysieren. Die SEO-Signale im DOM werden gecrawlt und indexiert. In manchen Fällen können diese Signale im HTML widersprüchlich sein. Dieses kleine Problem ist glücklicherweise in der Lösung.
Die Rolle des Crawls in der SEO-Strategie
Eine Website zu crawlen ist heute entscheidend, um ein SEO-Audit durchzuführen. Der Crawl hebt die strukturellen Verbesserungen hervor, die an einer Website vorzunehmen sind. Diese Operation bestätigt außerdem die Maßnahmen, die zur Optimierung der Website nötig sind. Der Crawl legt die Struktur der Website offen, den Zugang zu den Seiten, die Quellen der Probleme, die Volumetrie (Zahlen und Kategorien von Seiten), die Zahl der Links jeder URL, die Ladezeit, die Tiefe der Seiten (definiert durch das interne Linking), die Quellcodes, relevante und nutzlose URLs sowie das Vorhandensein und die Rate von Duplicate Content.
Diese wesentlichen Quellen von Unvollkommenheiten zu entdecken erlaubt es, Lösungen vorwegzunehmen. Ein regelmäßiger Crawl sichert außerdem die Gesundheit der Website. Diese Operation, die unsere SEO-Agentur anbietet, liefert nützliche Angaben zu den Wettbewerbern und erlaubt es, die Inhalte entsprechend anzupassen.