Was der Website-Check prüft
Die meisten Checks sehen nur die Startseite. Ob eine Unterseite aus der Sitemap noch antwortet, ob ein Link im Footer ins Leere führt oder ob die Staging-Einstellung „noindex“ nach dem Relaunch stehen geblieben ist, merkt man sonst erst Wochen später an der Search Console oder an sinkenden Besucherzahlen. Der Website-Check macht in einem Lauf, was ein Crawler zuerst tut:
- robots.txt: Sperrt sie mit „Disallow: /“ für alle Crawler die ganze Website? Welche Sitemap nennt sie?
- Sitemap: Ist unter /sitemap.xml (oder dem Verweis aus der robots.txt) eine lesbare XML-Sitemap? Ein Sitemap-Index wird bis zu drei Teilsitemaps tief gelesen.
- Jede Adresse per GET: Statuscode, Weiterleitungsziel und Antwortzeit. Ein HEAD-Request wäre schneller, aber viele Server beantworten ihn falsch – deshalb der echte Abruf.
- noindex: Meta-Tag robots oder Header X-Robots-Tag auf einer Seite, die in der Sitemap steht – ein Widerspruch, dem Suchmaschinen mit Nicht-Indexieren folgen.
- Canonical: Fehlt das Tag, oder zeigt es auf eine andere Adresse? Schrägstrich am Ende und http statt https zählen nicht als Abweichung.
- Interne Links der Startseite: Bis zum Zeitbudget werden Links geprüft, die noch nicht in der Sitemap standen; ein toter Link nennt seine Quelle.
robots.txt und Sitemap richtig
Eine robots.txt gehört in den Stammordner und nennt die Sitemap. Mehr braucht sie meistens nicht; einzelne Pfade sperrt man nur, wenn sie wirklich nicht gecrawlt werden sollen (Suchergebnisseiten, Warenkorb, interne Bereiche):
- „Disallow: /“ unter „User-agent: *“ sperrt alles. Nach einem Relaunch ist das die häufigste vergessene Einstellung – in WordPress steckt sie hinter „Suchmaschinen davon abhalten, diese Website zu indexieren“.
- Die Sitemap muss gültiges XML sein (<urlset> oder <sitemapindex>) und die endgültigen Adressen enthalten: mit https und der richtigen Schreibweise mit oder ohne www, ohne Weiterleitungen.
- Nur Seiten, die indexiert werden sollen: keine 404-Seiten, keine noindex-Seiten, keine Duplikate, die per Canonical woandershin zeigen.
User-agent: *
Disallow: /warenkorb/
Disallow: /suche
Sitemap: https://beispiel.de/sitemap.xmlSo liest du das Ergebnis
Der Check unterscheidet zwischen Fehlern, die Besucher und Rankings kosten, und Hinweisen, die man kennen sollte:
- robots.txt sperrt alles: kritisch. Google nimmt keine neue Seite mehr auf und wirft bestehende nach und nach aus dem Index.
- Kaputte Adresse (4xx, 5xx oder keine Antwort) in der Sitemap oder als interner Link: Warnung. Ab fünf kaputten Adressen kritisch.
- noindex auf einer Sitemap-Adresse und ein Canonical, das auf eine andere Adresse zeigt: Warnung – die Seite steht in der Sitemap, wird aber nicht indexiert.
- Fehlende Sitemap, Weiterleitung in der Sitemap und fehlendes Canonical: Hinweise. Ohne Sitemap findet Google neue Seiten nur über Links.
- Unvollständig: Das Zeitbudget war vor dem Ende aufgebraucht, etwa bei einer langsamen Website. Startseite und Sitemap kommen immer zuerst dran.
Häufige Fehler
- Staging-Einstellungen im Livebetrieb: noindex oder „Disallow: /“ aus der Testumgebung bleiben nach dem Umzug stehen. Der Schaden zeigt sich erst nach Wochen.
- Sitemap mit alten Adressen: Nach einer Umstellung der URL-Struktur stehen noch die alten Pfade in der Sitemap und antworten mit 404 oder leiten weiter.
- Canonical auf die falsche Domain: Nach dem Wechsel von http auf https oder von www auf die nackte Domain zeigt das Canonical auf die alte Adresse, weil die Basisadresse im CMS nicht geändert wurde.
- Footer-Links ins Leere: Eine Datenschutz- oder AGB-Seite wurde umbenannt, der Link im Footer auf jeder Seite nicht. Ein toter Link, hundertfach.
- Sitemap-Plugin deaktiviert: Nach einem Plugin-Wechsel liefert /sitemap.xml eine Fehlerseite mit Status 200 – für Google eine ungültige Sitemap, die stillschweigend ignoriert wird.
Website dauerhaft überwachen
Tote Links und falsche noindex-Angaben entstehen nicht beim Relaunch allein, sondern bei jedem Redakteur, der eine Seite löscht oder umbenennt. DomainWarn prüft die Website jeder Kundendomain täglich mit bis zu 50 Sitemap-Adressen und 100 internen Links, meldet jede neue kaputte Adresse als Änderung in der Zeitleiste und eröffnet einen Vorfall, wenn die robots.txt alles sperrt oder viele Seiten gleichzeitig ausfallen. Die Tabelle aller geprüften Adressen steht im Dashboard der Domain.
Häufige Fragen
- Warum nur 20 Adressen?
- Das kostenlose Tool prüft die Startseite, bis zu 19 Adressen aus der Sitemap in ihrer Reihenfolge und danach interne Links der Startseite, solange das Zeitbudget reicht. Das reicht, um die typischen Fehler zu sehen. Der tägliche Check im Monitoring prüft bis zu 50 Sitemap-Adressen und 100 Links.
- Prüft der Check auch Bilder, PDFs und externe Links?
- Interne Links auf PDFs und andere Dateien ja, sofern sie von der Startseite verlinkt sind. Externe Links nicht: Fremde Server zu prüfen wäre langsam und sagt nichts über die eigene Website. Bilder und Skripte werden nicht abgerufen.
- Meine Website hat keine Sitemap – ist das schlimm?
- Ein Hinweis, kein Fehler. Kleine Websites findet Google auch über Links. Ab einigen Dutzend Seiten lohnt sich eine Sitemap aber, und fast jedes CMS erzeugt sie von selbst: WordPress ab 5.5 unter /wp-sitemap.xml, Yoast und Rank Math unter /sitemap_index.xml, Shopware und TYPO3 unter /sitemap.xml.
- Was bedeutet „Canonical zeigt auf eine andere Adresse“?
- Die Seite sagt Suchmaschinen: „Die eigentliche Adresse ist eine andere.“ Das ist richtig bei bewussten Duplikaten (Druckansicht, Filterparameter) und falsch, wenn es jede Seite betrifft – dann stimmt meist die Basisadresse der Website im CMS nicht mehr, etwa nach dem Wechsel auf https.