Über das Blockieren von Suchmaschinen in der robots.txt
Was bedeutet es tatsächlich, blockiert zu werden?
Eine robots.txt-Regel weist einen Crawler an, einen Pfad nicht abzurufen. Wird sie auf die gesamte Website angewendet, hindert sie Suchmaschinen daran, Inhalte zu lesen, und alles, was darauf folgt, funktioniert nicht mehr: Es werden keine neuen Inhalte entdeckt, bestehende Seiten veralten und verschwinden schließlich aus dem Index.
Dieser Checker liest Ihre robots.txt-Datei und meldet, ob Suchmaschinen daran gehindert werden, auf Ihre Website zuzugreifen.
Es handelt sich um die potenziell schädlichste einzelne Zeile, die eine Website enthalten kann – und sie ist nur eine Zeile lang.
Wie es dazu kommt
Fast immer versehentlich und fast immer auf dieselbe Weise: Eine Staging-Website wird mit einer websiteweiten Disallow-Regel erstellt, damit sie nicht in den Suchergebnissen erscheint, und die Datei geht zusammen mit dem Rest des Deployments live.
Content-Management-Systeme haben ihre eigene Variante davon. In den meisten gibt es eine Einstellung wie „Suchmaschinen davon abhalten, die Website zu indexieren“, die während der Entwicklung aktiviert und danach nur selten wieder beachtet wird.
Wenn es passiert, geht äußerlich nichts kaputt. Die Website funktioniert für alle menschlichen Besucher einwandfrei. Deshalb vergehen oft Wochen, bevor jemand den Rückgang des Traffics mit der Ursache in Verbindung bringt.
Blockieren ist nicht dasselbe wie Entfernen
Das ist der Teil, der viele überrascht. Eine blockierte Seite kann weiterhin in den Suchergebnissen erscheinen – ohne Beschreibung –, weil dem Crawler mitgeteilt wurde, dass er sie nicht lesen, aber nicht, dass er sie auslassen soll.
Um eine Seite korrekt aus den Ergebnissen herauszuhalten, benötigen Sie eine Noindex-Direktive. Das bedeutet, dass der Crawler die Seite abrufen können muss, um diese Direktive zu erkennen. Blockierung und Deindexierung wirken in entgegengesetzte Richtungen.
Daher ist robots.txt das falsche Werkzeug für den Datenschutz. Die Datei steuert das Crawling, nicht die Sichtbarkeit, und ist selbst öffentlich zugänglich.
Ist die robots.txt im Jahr 2026 noch relevant?
Sie steht allem anderen voran. Inhalte, Struktur, Geschwindigkeit und Links setzen voraus, dass ein Crawler die Seite überhaupt erreichen kann – und nichts davon hilft, wenn dies nicht möglich ist.
Sie hat inzwischen auch eine zweite Aufgabe übernommen. Dieselbe Datei bestimmt nun, ob KI-Crawler Ihre Website lesen können – und damit, ob Ihre Seiten in generierten Antworten als Quellen zitiert werden können.
Für eine Datei, die normalerweise nur aus einer Handvoll Zeilen besteht, trägt sie unverhältnismäßig viel Verantwortung.
Was dieses Tool prüft
Sie ruft die robots.txt von der eingegebenen Domain ab und zeigt an, ob die darin enthaltenen Regeln Suchmaschinen daran hindern würden, Ihre Website zu crawlen.
Ein bestandener Test bedeutet, dass auf Website-Ebene nichts den Zugriff blockiert. Er bestätigt jedoch nicht, dass einzelne Pfade zugänglich sind. Wenn eine Seite trotz bestandenem Test nicht indexiert wird, sollten Sie sie daher separat überprüfen.
Wie es weitergeht
Wenn das Crawling freigegeben ist, stellt sich als Nächstes die Frage, was entdeckt werden kann und was absichtlich ausgeschlossen ist. Überprüfen Sie die gesamte Datei
robots.txt, stellen Sie sicher, dass Ihre
XML-Sitemap vorhanden und aktuell ist, und bestätigen Sie, dass kein
noindex-Tag stillschweigend das tut, was robots.txt nicht tut.