Über das Blockieren von KI-Crawlern
Welche Crawler sind gemeint?
Die KI-Unternehmen betreiben eigene benannte Crawler, die von den Ihnen bereits bekannten Such-Crawlern getrennt sind. GPTBot und OAI-SearchBot gehören zu OpenAI, ClaudeBot zu Anthropic, PerplexityBot zu Perplexity, Google-Extended steuert das Training von Gemini, und CCBot speist Common Crawl, aus dem viele Modelle trainiert werden.
Alle befolgen robots.txt auf die übliche Weise. Eine Regel, die ihren User-Agent nennt, entscheidet daher, ob sie Ihre Website auslesen dürfen. Dieser Prüfer liest Ihre robots.txt und meldet, ob diese Crawler blockiert werden.
Blockiert zu werden ist nicht automatisch falsch. Es ist eine Entscheidung, und der Zweck der Überprüfung besteht darin, sicherzustellen, dass es tatsächlich eine bewusste Entscheidung war.
Warum Websites sie versehentlich blockieren
Die häufigste Ursache ist eine pauschale Regel. Eine robots.txt-Datei, die Scraper mit einem umfassenden Disallow-Eintrag fernhalten soll, erfasst auch diese Crawler, ohne dass darauf hingewiesen wird.
Die zweite Ursache ist die Übernahme von Einstellungen. Viele Hosting-Anbieter, Sicherheits-Plugins und CDN-Konfigurationen haben 2023 und 2024 standardmäßig Sperren für KI-Crawler hinzugefügt, und Websites haben diese übernommen, ohne dass sich jemand bewusst dafür entschieden hat.
Das Dritte ist eine Entscheidung, die zum damaligen Zeitpunkt richtig war. Eine Sperre, die hinzugefügt wurde, als es um Trainingsdaten ging, verhindert jetzt auch, dass Ihre Seiten zum Zitieren gelesen werden – das ist ein anderer Kompromiss.
Der Kompromiss, über den es sich nachzudenken lohnt
Diese Crawler führen zwei unterschiedliche Aufgaben aus, die man getrennt betrachten sollte. Einige rufen Inhalte ab, um Modelle zu trainieren, wofür Sie direkt nichts erhalten. Andere rufen Seiten ab, um eine gerade gestellte Frage zu beantworten, und geben die Quelle an.
Das Blockieren der zweiten Art entfernt Sie aus den Antworten, in denen Ihre Wettbewerber erscheinen werden. Die erste Art zu blockieren, ist eine nachvollziehbare Position für einen Publisher, dessen Inhalte das Produkt sind.
Die User-Agents werden genau aus diesem Grund separat dokumentiert, sodass Sie die Crawler zulassen können, die Sie zitieren, und diejenigen ablehnen können, die Inhalte nur konsumieren.
Ist das in 2026 relevant?
Es wird von Jahr zu Jahr relevanter, da ein größerer Anteil der Recherche innerhalb eines Assistenten stattfindet. Eine Seite, die nicht abgerufen werden kann, kann nicht zitiert werden, und kein Ranking-Bericht wird Ihnen anzeigen, dass dies geschieht.
Die Asymmetrie macht es sinnvoll, dies zu überprüfen, statt einfach davon auszugehen. Einen Crawler zuzulassen kostet nichts, wenn Sie Ihre Meinung später ändern; ein Jahr lang aufgrund einer übernommenen Regel unsichtbar zu sein, ist teuer – und bleibt unbemerkt, solange es passiert.
Was dieses Tool prüft
Es ruft Ihre robots.txt ab und sucht nach Regeln, die wichtige KI-Crawler daran hindern würden, Ihre Website zu lesen, und meldet, welche blockiert werden.
Die Datei wird so gelesen, wie sie veröffentlicht ist. Daher wird eine von einem Plugin oder einem CDN hinzugefügte Regel genauso angezeigt wie eine von Ihnen verfasste. Wenn etwas blockiert wird, das Sie nicht blockieren wollten, sollten Sie zuerst dort nachsehen.
Wie es weitergeht
Der Crawling-Zugriff ist das erste von mehreren Hindernissen. Prüfen Sie, ob
Suchmaschinen durch dieselbe Datei blockiert werden, überprüfen Sie die
robots.txt-Datei als Ganzes und stellen Sie sicher, dass Sie eine
llms.txt-Datei veröffentlichen, die auf die lesenswerten Seiten verweist.