Informacje o blokowaniu robotów AI
O jakich robotach mówimy?
Firmy zajmujące się sztuczną inteligencją używają własnych, nazwanych robotów indeksujących, odrębnych od robotów wyszukiwarek, które już znasz. GPTBot i OAI-SearchBot należą do OpenAI, ClaudeBot do Anthropic, PerplexityBot do Perplexity, Google-Extended kontroluje trenowanie modeli Gemini, a CCBot zasila Common Crawl, na podstawie którego trenuje się wiele modeli.
Każdy z nich przestrzega pliku robots.txt w standardowy sposób, więc reguła zawierająca nazwę jego klienta użytkownika decyduje o tym, czy może odczytywać Twoją witrynę. Ten moduł sprawdza plik robots.txt i informuje, czy te roboty indeksujące są blokowane.
Zablokowanie ich nie jest automatycznie błędem. To decyzja, a celem sprawdzenia jest upewnienie się, że rzeczywiście została podjęta świadomie.
Dlaczego strony przypadkowo je blokują
Najczęstszą przyczyną jest ogólna reguła. Plik robots.txt napisany w celu powstrzymania skrobaczy, zawierający szeroką regułę disallow, obejmuje również te roboty, a nic nie informuje o tym, że do tego doszło.
Drugą przyczyną jest dziedziczenie ustawień. Wiele firm hostingowych, wtyczek zabezpieczających i konfiguracji CDN dodało domyślnie blokady robotów AI w latach 2023 i 2024, a strony przejęły te ustawienia bez świadomej decyzji kogokolwiek.
Trzecia to decyzja, która w swoim czasie była słuszna. Blokada dodana w okresie, gdy obawiano się o dane treningowe, obecnie uniemożliwia również odczytywanie stron na potrzeby cytowania, co wiąże się z innym kompromisem.
Kompromis, który warto przemyśleć
Te roboty wykonują dwie różne czynności i warto je rozdzielić. Niektóre pobierają treści w celu trenowania modeli, co nie przynosi Ci żadnych bezpośrednich korzyści. Inne pobierają strony, aby odpowiedzieć na zadawane w danej chwili pytanie i podać źródło.
Blokowanie drugiego rodzaju sprawia, że nie pojawiasz się w odpowiedziach, w których będą występować Twoi konkurenci. Blokowanie pierwszego jest rozsądnym rozwiązaniem dla wydawcy, dla którego treść stanowi produkt.
User-agenty są dokumentowane osobno właśnie z tego powodu, więc możesz zezwolić robotom, które cytują treści, i odmawiać dostępu tym, które tylko je pobierają.
Czy ma to znaczenie w 2026?
Z każdym rokiem ma to coraz większe znaczenie, ponieważ coraz większa część wyszukiwania informacji odbywa się za pośrednictwem asystenta. Strona, której nie można pobrać, nie może zostać zacytowana, a żaden raport pozycji w rankingu nie poinformuje Cię, że tak się dzieje.
To właśnie ta asymetria sprawia, że warto to sprawdzić, zamiast zakładać, że wszystko jest w porządku. Zezwolenie robotowi na dostęp nic nie kosztuje, jeśli później zmienisz zdanie; pozostawanie niewidocznym przez rok z powodu odziedziczonej reguły jest kosztowne — i dzieje się niezauważenie.
Co sprawdza to narzędzie
Pobiera plik robots.txt i wyszukuje reguły, które uniemożliwiałyby głównym robotom AI odczytywanie Twojej witryny, informując, które z nich są zablokowane.
Odczytuje plik w opublikowanej postaci, więc reguła dodana przez wtyczkę lub CDN jest widoczna tak samo jak reguła napisana przez Ciebie. Jeśli coś jest zablokowane, choć nie było to zamierzone, właśnie tam należy najpierw szukać przyczyny.
Co dalej
Dostęp dla robotów to pierwsza z kilku bramek. Sprawdź, czy
wyszukiwarki są blokowane przez ten sam plik, przejrzyj plik
robots.txt w całości i potwierdź, że publikujesz plik
llms.txt wskazujący strony warte przeczytania.