Informacje o możliwości crawlowania witryny
Co oznacza możliwość crawlowania?
Strona może być crawlowana, gdy wyszukiwarka może do niej dotrzeć, ma pozwolenie na jej pobranie i po dotarciu znajduje na niej coś wartego zachowania. Jeśli którykolwiek z tych warunków nie jest spełniony, strona jest w praktyce niewidoczna — niezależnie od tego, jak dobra jest jej treść.
To krok poprzedzający wszystko inne. Rankingi, fragmenty wyników wyszukiwania, cytowania AI — wszystko to zakłada, że strona w ogóle trafiła do indeksu, dlatego rozsądnym pierwszym krokiem, gdy strona po prostu się nie pojawia, jest sprawdzenie możliwości jej crawlowania przez witrynę, zamiast od razu przepisywać treść.
Najtrudniejsze jest to, że każda z tych awarii przebiega po cichu. Nic się nie psuje, nie pojawia się żaden błąd, strona wygląda dla Ciebie idealnie — po prostu nigdy się nie wyświetla.
Cztery rzeczy, które uniemożliwiają zindeksowanie strony
Niemal każdy problem z crawlowaniem jest jednym z tych przypadków i występują one w określonej kolejności:
- URL nie działa — zwraca błąd 404, błąd serwera albo łańcuch przekierowań, który kończy się niepowodzeniem.
- Plik robots.txt blokuje robota indeksującego, więc strona w ogóle nie zostaje pobrana.
- Dyrektywa noindex nakazuje wyszukiwarce pobrać stronę, ale nie uwzględniać jej w wynikach.
- Strona bez JavaScriptu wyświetla niemal pustą zawartość, więc niewiele można z niej zindeksować.
Kolejność ma znaczenie podczas ich naprawiania. Blokada w pliku robots.txt oznacza, że znajdujący się za nią tag noindex nie zostanie nawet odczytany, więc zastosowanie obu rozwiązań daje efekt odwrotny do oczekiwanego — strona pozostaje zablokowana dla robotów, a instrukcja jej usunięcia pozostaje niezauważona.
Robots.txt i noindex to nie to samo
To właśnie to nieporozumienie powoduje najwięcej szkód. Plik robots.txt określa, czy robot indeksujący może pobrać stronę, natomiast noindex — czy może ją zachować w indeksie. Działają na różnych etapach i nie można ich stosować zamiennie.
Aby wykluczyć stronę z wyników wyszukiwania, należy użyć noindex, a robot indeksujący musi mieć możliwość pobrania strony, aby to wykryć. Zablokowanie strony w pliku robots.txt może zamiast tego sprawić, że adres URL będzie widoczny bez żadnego opisu, ponieważ wyszukiwarka zna adres, ale nigdy nie miała pozwolenia, aby go sprawdzić.
W odwrotnym przypadku — gdy chodzi o stronę, którą chcesz, aby znaleziono — oba elementy muszą być jasne, a dyrektywa noindex może znajdować się w kodzie HTML lub w nagłówku HTTP. To właśnie wersja w nagłówku często wprowadza ludzi w błąd, ponieważ jest niewidoczna w źródle strony.
Roboty indeksujące AI to odrębna decyzja w 2026
Firmy zajmujące się AI korzystają z własnych, nazwanych robotów indeksujących, a ich blokowanie jest inną decyzją niż blokowanie wyszukiwarek. GPTBot, ClaudeBot, PerplexityBot i pozostałe roboty mają w pliku robots.txt osobne wpisy.
Wiele witryn zablokowało je, nie do końca zdając sobie z tego sprawę — często przez skopiowanie pliku robots.txt z innego miejsca. Jeśli zależy Ci na tym, aby Twoja witryna była cytowana w odpowiedziach AI, warto o tym wiedzieć, zamiast odkryć to dopiero później.
Odwrotne podejście również jest uzasadnione. Jeśli wolisz, aby Twoje treści nie były wykorzystywane do trenowania modeli ani tworzenia podsumowań, zablokowanie tych agentów jest sposobem, by to wyrazić — najważniejsze, aby była to świadoma decyzja, a nie przypadek.
Jak przetestować dostępność witryny dla robotów za pomocą tego narzędzia
Wprowadź adres URL, a narzędzie przeprowadzi jedenaście kontroli, raportując każdą z nich osobno, w kolejności, w jakiej napotkałby je robot indeksujący:
- Strona dostępna — kod statusu zwracany przez adres URL.
- Zablokowane dla wyszukiwarek — informacja, czy plik robots.txt zabrania dostępu Googlebotowi.
- Zablokowane roboty AI — liczba głównych agentów użytkownika AI, którym odmówiono dostępu.
- Tag noindex — dyrektywa noindex w kodzie HTML strony.
- Nagłówek noindex — ta sama dyrektywa przekazana jako X-Robots-Tag.
- Robots.txt — informacja, czy plik istnieje i co zawiera.
- Mapa witryny XML — informacja, czy istnieje mapa umożliwiająca robotom odkrycie pozostałej części witryny.
- Llms.txt – czy plik, którego szukają asystenci AI, jest obecny.
- Tag kanoniczny – który adres URL strona wskazuje jako przeznaczony do indeksowania.
- Wyrenderowana treść – jak dużą część strony robot widzi bez uruchamiania JavaScriptu.
- Błędy JavaScriptu – skrypty, które nie działają na stronie; często właśnie dlatego wyrenderowana treść jest uboga.
Sprawdza podany pojedynczy adres URL, zamiast skanować całą witrynę, dlatego testuj możliwość skanowania witryny na stronie, której faktycznie brakuje, a nie na stronie głównej – te dwie strony często się różnią, a strona główna rzadko jest tą, na której występuje problem.
Co dalej
Jeśli wszystko tutaj przechodzi pomyślnie, a strona nadal się nie wyświetla, kolejną rzeczą do sprawdzenia jest jej wykrywalność. Sprawdź, czy strona znajduje się w pliku
Mapa witryny XML, przejrzyj cały plik
robots.txt, a nie tylko reguły dotyczące jednego agenta, i sprawdź za pomocą narzędzia
Link wewnętrzny, czy w witrynie znajdują się do niej linki.