Informacje o plikach robots.txt
Czym jest plik robots.txt?
Robots.txt to zwykły plik tekstowy znajdujący się w katalogu głównym domeny, który informuje automatyczne programy odwiedzające, o które części witryny mogą wysyłać żądania. Jest to pierwsza rzecz, o którą prosi większość robotów indeksujących, jeszcze przed pobraniem jakiejkolwiek strony, i najstarszy standard w internecie służący do wskazywania, czego maszyna powinna pozostawić w spokoju.
Składnia jest celowo prosta: należy podać nazwę klienta użytkownika, a następnie wymienić ścieżki, które może pobierać lub których pobierać nie może. Ta prostota jest również pułapką, ponieważ pojedynczy nieprawidłowo umieszczony ukośnik może spowodować zablokowanie nie jednego folderu, lecz całej witryny. Generator pliku robots.txt jest przydatny przede wszystkim dlatego, że tworzy plik w prawidłowej, przewidywalnej strukturze, zamiast zmuszać Cię do pamiętania dokładnej pisowni dyrektyw, które zapisujesz raz w roku.
Kontroluje indeksowanie przez roboty, a nie indeksowanie w wyszukiwarkach — i to rozróżnienie nieustannie wprowadza ludzi w błąd. Zablokowanie adresu URL uniemożliwia robotowi jego pobranie, ale nie gwarantuje, że adres URL nie pojawi się w wynikach wyszukiwania, ponieważ strona może zostać zaindeksowana na podstawie linków do niej prowadzących, nawet jeśli nigdy nie zostanie odczytana.
Czy plik robots.txt nadal ma znaczenie w 2026?
Jego tradycyjna funkcja pozostaje niezmieniona: uniemożliwianie robotom dostępu do ścieżek administracyjnych, wewnętrznych wyników wyszukiwania, nawigacji fasetowej oraz nieskończonej liczby kombinacji parametrów, które w przeciwnym razie zużywałyby budżet indeksowania na stronach, na które nikt nie powinien trafiać.
Jego nowsza rola jest ważniejsza. Plik stał się miejscem, w którym właściciele witryn decydują, które roboty indeksujące AI mogą w ogóle uzyskać dostęp do ich treści — to pytanie, na które większość z nich wcześniej nigdy nie musiała odpowiadać. Każda duża firma zajmująca się AI ma obecnie własnego, nazwanego robota indeksującego, a większość z nich respektuje ten plik.
To sprawia, że robots.txt jest jednym z niewielu naprawdę istotnych plików w witrynie i warto go świadomie przejrzeć, zamiast bezkrytycznie korzystać z wersji dostarczonej domyślnie przez platformę.
Jak robots.txt ma się do wyszukiwania opartego na AI
Masz do podjęcia rzeczywistą decyzję i nie ma jednej uniwersalnie poprawnej odpowiedzi. Zablokowanie robotów AI chroni Twoje treści przed wykorzystywaniem ich do trenowania modeli lub jako materiału do generowania odpowiedzi. Jednocześnie eliminuje możliwość cytowania Twojej witryny w odpowiedziach, na których coraz większy odsetek osób polega zamiast przechodzić do wyników wyszukiwania.
Te dwa skutki nie są symetryczne. Blokowanie jest niemal całkowite, natomiast cytowanie treści jest niepewne, dlatego wybór zależy od tego, czy Twoja treść jest produktem, czy materiałem marketingowym promującym ten produkt. Wydawca sprzedający subskrypcje może zasadnie blokować dostęp, natomiast firma, której strony mają być znajdowane, zazwyczaj tego nie robi.
Najważniejsze jest to, aby plik określał to, co rzeczywiście zamierzasz. Generator pliku robots.txt ułatwia jednoznaczne określenie tych reguł, zamiast pozostawiać je domyślne wskutek pominięcia.
Najlepsze praktyki dotyczące pliku robots.txt
- Umieść plik w katalogu głównym domeny. W każdym innym miejscu zostanie całkowicie zignorowany.
- Nigdy nie używaj go do ukrywania poufnych treści. Plik jest publiczny, a jego odczytanie to najszybszy sposób na znalezienie ścieżek, które miały pozostać ukryte.
- Jeśli celem jest wykluczenie strony z wyników wyszukiwania, użyj dyrektywy noindex zamiast blokady indeksowania.
- Nie łącz obu rozwiązań na tej samej stronie. Zablokowanej strony nie można odczytać, więc jej dyrektywa noindex nigdy nie zostanie wykryta.
- Umieść odwołanie do mapy witryny XML w pliku, aby roboty mogły ją znaleźć bez konieczności wskazywania jej osobno.
- Zasady dotyczące robotów AI ustalaj świadomie, a nie domyślnie.
Typowe błędy
- Blokowanie plików CSS lub JavaScript uniemożliwia wyszukiwarkom renderowanie strony tak, jak widzi ją użytkownik.
- Pozostawienie po uruchomieniu witryny reguły z etapu tworzenia, która blokuje całą witrynę. To najbardziej szkodliwy błąd w pliku robots.txt.
- Założenie, że zablokowany adres URL zniknie z wyników wyszukiwania, choć może nadal być w nich widoczny bez opisu.
- Pisanie reguł dla ciągu user agent, który nie istnieje, przez co nic nie zostaje zablokowane.
- Zapominanie, że subdomeny wymagają własnego pliku; reguła w głównej domenie ich nie obejmuje.
Korzystanie z generatora robots.txt
Wybierz roboty, którym chcesz zezwolić na dostęp lub go odmówić, dodaj katalogi, do których nie powinny mieć dostępu, ustaw opóźnienie indeksowania, jeśli Twój serwer tego wymaga, i wskaż mapę witryny. Generator tworzy poprawnie sformatowany plik, który możesz zapisać w katalogu głównym swojej domeny.
Gdy plik będzie już dostępny, zweryfikuj go zamiast zakładać, że wszystko działa prawidłowo. Otwórz plik w przeglądarce, aby potwierdzić, że jest udostępniany, i sprawdź w Search Console, czy strony, które mają być dostępne dla robotów, nadal są indeksowalne. Plik robots.txt, który po cichu blokuje więcej, niż zamierzono, może pozostać niezauważony przez całe tygodnie, jeśli polegasz wyłącznie na analizie ruchu.
Co dalej