Informacje o pliku robots.txt
Czym jest plik robots.txt?
Robots.txt to zwykły plik tekstowy znajdujący się w katalogu głównym domeny, który informuje automatyczne programy odwiedzające witrynę, o jakie jej części mogą wysyłać żądania. To pierwsza rzecz, o którą większość robotów indeksujących prosi przed pobraniem jakiejkolwiek strony, a także najstarszy obowiązujący w internecie sposób wskazywania, co maszyna powinna pozostawić w spokoju.
Plik ten kontroluje indeksowanie przez roboty, a nie indeksowanie stron, i to rozróżnienie nieustannie wprowadza ludzi w błąd. Zablokowanie adresu URL uniemożliwia robotowi jego pobranie, ale nie gwarantuje usunięcia tego adresu z wyników wyszukiwania, ponieważ strona może zostać zaindeksowana na podstawie prowadzących do niej linków, nawet jeśli robot nigdy jej nie odczyta.
Warto uruchomić narzędzie do sprawdzania pliku robots.txt, ponieważ pojedynczy, niewłaściwie umieszczony znak zmienia znaczenie całego pliku, a nic na stronie nie wskazuje na problem, dopóki nie zniknie ruch.
Czy plik robots.txt nadal ma znaczenie w 2026?
Jego tradycyjna funkcja pozostaje niezmieniona: uniemożliwianie robotom dostępu do ścieżek administracyjnych, wewnętrznych wyników wyszukiwania, nawigacji fasetowej oraz nieskończonej liczby kombinacji parametrów, które w przeciwnym razie zużywałyby budżet indeksowania na stronach, na które nikt nie powinien trafiać.
Jego nowsza rola jest ważniejsza. Plik stał się miejscem, w którym właściciele witryn decydują, które roboty indeksujące AI mogą w ogóle uzyskać dostęp do ich treści — to pytanie, na które większość z nich wcześniej nigdy nie musiała odpowiadać. Każda duża firma zajmująca się AI ma obecnie własnego, nazwanego robota indeksującego, a większość z nich respektuje ten plik.
To sprawia, że jest to jeden z niewielu naprawdę istotnych plików w witrynie — warto go świadomie przejrzeć, zamiast bezrefleksyjnie przyjmować ustawienia domyślnie dostarczone przez platformę.
Jak robots.txt ma się do wyszukiwania opartego na AI
Masz przed sobą rzeczywistą decyzję i nie ma na nią jednej, uniwersalnie poprawnej odpowiedzi. Zablokowanie robotów indeksujących AI chroni Twoje treści przed wykorzystaniem ich jako materiałów treningowych lub źródeł odpowiedzi. Jednocześnie eliminuje wszelką możliwość cytowania ich w odpowiedziach, na których polega obecnie coraz większa liczba osób.
Te dwa skutki nie są symetryczne. Blokowanie jest niemal całkowite, podczas gdy cytowanie jest niepewne, dlatego wybór zależy od tego, czy Twoje treści są produktem, czy narzędziem marketingowym promującym ten produkt.
Wydawca sprzedający subskrypcje może zasadnie blokować dostęp; firma, której strony mają być znajdowane, zwykle tego nie robi. Liczy się to, aby plik określał to, co rzeczywiście zamierzasz.
Najlepsze praktyki dotyczące pliku robots.txt
- Umieść plik w katalogu głównym domeny. W każdym innym miejscu zostanie całkowicie zignorowany.
- Nigdy nie używaj go do ukrywania poufnych treści. Plik jest publiczny, a jego odczytanie to najszybszy sposób na znalezienie ścieżek, które miały pozostać ukryte.
- Jeśli celem jest wykluczenie strony z wyników wyszukiwania, użyj dyrektywy noindex zamiast blokady indeksowania.
- Nie łącz obu rozwiązań na tej samej stronie. Zablokowanej strony nie można odczytać, więc jej dyrektywa noindex nigdy nie zostanie wykryta.
- Umieść odwołanie do mapy witryny XML w pliku, aby roboty mogły ją znaleźć bez konieczności wskazywania jej osobno.
- Dla subdomen utwórz osobny plik — reguła w domenie głównej ich nie obejmuje.
Typowe błędy
- Pozostawienie po uruchomieniu witryny reguły z okresu prac deweloperskich, która blokuje całą witrynę, to najbardziej szkodliwa wersja tego błędu.
- Blokowanie plików CSS lub JavaScript, co uniemożliwia wyszukiwarkom renderowanie strony tak, jak widzi ją użytkownik.
- Założenie, że zablokowany adres URL zniknie z wyników wyszukiwania, choć może nadal być w nich wyświetlany bez opisu.
- Pisanie reguł dla ciągu user agent, który nie istnieje, przez co nic nie zostaje zablokowane.
- Blokowanie ścieżek skanowania, które następnie zgłaszasz we własnej mapie witryny, powoduje wysyłanie sprzecznych instrukcji.
Co sprawdza to narzędzie
Moduł sprawdzający plik robots.txt pobiera go z katalogu głównego domeny i informuje, czy taki plik istnieje.
Potwierdza jego istnienie, zamiast oceniać zawarte w nim reguły, więc plik, który przypadkowo blokuje całą witrynę, przechodzi sprawdzenie dokładnie tak samo jak poprawny plik. Najważniejsze jest odczytanie jego faktycznej treści — zajmuje to około minuty.
Co dalej