Tentang Robots.txt
Apa itu file robots.txt?
Robots.txt adalah file teks biasa di root domain yang memberi tahu pengunjung otomatis bagian mana dari situs yang boleh mereka minta. File ini merupakan hal pertama yang diminta oleh sebagian besar crawler, sebelum halaman apa pun, dan merupakan konvensi tertua di web untuk menyatakan bagian mana yang harus dibiarkan oleh mesin.
File ini mengatur crawling, bukan pengindeksan, dan perbedaan ini terus-menerus membingungkan banyak orang. Memblokir URL akan mencegah crawler mengambilnya; tetapi hal itu tidak secara andal membuat URL tersebut tidak muncul di hasil pencarian, karena suatu halaman dapat diindeks berdasarkan kekuatan tautan yang mengarah ke halaman tersebut meskipun halaman itu tidak pernah dibaca.
Pemeriksa robots.txt layak dijalankan karena satu karakter yang salah penempatan dapat mengubah arti seluruh file, dan tidak ada indikasi masalah pada situs hingga lalu lintas menghilang.
Apakah robots.txt masih penting pada 2026?
Fungsi tradisionalnya tidak berubah: mencegah crawler mengakses jalur admin, hasil pencarian internal, navigasi bersegi, dan kombinasi parameter tanpa akhir yang jika tidak dikendalikan akan menghabiskan anggaran crawling pada halaman yang seharusnya tidak menjadi halaman tujuan pengguna.
Tugas barunya lebih besar. File ini telah menjadi tempat para pemilik situs menentukan perayap AI mana yang boleh mengakses konten mereka, sebuah pertanyaan yang sebelumnya hampir tidak pernah perlu mereka jawab. Kini setiap perusahaan AI besar mengoperasikan perayap dengan nama khusus, dan sebagian besar menghormati file ini.
Hal ini menjadikannya salah satu dari sedikit file yang benar-benar berdampak besar pada situs, serta layak ditinjau secara sengaja alih-alih menerima begitu saja pengaturan bawaan yang dikirimkan oleh suatu platform.
Kaitan robots.txt dengan penelusuran AI
Anda perlu mengambil keputusan nyata, dan tidak ada jawaban yang benar secara universal. Memblokir perayap AI melindungi konten Anda agar tidak digunakan sebagai materi pelatihan atau jawaban. Namun, tindakan ini juga menghilangkan kemungkinan konten Anda dikutip dalam jawaban yang kini semakin diandalkan oleh banyak orang.
Kedua dampak tersebut tidak seimbang. Pemblokiran hampir bersifat mutlak, sementara kemungkinan dikutip tidak pasti, sehingga pilihan bergantung pada apakah konten Anda merupakan produk atau sarana pemasarannya.
Penerbit yang menjual langganan mungkin wajar memblokir akses; bisnis yang halaman-halamannya dibuat agar ditemukan biasanya tidak. Yang penting, berkas tersebut menyatakan apa yang benar-benar Anda maksudkan.
Praktik terbaik robots.txt
- Simpan file tersebut di root domain. Jika ditempatkan di lokasi lain, file tersebut akan diabaikan sepenuhnya.
- Jangan pernah menggunakannya untuk menyembunyikan konten sensitif. File ini bersifat publik, dan membacanya adalah cara tercepat untuk menemukan jalur yang ingin Anda sembunyikan.
- Gunakan direktif noindex, bukan blokir perayapan, jika tujuannya adalah mencegah halaman muncul di hasil penelusuran.
- Jangan gabungkan keduanya pada halaman yang sama. Halaman yang diblokir tidak akan pernah dapat dibaca, sehingga noindex di dalamnya tidak akan pernah terdeteksi.
- Cantumkan sitemap XML Anda dalam file tersebut agar perayap dapat menemukannya tanpa perlu diberi tahu secara terpisah.
- Buat berkas tersendiri untuk setiap subdomain; aturan di domain utama tidak mencakup subdomain.
Kesalahan umum
- Membiarkan aturan dari masa pengembangan yang memblokir seluruh situs setelah peluncuran, yang merupakan bentuk kesalahan ini yang paling merugikan.
- Memblokir CSS atau JavaScript, sehingga mesin pencari tidak dapat merender halaman seperti yang dilihat pengunjung.
- Menganggap URL yang diblokir akan menghilang dari hasil penelusuran, padahal URL tersebut mungkin tetap tercantum tanpa deskripsi.
- Menulis aturan untuk string agen pengguna yang tidak ada, sehingga tidak ada yang terpengaruh.
- Memblokir jalur perayapan yang kemudian dikirimkan oleh sitemap Anda sendiri, sehingga memberikan instruksi yang saling bertentangan.
Yang diperiksa alat ini
Pemeriksa robots.txt meminta file tersebut dari root domain dan melaporkan apakah file itu ada.
Pemeriksa ini mengonfirmasi keberadaan file, bukan mengevaluasi aturannya, sehingga file yang secara tidak sengaja memblokir seluruh situs Anda akan dianggap sama benarnya dengan file yang benar. Yang penting adalah membaca isi sebenarnya, dan itu hanya membutuhkan sekitar satu menit.
Ke mana selanjutnya
Robots.txt adalah salah satu dari tiga instruksi yang menentukan apakah sebuah halaman dapat ditemukan. Buat atau revisi file Anda dengan
generator robots.txt, periksa
pemeriksa tag noindex yang mencegah halaman yang telah diambil untuk muncul dalam hasil, dan pastikan
Pembuat sitemap XML mencantumkan halaman yang memang ingin Anda crawl.