Tentang Pemblokiran Perayap AI
Perayap mana yang dimaksud?
Perusahaan AI menjalankan crawler mereka sendiri dengan nama masing-masing, dan crawler tersebut terpisah dari crawler mesin pencari yang sudah Anda kenal. GPTBot dan OAI-SearchBot milik OpenAI, ClaudeBot milik Anthropic, PerplexityBot milik Perplexity, Google-Extended mengatur pelatihan Gemini, dan CCBot memasok data ke Common Crawl, yang menjadi sumber pelatihan bagi banyak model.
Masing-masing mematuhi robots.txt dengan cara biasa, sehingga aturan yang mencantumkan user-agent-nya menentukan apakah crawler tersebut dapat membaca situs Anda. Pemeriksa ini membaca robots.txt Anda dan melaporkan apakah crawler-crawler tersebut diblokir.
Diblokir bukan berarti secara otomatis salah. Itu adalah sebuah keputusan, dan tujuan pemeriksaan ini adalah memastikan bahwa keputusan tersebut memang disengaja.
Mengapa situs akhirnya memblokirnya secara tidak sengaja
Penyebab yang umum adalah aturan yang berlaku menyeluruh. robots.txt yang ditulis untuk mencegah scraper dengan larangan yang luas juga menangkap crawler ini, dan tidak ada pemberitahuan bahwa hal tersebut telah terjadi.
Penyebab kedua adalah pewarisan konfigurasi. Banyak penyedia hosting, plugin keamanan, dan konfigurasi CDN menambahkan pemblokiran crawler AI secara default selama 2023 dan 2024, lalu situs menggunakannya tanpa ada yang sengaja memilihnya.
Yang ketiga adalah keputusan yang tepat pada saat itu. Pemblokiran yang ditambahkan ketika kekhawatirannya adalah data pelatihan kini juga mencegah halaman Anda dibaca untuk keperluan sitasi, yang merupakan kompromi yang berbeda.
Kompromi yang patut dipertimbangkan
Ada dua hal berbeda yang dilakukan crawler ini, dan keduanya perlu dipisahkan. Sebagian mengambil konten untuk melatih model, yang tidak memberikan apa pun secara langsung kepada Anda. Sebagian lainnya mengambil halaman untuk menjawab pertanyaan yang sedang diajukan saat ini, lalu mencantumkan sumbernya.
Memblokir jenis kedua membuat Anda tidak muncul dalam jawaban yang menampilkan pesaing Anda. Memblokir jenis pertama merupakan sikap yang wajar bagi penerbit yang menjadikan kontennya sebagai produk.
User-agent didokumentasikan secara terpisah karena alasan ini, sehingga Anda dapat mengizinkan crawler yang mencantumkan sumber dan menolak crawler yang hanya mengonsumsi konten.
Apakah ini penting pada 2026?
Hal ini semakin penting setiap tahun karena semakin banyak penelitian dilakukan di dalam asisten. Halaman yang tidak dapat diambil tidak dapat dikutip, dan tidak ada laporan peringkat yang akan memberi tahu Anda bahwa hal itu sedang terjadi.
Asimetri inilah yang membuatnya layak diperiksa, bukan sekadar diasumsikan. Mengizinkan perayap tidak memerlukan biaya apa pun jika nantinya Anda berubah pikiran; tidak terlihat selama setahun karena aturan bawaan adalah hal yang mahal, dan sering kali tidak disadari saat itu terjadi.
Yang diperiksa alat ini
Alat ini mengambil robots.txt Anda dan mencari aturan yang dapat mencegah perayap AI utama membaca situs Anda, lalu melaporkan perayap mana yang diblokir.
Alat ini membaca file sebagaimana dipublikasikan, sehingga aturan yang ditambahkan oleh plugin atau CDN akan muncul sama seperti aturan yang Anda tulis sendiri. Jika ada sesuatu yang diblokir tanpa disengaja, di situlah tempat pertama yang perlu diperiksa.
Ke mana selanjutnya
Akses perayapan adalah gerbang pertama dari beberapa gerbang. Periksa apakah
mesin pencari diblokir oleh file yang sama, tinjau file
robots.txt secara keseluruhan, dan pastikan Anda menerbitkan file
llms.txt yang mengarah ke halaman-halaman yang layak dibaca.