Yapay Zekâ Tarayıcılarını Engelleme Hakkında
Hangi tarayıcılardan bahsediyoruz?
Yapay zekâ şirketleri, kendi adlarını taşıyan tarayıcıları çalıştırır ve bunlar, hâlihazırda bildiğiniz arama motoru tarayıcılarından ayrıdır. GPTBot ve OAI-SearchBot OpenAI’a, ClaudeBot Anthropic’e, PerplexityBot Perplexity’ye aittir; Google-Extended Gemini’nin eğitimini yönetir ve CCBot, birçok modelin eğitildiği Common Crawl’a veri sağlar.
Her biri robots.txt kurallarına normal şekilde uyar; dolayısıyla user-agent’ını belirten bir kural, sitenizi okuyup okuyamayacağını belirler. Bu denetleyici robots.txt dosyanızı okur ve bu tarayıcıların engellenip engellenmediğini bildirir.
Engellenmek otomatik olarak yanlış değildir. Bu bir karardır ve kontrol etmenin amacı, gerçekten böyle bir karar verildiğinden emin olmaktır.
Sitelerin onları yanlışlıkla engellemesinin nedenleri
En yaygın neden genel kapsamlı bir kuraldır. Scraper’ları engellemek amacıyla geniş kapsamlı bir disallow kuralıyla yazılmış robots.txt dosyası bu tarayıcıları da yakalar ve bunun gerçekleştiğini bildiren hiçbir şey olmaz.
İkinci neden devralınan yapılandırmalardır. Pek çok hosting sağlayıcısı, güvenlik eklentisi ve CDN yapılandırması 2023 ve 2024 yıllarında AI tarayıcılarını varsayılan olarak engellemeye başladı ve siteler, hiç kimse bunu seçmeden bu ayarları devraldı.
Üçüncüsü, o zaman için doğru olan bir karardı. Endişe eğitim verileriyle ilgiliyken eklenen bir engelleme, artık sayfalarınızın kaynak gösterilmek üzere okunmasını da önlüyor; bu ise farklı bir ödünleşim.
Üzerinde düşünmeye değer ödünleşim
Bu tarayıcıların yaptığı iki farklı şey var ve bunları birbirinden ayırmak önemli. Bazıları modelleri eğitmek için içerik getirir; bu işlem size doğrudan hiçbir şey sağlamaz. Diğerleri ise o anda sorulan bir soruyu yanıtlamak ve kaynağı belirtmek için sayfaları getirir.
İkinci türü engellemek, rakiplerinizin görüneceği yanıtlarda yer almanızı engeller. İlk türü engellemek ise içeriği ürün olan bir yayıncı için makul bir tutumdur.
User-agent’ler tam da bu nedenle ayrı ayrı belgelenmiştir; böylece alıntı yapan tarayıcılara izin verebilir, yalnızca içerik tüketenleri ise reddedebilirsiniz.
Bu, 2026 yılında önemli mi?
Araştırmaların daha büyük bir bölümünün bir asistan içinde gerçekleştirilmesiyle bu konu her yıl daha da önem kazanıyor. Getirilemeyen bir sayfadan alıntı yapılamaz ve bunun gerçekleştiğini size gösterecek hiçbir sıralama raporu yoktur.
Asimetrik olan nokta, bunu varsaymak yerine kontrol etmeye değer kılan şeydir. Daha sonra fikrinizi değiştirmeye karar verirseniz bir tarayıcıya izin vermenin hiçbir maliyeti yoktur; devralınan bir kural nedeniyle bir yıl boyunca görünmez kalmak ise, bu durum fark edilmeden devam ederken hem maliyetlidir hem de görünmezdir.
Bu aracın kontrol ettikleri
robots.txt dosyanızı alır ve başlıca yapay zekâ tarayıcılarının sitenizi okumasını engelleyecek kuralları arayarak hangilerinin engellendiğini bildirir.
Dosyayı yayımlandığı hâliyle okur; bu nedenle bir eklenti veya CDN tarafından eklenen bir kural, sizin yazdığınız bir kuralla aynı şekilde görünür. İstemediğiniz bir şey engelleniyorsa, ilk olarak bakmanız gereken yer burasıdır.
Sonraki adımlar
Tarama erişimi, birkaç kapıdan ilkinizdir.
arama motorları'in aynı dosya tarafından engellenip engellenmediğini kontrol edin,
robots.txt dosyasını bir bütün olarak inceleyin ve okunmaya değer sayfalara yönlendiren bir
llms.txt dosyası yayınladığınızı doğrulayın.