Robots.txt Dosyaları Hakkında
robots.txt dosyası nedir?
Robots.txt, bir alan adının kök dizininde bulunan ve otomatik ziyaretçilere sitenin hangi bölümlerini talep edebileceklerini bildiren düz metin dosyasıdır. Çoğu tarayıcının herhangi bir sayfadan önce istediği ilk şeydir ve web'de bir makinenin hangi bölümlere dokunmaması gerektiğini belirtmek için kullanılan en eski kuraldır.
Söz dizimi özellikle basittir: bir kullanıcı aracısının adını yazın, ardından erişebileceği veya erişemeyeceği yolları listeleyin. Ancak bu basitlik aynı zamanda tuzaktır; çünkü yanlış yere konmuş tek bir eğik çizgi, yalnızca bir klasörü engellemekten tüm siteyi engellemeye geçiş yapabilir. Bir robots.txt oluşturucunun asıl önemi, yılda yalnızca bir kez yazdığınız yönergelerin doğru yazımını hatırlamak zorunda bırakmak yerine dosyayı geçerli ve öngörülebilir bir yapıda oluşturmasıdır.
Tarama işlemini kontrol eder, dizine eklemeyi değil; bu ayrım sürekli olarak kullanıcıların kafasını karıştırır. Bir URL’yi engellemek, tarayıcının onu almasını durdurur; ancak URL’nin arama sonuçlarına girmesini güvenilir biçimde engellemez, çünkü bir sayfa hiç okunmadan, kendisine yönlendiren bağlantılar sayesinde dizine eklenebilir.
robots.txt 2026 yılında hâlâ önemli mi?
Geleneksel görevi değişmedi: tarama bütçesini, kullanıcıların ulaşmaması gereken sayfalarda tüketebilecek yönetici yollarını, site içi arama sonuçlarını, yönlü gezinmeyi ve sonsuz sayıdaki parametre kombinasyonunu tarayıcılardan uzak tutmak.
Daha yeni görevi ise daha kapsamlıdır. Dosya, site sahiplerinin hangi yapay zekâ tarayıcılarının içeriklerine erişip erişemeyeceğine karar verdiği bir yer hâline geldi; bu, çoğunun daha önce yanıtlamak zorunda kalmadığı bir soruydu. Artık her büyük yapay zekâ şirketi adı belirlenmiş bir tarayıcı işletiyor ve çoğu bu dosyaya uyuyor.
Bu da robots.txt dosyasını bir sitedeki gerçekten önemli sayılı dosyalardan biri hâline getiriyor. Bu nedenle, bir platformun varsayılan olarak sunduğu ayarları olduğu gibi devralmak yerine dosyayı bilinçli bir şekilde gözden geçirmek gerekir.
robots.txt dosyasının yapay zekâ aramasıyla ilişkisi
Vermeleri gereken gerçek bir karar var ve evrensel olarak doğru bir yanıt bulunmuyor. Yapay zekâ tarayıcılarını engellemek, içeriğinizin eğitim veya yanıt materyali olarak kullanılmasına karşı koruma sağlar. Ayrıca, artık giderek daha fazla insanın sonuçlara tıklamak yerine güvendiği yanıtlarda sitenizden alıntı yapılma ihtimalini de ortadan kaldırır.
İki etki simetrik değildir. Engelleme neredeyse kesinken, atıf alma belirsizdir; bu nedenle seçim, içeriğinizin ürün mü yoksa ürünün pazarlaması mı olduğuna bağlıdır. Abonelik satan bir yayıncı makul bir şekilde engelleme yapabilir; sayfaları bulunmak amacıyla var olan bir işletme ise genellikle bunu yapmaz.
En önemli nokta, dosyanın gerçekten amaçladığınız şeyi belirtmesidir. Bir robots.txt oluşturucu, bu kuralları eksiklik yoluyla ima etmek yerine açıkça ifade etmeyi kolaylaştırır.
Robots.txt en iyi uygulamaları
- Dosyayı alan adının kök dizininde tutun. Başka bir yerde olursa tamamen yok sayılır.
- Hassas içerikleri gizlemek için bunu asla kullanmayın. Dosya herkese açıktır ve okunması, gizlemek istediğiniz yolları bulmanın en hızlı yoludur.
- Amaç bir sayfanın arama sonuçlarında yer almasını engellemekse, tarama engeli yerine noindex yönergesini kullanın.
- İkisini aynı sayfada birlikte kullanmayın. Engellenen bir sayfa hiçbir zaman okunamaz; bu nedenle noindex yönergesi de hiçbir zaman görülmez.
- Tarayıcıların ayrıca belirtilmesine gerek kalmadan bulabilmesi için XML site haritanıza dosyada referans verin.
- Yapay zekâ tarayıcısı kurallarını varsayılan olarak değil, bilinçli bir karar doğrultusunda gözden geçirin.
Yaygın hatalar
- CSS veya JavaScript'i engellemek, arama motorlarının sayfayı ziyaretçinin gördüğü şekilde oluşturmasını engeller.
- Lansmandan sonra tüm siteyi engelleyen, geliştirme döneminden kalma bir kuralı bırakmak. Bu, en fazla zarar veren robots.txt hatasıdır.
- Engellenen bir URL’nin arama sonuçlarından çıkacağını varsaymak; oysa URL, açıklama olmadan listelenmeye devam edebilir.
- Mevcut olmayan bir kullanıcı aracısı dizesi için kurallar yazmak; bu nedenle hiçbir şey etkilenmez.
- Alt alan adlarının kendi dosyasına ihtiyaç duyduğunu unutmak; ana alan adındaki bir kural alt alan adlarını kapsamaz.
robots.txt oluşturucusunu kullanmak
İzin verilecek veya reddedilecek tarayıcıları seçin, erişilmesini istemediğiniz dizinleri ekleyin, sunucunuzun ihtiyaç duyması hâlinde bir tarama gecikmesi ayarlayın ve site haritanızın konumunu belirtin. Oluşturucu, kaydedip alan adınızın kök dizinine yükleyebileceğiniz, doğru biçimlendirilmiş bir dosya hazırlar.
Dosya yayına girdikten sonra varsayımda bulunmak yerine doğrulayın. Dosyanın sunulduğunu onaylamak için dosyayı bir tarayıcıda açın ve taranabilir olmasını beklediğiniz sayfaların hâlâ taranabildiğini Search Console'da kontrol edin. Gerekenden fazlasını sessizce engelleyen bir robots.txt dosyasını yalnızca trafik üzerinden fark etmek haftalar sürebilir.
Sonraki adımlar