Over het blokkeren van AI-crawlers
Over welke crawlers hebben we het?
AI-bedrijven gebruiken hun eigen crawlers met een specifieke naam, die losstaan van de zoekcrawlers die je al kent. GPTBot en OAI-SearchBot zijn van OpenAI, ClaudeBot van Anthropic, PerplexityBot van Perplexity, Google-Extended regelt het trainen van Gemini en CCBot levert gegevens aan Common Crawl, waarvan veel modellen worden getraind.
Elke crawler volgt robots.txt op de gebruikelijke manier. Een regel met zijn user-agent bepaalt dus of de crawler je site mag uitlezen. Deze checker leest je robots.txt en rapporteert of deze crawlers worden geblokkeerd.
Geblokkeerd worden is niet automatisch verkeerd. Het is een beslissing, en het doel van de controle is om zeker te weten dat het inderdaad een beslissing was.
Waarom websites ze per ongeluk blokkeren
De meest voorkomende oorzaak is een algemene regel. Een robots.txt-bestand dat met een brede disallow-regel scrapers buiten de deur probeert te houden, blokkeert deze crawlers ook, zonder dat ergens wordt gemeld dat dit is gebeurd.
De tweede oorzaak is overerving. Veel hostingproviders, beveiligingsplug-ins en CDN-configuraties hebben in 2023 en 2024 standaard blokkades voor AI-crawlers toegevoegd, waarna websites deze overnamen zonder dat iemand daar bewust voor koos.
De derde is een beslissing die destijds juist was. Een blokkade die werd toegevoegd toen trainingsdata de zorg was, voorkomt nu ook dat je pagina's worden gelezen voor bronvermeldingen, wat een andere afweging is.
De afweging waarover je moet nadenken
Deze crawlers doen twee verschillende dingen, en het is de moeite waard om die van elkaar te scheiden. Sommige halen content op om modellen te trainen, wat jou niets rechtstreeks oplevert. Andere halen pagina's op om een vraag te beantwoorden die op dit moment wordt gesteld en vermelden de bron.
Het blokkeren van de tweede soort zorgt ervoor dat je niet meer voorkomt in antwoorden waarin je concurrenten wel verschijnen. Het blokkeren van de eerste soort is een verdedigbaar standpunt voor een uitgever voor wie de inhoud het product is.
De user-agents worden juist om deze reden afzonderlijk gedocumenteerd, zodat je de crawlers die citeren kunt toestaan en de crawlers die alleen inhoud consumeren kunt weigeren.
Doet dit ertoe in 2026?
Het wordt elk jaar belangrijker dat een groter deel van het onderzoek binnen een assistent plaatsvindt. Een pagina die niet kan worden opgehaald, kan niet worden geciteerd, en er is geen rankingrapport dat je laat zien dat dit gebeurt.
De asymmetrie maakt het de moeite waard om dit te controleren in plaats van er zomaar van uit te gaan. Een crawler toestaan kost niets als je later van gedachten verandert; een jaar lang onzichtbaar zijn door een overgenomen regel is kostbaar, terwijl je je daar niet van bewust bent.
Wat deze tool controleert
Het haalt je robots.txt op en zoekt naar regels die zouden voorkomen dat de belangrijkste AI-crawlers je site kunnen lezen, en rapporteert welke zijn geblokkeerd.
Het leest het bestand zoals het is gepubliceerd, dus een regel die door een plug-in of een CDN is toegevoegd, wordt op dezelfde manier weergegeven als een regel die je zelf hebt geschreven. Als iets is geblokkeerd zonder dat je dat zo hebt bedoeld, is dat de eerste plek om te kijken.
Waar je nu verder kunt gaan
Crawltoegang is de eerste van meerdere toegangspoorten. Controleer of
zoekmachines door hetzelfde bestand worden geblokkeerd, bekijk het bestand
robots.txt als geheel en bevestig dat je een bestand
llms.txt publiceert dat verwijst naar de pagina's die het lezen waard zijn.