Over het blokkeren van zoekmachines in Robots.txt
Wat betekent geblokkeerd zijn eigenlijk?
Een robots.txt-regel vertelt een crawler dat deze een pad niet mag ophalen. Als de regel op de hele site wordt toegepast, voorkomt dit dat zoekmachines iets kunnen lezen. Alles wat daarna komt, werkt dan ook niet meer: nieuwe content wordt niet ontdekt en bestaande pagina's raken verouderd en verdwijnen uiteindelijk uit de index.
Deze checker leest je robots.txt en meldt of zoekmachines de toegang tot je site wordt ontzegd.
Het is de schadelijkste regel die een site kan bevatten, en hij is maar één regel lang.
Hoe het gebeurt
Bijna altijd per ongeluk, en bijna altijd op dezelfde manier: er wordt een stagingomgeving gebouwd met een sitebrede disallow om deze uit de zoekresultaten te houden, en het bestand gaat samen met de rest van de deployment live.
Contentmanagementsystemen hebben hier hun eigen variant van. In de meeste daarvan bestaat een instelling als ‘zoekmachines ontmoedigen’, die tijdens de ontwikkeling wordt aangevinkt en daarna zelden nog wordt bekeken.
Er gaat niets zichtbaar mis wanneer dit gebeurt. De site werkt perfect voor elke menselijke bezoeker, waardoor het vaak weken duurt voordat iemand de daling in het verkeer in verband brengt met de oorzaak.
Blokkeren is niet hetzelfde als verwijderen
Dit is het deel dat mensen verrast. Een geblokkeerde pagina kan nog steeds in de zoekresultaten verschijnen, zonder beschrijving, omdat de crawler de opdracht kreeg de pagina niet te lezen, maar niet om deze uit de resultaten te laten.
Om een pagina correct uit de zoekresultaten te houden, heb je een noindex-directive nodig. Dat betekent dat de crawler de pagina moet mogen ophalen om deze te kunnen zien. Blokkeren en de-indexeren werken elkaar tegen.
Robots.txt is dus het verkeerde middel voor privacy. Het bestand regelt het crawlen, niet de zichtbaarheid, en het bestand zelf is openbaar.
Is robots.txt nog steeds relevant in 2026?
Het is de voorwaarde voor alles wat volgt. Voor content, structuur, snelheid en links moet een crawler de pagina in de eerste plaats kunnen bereiken, en geen daarvan helpt als dat niet kan.
Het heeft er inmiddels ook een tweede functie bij gekregen. Datzelfde bestand bepaalt nu of AI-crawlers je site mogen lezen, en daarmee of je pagina's kunnen worden geciteerd in gegenereerde antwoorden.
Voor een bestand dat meestal maar uit een handvol regels bestaat, draagt het een buitensporig grote verantwoordelijkheid.
Wat deze tool controleert
Het haalt robots.txt op van het domein dat je invoert en rapporteert of de regels zoekmachines zouden verhinderen je site te crawlen.
Een geslaagde controle betekent dat er op siteniveau niets is dat ze blokkeert. Het bevestigt niet dat afzonderlijke paden toegankelijk zijn. Controleer daarom afzonderlijk een pagina die ondanks deze geslaagde controle niet wordt geïndexeerd.
Waar je nu verder kunt gaan
Als crawlen is toegestaan, zijn de volgende vragen: wat kan worden ontdekt en wat is bewust uitgesloten? Controleer het volledige bestand
robots.txt, ga na of je
XML-sitemap aanwezig en actueel is, en bevestig dat geen
noindex-tag stiekem doet wat robots.txt niet doet.