Over de crawlbaarheid van websites
Wat betekent crawlbaarheid?
Een pagina is crawlbaar wanneer een zoekmachine deze kan bereiken, toestemming heeft om de pagina op te halen en bij aankomst iets vindt dat de moeite waard is om te bewaren. Als één van deze voorwaarden niet wordt vervuld, is de pagina in feite onzichtbaar, hoe goed de content ook is.
Het is de stap die aan alles voorafgaat. Rankings, snippets, AI-citaten — bij alles wordt ervan uitgegaan dat de pagina überhaupt in een index is opgenomen. Daarom is het verstandig om, wanneer een pagina simpelweg niet verschijnt, eerst de crawlbaarheid van de website te testen in plaats van meteen de content te herschrijven.
Het lastige is dat al deze problemen zich stilletjes voordoen. Er gaat niets stuk, er verschijnen geen foutmeldingen, de pagina ziet er voor jou perfect uit — maar hij wordt gewoon nooit weergegeven.
De vier dingen waardoor een pagina niet wordt geïndexeerd
Bijna elk crawlbaarheidsprobleem valt hieronder, en ze doen zich in een specifieke volgorde voor:
- De URL wordt niet opgelost: een 404-fout, een serverfout of een omleidingsketen die uiteindelijk mislukt.
- Robots.txt blokkeert de crawler, waardoor de pagina helemaal niet wordt opgehaald.
- Een noindex-instructie vertelt de zoekmachine de pagina wel op te halen, maar niet in de zoekresultaten op te nemen.
- De pagina geeft zonder JavaScript vrijwel niets weer, waardoor er weinig te indexeren valt.
De volgorde is belangrijk wanneer je deze problemen oplost. Een blokkade in robots.txt betekent dat de noindex-tag eronder nooit wordt gelezen. De combinatie van beide heeft dus het tegenovergestelde effect van wat mensen verwachten: de pagina blijft geblokkeerd voor crawlers en de instructie om de pagina te verwijderen wordt niet gezien.
Robots.txt en noindex zijn niet hetzelfde
Dit is de verwarring die de meeste schade veroorzaakt. Robots.txt bepaalt of een crawler een pagina mag ophalen; noindex bepaalt of de pagina in de zoekindex mag worden opgenomen. Ze werken in verschillende fasen en zijn niet uitwisselbaar.
Om een pagina uit de zoekresultaten te houden, heb je noindex nodig en moet de crawler toegang hebben tot de pagina om dit te kunnen zien. Als je de pagina daarentegen in robots.txt blokkeert, kan een URL zonder enige beschrijving in de zoekresultaten blijven staan, omdat de zoekmachine het adres wel kent, maar nooit toestemming heeft gekregen om de pagina te bekijken.
Voor het tegenovergestelde – een pagina die je wél gevonden wilt laten worden – moeten beide duidelijk zijn, en de noindex kan zowel in de HTML als in een HTTP-header staan. De header-versie is degene die mensen vaak over het hoofd zien, omdat deze onzichtbaar is in de paginabron.
AI-crawlers zijn in 2026 een afzonderlijke keuze
De AI-bedrijven gebruiken hun eigen crawlers met een herkenbare naam, en deze blokkeren is een andere keuze dan zoekmachines blokkeren. GPTBot, ClaudeBot, PerplexityBot en alle andere maken elk hun eigen keuze in robots.txt.
Veel websites hebben ze geblokkeerd zonder dat dit echt de bedoeling was, vaak doordat ze een robots.txt-bestand van elders hebben gekopieerd. Als het voor jou belangrijk is om in AI-antwoorden te worden vermeld, is het de moeite waard om dit te weten in plaats van er later achter te komen.
Het tegenovergestelde is ook een legitiem standpunt. Als je liever niet wilt dat je content wordt gebruikt voor training of samenvattingen, is het blokkeren van die agents de manier om dat aan te geven. Het gaat erom dat dit een bewuste beslissing is en geen ongeluk.
Zo test je de crawlbaarheid van een website met deze tool
Voer een URL in en de tool voert er elf controles op uit. Elke controle wordt afzonderlijk gerapporteerd, in de volgorde waarin een crawler ze tegenkomt:
- Pagina bereikbaar - de statuscode die de URL retourneert.
- Zoekmachines geblokkeerd - of robots.txt Googlebot de toegang ontzegt.
- AI-crawlers geblokkeerd - hoeveel van de belangrijkste AI-user-agents de toegang wordt ontzegd.
- Noindex-tag - een noindex-richtlijn in de HTML van de pagina.
- Noindex-header - dezelfde richtlijn, aangeleverd als een X-Robots-Tag.
- Robots.txt - of het bestand bestaat en wat het bevat.
- XML-sitemap - of er een bestaat waarmee crawlers de rest van de site kunnen ontdekken.
- Llms.txt - of het bestand waar AI-assistenten naar zoeken aanwezig is.
- Canonical-tag - welke URL de pagina aanwijst als de URL die moet worden geïndexeerd.
- Gegenereerde content - hoeveel van de pagina een crawler ziet zonder JavaScript uit te voeren.
- JavaScript-fouten - scripts die op de pagina mislukken, wat vaak de reden is dat de gegenereerde content beperkt is.
De tool controleert de afzonderlijke URL die je opgeeft in plaats van de hele site te crawlen. Test de crawlbaarheid van je website daarom op de pagina die daadwerkelijk ontbreekt, en niet op de homepage - die twee verschillen vaak, en de homepage is zelden de pagina met het probleem.
Waar je nu verder kunt gaan
Als alles hier in orde is en de pagina nog steeds niet wordt weergegeven, is de vindbaarheid het volgende waar je naar moet kijken. Controleer of de pagina in je
XML-sitemap staat, bekijk het volledige
robots.txt-bestand in plaats van alleen de regels voor één agent en controleer met de
interne link-checker of er ergens op de site naar wordt gelinkt.