Om websitets crawlbarhed
Hvad betyder crawlbarhed?
En side kan crawles, når en søgemaskine kan nå den, har tilladelse til at hente den og finder noget, der er værd at gemme, når den er fremme. Hvis blot én af disse betingelser ikke er opfyldt, er siden i praksis usynlig, uanset hvor godt indholdet er.
Det er trinnet, der kommer før alt andet. Rangeringer, snippets, AI-citater – det hele forudsætter, at siden overhovedet er kommet med i et indeks, så det fornuftige første skridt, når en side ganske enkelt ikke vises, er at teste, om websitet kan crawles, i stedet for at begynde at omskrive indholdet.
Det besværlige er, at alle disse fejl er tavse. Intet går i stykker, der vises ingen fejl, siden ser perfekt ud for dig – den dukker bare aldrig op.
De fire ting, der forhindrer en side i at blive indekseret
Næsten alle problemer med crawlbarhed skyldes én af disse ting, og de opstår i en bestemt rækkefølge:
- URL’en kan ikke åbnes – det skyldes en 404-fejl, en serverfejl eller en omdirigeringskæde, der ender uden resultat.
- Robots.txt forhindrer crawleren i at få adgang, så siden aldrig hentes.
- Et noindex-direktiv fortæller søgemaskinen, at siden skal hentes, men holdes ude af søgeresultaterne.
- Siden viser næsten intet uden JavaScript, så der er kun lidt at indeksere.
Rækkefølgen er vigtig, når du løser problemerne. En blokering i robots.txt betyder, at noindex-tagget nedenunder slet ikke bliver læst, så kombinationen af de to gør det modsatte af, hvad man forventer – siden forbliver blokeret for crawling, og instruktionen om at fjerne den bliver ikke set.
Robots.txt og noindex er ikke det samme
Dette er den misforståelse, der forårsager mest skade. Robots.txt styrer, om en crawler må hente en side; noindex styrer, om den må beholde siden i indekset. De fungerer på forskellige stadier og kan ikke erstatte hinanden.
Hvis du vil holde en side ude af søgeresultaterne, skal du bruge noindex, og crawleren skal have lov til at hente siden for at kunne se det. Hvis du i stedet blokerer siden i robots.txt, kan en URL ende med at være opført helt uden beskrivelse, fordi søgemaskinen kender adressen, men aldrig har fået lov til at se på den.
For det omvendte – en side, du gerne vil have fundet – skal begge dele være tydelige, og noindex kan angives enten i HTML-koden eller i en HTTP-header. Header-versionen er den, der ofte overses, eftersom den er usynlig i sidens kildekode.
AI-crawlere er en særskilt beslutning i 2026
AI-virksomhederne kører deres egne navngivne crawlere, og blokering af dem er et andet valg end blokering af søgemaskiner. GPTBot, ClaudeBot, PerplexityBot og resten har hver deres linje i robots.txt.
Mange websteder har blokeret dem uden egentlig at mene det, ofte ved at kopiere en robots.txt-fil fra et andet sted. Hvis det er vigtigt for dig at blive citeret i AI-svar, er det værd at vide på forhånd i stedet for at opdage det senere.
Det modsatte er også et legitimt valg. Hvis du helst ikke vil have, at dit indhold bruges til træning eller opsummering, er blokering af disse agenter måden, du tilkendegiver det på – pointen er, at det bør være en bevidst beslutning og ikke et uheld.
Sådan tester du et websteds crawlbarhed med dette værktøj
Indtast en URL, så kører værktøjet elleve kontroller af den og rapporterer hver enkelt separat i den rækkefølge, en crawler møder dem:
- Side tilgængelig – den statuskode, URL'en returnerer.
- Søgemaskiner blokeret – om robots.txt forbyder Googlebot adgang.
- AI-crawlere blokeret – hvor mange af de større AI-brugeragenter der ikke har tilladelse.
- Noindex-tag – et noindex-direktiv i sidens HTML.
- Noindex-header – det samme direktiv leveret som et X-Robots-Tag.
- Robots.txt – om filen findes, og hvad den indeholder.
- XML-sitemap – om der findes et, som crawlere kan bruge til at finde resten af webstedet.
- Llms.txt – om den fil, AI-assistenter leder efter, er til stede.
- Canonical-tag – hvilken URL siden angiver som den, der skal indekseres.
- Rendreret indhold – hvor meget af siden en crawler kan se uden at køre JavaScript.
- JavaScript-fejl – scripts på siden, der ikke fungerer, hvilket ofte er grunden til, at det rendrerede indhold er sparsomt.
Den tjekker den enkelte URL, du angiver, i stedet for at crawle hele webstedet, så test webstedets crawlbarhed på den side, der faktisk mangler, frem for på startsiden – de to er ofte forskellige, og det er sjældent startsiden, der har problemet.
Hvad kan du gøre som det næste
Hvis alt her består, og siden stadig ikke vises, er det næste, du bør undersøge, om den kan findes. Kontrollér, at siden er angivet i din
XML-sitemap, gennemgå hele
robots.txt-filen i stedet for kun reglerne for én agent, og se, om noget på webstedet linker til den, ved hjælp af
internt link-kontrollen.