Om blokering af AI-crawlere
Hvilke crawlere taler vi om?
AI-virksomhederne bruger deres egne navngivne crawlere, som er separate fra de søgecrawlere, du allerede kender. GPTBot og OAI-SearchBot tilhører OpenAI, ClaudeBot tilhører Anthropic, PerplexityBot tilhører Perplexity, Google-Extended styrer Gemini-træning, og CCBot leverer data til Common Crawl, som mange modeller trænes på.
Alle følger robots.txt på almindelig vis, så en regel, der angiver deres user-agent, afgør, om de kan læse dit websted. Dette værktøj læser din robots.txt og rapporterer, om disse crawlere bliver blokeret.
At blive blokeret er ikke automatisk forkert. Det er en beslutning, og formålet med kontrollen er at sikre, at det faktisk var en beslutning.
Hvorfor websites ender med at blokere dem ved en fejl
Den mest almindelige årsag er en generel regel. En robots.txt-fil, der er skrevet for at holde scrapers ude med et bredt forbud, rammer også disse crawlers, uden at nogen får besked om, at det er sket.
Den anden årsag er nedarvning. Mange hostingudbydere, sikkerhedsplugins og CDN-konfigurationer tilføjede som standard blokeringer af AI-crawlers i løbet af 2023 og 2024, og websites tog dem i brug, uden at nogen aktivt havde valgt det.
Det tredje er en beslutning, der var rigtig på det tidspunkt. En blokering, der blev tilføjet, da bekymringen handlede om træningsdata, forhindrer nu også, at dine sider bliver læst med henblik på kildehenvisninger, hvilket indebærer en anden afvejning.
Den afvejning, der er værd at overveje
Der er to forskellige ting, disse crawlere gør, og det er værd at adskille dem. Nogle henter indhold for at træne modeller, hvilket ikke giver dig noget direkte tilbage. Andre henter sider for at besvare et spørgsmål, der bliver stillet lige nu, og angiver kilden.
At blokere den anden type fjerner dig fra de svar, som dine konkurrenter vil optræde i. At blokere den første er en rimelig tilgang for en udgiver, hvis indhold er selve produktet.
User-agenterne er dokumenteret separat netop af denne grund, så du kan tillade de crawlere, der citerer, og afvise dem, der kun forbruger indholdet.
Betyder det noget i 2026?
Det betyder mere for hvert år, fordi en større andel af researchen foregår i en assistent. En side, der ikke kan hentes, kan ikke citeres, og der findes ingen rankingrapport, der fortæller dig, at det sker.
Det er asymmetrien, der gør dette værd at kontrollere i stedet for bare at antage noget. Det koster ikke noget at tillade en crawler, hvis du senere beslutter dig for at skifte mening; at være usynlig i et år på grund af en nedarvet regel er dyrt, uden at du opdager det, mens det sker.
Hvad dette værktøj kontrollerer
Den henter din robots.txt og leder efter regler, der ville forhindre de større AI-crawlere i at læse dit website, og rapporterer, hvilke der er blokeret.
Den læser filen, som den er publiceret, så en regel, der er tilføjet af et plugin eller et CDN, vises på samme måde som en regel, du selv har skrevet. Hvis noget er blokeret, uden at det var tilsigtet, er det dér, du bør lede først.
Hvad kan du gøre som det næste
Crawl-adgang er den første af flere porte. Kontrollér, om
søgemaskiner blokeres af den samme fil, gennemgå
robots.txt-filen som helhed, og bekræft, at du udgiver en
llms.txt-fil, der peger på de sider, der er værd at læse.