Om robots.txt-filer
Hvad er en robots.txt-fil?
Robots.txt er en almindelig tekstfil, der ligger i domænets rodmappe og fortæller automatiserede besøgende, hvilke dele af webstedet de må anmode om. Det er det første, de fleste crawlere anmoder om, før de henter en side, og det er den ældste konvention på nettet til at angive, hvad en maskine bør holde sig fra.
Syntaksen er bevidst enkel: angiv en user agent, og angiv derefter de stier, som den må eller ikke må hente. Denne enkelhed er også faldgruben, fordi en enkelt forkert placeret skråstreg kan gå fra at blokere én mappe til at blokere et helt websted. En robots.txt-generator er først og fremmest nyttig, fordi den opretter filen i et gyldigt og forudsigeligt format, så du ikke selv skal huske den nøjagtige stavemåde af direktiver, du kun skriver én gang om året.
Det styrer crawling, ikke indeksering, og den forskel forvirrer konstant folk. Blokering af en URL forhindrer en crawler i at hente den, men holder ikke pålideligt URL'en ude af søgeresultaterne, fordi en side kan blive indekseret på baggrund af links, der peger på den, uden nogensinde at være blevet læst.
Er robots.txt stadig relevant i 2026?
Den traditionelle funktion er uændret: at holde crawlere ude af administrationsstier, interne søgeresultater, facetteret navigation og de endeløse kombinationer af parametre, som ellers ville bruge crawlbudget på sider, som ingen bør lande på.
Dens nyere opgave er større. Filen er blevet det sted, hvor webstedsejere beslutter, hvilke AI-crawlere der overhovedet må få adgang til deres indhold – et spørgsmål, som de fleste aldrig tidligere havde behøvet at tage stilling til. Alle større AI-virksomheder driver nu en navngiven crawler, og de fleste respekterer filen.
Det gør robots.txt til en af de få filer på et websted, der reelt har betydning, og til en fil, der er værd at gennemgå bevidst i stedet for blot at arve den version, som en platform leverede som standard.
Hvordan robots.txt hænger sammen med AI-søgning
Du står over for et reelt valg, og der findes ikke ét universelt korrekt svar. Blokering af AI-crawlere beskytter dit indhold mod at blive brugt som trænings- eller svarmateriale. Det fjerner også enhver mulighed for, at dit website bliver citeret i de svar, som en voksende andel af mennesker nu stoler på i stedet for at klikke videre til søgeresultaterne.
De to effekter er ikke symmetriske. Blokering er næsten absolut, mens det er usikkert, om man bliver citeret, så valget afhænger af, om dit indhold er produktet eller markedsføringen af det. En udgiver, der sælger abonnementer, kan med god grund blokere; en virksomhed, hvis sider er oprettet for at blive fundet, vil som regel ikke gøre det.
Det vigtigste er, at filen angiver, hvad du faktisk har til hensigt. En robots.txt-generator gør det nemt at angive disse regler eksplicit i stedet for at lade dem være underforstået gennem udeladelser.
Bedste praksis for robots.txt
- Placer filen i domænets rodmappe. Hvis den placeres et andet sted, ignoreres den fuldstændigt.
- Brug den aldrig til at skjule følsomt indhold. Filen er offentlig, og ved at læse den kan man hurtigst finde de stier, du ønskede at skjule.
- Brug en noindex-direktiv i stedet for en crawl-blokering, når målet er at holde en side ude af søgeresultaterne.
- Kombinér ikke de to på den samme side. En blokeret side kan aldrig læses, så dens noindex-direktiv bliver aldrig set.
- Referér til dit XML-sitemap i filen, så crawlere kan finde det uden at få det oplyst separat.
- Gennemgå reglerne for AI-crawlere som en bevidst beslutning, ikke som en standardindstilling.
Almindelige fejl
- Blokering af CSS eller JavaScript, hvilket forhindrer søgemaskiner i at gengive siden, som en besøgende ser den.
- At lade en regel fra udviklingsfasen blokere hele websitet efter lanceringen. Dette er den mest skadelige robots.txt-fejl.
- At antage, at en blokeret URL forsvinder fra søgeresultaterne, selv om den kan forblive på listen uden en beskrivelse.
- At skrive regler for en user agent-streng, der ikke findes, så intet bliver påvirket.
- At glemme, at underdomæner skal have deres egen fil; en regel på hoveddomænet gælder ikke for dem.
Brug af robots.txt-generatoren
Vælg, hvilke crawlere der skal tillades eller afvises, tilføj eventuelle mapper, der skal holdes ude, angiv en crawl-forsinkelse, hvis din server har brug for det, og angiv dit sitemap. Generatoren sammensætter en korrekt formateret fil, som du kan gemme i roden af dit domæne.
Når den er live, skal du verificere den i stedet for at gå ud fra, at alt er i orden. Hent filen i en browser for at bekræfte, at den bliver leveret, og tjek i Search Console, at de sider, du forventer skal kunne crawles, stadig kan det. En robots.txt-fil, der ubemærket blokerer mere end tilsigtet, kan tage flere uger at opdage alene via trafikken.
Hvad kan du gøre som det næste
Når filen er live, skal du bekræfte, at den bliver leveret, og at den ikke blokerer mere, end du havde til hensigt. Tjek den med
robots.txt-kontrol, gennemgå
Kontrol af noindex-tags, som holder en hentet side ude af resultaterne, og sørg for, at det
Kontrol af XML-sitemap, du henviste til, faktisk findes.