Om llms.txt
Hvad er llms.txt?
En llms.txt-fil er et kort markdown-dokument i roden af dit websted på /llms.txt, som henviser en sprogmodel til de sider, der er værd at læse, og med én linje beskriver, hvad hver side omhandler. Den blev foreslået af Jeremy Howard fra Answer.AI i slutningen af 2024.
Det problem, den løser, er reelt. En model, der læser en moderne webside, møder navigation, cookie-meddelelser, widgets med relaterede indlæg og markup omkring en lille mængde egentligt indhold, samtidig med at den har et begrænset kontekstvindue at arbejde med. En kurateret liste over rene sider med beskrivelser er et langt bedre udgangspunkt end en crawling af hele webstedet.
Formatet er bevidst enkelt: en titel, eventuelt et resumé og derefter sektioner med overskrifter og kommenterede links. Det er hele specifikationen, og llms.txt-generatoren ovenfor producerer præcis denne struktur.
Sådan ser filen ud
- En H1-overskrift med webstedets eller projektets navn. Dette er den eneste obligatoriske linje.
- En valgfri blokcitat, der opsummerer webstedet i én sætning.
- Valgfri brødtekst med den kontekst, en læser først har brug for.
- H2-sektioner, der hver indeholder en markdown-liste med links angivet som navn, URL og en kort beskrivelse.
- En valgfri sektion med overskriften "Valgfrit" til links, der kan springes over, når pladsen er begrænset.
En tilhørende fil, llms-full.txt, indeholder den fulde tekst fra disse sider indlejret i stedet for som links. Den kræver en større vedligeholdelsesindsats og bør derfor vente, indtil den korte version skaber værdi for dig.
En standard, der er ved at blive taget i brug
llms.txt er nyt, og vi er på et stadie, hvor udgivere er gået forrest. Dokumentationssider tog det tidligt til sig, understøttelse er dukket op i en voksende liste af frameworks og værktøjer, og antallet af websteder, der offentliggør en sådan fil, stiger støt.
AI-udbyderne har endnu ikke offentligt forpligtet sig til at læse den, hvilket er normalt for en konvention af denne alder – det samme gjaldt XML-sitemaps og strukturerede data, før de også blev standard.
Det gør den til et fornuftigt tidligt skridt. Det tager en eftermiddag at skrive den, det koster intet at vedligeholde den, og det er mere værd at have den på plads, før understøttelsen falder på plads, end at vente på at være sikker.
Hvad kendetegner en god en?
Beskrivelserne gør arbejdet. "Priser" fortæller en model ikke noget, den ikke kunne udlede af URL'en, hvorimod "Prisniveauer, hvad der er inkluderet på hvert niveau, og hvordan brugen tælles" beskriver, hvad der faktisk findes på siden, og gør den udvælgbar til et specifikt spørgsmål.
Vær også selektiv. En filliste med fire hundrede URL'er er et sitemap med ekstra trin, og det modarbejder formålet, som er at angive, hvilke sider der er vigtige. Tyve velforberedte links slår hele websitet.
Peg på den reneste version af hver side. Hvis du udgiver dokumentation både i en kraftigt designet version og i ren Markdown-form, skal du linke til den rene version.
Almindelige fejl
- At indsætte hele sitemapet, hvilket fjerner den kuratering, der giver filen dens værdi.
- Beskrivelser, der gentager linkteksten i stedet for at beskrive siden.
- Relative stier, som er tvetydige, når filen læses andre steder end på dit website.
- At skrive det én gang og aldrig vende tilbage til det, efterhånden som websitet ændrer sig.
- At betragte det som en erstatning for, at sidens indhold er godt, hvilket det ikke er.
Sådan hænger det sammen med AI-søgning
Det er i sig selv en nyttig øvelse at skrive et, fordi det tvinger dig til at beslutte, hvilke tyve sider der faktisk repræsenterer webstedet. Det er det samme spørgsmål, der afgør, hvilke af dine sider der bliver citeret i et AI-svar.
Det fungerer bedst sammen med resten af det grundlæggende arbejde: tydelige overskrifter, indhold, der besvarer et spørgsmål i sit første afsnit, strukturerede data samt sider, der indlæses hurtigt og kan tilgås. Et kurateret indeks hjælper et system, der allerede gerne vil læse dit indhold, mens de andre ting får systemet til at ville det.
Gør begge dele, så understøtter de hinanden.
Brug af llms.txt-generatoren
Indtast dit websteds navn, URL og en kort opsummering på én linje, og tilføj derefter en sektion for hver del af webstedet samt de links, der er værd at inkludere. Relative stier udvides ud fra dit websteds URL, så du kan skrive /docs og få den fulde adresse.
Outputtet kan redigeres, før du kopierer eller downloader det, og det er typisk her, beskrivelserne får deres sidste gennemgang. Gem resultatet som llms.txt i roden af dit websted, så det kan tilgås på ditdomæne.com/llms.txt.
Hvad kan du gøre som det næste
Filen er et indeks, så det er siderne bag den, der er vigtige. Kontrollér, at disse sider kan tilgås med
robots.txt-kontrollen, bekræft, at dit
XML-sitemap er komplet og opdateret, og sørg for, at siderne selv indeholder korrekt
schema-opmærkning.