Über llms.txt
Was ist llms.txt?
Eine llms.txt-Datei ist ein kurzes Markdown-Dokument im Stammverzeichnis Ihrer Website unter /llms.txt. Sie verweist ein Sprachmodell auf die lesenswerten Seiten und beschreibt in einer Zeile, worum es auf jeder Seite geht. Vorgeschlagen wurde sie Ende 2024 von Jeremy Howard von Answer.AI.
Das Problem, das sie löst, ist real. Wenn ein Modell eine moderne Webseite liest, stößt es auf Navigation, Cookie-Hinweise, Widgets für ähnliche Beiträge und Markup, die eine geringe Menge tatsächlich relevanter Inhalte umgeben, während ihm nur ein begrenztes Kontextfenster zur Verfügung steht. Eine kuratierte Liste sauberer Seiten mit Beschreibungen ist daher ein wesentlich besserer Ausgangspunkt als das Crawlen der gesamten Website.
Das Format ist bewusst schlicht gehalten: ein Titel, eine optionale Zusammenfassung und anschließend mit Überschriften versehene Abschnitte mit kommentierten Links. Das ist die gesamte Spezifikation, und der llms.txt-Generator oben erzeugt genau diese Struktur.
So sieht die Datei aus
- Eine H1-Überschrift mit dem Namen der Website oder des Projekts. Dies ist die einzige erforderliche Zeile.
- Ein optionaler Blockquote, der die Website in einem Satz zusammenfasst.
- Optionaler Fließtext mit allen Kontextinformationen, die ein Leser zuerst benötigt.
- H2-Abschnitte, jeweils mit einer Markdown-Liste von Links im Format: Name, URL und eine kurze Beschreibung.
- Ein optionaler Abschnitt mit der Überschrift „Optional“ für Links, die bei knappem Platz übersprungen werden können.
Eine Begleitdatei namens llms-full.txt enthält den vollständigen Text dieser Seiten direkt eingebettet statt nur als Verweise. Ihre Pflege bedeutet einen größeren Aufwand und sollte besser warten, bis die Kurzversion einen Nutzen für Sie bringt.
Ein Standard, der sich gerade durchsetzt
llms.txt ist neu und befindet sich in einer Phase, in der die Verlage den Anfang gemacht haben. Dokumentationsseiten haben es früh übernommen, die Unterstützung durch eine wachsende Zahl von Frameworks und Tools ist hinzugekommen, und die Zahl der Websites, die eine solche Datei veröffentlichen, steigt kontinuierlich.
Die KI-Anbieter haben sich bislang nicht öffentlich dazu verpflichtet, diese Datei zu lesen, was für einen Standard in diesem frühen Entwicklungsstadium normal ist – dasselbe galt auch für XML-Sitemaps und strukturierte Daten, bevor sie zur Routine wurden.
Das macht sie zu einem sinnvollen frühen Schritt. Das Verfassen dauert einen Nachmittag, die Pflege kostet nichts, und sie einzurichten, bevor sich die Unterstützung etabliert hat, ist sinnvoller, als zu warten, bis Gewissheit besteht.
Was eine gute Datei ausmacht
Die Beschreibungen leisten die eigentliche Arbeit. „Preise“ sagt einem Modell nichts, was es nicht bereits aus der URL ableiten könnte, während „Preisstufen, die auf jeder Stufe enthaltenen Leistungen und die Zählweise der Nutzung“ beschreibt, was tatsächlich auf der Seite steht, und sie für eine konkrete Frage auswählbar macht.
Seien Sie ebenfalls selektiv. Eine Datei mit vierhundert URLs ist eine Sitemap mit zusätzlichen Schritten und verfehlt den Zweck: anzugeben, welche Seiten relevant sind. Zwanzig gut beschriebene Links sind besser als die gesamte Website.
Verlinken Sie auf die sauberste Version jeder Seite. Wenn Sie Dokumentation sowohl in einer stark gestalteten als auch in einer einfachen Markdown-Version veröffentlichen, verlinken Sie auf die einfache Version.
Häufige Fehler
- Die gesamte Sitemap einzufügen, wodurch die sorgfältige Auswahl entfällt, die der Datei ihren Wert verleiht.
- Beschreibungen, die lediglich den Linktext wiederholen, anstatt die Seite zu beschreiben.
- Relative Pfade, die mehrdeutig sind, sobald die Datei irgendwo anders als auf Ihrer Website gelesen wird.
- Die Datei einmal zu erstellen und sie nie wieder zu aktualisieren, obwohl sich die Website verändert.
- Es als Ersatz dafür zu behandeln, dass der Seiteninhalt gut ist – was er nicht ist.
Wie dies mit der KI-Suche zusammenhängt
Einen solchen zu erstellen, ist an sich schon eine nützliche Übung, weil man dadurch entscheiden muss, welche zwanzig Seiten die Website tatsächlich repräsentieren. Das ist dieselbe Frage, die entscheidet, welche deiner Seiten in einer KI-Antwort zitiert wird.
Am besten funktioniert das zusammen mit den übrigen Grundlagen: klare Überschriften, Inhalte, die eine Frage bereits im ersten Absatz beantworten, strukturierte Daten sowie schnelle und erreichbare Seiten. Ein kuratiertes Verzeichnis hilft einem System, das dich ohnehin lesen möchte – und die anderen Maßnahmen sorgen dafür, dass es das möchte.
Mach beides – sie verstärken sich gegenseitig.
Verwendung des llms.txt-Generators
Gib den Namen deiner Website, die URL und eine einzeilige Zusammenfassung ein. Füge anschließend für jeden Bereich der Website einen Abschnitt sowie die Links hinzu, die aufgenommen werden sollen. Relative Pfade werden anhand der URL deiner Website ergänzt. Du kannst also /docs eingeben und erhältst die vollständige Adresse.
Die Ausgabe kann bearbeitet werden, bevor du sie kopierst oder herunterlädst. An dieser Stelle erhalten die Beschreibungen normalerweise ihren letzten Feinschliff. Speichere das Ergebnis als llms.txt im Stammverzeichnis deiner Website, damit es unter deinerdomain.com/llms.txt erreichbar ist.
Wie es weitergeht
Die Datei ist ein Index, daher sind die dahinterliegenden Seiten entscheidend. Prüfen Sie mit dem
robots.txt-Checker, ob diese Seiten erreichbar sind, bestätigen Sie, dass Ihre
XML-Sitemap vollständig und aktuell ist, und stellen Sie sicher, dass die Seiten selbst korrektes
Schema-Markup enthalten.