À propos de llms.txt
Qu’est-ce que llms.txt ?
Un fichier llms.txt est un court document Markdown situé à la racine de votre site, à l’adresse /llms.txt. Il indique à un modèle de langage quelles pages méritent d’être consultées et précise en une ligne le sujet de chacune. Il a été proposé par Jeremy Howard, d’Answer.AI, fin 2024.
Le problème auquel il répond est bien réel. Lorsqu’un modèle lit une page web moderne, il doit traiter la navigation, les avis relatifs aux cookies, les widgets d’articles connexes et le balisage qui entourent une petite quantité de contenu réel, tout en disposant d’une fenêtre de contexte limitée. Une liste organisée de pages épurées, accompagnées de descriptions, constitue un bien meilleur point de départ qu’une exploration de l’ensemble du site.
Le format est volontairement simple : un titre, un résumé facultatif, puis des sections titrées contenant des liens annotés. C’est toute la spécification, et le générateur llms.txt ci-dessus produit exactement cette structure.
À quoi ressemble le fichier
- Un H1 avec le nom du site ou du projet. C’est la seule ligne obligatoire.
- Un bloc de citation facultatif résumant le site en une phrase.
- Un texte facultatif fournissant tout le contexte dont le lecteur a besoin au préalable.
- Des sections H2, chacune contenant une liste de liens au format Markdown, écrits sous la forme d’un nom, d’une URL et d’une courte description.
- Une section facultative intitulée « Optional », pour les liens qui peuvent être ignorés lorsque l’espace est limité.
Un fichier complémentaire, llms-full.txt, contient le texte intégral de ces pages directement intégré plutôt que sous forme de liens. Sa maintenance représente un engagement plus important ; il vaut donc mieux attendre que la version courte vous soit déjà utile.
Une norme en cours d’adoption
llms.txt est récent et se trouve encore à un stade où les éditeurs ont été les premiers à l’adopter. Les sites de documentation l’ont adopté rapidement, la prise en charge s’est étendue à une liste croissante de frameworks et d’outils, et le nombre de sites qui en publient un augmente régulièrement.
Les fournisseurs d’IA ne se sont pas encore publiquement engagés à le lire, ce qui est normal pour une convention aussi récente : il en allait de même pour les sitemaps XML et les données structurées avant qu’ils ne deviennent eux aussi courants.
Cela en fait une initiative précoce judicieuse. Sa rédaction ne prend qu’un après-midi, sa maintenance ne coûte rien, et le fait de l’avoir en place avant que sa prise en charge ne se stabilise vaut mieux que d’attendre d’en avoir la certitude.
Ce qui caractérise un bon fichier
Les descriptions font le travail. « Tarifs » n’apprend rien à un modèle qu’il ne pourrait pas déduire de l’URL, tandis que « Paliers tarifaires, éléments inclus à chaque niveau et mode de comptabilisation de l’utilisation » décrit ce qui se trouve réellement sur la page et permet de la sélectionner pour une question précise.
Soyez également sélectif. Un fichier répertoriant quatre cents URL est un sitemap déguisé, ce qui va à l’encontre de l’objectif, à savoir indiquer quelles pages sont importantes. Vingt liens bien décrits valent mieux que l’intégralité du site.
Pointez vers la version la plus épurée de chaque page. Si vous publiez la documentation à la fois dans une version très stylisée et dans une version Markdown simple, créez un lien vers cette dernière.
Erreurs courantes
- Y intégrer l’intégralité du sitemap, ce qui supprime la sélection éditoriale qui fait la valeur du fichier.
- Des descriptions qui répètent le texte du lien au lieu de décrire la page.
- Des chemins relatifs, ambigus dès que le fichier est consulté ailleurs que sur votre site.
- L’écrire une fois, puis ne plus jamais le mettre à jour à mesure que le site évolue.
- Le considérer comme un substitut à un contenu de qualité pour la page, ce qu’il n’est pas.
Quel est le lien avec la recherche par IA ?
En rédiger un est un exercice utile en soi, car cela vous oblige à décider quelles sont les vingt pages qui représentent réellement le site. C’est la même question qui détermine quelles pages seront citées dans une réponse générée par une IA.
Il est plus efficace lorsqu’il s’inscrit dans le prolongement du reste du travail préparatoire : des titres clairs, un contenu qui répond à une question dès son premier paragraphe, des données structurées et des pages rapides et accessibles. Un index soigneusement sélectionné aide un système qui souhaite déjà vous lire, tandis que ces autres éléments lui donnent envie de le faire.
Faites les deux : ils se renforcent mutuellement.
Utiliser le générateur llms.txt
Saisissez le nom de votre site, son URL et un résumé en une ligne, puis ajoutez une section pour chaque partie du site ainsi que les liens à inclure. Les chemins relatifs sont complétés à partir de l’URL de votre site : vous pouvez donc saisir /docs pour obtenir l’adresse complète.
Le résultat peut être modifié avant d’être copié ou téléchargé, ce qui permet généralement d’apporter la touche finale aux descriptions. Enregistrez le résultat sous le nom llms.txt à la racine de votre site afin qu’il soit accessible à l’adresse votredomaine.com/llms.txt.
Pour aller plus loin
Le fichier est un index : ce sont donc les pages qu’il référence qui comptent. Vérifiez que ces pages sont accessibles à l’aide du vérificateur
robots.txt, confirmez que votre
Sitemap XML est complet et à jour, et assurez-vous que les pages elles-mêmes contiennent un balisage
schema approprié.