Informazioni su llms.txt
Che cos'è llms.txt?
Un file llms.txt è un breve documento Markdown situato nella radice del sito, all’indirizzo /llms.txt, che indirizza un modello linguistico verso le pagine che vale la pena leggere e indica in una riga il contenuto di ciascuna. È stato proposto da Jeremy Howard di Answer.AI alla fine del 2024.
Il problema che affronta è reale. Quando un modello legge una pagina web moderna, trova elementi di navigazione, avvisi sui cookie, widget con articoli correlati e markup che circondano una piccola quantità di contenuti effettivi, oltre ad avere una finestra di contesto limitata. Un elenco curato di pagine essenziali con relative descrizioni è un punto di partenza di gran lunga migliore rispetto alla scansione dell’intero sito.
Il formato è volutamente semplice: un titolo, un riepilogo facoltativo, quindi sezioni con intestazioni contenenti link annotati. Questa è l’intera specifica e il generatore di llms.txt qui sopra produce esattamente questa struttura.
Come appare il file
- Un H1 con il nome del sito o del progetto. Questa è l’unica riga obbligatoria.
- Un blocco di citazione facoltativo che riassume il sito in una frase.
- Testo facoltativo che fornisce qualsiasi contesto di cui il lettore abbia bisogno.
- Sezioni H2, ciascuna contenente un elenco Markdown di link scritti con nome, URL e una breve descrizione.
- Una sezione facoltativa intitolata "Facoltativo", per i link che possono essere ignorati quando lo spazio è limitato.
Un file complementare, llms-full.txt, contiene il testo completo di quelle pagine incorporato anziché collegato. Richiede un impegno maggiore per la manutenzione, quindi vale la pena rimandarne l’adozione finché la versione breve non ti sarà utile.
Uno standard in fase di adozione
llms.txt è recente e si trova nella fase in cui sono stati gli editori a fare il primo passo. I siti di documentazione lo hanno adottato per primi, il supporto è comparso in un numero crescente di framework e strumenti, e il numero di siti che ne pubblicano uno aumenta costantemente.
I provider di IA non hanno ancora assunto impegni pubblici riguardo alla sua lettura, il che è normale per una convenzione così recente: lo stesso valeva per le sitemap XML e per i dati strutturati, prima che entrambi diventassero una pratica comune.
Questo lo rende un’iniziativa iniziale sensata. Ci vuole un pomeriggio per scriverlo, non costa nulla mantenerlo e averlo pronto prima che il supporto si stabilizzi vale più che aspettare di avere la certezza.
Cosa rende efficace un file di questo tipo
Le descrizioni fanno il lavoro. «Prezzi» non dice a un modello nulla che non potrebbe dedurre dall’URL, mentre «Livelli di prezzo, cosa è incluso in ciascun livello e come viene conteggiato l’utilizzo» descrive ciò che è effettivamente presente nella pagina e la rende selezionabile per una domanda specifica.
Sii selettivo anche tu. Un file che elenca quattrocento URL è una sitemap con passaggi aggiuntivi e vanifica lo scopo, ovvero indicare quali pagine sono importanti. Venti link ben descritti valgono più dell’intero sito.
Indica la versione più pulita di ogni pagina. Se pubblichi la documentazione sia in una versione con uno stile elaborato sia in una versione in semplice Markdown, collega quella semplice.
Errori comuni
- Inserire l'intera sitemap, eliminando così la selezione editoriale che conferisce valore al file.
- Descrizioni che ripetono il testo del link invece di descrivere la pagina.
- Percorsi relativi, ambigui quando il file viene letto in un contesto diverso dal tuo sito.
- Scriverlo una volta e non aggiornarlo mai più quando il sito cambia.
- Considerarlo un sostituto di contenuti di qualità per la pagina, cosa che non è.
Come si collega alla ricerca basata sull’IA
Scriverne uno è un esercizio utile di per sé, perché ti costringe a decidere quali venti pagine rappresentino davvero il sito. È la stessa domanda che determina quali delle tue pagine verranno citate in una risposta generata dall’IA.
Funziona al meglio insieme al resto del lavoro di base: titoli chiari, contenuti che rispondono a una domanda già nel primo paragrafo, dati strutturati e pagine veloci e facilmente raggiungibili. Un indice curato aiuta un sistema che vuole già leggerti, mentre sono queste altre cose a far sì che lo voglia.
Fai entrambe le cose: si rafforzano a vicenda.
Utilizzo del generatore di llms.txt
Inserisci il nome del sito, l’URL e un riepilogo di una riga, quindi aggiungi una sezione per ogni parte del sito e i link che vale la pena includere. I percorsi relativi vengono completati in base all’URL del sito, quindi puoi digitare /docs e ottenere l’indirizzo completo.
L’output può essere modificato prima di copiarlo o scaricarlo; è in questa fase che le descrizioni ricevono solitamente la revisione finale. Salva il risultato come llms.txt nella directory principale del sito, in modo che sia disponibile all’indirizzo tuodominio.com/llms.txt.
Cosa fare dopo
Il file è un indice, quindi sono importanti le pagine che vi sono collegate. Verifica che tali pagine siano raggiungibili con il controllo
robots.txt, conferma che la tua
Sitemap XML sia completa e aggiornata e assicurati che le pagine stesse contengano un markup
schema appropriato.