Sobre o llms.txt
O que é o llms.txt?
Um ficheiro llms.txt é um documento Markdown curto na raiz do seu site, em /llms.txt, que direciona um modelo de linguagem para as páginas que vale a pena consultar e indica, numa linha, o tema de cada uma. Foi proposto por Jeremy Howard, da Answer.AI, no final de 2024.
O problema que aborda é real. Ao ler uma página Web moderna, um modelo depara-se com navegação, avisos de cookies, widgets de publicações relacionadas e marcação à volta de uma pequena quantidade de conteúdo efetivo, além de ter uma janela limitada com que trabalhar. Uma lista selecionada de páginas limpas, acompanhadas de descrições, é um ponto de partida muito melhor do que rastrear todo o site.
O formato é deliberadamente simples: um título, um resumo opcional e, em seguida, secções com títulos e links anotados. Essa é toda a especificação, e o gerador de llms.txt acima produz exatamente essa estrutura.
Como é o aspeto do ficheiro
- Um H1 com o nome do site ou projeto. Esta é a única linha obrigatória.
- Um bloco de citação opcional que resume o site numa frase.
- Texto corrido opcional com qualquer contexto de que o leitor necessite primeiro.
- Secções H2, cada uma contendo uma lista Markdown de links apresentados como nome, URL e uma breve descrição.
- Uma secção opcional com o título "Opcional", para links que podem ser ignorados quando o espaço é limitado.
Um ficheiro complementar, llms-full.txt, contém o texto integral dessas páginas incorporado, em vez de apresentar ligações para as mesmas. É um compromisso maior em termos de manutenção e vale a pena deixar essa tarefa para quando a versão curta já estiver a ser útil.
Um padrão em processo de adoção
O llms.txt é recente e encontra-se numa fase em que os editores de conteúdos foram os primeiros a adotá-lo. Os sites de documentação começaram a utilizá-lo desde cedo, surgiu suporte numa lista cada vez maior de frameworks e ferramentas, e o número de sites que publicam um ficheiro deste tipo aumenta de forma constante.
Os fornecedores de IA ainda não assumiram publicamente o compromisso de o ler, o que é normal para uma convenção com esta idade — o mesmo aconteceu com os sitemaps XML e com os dados estruturados antes de ambos se tornarem práticas correntes.
Isso faz com que seja uma medida inicial sensata. Demora uma tarde a escrever, não custa nada manter e tê-lo implementado antes de o suporte se estabelecer vale mais do que esperar para ter a certeza.
O que caracteriza um bom ficheiro
As descrições fazem o trabalho. «Preços» não diz a um modelo nada que ele não pudesse inferir a partir do URL, ao passo que «Níveis de preços, o que está incluído em cada nível e como a utilização é contabilizada» descreve o que está realmente na página e torna-a selecionável para uma pergunta específica.
Seja seletivo também. Um ficheiro que enumere quatrocentos URLs é um mapa do site com passos adicionais e anula o objetivo, que é indicar quais as páginas relevantes. Vinte ligações bem descritas valem mais do que o site inteiro.
Aponte para a versão mais limpa de cada página. Se publicar documentação tanto numa versão com muitos estilos como numa versão simples em Markdown, crie uma ligação para a versão simples.
Erros comuns
- Incluir todo o mapa do site, eliminando a curadoria que dá valor ao ficheiro.
- Descrições que repetem o texto da ligação em vez de descreverem a página.
- Caminhos relativos, que são ambíguos quando o ficheiro é lido fora do seu site.
- Escrevê-lo uma vez e nunca mais o rever à medida que o site muda.
- Tratá-lo como um substituto para um bom conteúdo na página, o que não é.
Como isto se relaciona com a pesquisa por IA
Escrever um é um exercício útil por si só, porque obriga a decidir quais são, de facto, as vinte páginas que representam o site. Essa é a mesma questão que determina quais das suas páginas são citadas numa resposta de IA.
Funciona melhor em conjunto com o restante trabalho de base: títulos claros, conteúdo que responde a uma pergunta logo no primeiro parágrafo, dados estruturados e páginas rápidas e acessíveis. Um índice selecionado ajuda um sistema que já quer ler o seu conteúdo, e são essas outras coisas que fazem com que ele queira fazê-lo.
Faça ambos e eles reforçam-se mutuamente.
Utilizar o gerador de llms.txt
Introduza o nome do site, o URL e um resumo de uma linha. Em seguida, adicione uma secção para cada parte do site e as ligações que vale a pena incluir. Os caminhos relativos são expandidos com base no URL do site, por isso pode escrever /docs e obter o endereço completo.
O resultado pode ser editado antes de o copiar ou transferir, que é normalmente quando as descrições recebem a sua revisão final. Guarde o resultado como llms.txt na raiz do site, para que fique disponível em oseudominio.com/llms.txt.
Próximos passos
O ficheiro é um índice, pelo que o que importa são as páginas que estão por detrás dele. Verifique se essas páginas estão acessíveis com o verificador de
robots.txt, confirme se o seu
Mapa do site XML está completo e atualizado e certifique-se de que as próprias páginas incluem uma marcação
schema adequada.