Acerca de llms.txt
¿Qué es llms.txt?
Un archivo llms.txt es un breve documento Markdown situado en la raíz de tu sitio, en /llms.txt, que dirige a un modelo de lenguaje hacia las páginas que merece la pena leer e indica en una línea el tema de cada una. Fue propuesto por Jeremy Howard, de Answer.AI, a finales de 2024.
El problema que aborda es real. Al leer una página web moderna, un modelo se encuentra con la navegación, avisos de cookies, widgets de publicaciones relacionadas y código de marcado que rodean una pequeña cantidad de contenido real, además de disponer de una ventana de contexto limitada. Una lista seleccionada de páginas limpias con descripciones es un punto de partida mucho mejor que rastrear todo el sitio.
El formato es deliberadamente sencillo: un título, un resumen opcional y, a continuación, secciones con encabezados de enlaces anotados. Esa es toda la especificación, y el generador de llms.txt de arriba produce exactamente esa estructura.
Cómo es el archivo
- Un H1 con el nombre del sitio o proyecto. Esta es la única línea obligatoria.
- Un bloque de cita opcional que resume el sitio en una frase.
- Texto introductorio opcional con cualquier contexto que el lector necesite conocer previamente.
- Secciones H2, cada una con una lista de enlaces en Markdown escritos como nombre, URL y una breve descripción.
- Una sección opcional con el encabezado «Opcional», para enlaces que se pueden omitir cuando hay poco espacio.
Un archivo complementario, llms-full.txt, contiene el texto completo de esas páginas integrado en lugar de enlazado. Requiere un mayor esfuerzo de mantenimiento y conviene dejarlo para más adelante, hasta que la versión breve empiece a ofrecer resultados.
Un estándar en proceso de adopción
llms.txt es nuevo y se encuentra en una fase en la que los editores han sido los primeros en adoptarlo. Los sitios de documentación lo incorporaron pronto, la compatibilidad se ha extendido a una lista cada vez mayor de frameworks y herramientas, y el número de sitios que publican uno crece de forma constante.
Los proveedores de IA aún no se han comprometido públicamente a leerlo, lo cual es normal en el caso de una convención tan reciente; lo mismo ocurrió con los sitemaps XML y los datos estructurados antes de que ambos se convirtieran en algo habitual.
Eso lo convierte en una medida inicial sensata. Se tarda una tarde en escribirlo, no cuesta nada mantenerlo y tenerlo implementado antes de que se consolide la compatibilidad merece más la pena que esperar a tener certezas.
Qué debe tener uno bueno
Las descripciones hacen el trabajo. «Precios» no aporta a un modelo ninguna información que no pudiera inferir de la URL, mientras que «Niveles de precios, qué incluye cada uno y cómo se contabiliza el uso» describe lo que realmente hay en la página y hace que pueda seleccionarse para una pregunta concreta.
Sé selectivo también. Un archivo con cuatrocientas URL es un mapa del sitio con pasos adicionales, y contradice el objetivo, que es indicar qué páginas importan. Veinte enlaces bien descritos son mejores que todo el sitio.
Apunta a la versión más limpia de cada página. Si publicas documentación tanto en un formato con mucho estilo como en formato Markdown sin formato, enlaza la versión sin formato.
Errores comunes
- Incluir todo el sitemap, eliminando así la selección editorial que da valor al archivo.
- Descripciones que repiten el texto del enlace en lugar de describir la página.
- Rutas relativas, que resultan ambiguas cuando el archivo se lee desde un lugar distinto de tu sitio.
- Escribirlo una vez y no volver a revisarlo a medida que cambia el sitio.
- Considerarlo un sustituto de un buen contenido en la página, cuando no lo es.
Cómo se relaciona esto con la búsqueda mediante IA
Escribir uno ya es un ejercicio útil de por sí, porque te obliga a decidir qué veinte páginas representan realmente el sitio web. Esa es la misma pregunta que determina cuál de tus páginas se cita en una respuesta de IA.
Funciona mejor junto con el resto del trabajo fundamental: encabezados claros, contenido que responde a una pregunta en su primer párrafo, datos estructurados y páginas rápidas y accesibles. Un índice seleccionado ayuda a un sistema que ya quiere leerte, y esas otras cosas son las que hacen que quiera hacerlo.
Haz ambas cosas y se refuerzan mutuamente.
Uso del generador de llms.txt
Introduce el nombre de tu sitio, la URL y un resumen de una línea. Después, añade una sección para cada parte del sitio y los enlaces que merezca la pena incluir. Las rutas relativas se completan con la URL de tu sitio, así que puedes escribir /docs y obtener la dirección completa.
El resultado se puede editar antes de copiarlo o descargarlo; es entonces cuando normalmente se da el último repaso a las descripciones. Guarda el resultado como llms.txt en la raíz de tu sitio para que esté disponible en tudominio.com/llms.txt.
Qué hacer a continuación
El archivo es un índice, por lo que lo importante son las páginas que contiene. Comprueba que se puede acceder a esas páginas con el comprobador de
robots.txt, confirma que tu
Mapa del sitio XML está completo y actualizado, y asegúrate de que las propias páginas incluyen un marcado
schema adecuado.