Informacje o pliku llms.txt
Czym jest plik llms.txt?
Plik llms.txt to krótki dokument w formacie Markdown znajdujący się w katalogu głównym witryny, pod adresem /llms.txt. Wskazuje on modelowi językowemu strony warte przeczytania i w jednym wierszu opisuje, czego dotyczy każda z nich. Pomysł ten został zaproponowany przez Jeremy’ego Howarda z Answer.AI pod koniec 2024 roku.
Problem, który rozwiązuje, jest rzeczywisty. Model analizujący nowoczesną stronę internetową otrzymuje nawigację, komunikaty dotyczące plików cookie, widżety z powiązanymi artykułami i znaczniki otaczające niewielką ilość właściwej treści, a ponadto ma do dyspozycji ograniczony kontekst. Wyselekcjonowana lista przejrzystych stron wraz z opisami jest znacznie lepszym punktem wyjścia niż przeszukiwanie całej witryny.
Format jest celowo prosty: tytuł, opcjonalne podsumowanie, a następnie sekcje z nagłówkami i opisanymi linkami. To cała specyfikacja, a powyższy generator llms.txt tworzy dokładnie taki układ.
Jak wygląda plik
- Nagłówek H1 z nazwą witryny lub projektu. To jedyna wymagana linia.
- Opcjonalny blok cytatu podsumowujący witrynę w jednym zdaniu.
- Opcjonalny tekst zawierający wszelkie informacje kontekstowe, których czytelnik potrzebuje w pierwszej kolejności.
- Sekcje H2, z których każda zawiera listę linków w formacie Markdown, zapisanych jako nazwa, URL i krótki opis.
- Opcjonalna sekcja zatytułowana „Optional” z linkami, które można pominąć, gdy brakuje miejsca.
Plik towarzyszący llms-full.txt zawiera pełny tekst tych stron w formie osadzonej, a nie jedynie połączonej za pomocą odnośników. Jego utrzymanie wymaga większego zaangażowania, dlatego warto się tym zająć dopiero wtedy, gdy krótsza wersja zacznie przynosić Ci korzyści.
Standard w trakcie wdrażania
llms.txt to nowy standard, który znajduje się na etapie, na którym jako pierwsi zaczęli go stosować wydawcy. Serwisy z dokumentacją szybko go przyjęły, wsparcie pojawiło się w coraz większej liczbie frameworków i narzędzi, a liczba witryn publikujących taki plik stale rośnie.
Dostawcy AI nie złożyli jeszcze publicznych deklaracji dotyczących odczytywania go, co jest normalne w przypadku standardu w tym wieku — tak samo było z mapami witryn XML i danymi strukturalnymi, zanim oba rozwiązania stały się powszechne.
To sprawia, że jest to rozsądny krok na wczesnym etapie. Napisanie go zajmuje jedno popołudnie, jego utrzymanie nic nie kosztuje, a wdrożenie go, zanim ustalą się zasady obsługi, jest bardziej opłacalne niż czekanie na pewność.
Co składa się na dobry plik
To opisy wykonują całą pracę. „Cennik” nie mówi modelowi niczego, czego nie mógłby wywnioskować z adresu URL, podczas gdy „Poziomy cenowe, zawartość każdego poziomu oraz sposób naliczania wykorzystania” opisuje faktyczną zawartość strony i sprawia, że można ją wybrać w odpowiedzi na konkretne pytanie.
Zachowaj również selektywność. Plik zawierający czterysta adresów URL to mapa witryny z dodatkowymi krokami, co mija się z celem — wskazaniem, które strony mają znaczenie. Dwadzieścia dobrze opisanych linków jest lepszych niż cała witryna.
Wskaż najczystszą wersję każdej strony. Jeśli publikujesz dokumentację zarówno w mocno stylowanej, jak i w zwykłej wersji Markdown, zamieść link do tej zwykłej.
Typowe błędy
- Wklejanie całej mapy witryny, co usuwa selekcję nadającą plikowi jego wartość.
- Opisy, które powtarzają tekst linku zamiast opisywać stronę.
- Ścieżki względne, które stają się niejednoznaczne, gdy plik zostanie odczytany poza Twoją witryną.
- Napisanie tego raz i nigdy nieaktualizowanie wraz ze zmianami w witrynie.
- Traktowanie go jako zamiennika dobrej treści na stronie, którym nie jest.
Jak ma się to do wyszukiwania opartego na AI
Samo napisanie go jest wartościowym ćwiczeniem, ponieważ zmusza do zdecydowania, które dwadzieścia stron faktycznie reprezentuje witrynę. To dokładnie to samo pytanie, które decyduje o tym, która z Twoich stron zostanie zacytowana w odpowiedzi AI.
Najlepiej sprawdza się w połączeniu z pozostałymi elementami podstaw: jasnymi nagłówkami, treścią odpowiadającą na pytanie już w pierwszym akapicie, danymi strukturalnymi oraz stronami, które szybko się wczytują i są dostępne. Starannie dobrany indeks pomaga systemowi, który już chce zapoznać się z Twoją witryną, a pozostałe elementy sprawiają, że ten system w ogóle tego chce.
Zrób oba — wzajemnie się wzmacniają.
Korzystanie z generatora llms.txt
Wprowadź nazwę witryny, jej adres URL i jednowierszowe podsumowanie, a następnie dodaj sekcję dla każdej części witryny oraz linki, które warto uwzględnić. Ścieżki względne są rozwijane na podstawie adresu URL witryny, więc możesz wpisać /docs, aby uzyskać pełny adres.
Wynik można edytować przed skopiowaniem lub pobraniem — to właśnie na tym etapie opisy zwykle zyskują ostateczny kształt. Zapisz wynik jako llms.txt w katalogu głównym witryny, aby był dostępny pod adresem twojadomena.com/llms.txt.
Co dalej
Plik jest indeksem, więc najważniejsze są strony, do których prowadzi. Sprawdź za pomocą narzędzia
robots.txt, czy można uzyskać dostęp do tych stron, upewnij się, że plik
Mapa witryny XML jest kompletny i aktualny, oraz sprawdź, czy same strony zawierają prawidłowe znaczniki
schemat.