Informacje o czytelności dla LLM
Czym jest czytelność dla LLM?
Czytelność dla LLM określa, jak dużą część Twojej strony asystent AI może faktycznie odczytać po jej wyrenderowaniu. Nie chodzi o to, co widzi odwiedzający, ani o zawartość pliku źródłowego, lecz o tekst, który pozostaje po załadowaniu strony i usunięciu znaczników.
Te trzy rzeczy różnią się od siebie bardziej, niż mogłoby się wydawać. Strona, która wygląda na bogatą w treści, po pominięciu nawigacji, komunikatów o plikach cookie, widżetów z powiązanymi wpisami i znaczników skryptów może zawierać zaledwie kilkaset użytecznych słów.
Ten moduł sprawdzający ładuje stronę w prawdziwej przeglądarce, tak samo jak nasz audyt, i informuje, ile znajduje się na niej czytelnej treści. Strona, którą system może dokładnie odczytać, może zostać zacytowana; ta, którą ledwo potrafi odczytać, zostanie pominięta na rzecz konkurencyjnej strony, którą jest w stanie odczytać.
Dlaczego liczy się wersja wyrenderowana
Treści składane przez JavaScript po załadowaniu strony mogą być niewidoczne dla narzędzi odczytujących stronę. Nie każdy crawler wykonuje skrypty, a te, które to robią, szybko przerywają działanie, dlatego strona, której główny tekst pojawia się z opóźnieniem, może zostać odczytana jako niemal pusta.
Najpewniejszym rozwiązaniem jest dostarczanie wartościowej treści w początkowym kodzie HTML za pomocą renderowania po stronie serwera lub generowania statycznego. Wolno działający skrypt pogorszy wtedy komfort korzystania ze strony, zamiast sprawić, że strona zniknie.
Stosunek ma znaczenie równie duże jak sama ilość treści. Stronę, na której właściwy tekst jest ukryty pod warstwami znaczników prezentacyjnych, trudniej poprawnie wyodrębnić, nawet jeśli dla użytkownika renderuje się bez zarzutu.
To najmniej efektowna część procesu zdobywania wzmianek i jedna z najbardziej decydujących, ponieważ wszystko inne zakłada jej istnienie. Struktura, nagłówki i dane strukturalne zakładają, że tekst jest dostępny, a właśnie ten element najczęściej psuje się po cichu podczas redesignu — strona nadal wygląda poprawnie dla każdego, kto sprawdza ją w przeglądarce.
Co zwykle jest pomijane
- Tekst wstrzykiwany przez JavaScript po otrzymaniu początkowej odpowiedzi.
- Treści ukryte za kartami, akordeonami lub przyciskami „czytaj więcej”, które nigdy się nie otwierają.
- Wszystko, co znajduje się w elemencie iframe, będącym osobnym dokumentem.
- Tekst występujący wyłącznie na obrazie, bez odpowiednika w formie tekstowej.
- Strony, które składają się głównie z interfejsu, a ich treść stanowi jeden akapit.
Co sprawdza to narzędzie
Renderuje stronę w przeglądarce bez interfejsu graficznego i zgłasza wynikową treść możliwą do odczytania, dzięki czemu widzisz mniej więcej to, z czym musiałaby pracować maszyna odczytująca stronę.
Porównaj to z tym, co według Ciebie znajduje się na stronie. Duża rozbieżność wskazuje na treść zależną od skryptów lub stronę, której zawartość jest uboższa, niż sugeruje jej układ.
Co dalej
Czytelny tekst to surowiec; struktura sprawia, że można go wykorzystać. Sprawdź, czy
tagi nagłówków nadają stronie logiczny układ, upewnij się, że
liczba słów odpowiada zamierzonej długości publikowanego tekstu, i poszukaj błędów
JavaScript, które mogą uniemożliwiać wczytanie treści.