Informazioni sulla leggibilità per gli LLM
Che cos’è la leggibilità per gli LLM?
La leggibilità per gli LLM indica quanto del contenuto della tua pagina un assistente IA riesce effettivamente a leggere una volta eseguito il rendering. Non si tratta di ciò che vede un visitatore né di ciò che è presente nel file sorgente, ma del testo che rimane quando la pagina viene caricata e il markup viene rimosso.
Queste tre cose divergono più di quanto ci si aspetti. Una pagina che sembra ricca di contenuti può ridursi a poche centinaia di parole effettivamente utilizzabili una volta esclusi la navigazione, gli avvisi sui cookie, i widget dei post correlati e i tag degli script.
Questo strumento di controllo carica la tua pagina in un browser reale, proprio come fa il nostro audit, e segnala quanto contenuto leggibile è presente. Una pagina che un sistema riesce a leggere accuratamente può essere citata; una che riesce a leggere a malapena viene ignorata a favore di quella di un concorrente.
Perché conta la versione renderizzata
I contenuti assemblati da JavaScript dopo il caricamento potrebbero non essere disponibili per gli strumenti che leggono la pagina. Non tutti i crawler eseguono gli script e quelli che lo fanno rinunciano rapidamente; di conseguenza, una pagina il cui testo principale viene caricato in ritardo può essere interpretata come quasi vuota.
La soluzione più affidabile consiste nel fornire contenuti significativi nell’HTML iniziale tramite il rendering lato server o la generazione statica. In questo modo, uno script lento peggiora l’esperienza anziché far scomparire una pagina.
Il rapporto è importante quanto la quantità. Una pagina in cui il testo effettivo è nascosto sotto strati di markup di presentazione è più difficile da estrarre in modo pulito, anche se viene visualizzata perfettamente per un utente.
Questa è la parte meno affascinante dell’essere citati e una delle più decisive, perché tutto il resto la dà per scontata: struttura, intestazioni e dati strutturati presumono che il testo sia raggiungibile, ed è l’elemento più soggetto a rompersi silenziosamente durante un redesign: la pagina continua ad apparire corretta a chiunque la controlli in un browser.
Cosa tende a mancare
- Testo inserito da JavaScript dopo la risposta iniziale.
- Contenuti nascosti dietro schede, sezioni a fisarmonica o pulsanti «leggi di più» che non si aprono mai.
- Qualsiasi elemento all’interno di un iframe, che costituisce un documento separato.
- Testo presente esclusivamente in un’immagine, senza un equivalente testuale.
- Pagine costituite per lo più dall’interfaccia, in cui il contenuto sostanziale è un paragrafo.
Cosa controlla questo strumento
Esegue il rendering della pagina in un browser headless e segnala il contenuto leggibile risultante, così puoi vedere all’incirca ciò con cui dovrebbe lavorare una macchina che legge la pagina.
Confrontalo con ciò che ritieni sia presente nella pagina. Una differenza significativa indica contenuti che dipendono dagli script oppure una pagina con meno sostanza di quanto suggerisca il layout.
Cosa fare dopo
Il testo leggibile è la materia prima; la struttura è ciò che lo rende utilizzabile. Controlla che gli
tag header diano alla pagina una struttura logica, verifica che
conteggio parole corrisponda a ciò che intendevi pubblicare e cerca eventuali errori
JavaScript che potrebbero impedire al contenuto di essere caricato.