Informazioni sulla scansionabilità del sito web
Che cosa significa scansionabilità?
Una pagina è scansionabile quando un motore di ricerca può raggiungerla, è autorizzato a recuperarla e, una volta arrivato, trova qualcosa che vale la pena conservare. Se anche solo una di queste condizioni non è soddisfatta, la pagina è di fatto invisibile, indipendentemente dalla qualità dei suoi contenuti.
È il passaggio che viene prima di tutto il resto. Il posizionamento, gli snippet e le citazioni dell’IA presuppongono tutti che la pagina sia stata innanzitutto inserita nell’indice, quindi, quando una pagina semplicemente non compare, la prima cosa sensata da fare è verificare la scansionabilità del sito anziché iniziare a riscrivere i contenuti.
La parte più insidiosa è che ognuno di questi problemi si manifesta in modo silenzioso. Nulla si interrompe, non viene visualizzato alcun errore, la pagina appare perfetta ai tuoi occhi: semplicemente, non compare mai.
Le quattro cause che impediscono a una pagina di essere indicizzata
Quasi ogni problema di scansionabilità rientra in una di queste categorie, che si verificano in un ordine specifico:
- L'URL non si risolve: restituisce un errore 404, un errore del server oppure una catena di reindirizzamenti che fallisce.
- Il file robots.txt impedisce al crawler di accedere alla pagina, che quindi non viene mai recuperata.
- Una direttiva noindex indica al motore di ricerca di recuperare la pagina, ma di escluderla dai risultati.
- La pagina visualizza quasi nulla senza JavaScript, quindi c'è ben poco da indicizzare.
L'ordine è importante quando si risolvono questi problemi. Un blocco in robots.txt significa che il tag noindex sottostante non viene nemmeno letto, quindi la combinazione dei due produce l'effetto opposto a quello che ci si aspetta: la scansione della pagina rimane bloccata e l'istruzione per rimuoverla non viene rilevata.
Robots.txt e noindex non sono la stessa cosa
Questa è la confusione che causa più danni. Robots.txt controlla se un crawler può recuperare una pagina; noindex controlla se può conservarla nel proprio indice. Operano in fasi diverse e non sono intercambiabili.
Per tenere una pagina fuori dai risultati di ricerca serve noindex, e il crawler deve poter recuperare la pagina per rilevarlo. Bloccarla invece in robots.txt può lasciare un URL elencato senza alcuna descrizione, perché il motore conosce l’indirizzo ma non ha mai avuto il permesso di esaminarlo.
Per il caso opposto, ovvero una pagina che vuoi venga trovata, entrambe le condizioni devono essere chiare e il noindex può essere presente nell’HTML o in un’intestazione HTTP. La versione nell’intestazione è quella che trae in inganno, poiché è invisibile nel codice sorgente della pagina.
I crawler AI sono una decisione separata nel 2026
Le aziende di intelligenza artificiale gestiscono crawler proprietari con nomi specifici e bloccarli è una scelta diversa dal bloccare i motori di ricerca. GPTBot, ClaudeBot, PerplexityBot e tutti gli altri hanno ciascuno una propria direttiva in robots.txt.
Molti siti li hanno bloccati senza volerlo, spesso copiando un file robots.txt da qualche altra parte. Se per te è importante essere citato nelle risposte generate dall’IA, vale la pena saperlo ora invece di scoprirlo in seguito.
Anche la posizione opposta è legittima. Se preferisci che i tuoi contenuti non vengano utilizzati per l’addestramento o la sintesi, bloccare questi agenti è il modo per comunicarlo: il punto è che dovrebbe trattarsi di una decisione, non di un incidente.
Come testare la scansionabilità di un sito web con questo strumento
Inserisci un URL e lo strumento esegue undici controlli su di esso, riportando ciascun risultato separatamente, nell’ordine in cui un crawler li incontra:
- Pagina raggiungibile - il codice di stato restituito dall’URL.
- Motori di ricerca bloccati - indica se robots.txt impedisce l’accesso a Googlebot.
- Crawler IA bloccati - quanti dei principali user agent IA non sono autorizzati.
- Tag noindex - una direttiva noindex nell’HTML della pagina.
- Header noindex - la stessa direttiva trasmessa come X-Robots-Tag.
- Robots.txt - indica se il file esiste e cosa contiene.
- Sitemap XML - indica se ne esiste una che consenta ai crawler di scoprire il resto del sito.
- Llms.txt - indica se è presente il file che gli assistenti IA cercano.
- Tag canonical - indica quale URL la pagina designa come quello da indicizzare.
- Contenuto renderizzato - indica quanto della pagina un crawler riesce a vedere senza eseguire JavaScript.
- Errori JavaScript - indica gli script che non vengono eseguiti correttamente nella pagina, spesso il motivo per cui il contenuto renderizzato è scarso.
Controlla il singolo URL che inserisci invece di eseguire la scansione dell'intero sito, quindi verifica la scansionabilità del sito sulla pagina in cui il contenuto è effettivamente mancante e non sulla homepage: spesso le due pagine differiscono e raramente è la homepage ad avere il problema.
Cosa fare dopo
Se tutto qui viene superato e la pagina continua a non comparire, la reperibilità è il prossimo aspetto da esaminare. Verifica che la pagina sia elencata nella tua
Sitemap XML, esamina l’intero file
robots.txt anziché le regole per un solo agente e controlla se c’è qualche collegamento nel sito che rimanda a essa con il verificatore
link interno.