Testa la scansionabilità del sito

Il test gratuito di scansionabilità di SEOptimer verifica se i motori di ricerca e i crawler IA riescono a raggiungere, recuperare e indicizzare la tua pagina, analizzando le regole di robots.txt, le direttive noindex, il codice di stato e la quantità effettiva di contenuti visualizzati.

Esegui un audit SEO su qualsiasi sito in pochi secondi
+ Strumenti SEO / GEO completi per ogni esigenza

Esegui oltre 100 controlli sul tuo sito web per SEO On-Page, usabilità, prestazioni, social e link. Ora con GEO incluso in ogni report. SEOptimer offre anche ricerca di parole chiave, monitoraggio del posizionamento, analisi dei backlink e un crawler completo del sito.

Informazioni sulla scansionabilità del sito web

Che cosa significa scansionabilità?

Una pagina è scansionabile quando un motore di ricerca può raggiungerla, è autorizzato a recuperarla e, una volta arrivato, trova qualcosa che vale la pena conservare. Se anche solo una di queste condizioni non è soddisfatta, la pagina è di fatto invisibile, indipendentemente dalla qualità dei suoi contenuti.
È il passaggio che viene prima di tutto il resto. Il posizionamento, gli snippet e le citazioni dell’IA presuppongono tutti che la pagina sia stata innanzitutto inserita nell’indice, quindi, quando una pagina semplicemente non compare, la prima cosa sensata da fare è verificare la scansionabilità del sito anziché iniziare a riscrivere i contenuti.
La parte più insidiosa è che ognuno di questi problemi si manifesta in modo silenzioso. Nulla si interrompe, non viene visualizzato alcun errore, la pagina appare perfetta ai tuoi occhi: semplicemente, non compare mai.

Le quattro cause che impediscono a una pagina di essere indicizzata

Quasi ogni problema di scansionabilità rientra in una di queste categorie, che si verificano in un ordine specifico:
  • L'URL non si risolve: restituisce un errore 404, un errore del server oppure una catena di reindirizzamenti che fallisce.
  • Il file robots.txt impedisce al crawler di accedere alla pagina, che quindi non viene mai recuperata.
  • Una direttiva noindex indica al motore di ricerca di recuperare la pagina, ma di escluderla dai risultati.
  • La pagina visualizza quasi nulla senza JavaScript, quindi c'è ben poco da indicizzare.
L'ordine è importante quando si risolvono questi problemi. Un blocco in robots.txt significa che il tag noindex sottostante non viene nemmeno letto, quindi la combinazione dei due produce l'effetto opposto a quello che ci si aspetta: la scansione della pagina rimane bloccata e l'istruzione per rimuoverla non viene rilevata.

Robots.txt e noindex non sono la stessa cosa

Questa è la confusione che causa più danni. Robots.txt controlla se un crawler può recuperare una pagina; noindex controlla se può conservarla nel proprio indice. Operano in fasi diverse e non sono intercambiabili.
Per tenere una pagina fuori dai risultati di ricerca serve noindex, e il crawler deve poter recuperare la pagina per rilevarlo. Bloccarla invece in robots.txt può lasciare un URL elencato senza alcuna descrizione, perché il motore conosce l’indirizzo ma non ha mai avuto il permesso di esaminarlo.
Per il caso opposto, ovvero una pagina che vuoi venga trovata, entrambe le condizioni devono essere chiare e il noindex può essere presente nell’HTML o in un’intestazione HTTP. La versione nell’intestazione è quella che trae in inganno, poiché è invisibile nel codice sorgente della pagina.

I crawler AI sono una decisione separata nel 2026

Le aziende di intelligenza artificiale gestiscono crawler proprietari con nomi specifici e bloccarli è una scelta diversa dal bloccare i motori di ricerca. GPTBot, ClaudeBot, PerplexityBot e tutti gli altri hanno ciascuno una propria direttiva in robots.txt.
Molti siti li hanno bloccati senza volerlo, spesso copiando un file robots.txt da qualche altra parte. Se per te è importante essere citato nelle risposte generate dall’IA, vale la pena saperlo ora invece di scoprirlo in seguito.
Anche la posizione opposta è legittima. Se preferisci che i tuoi contenuti non vengano utilizzati per l’addestramento o la sintesi, bloccare questi agenti è il modo per comunicarlo: il punto è che dovrebbe trattarsi di una decisione, non di un incidente.

Come testare la scansionabilità di un sito web con questo strumento

Inserisci un URL e lo strumento esegue undici controlli su di esso, riportando ciascun risultato separatamente, nell’ordine in cui un crawler li incontra:
  • Pagina raggiungibile - il codice di stato restituito dall’URL.
  • Motori di ricerca bloccati - indica se robots.txt impedisce l’accesso a Googlebot.
  • Crawler IA bloccati - quanti dei principali user agent IA non sono autorizzati.
  • Tag noindex - una direttiva noindex nell’HTML della pagina.
  • Header noindex - la stessa direttiva trasmessa come X-Robots-Tag.
  • Robots.txt - indica se il file esiste e cosa contiene.
  • Sitemap XML - indica se ne esiste una che consenta ai crawler di scoprire il resto del sito.
  • Llms.txt - indica se è presente il file che gli assistenti IA cercano.
  • Tag canonical - indica quale URL la pagina designa come quello da indicizzare.
  • Contenuto renderizzato - indica quanto della pagina un crawler riesce a vedere senza eseguire JavaScript.
  • Errori JavaScript - indica gli script che non vengono eseguiti correttamente nella pagina, spesso il motivo per cui il contenuto renderizzato è scarso.
Controlla il singolo URL che inserisci invece di eseguire la scansione dell'intero sito, quindi verifica la scansionabilità del sito sulla pagina in cui il contenuto è effettivamente mancante e non sulla homepage: spesso le due pagine differiscono e raramente è la homepage ad avere il problema.

Cosa fare dopo

Se tutto qui viene superato e la pagina continua a non comparire, la reperibilità è il prossimo aspetto da esaminare. Verifica che la pagina sia elencata nella tua Sitemap XML, esamina l’intero file robots.txt anziché le regole per un solo agente e controlla se c’è qualche collegamento nel sito che rimanda a essa con il verificatore link interno.

Strumento SEO completo con oltre 55 strumenti

Controlla titoli, meta description, intestazioni, dati strutturati, Core Web Vitals, SSL e robots.txt. Genera meta tag, sitemap e regole .htaccess, minimizza CSS, JS e HTML e crea contenuti con i nostri strumenti di scrittura basati sull’IA, istantaneamente e gratuitamente.

Approfondimenti

Vedi di più
What is a Google Crawler?
You know when you use Google to search for a service, or find information? And once the page loads there is always one website at the very t...
AI Crawlability: Should You Let AI Bots Access Your Site and How Can You Check?
As more people use ChatGPT, Claude, Perplexity, and Google’s AI search features, AI crawlability is becoming increasingly important for webs...
Robots.txt - La Guida Definitiva
Cos'è Robots.txt? Robots.txt è un file in formato testo che istruisce i bot crawler ad indicizzare o non indicizzare certe pagine. È an...
How to Fix 'Indexed, though blocked by robots.txt' in Google Search Console
If you received the warning ‘Indexed, though blocked by robots.txt’ notification in Google Search Console, you’ll want to fix it as soon a...
What is Rendered Content and How it Affects AI Crawlers?
Key Takeaway   Rendered content refers to the version of a webpage that a browser displays after executing HTML, CSS, and JavaScript....
Crawl Depth in SEO: What is It & How to Improve It?
Crawl depth influences how efficiently Google can index your content.   Googlebot has limited time and server resources. Therefore, th...