Informazioni sul blocco dei crawler IA
A quali crawler ci riferiamo?
Le aziende di IA utilizzano crawler propri con nomi specifici, separati dai crawler dei motori di ricerca che già conosci. GPTBot e OAI-SearchBot appartengono a OpenAI, ClaudeBot ad Anthropic, PerplexityBot a Perplexity, Google-Extended controlla l’addestramento di Gemini e CCBot alimenta Common Crawl, dai cui dati vengono addestrati molti modelli.
Ciascuno segue robots.txt secondo le modalità consuete, quindi una regola che ne specifica lo user-agent determina se può leggere il tuo sito. Questo strumento analizza il tuo robots.txt e indica se questi crawler sono bloccati.
Essere bloccati non è automaticamente un errore. È una decisione, e lo scopo del controllo è assicurarsi che sia stata presa consapevolmente.
Perché i siti finiscono per bloccarli per errore
La causa più comune è una regola generale. Un robots.txt scritto per tenere fuori gli scraper con una direttiva di disallow ampia blocca anche questi crawler, senza che nulla segnali che sia successo.
La seconda causa è l’ereditarietà. Molti hosting, plugin di sicurezza e configurazioni CDN hanno aggiunto blocchi per i crawler di IA come impostazione predefinita nel corso del 2023 e del 2024, e i siti li hanno adottati senza che nessuno lo decidesse.
Il terzo è una decisione che all’epoca era giusta. Un blocco aggiunto quando la preoccupazione riguardava i dati di addestramento ora impedisce anche che le tue pagine vengano lette per essere citate, il che comporta un compromesso diverso.
Il compromesso su cui vale la pena riflettere
Questi crawler svolgono due attività distinte, che è opportuno separare. Alcuni recuperano contenuti per addestrare i modelli, senza offrirti nulla direttamente in cambio. Altri recuperano pagine per rispondere a una domanda posta in quel momento e citano la fonte.
Bloccare il secondo tipo ti esclude dalle risposte in cui compariranno i tuoi concorrenti. Bloccare il primo è una posizione ragionevole per un editore il cui contenuto è il prodotto.
Gli user agent sono documentati separatamente proprio per questo motivo, così puoi consentire i crawler che citano i contenuti e rifiutare quelli che si limitano a consumarli.
È importante nel 2026?
Ogni anno diventa più importante, perché una quota sempre maggiore delle ricerche avviene all’interno di un assistente. Una pagina che non può essere recuperata non può essere citata, e non esiste alcun report sul ranking che ti segnali che sta accadendo.
L’asimmetria è ciò che rende utile verificare invece di dare per scontato. Consentire l’accesso a un crawler non costa nulla se in seguito decidi di cambiare idea; rimanere invisibili per un anno a causa di una regola ereditata è costoso, e accade senza che tu te ne accorga.
Cosa controlla questo strumento
Recupera il tuo file robots.txt e cerca le regole che impedirebbero ai principali crawler di IA di leggere il tuo sito, indicando quali sono bloccati.
Legge il file così come è pubblicato, quindi una regola aggiunta da un plugin o da una CDN viene visualizzata allo stesso modo di una regola scritta da te. Se qualcosa è bloccato senza che fosse tua intenzione, è lì che conviene cercare per prima cosa.
Cosa fare dopo
L'accesso alla scansione è il primo di diversi controlli. Verifica se
motori di ricerca sono bloccati dallo stesso file, esamina il file
robots.txt nel suo insieme e conferma di pubblicare un file
llms.txt che punti alle pagine che vale la pena leggere.