Sobre o bloqueio de rastreadores de IA
De que rastreadores estamos a falar?
As empresas de IA utilizam os seus próprios rastreadores identificados pelo nome, que são distintos dos rastreadores de pesquisa que já conhece. O GPTBot e o OAI-SearchBot pertencem à OpenAI, o ClaudeBot à Anthropic, o PerplexityBot à Perplexity, o Google-Extended controla o treino do Gemini e o CCBot alimenta o Common Crawl, a partir do qual muitos modelos são treinados.
Cada um respeita o robots.txt da forma habitual, pelo que uma regra que indique o seu agente de utilizador determina se pode ler o seu site. Este verificador lê o seu robots.txt e indica se esses rastreadores estão a ser bloqueados.
Ser bloqueado não é automaticamente errado. É uma decisão, e o objetivo da verificação é garantir que foi mesmo uma decisão.
Porque é que os sites acabam por bloqueá-los acidentalmente
A causa mais comum é uma regra abrangente. Um robots.txt criado para impedir o acesso de raspadores, através de uma diretiva Disallow ampla, também apanha estes rastreadores, sem que nada indique que isso aconteceu.
A segunda causa é a herança. Muitos alojamentos, plugins de segurança e configurações de CDN adicionaram bloqueios de rastreadores de IA por predefinição durante 2023 e 2024, e os sites adotaram-nos sem que ninguém tivesse escolhido fazê-lo.
A terceira é uma decisão que estava certa na altura. Um bloqueio adicionado quando a preocupação era os dados de treino impede agora também que as suas páginas sejam lidas para efeitos de citação, o que representa um compromisso diferente.
O compromisso que vale a pena ponderar
Estes crawlers fazem duas coisas distintas, e vale a pena separá-las. Alguns obtêm conteúdo para treinar modelos, sem lhe devolverem nada diretamente. Outros obtêm páginas para responder a uma pergunta que está a ser feita naquele momento e citam a fonte.
Bloquear o segundo tipo faz com que deixe de aparecer nas respostas em que os seus concorrentes aparecem. Bloquear o primeiro é uma posição razoável para um editor cujo conteúdo é o produto.
Os user agents estão documentados separadamente precisamente por este motivo, para que possa permitir os crawlers que citam e recusar os que apenas consomem.
Isto é importante em 2026?
É cada vez mais importante, à medida que uma parcela maior da pesquisa é feita dentro de um assistente. Uma página que não pode ser obtida não pode ser citada, e não existe nenhum relatório de rankings que lhe diga que isso está a acontecer.
A assimetria é o que torna isto algo que vale a pena verificar, em vez de simplesmente assumir. Permitir que um rastreador aceda ao site não tem qualquer custo se decidir mudar de ideias mais tarde; ficar invisível durante um ano devido a uma regra herdada é dispendioso e passa despercebido enquanto acontece.
O que esta ferramenta verifica
Obtém o seu robots.txt e procura regras que impediriam os principais rastreadores de IA de lerem o seu site, indicando quais estão bloqueados.
Lê o ficheiro tal como foi publicado, por isso uma regra adicionada por um plugin ou por uma CDN aparece da mesma forma que uma regra escrita por si. Se algo estiver bloqueado sem que essa fosse a sua intenção, é aí que deve procurar primeiro.
Próximos passos
O acesso ao rastreio é a primeira de várias barreiras. Verifique se os
motores de pesquisa estão bloqueados pelo mesmo ficheiro, reveja o ficheiro
robots.txt como um todo e confirme que publica um ficheiro
llms.txt que aponta para as páginas que vale a pena consultar.