Sobre a rastreabilidade do site
O que significa rastreabilidade?
Uma página pode ser rastreada quando um motor de pesquisa consegue aceder-lhe, tem autorização para a obter e encontra algo que vale a pena guardar quando lá chega. Se alguma destas condições falhar, a página fica efetivamente invisível, por melhor que seja o conteúdo.
É o passo que vem antes de tudo o resto. Posicionamento, snippets e citações de IA — tudo isso pressupõe que a página tenha sido indexada à partida, por isso, quando uma página simplesmente não aparece, o primeiro passo sensato é testar a rastreabilidade do site em vez de começar a reescrever o conteúdo.
A parte complicada é que todas estas falhas são silenciosas. Nada deixa de funcionar, não aparece nenhum erro, a página parece perfeita para si — simplesmente nunca aparece.
As quatro coisas que impedem uma página de ser indexada
Quase todos os problemas de rastreabilidade são um destes, e ocorrem por uma ordem específica:
- O URL não é resolvido — um erro 404, um erro do servidor ou uma cadeia de redireccionamentos que termina sem sucesso.
- O robots.txt impede o rastreador, pelo que a página nunca chega a ser obtida.
- Uma directiva noindex indica ao motor de pesquisa que deve obter a página, mas mantê-la fora dos resultados.
- A página apresenta quase nada sem JavaScript, pelo que há pouco conteúdo para indexar.
A ordem é importante ao corrigi-los. Um bloqueio no robots.txt significa que a etiqueta noindex abaixo dele nem sequer é lida; assim, combinar os dois produz o efeito oposto ao que as pessoas esperam — a página continua bloqueada para rastreamento e a instrução para a remover não é vista.
Robots.txt e noindex não são a mesma coisa
Esta é a confusão que causa mais danos. O robots.txt controla se um crawler pode obter uma página; o noindex controla se pode mantê-la no índice. Operam em fases diferentes e não são intercambiáveis.
Para manter uma página fora dos resultados de pesquisa, deve usar noindex, e o crawler tem de ter autorização para obter a página e detetá-lo. Bloqueá-la no robots.txt pode, em vez disso, deixar um URL listado sem qualquer descrição, porque o motor de pesquisa conhece o endereço, mas nunca teve autorização para o consultar.
No caso inverso — uma página que quer que seja encontrada — ambos têm de estar claros, e o noindex pode surgir no HTML ou num cabeçalho HTTP. A versão no cabeçalho é a que costuma escapar às pessoas, uma vez que é invisível no código-fonte da página.
Os crawlers de IA são uma decisão à parte em 2026
As empresas de IA utilizam os seus próprios crawlers identificados pelo nome, e bloqueá-los é uma decisão diferente de bloquear os motores de pesquisa. GPTBot, ClaudeBot, PerplexityBot e os restantes seguem, cada um, a sua própria regra no robots.txt.
Muitos sites bloquearam-nos sem essa intenção, frequentemente por copiarem um ficheiro robots.txt de outro local. Se para si é importante ser citado em respostas de IA, é melhor saber isso agora do que descobri-lo mais tarde.
A posição oposta também é legítima. Se preferir que o seu conteúdo não seja utilizado para treinar modelos ou criar resumos, bloquear esses agentes é a forma de o indicar — o importante é que seja uma decisão, e não um acidente.
Como testar a capacidade de rastreamento de um site com esta ferramenta
Introduza um URL e a ferramenta executa onze verificações, apresentando cada uma separadamente, pela ordem em que um rastreador as encontra:
- Página acessível — o código de estado devolvido pelo URL.
- Motores de pesquisa bloqueados — se o robots.txt impede o acesso do Googlebot.
- Rastreadores de IA bloqueados — quantos dos principais agentes de utilizador de IA não têm acesso permitido.
- Etiqueta noindex — uma diretiva noindex no HTML da página.
- Cabeçalho noindex — a mesma diretiva transmitida como um X-Robots-Tag.
- Robots.txt — se o ficheiro existe e o que contém.
- Mapa do site XML — se existe um, para que os rastreadores possam descobrir o resto do site.
- Llms.txt - se o ficheiro que os assistentes de IA procuram está presente.
- Etiqueta canónica - qual o URL que a página indica como aquele que deve ser indexado.
- Conteúdo renderizado - quanto da página um crawler consegue ver sem executar JavaScript.
- Erros de JavaScript - scripts que falham na página, o que muitas vezes explica o conteúdo renderizado reduzido.
Verifica o URL individual que lhe fornece, em vez de rastrear todo o site. Por isso, teste a rastreabilidade do site na página que está efetivamente em falta, e não na página inicial — as duas são frequentemente diferentes, e raramente é a página inicial que tem o problema.
Próximos passos
Se tudo aqui passar e a página continuar a não aparecer, a próxima coisa a verificar é a capacidade de descoberta. Confirme se a página está listada no seu
Mapa do site XML, reveja o ficheiro
robots.txt completo em vez de analisar apenas as regras para um agente e verifique se existe alguma ligação no site para essa página com o verificador de
ligação interna.