Testar a capacidade de rastreio do site

O teste gratuito de capacidade de rastreio da SEOptimer verifica se os motores de pesquisa e os rastreadores de IA conseguem aceder, obter e indexar a sua página — regras do robots.txt, diretivas noindex, código de estado e a quantidade de conteúdo efetivamente renderizado.

Audite qualquer site em segundos
+ Ferramentas abrangentes de SEO / GEO para todas as funções

Execute mais de 100 verificações no seu site em SEO On-Page, Usabilidade, Desempenho, Redes sociais e Ligações. Agora com GEO em todos os relatórios. O SEOptimer também oferece pesquisa de palavras-chave, monitorização de posições, backlinks e um crawler completo do site.

Sobre a rastreabilidade do site

O que significa rastreabilidade?

Uma página pode ser rastreada quando um motor de pesquisa consegue aceder-lhe, tem autorização para a obter e encontra algo que vale a pena guardar quando lá chega. Se alguma destas condições falhar, a página fica efetivamente invisível, por melhor que seja o conteúdo.
É o passo que vem antes de tudo o resto. Posicionamento, snippets e citações de IA — tudo isso pressupõe que a página tenha sido indexada à partida, por isso, quando uma página simplesmente não aparece, o primeiro passo sensato é testar a rastreabilidade do site em vez de começar a reescrever o conteúdo.
A parte complicada é que todas estas falhas são silenciosas. Nada deixa de funcionar, não aparece nenhum erro, a página parece perfeita para si — simplesmente nunca aparece.

As quatro coisas que impedem uma página de ser indexada

Quase todos os problemas de rastreabilidade são um destes, e ocorrem por uma ordem específica:
  • O URL não é resolvido — um erro 404, um erro do servidor ou uma cadeia de redireccionamentos que termina sem sucesso.
  • O robots.txt impede o rastreador, pelo que a página nunca chega a ser obtida.
  • Uma directiva noindex indica ao motor de pesquisa que deve obter a página, mas mantê-la fora dos resultados.
  • A página apresenta quase nada sem JavaScript, pelo que há pouco conteúdo para indexar.
A ordem é importante ao corrigi-los. Um bloqueio no robots.txt significa que a etiqueta noindex abaixo dele nem sequer é lida; assim, combinar os dois produz o efeito oposto ao que as pessoas esperam — a página continua bloqueada para rastreamento e a instrução para a remover não é vista.

Robots.txt e noindex não são a mesma coisa

Esta é a confusão que causa mais danos. O robots.txt controla se um crawler pode obter uma página; o noindex controla se pode mantê-la no índice. Operam em fases diferentes e não são intercambiáveis.
Para manter uma página fora dos resultados de pesquisa, deve usar noindex, e o crawler tem de ter autorização para obter a página e detetá-lo. Bloqueá-la no robots.txt pode, em vez disso, deixar um URL listado sem qualquer descrição, porque o motor de pesquisa conhece o endereço, mas nunca teve autorização para o consultar.
No caso inverso — uma página que quer que seja encontrada — ambos têm de estar claros, e o noindex pode surgir no HTML ou num cabeçalho HTTP. A versão no cabeçalho é a que costuma escapar às pessoas, uma vez que é invisível no código-fonte da página.

Os crawlers de IA são uma decisão à parte em 2026

As empresas de IA utilizam os seus próprios crawlers identificados pelo nome, e bloqueá-los é uma decisão diferente de bloquear os motores de pesquisa. GPTBot, ClaudeBot, PerplexityBot e os restantes seguem, cada um, a sua própria regra no robots.txt.
Muitos sites bloquearam-nos sem essa intenção, frequentemente por copiarem um ficheiro robots.txt de outro local. Se para si é importante ser citado em respostas de IA, é melhor saber isso agora do que descobri-lo mais tarde.
A posição oposta também é legítima. Se preferir que o seu conteúdo não seja utilizado para treinar modelos ou criar resumos, bloquear esses agentes é a forma de o indicar — o importante é que seja uma decisão, e não um acidente.

Como testar a capacidade de rastreamento de um site com esta ferramenta

Introduza um URL e a ferramenta executa onze verificações, apresentando cada uma separadamente, pela ordem em que um rastreador as encontra:
  • Página acessível — o código de estado devolvido pelo URL.
  • Motores de pesquisa bloqueados — se o robots.txt impede o acesso do Googlebot.
  • Rastreadores de IA bloqueados — quantos dos principais agentes de utilizador de IA não têm acesso permitido.
  • Etiqueta noindex — uma diretiva noindex no HTML da página.
  • Cabeçalho noindex — a mesma diretiva transmitida como um X-Robots-Tag.
  • Robots.txt — se o ficheiro existe e o que contém.
  • Mapa do site XML — se existe um, para que os rastreadores possam descobrir o resto do site.
  • Llms.txt - se o ficheiro que os assistentes de IA procuram está presente.
  • Etiqueta canónica - qual o URL que a página indica como aquele que deve ser indexado.
  • Conteúdo renderizado - quanto da página um crawler consegue ver sem executar JavaScript.
  • Erros de JavaScript - scripts que falham na página, o que muitas vezes explica o conteúdo renderizado reduzido.
Verifica o URL individual que lhe fornece, em vez de rastrear todo o site. Por isso, teste a rastreabilidade do site na página que está efetivamente em falta, e não na página inicial — as duas são frequentemente diferentes, e raramente é a página inicial que tem o problema.

Próximos passos

Se tudo aqui passar e a página continuar a não aparecer, a próxima coisa a verificar é a capacidade de descoberta. Confirme se a página está listada no seu Mapa do site XML, reveja o ficheiro robots.txt completo em vez de analisar apenas as regras para um agente e verifique se existe alguma ligação no site para essa página com o verificador de ligação interna.

Caixa de ferramentas abrangente de SEO com mais de 55 ferramentas

Verifique Títulos, Meta descrições, Cabeçalhos, Schema, Core Web Vitals, SSL e Robots.txt. Gere Meta tags, Sitemaps e regras .htaccess, minimize CSS, JS e HTML e crie textos com as nossas ferramentas de escrita com IA — instantaneamente e de forma gratuita.

Leituras adicionais

Ver Mais
What is a Google Crawler?
You know when you use Google to search for a service, or find information? And once the page loads there is always one website at the very t...
AI Crawlability: Should You Let AI Bots Access Your Site and How Can You Check?
As more people use ChatGPT, Claude, Perplexity, and Google’s AI search features, AI crawlability is becoming increasingly important for webs...
Robots.txt - The Ultimate Guide
What is Robots.txt?   Robots.txt is a file in text form that instructs bot crawlers to index or not index certain pages. It is also know...
How to Fix 'Indexed, though blocked by robots.txt' in Google Search Console
If you received the warning ‘Indexed, though blocked by robots.txt’ notification in Google Search Console, you’ll want to fix it as soon a...
What is Rendered Content and How it Affects AI Crawlers?
Key Takeaway   Rendered content refers to the version of a webpage that a browser displays after executing HTML, CSS, and JavaScript....
Crawl Depth in SEO: What is It & How to Improve It?
Crawl depth influences how efficiently Google can index your content.   Googlebot has limited time and server resources. Therefore, th...