Sobre o Robots.txt
O que é um ficheiro robots.txt?
O robots.txt é um ficheiro de texto simples na raiz de um domínio que indica aos visitantes automatizados que partes do site podem solicitar. É a primeira coisa que a maioria dos crawlers solicita, antes de qualquer página, e a convenção mais antiga da Web para indicar o que uma máquina deve deixar em paz.
Controla o rastreio, não a indexação, e esta distinção causa constantemente confusão. Bloquear um URL impede que um crawler o obtenha; não impede de forma fiável que esse URL apareça nos resultados de pesquisa, porque uma página pode ser indexada com base nos links que apontam para ela sem nunca ser lida.
Vale a pena executar um verificador de robots.txt, porque um único carácter colocado incorretamente altera o significado de todo o ficheiro, e nada no site indica que existe um problema até o tráfego desaparecer.
O robots.txt ainda é relevante em 2026?
A sua função tradicional mantém-se inalterada: impedir que os crawlers acedam a caminhos de administração, resultados de pesquisa internos, navegação facetada e às infinitas combinações de parâmetros que, de outro modo, consumiriam o orçamento de rastreio em páginas onde ninguém deveria chegar.
A sua nova função é mais abrangente. O ficheiro tornou-se o local onde os proprietários de sites decidem quais os rastreadores de IA que podem aceder aos seus conteúdos, uma questão que a maioria nunca tinha tido de considerar. Todas as grandes empresas de IA operam agora um rastreador identificado pelo nome, e a maioria respeita o ficheiro.
Isso faz dele um dos poucos ficheiros verdadeiramente determinantes de um site e um ficheiro que vale a pena rever deliberadamente, em vez de aceitar o que quer que uma plataforma tenha fornecido por predefinição.
Como o robots.txt se relaciona com a pesquisa por IA
Tem uma decisão real a tomar e não existe uma resposta universalmente correta. Bloquear os crawlers de IA protege o seu conteúdo de ser utilizado como material de treino ou para respostas. Também elimina qualquer possibilidade de o seu conteúdo ser citado nas respostas em que uma percentagem crescente de pessoas confia atualmente.
Os dois efeitos não são simétricos. O bloqueio é praticamente absoluto, enquanto a possibilidade de ser citado é incerta, pelo que a escolha depende de o seu conteúdo ser o produto ou o marketing do produto.
Um editor que vende subscrições pode legitimamente bloquear; uma empresa cujas páginas existem para serem encontradas normalmente não o fará. O que importa é que o ficheiro indique aquilo que realmente pretende.
Boas práticas para robots.txt
- Mantenha o ficheiro na raiz do domínio. Em qualquer outro local, será completamente ignorado.
- Nunca o utilize para ocultar conteúdo sensível. O ficheiro é público, e lê-lo é a forma mais rápida de encontrar os caminhos que queria ocultar.
- Utilize uma diretiva noindex em vez de um bloqueio de rastreio quando o objetivo é manter uma página fora dos resultados.
- Não combine os dois na mesma página. Uma página bloqueada nunca pode ser lida, pelo que o respetivo noindex nunca é detetado.
- Faça referência ao seu sitemap XML no ficheiro para que os crawlers o encontrem sem ser necessário indicá-lo separadamente.
- Dê aos subdomínios o seu próprio ficheiro; uma regra no domínio principal não os abrange.
Erros comuns
- Deixar, após o lançamento, uma regra da fase de desenvolvimento que bloqueia todo o site — a versão mais prejudicial deste erro.
- Bloquear CSS ou JavaScript, impedindo os motores de pesquisa de apresentar a página como um visitante a vê.
- Partir do princípio de que um URL bloqueado desaparece dos resultados de pesquisa, quando pode continuar listado sem uma descrição.
- Escrever regras para uma cadeia de user agent que não existe, pelo que nada é afetado.
- Bloquear caminhos de rastreio que o seu próprio sitemap envia, emitindo instruções contraditórias.
O que esta ferramenta verifica
O verificador do robots.txt solicita o ficheiro à raiz do domínio e indica se este existe.
Confirma a existência do ficheiro em vez de avaliar as regras, pelo que um ficheiro que bloqueie acidentalmente todo o seu site é considerado tão correto como um ficheiro válido. O que realmente importa é ler o conteúdo do ficheiro, o que demora cerca de um minuto.
Próximos passos