Sobre os ficheiros Robots.txt
O que é um ficheiro robots.txt?
O Robots.txt é um ficheiro de texto simples localizado na raiz de um domínio que informa os visitantes automatizados sobre as partes do site que podem solicitar. É a primeira coisa que a maioria dos crawlers solicita, antes de qualquer página, e é a convenção mais antiga da web para indicar o que uma máquina deve deixar em paz.
A sintaxe é deliberadamente simples: indique um agente do utilizador e, em seguida, liste os caminhos que este pode ou não pode obter. Essa simplicidade é também a armadilha, porque uma única barra colocada no sítio errado pode passar de bloquear uma pasta a bloquear um site inteiro. Um gerador de robots.txt é importante sobretudo porque produz o ficheiro numa estrutura válida e previsível, em vez de o obrigar a lembrar-se da grafia exata das diretivas que escreve uma vez por ano.
Controla o rastreio, não a indexação, e essa distinção induz constantemente as pessoas em erro. Bloquear um URL impede que um crawler o obtenha; não impede de forma fiável que o URL apareça nos resultados de pesquisa, porque uma página pode ser indexada com base nos links que apontam para ela sem nunca ser lida.
O robots.txt ainda é relevante em 2026?
A sua função tradicional mantém-se inalterada: impedir que os crawlers acedam a caminhos de administração, resultados de pesquisa internos, navegação facetada e às infinitas combinações de parâmetros que, de outro modo, consumiriam o orçamento de rastreio em páginas onde ninguém deveria chegar.
A sua nova função é mais abrangente. O ficheiro tornou-se o local onde os proprietários de sites decidem quais os rastreadores de IA que podem aceder aos seus conteúdos, uma questão que a maioria nunca tinha tido de considerar. Todas as grandes empresas de IA operam agora um rastreador identificado pelo nome, e a maioria respeita o ficheiro.
Isso faz do robots.txt um dos poucos ficheiros verdadeiramente relevantes de um site, e um ficheiro que vale a pena rever deliberadamente, em vez de simplesmente aceitar o que quer que uma plataforma tenha enviado por predefinição.
Como o robots.txt se relaciona com a pesquisa por IA
Tem uma decisão real a tomar, e não existe uma resposta universalmente correta. Bloquear os rastreadores de IA protege o seu conteúdo contra a utilização como material de treino ou para gerar respostas. Também elimina qualquer possibilidade de o seu site ser citado nas respostas que uma parcela crescente de pessoas consulta agora, em vez de clicar nos resultados.
Os dois efeitos não são simétricos. O bloqueio é praticamente absoluto, enquanto ser citado é incerto, pelo que a escolha depende de o seu conteúdo ser o produto ou o marketing do mesmo. Um editor que vende subscrições pode legitimamente bloquear; uma empresa cujas páginas existem para serem encontradas, normalmente, não.
O mais importante é que o ficheiro indique aquilo que realmente pretende. Um gerador de robots.txt facilita a definição explícita dessas regras, em vez de as deixar implícitas por omissão.
Boas práticas para robots.txt
- Mantenha o ficheiro na raiz do domínio. Em qualquer outro local, será completamente ignorado.
- Nunca o utilize para ocultar conteúdo sensível. O ficheiro é público, e lê-lo é a forma mais rápida de encontrar os caminhos que queria ocultar.
- Utilize uma diretiva noindex em vez de um bloqueio de rastreio quando o objetivo é manter uma página fora dos resultados.
- Não combine os dois na mesma página. Uma página bloqueada nunca pode ser lida, pelo que o respetivo noindex nunca é detetado.
- Faça referência ao seu sitemap XML no ficheiro para que os crawlers o encontrem sem ser necessário indicá-lo separadamente.
- Analise as regras de rastreio de IA como uma decisão deliberada, não como uma predefinição.
Erros comuns
- Bloquear CSS ou JavaScript, o que impede os motores de pesquisa de apresentar a página como um visitante a vê.
- Deixar uma regra da fase de desenvolvimento a bloquear o site inteiro após o lançamento. Este é o erro de robots.txt mais prejudicial.
- Partir do princípio de que um URL bloqueado desaparecerá dos resultados de pesquisa, quando pode continuar listado sem uma descrição.
- Escrever regras para uma cadeia de user agent que não existe, pelo que nada é afetado.
- Esquecer que os subdomínios precisam do seu próprio ficheiro; uma regra no domínio principal não os abrange.
Utilizar o gerador de robots.txt
Escolha os rastreadores que pretende permitir ou recusar, adicione quaisquer diretórios que devam ser excluídos, defina um atraso de rastreio se o seu servidor precisar de um e indique o seu mapa do site. O gerador cria um ficheiro corretamente formatado que pode guardar na raiz do seu domínio.
Quando estiver disponível, verifique-o em vez de partir do princípio de que está tudo bem. Abra o ficheiro num navegador para confirmar que está a ser servido e verifique na Search Console se as páginas que espera que possam ser rastreadas continuam a sê-lo. Um ficheiro robots.txt que bloqueie silenciosamente mais do que o pretendido pode demorar semanas a ser detetado apenas através do tráfego.
Próximos passos