Acerca del bloqueo de rastreadores de IA
¿De qué rastreadores hablamos?
Las empresas de IA utilizan sus propios rastreadores con nombre, que son independientes de los rastreadores de los motores de búsqueda que ya conoce. GPTBot y OAI-SearchBot pertenecen a OpenAI, ClaudeBot a Anthropic, PerplexityBot a Perplexity, Google-Extended controla el entrenamiento de Gemini y CCBot proporciona datos a Common Crawl, a partir de los cuales se entrenan muchos modelos.
Todos siguen las reglas de robots.txt de la forma habitual, por lo que una regla que indique su agente de usuario determina si pueden leer su sitio. Este comprobador lee su robots.txt e informa de si esos rastreadores están bloqueados.
Estar bloqueados no es necesariamente un error. Es una decisión, y el objetivo de comprobarlo es asegurarse de que realmente lo fue.
Por qué los sitios acaban bloqueándolos por accidente
La causa más habitual es una regla general. Un robots.txt escrito para impedir el acceso de los rastreadores mediante una directiva Disallow amplia también bloquea a estos rastreadores, y nada avisa de que ha ocurrido.
La segunda causa es la herencia de configuraciones. Durante 2023 y 2024, muchos proveedores de hosting, plugins de seguridad y configuraciones de CDN añadieron bloqueos de rastreadores de IA de forma predeterminada, y los sitios los adoptaron sin que nadie lo decidiera.
La tercera es una decisión que fue acertada en su momento. Un bloqueo añadido cuando la preocupación eran los datos de entrenamiento ahora también impide que tus páginas se lean para incluirlas como fuentes, lo que supone un equilibrio diferente.
El equilibrio que merece la pena considerar
Estos rastreadores hacen dos cosas distintas, y conviene diferenciarlas. Algunos obtienen contenido para entrenar modelos, lo que no te proporciona nada directamente. Otros consultan páginas para responder a una pregunta que se está formulando en ese momento e incluyen la fuente.
Bloquear el segundo tipo hace que no aparezcas en las respuestas en las que sí aparecerán tus competidores. Bloquear el primero es una postura razonable para un editor cuyo contenido es el producto.
Los agentes de usuario están documentados por separado precisamente por este motivo, para que puedas permitir el acceso a los rastreadores que citan fuentes y rechazar el de los que solo consumen contenido.
¿Importa esto en 2026?
Cada año importa más, ya que una mayor parte de la investigación se realiza dentro de un asistente. Una página que no se puede rastrear no puede citarse, y no existe ningún informe de posicionamiento que te indique que está ocurriendo.
La asimetría es lo que hace que esto merezca la pena comprobarlo en lugar de darlo por hecho. Permitir el acceso a un rastreador no cuesta nada si más adelante decides cambiar de opinión; pasar un año siendo invisible por una regla heredada resulta costoso, y además ocurre sin que te des cuenta.
Qué comprueba esta herramienta
Obtiene tu archivo robots.txt y busca reglas que impedirían a los principales rastreadores de IA leer tu sitio, e informa de cuáles están bloqueados.
Lee el archivo tal como está publicado, por lo que una regla añadida por un plugin o una CDN aparece igual que una que hayas escrito tú. Si hay algo bloqueado que no pretendías bloquear, ese es el primer lugar que debes revisar.
Qué hacer a continuación
El acceso al rastreo es la primera de varias barreras. Comprueba si
motores de búsqueda están bloqueados por el mismo archivo, revisa el archivo
robots.txt en su totalidad y confirma que publicas un archivo
llms.txt que apunte a las páginas que merece la pena leer.