Acerca de la rastreabilidad de los sitios web
¿Qué significa la rastreabilidad?
Una página se puede rastrear cuando un motor de búsqueda puede acceder a ella, tiene permiso para obtenerla y encuentra algo que merece la pena conservar una vez que llega. Si falla cualquiera de estos aspectos, la página será prácticamente invisible, por muy bueno que sea su contenido.
Es el paso previo a todo lo demás. El posicionamiento, los fragmentos y las citas de IA presuponen que la página se ha incluido primero en un índice, por lo que, cuando una página simplemente no aparece, lo más sensato es comprobar si el sitio se puede rastrear antes de empezar a reescribir el contenido.
La parte complicada es que todos estos fallos son silenciosos. Nada se rompe, no aparece ningún error, la página te parece perfecta; simplemente nunca aparece.
Las cuatro cosas que impiden que una página se indexe
Casi todos los problemas de rastreo son uno de estos, y se producen en un orden específico:
- La URL no se resuelve: devuelve un error 404, un error del servidor o una cadena de redirecciones que termina fallando.
- El archivo robots.txt impide el acceso del rastreador, por lo que la página nunca llega a obtenerse.
- Una directiva noindex indica al motor que obtenga la página, pero que la mantenga fuera de los resultados.
- La página no muestra prácticamente nada sin JavaScript, por lo que hay poco contenido que indexar.
El orden importa a la hora de solucionar estos problemas. Un bloqueo en robots.txt significa que la etiqueta noindex que aparece debajo ni siquiera se llega a leer, por lo que combinar ambas directivas produce el efecto contrario al esperado: la página sigue bloqueada para el rastreo y la instrucción para eliminarla no se detecta.
Robots.txt y noindex no son lo mismo
Esta es la confusión que más daños causa. Robots.txt controla si un rastreador puede recuperar una página; noindex controla si puede conservarla. Operan en fases diferentes y no son intercambiables.
Para mantener una página fuera de los resultados de búsqueda, necesitas noindex, y el rastreador debe tener permiso para recuperar la página para poder detectarlo. Bloquearla en robots.txt, en cambio, puede hacer que una URL aparezca listada sin ninguna descripción, porque el buscador conoce la dirección, pero nunca ha tenido permiso para acceder a ella.
En el caso contrario —una página que sí quieres que se encuentre—, ambas directivas deben estar claras, y el noindex puede aparecer tanto en el HTML como en una cabecera HTTP. La versión en la cabecera es la que suele pasar desapercibida, ya que no es visible en el código fuente de la página.
Los rastreadores de IA son una decisión aparte en 2026
Las empresas de IA utilizan sus propios rastreadores con nombre, y bloquearlos es una decisión distinta de bloquear los motores de búsqueda. GPTBot, ClaudeBot, PerplexityBot y el resto siguen cada uno su propia directiva en robots.txt.
Muchos sitios los han bloqueado sin pretenderlo, a menudo al copiar un archivo robots.txt de otro lugar. Si para ti es importante que se cite tu sitio en las respuestas de la IA, conviene saberlo ahora en lugar de descubrirlo más adelante.
La postura contraria también es legítima. Si prefieres que tu contenido no se utilice para entrenar modelos o generar resúmenes, bloquear esos agentes es la forma de indicarlo; la cuestión es que debe ser una decisión, no un accidente.
Cómo comprobar la rastreabilidad de un sitio web con esta herramienta
Introduce una URL y la herramienta realiza once comprobaciones, informando de cada una por separado, en el orden en que un rastreador las encuentra:
- Página accesible: el código de estado que devuelve la URL.
- Motores de búsqueda bloqueados: si robots.txt impide el acceso a Googlebot.
- Rastreadores de IA bloqueados: cuántos de los principales agentes de usuario de IA tienen el acceso bloqueado.
- Etiqueta noindex: una directiva noindex en el HTML de la página.
- Cabecera noindex: la misma directiva enviada como X-Robots-Tag.
- Robots.txt: si el archivo existe y qué contiene.
- Mapa del sitio XML: si existe uno para que los rastreadores puedan descubrir el resto del sitio.
- Llms.txt: si está presente el archivo que buscan los asistentes de IA.
- Etiqueta canónica: qué URL designa la página como la que se debe indexar.
- Contenido renderizado: cuánto de la página puede ver un rastreador sin ejecutar JavaScript.
- Errores de JavaScript: scripts que fallan en la página, lo que suele explicar que el contenido renderizado sea escaso.
Comprueba la URL individual que le proporciones en lugar de rastrear todo el sitio, así que prueba la rastreabilidad del sitio web en la página que realmente falta y no en la página de inicio; ambas suelen diferir y la página de inicio rara vez es la que presenta el problema.
Qué hacer a continuación
Si todo esto supera la comprobación y la página sigue sin aparecer, lo siguiente que debes revisar es su capacidad de descubrimiento. Comprueba que la página figure en tu
Mapa del sitio XML, revisa el archivo
robots.txt completo en lugar de solo las reglas para un agente y comprueba si alguna parte del sitio enlaza con ella mediante el comprobador de
enlace interno.