Comprueba la rastreabilidad de tu sitio web

La prueba gratuita de rastreabilidad de SEOptimer comprueba si los motores de búsqueda y los rastreadores de IA pueden acceder a tu página, obtenerla e indexarla: reglas de robots.txt, directivas noindex, código de estado y cuánto contenido se renderiza realmente.

Audita cualquier sitio web con SEO en cuestión de segundos
+ Herramientas SEO / GEO completas para cada función

Realiza más de 100 comprobaciones en tu sitio web de SEO On-Page, usabilidad, rendimiento, redes sociales y enlaces. Ahora con GEO en todos los informes. SEOptimer también ofrece investigación de palabras clave, seguimiento de posiciones, análisis de backlinks y un rastreador web completo.

Acerca de la rastreabilidad de los sitios web

¿Qué significa la rastreabilidad?

Una página se puede rastrear cuando un motor de búsqueda puede acceder a ella, tiene permiso para obtenerla y encuentra algo que merece la pena conservar una vez que llega. Si falla cualquiera de estos aspectos, la página será prácticamente invisible, por muy bueno que sea su contenido.
Es el paso previo a todo lo demás. El posicionamiento, los fragmentos y las citas de IA presuponen que la página se ha incluido primero en un índice, por lo que, cuando una página simplemente no aparece, lo más sensato es comprobar si el sitio se puede rastrear antes de empezar a reescribir el contenido.
La parte complicada es que todos estos fallos son silenciosos. Nada se rompe, no aparece ningún error, la página te parece perfecta; simplemente nunca aparece.

Las cuatro cosas que impiden que una página se indexe

Casi todos los problemas de rastreo son uno de estos, y se producen en un orden específico:
  • La URL no se resuelve: devuelve un error 404, un error del servidor o una cadena de redirecciones que termina fallando.
  • El archivo robots.txt impide el acceso del rastreador, por lo que la página nunca llega a obtenerse.
  • Una directiva noindex indica al motor que obtenga la página, pero que la mantenga fuera de los resultados.
  • La página no muestra prácticamente nada sin JavaScript, por lo que hay poco contenido que indexar.
El orden importa a la hora de solucionar estos problemas. Un bloqueo en robots.txt significa que la etiqueta noindex que aparece debajo ni siquiera se llega a leer, por lo que combinar ambas directivas produce el efecto contrario al esperado: la página sigue bloqueada para el rastreo y la instrucción para eliminarla no se detecta.

Robots.txt y noindex no son lo mismo

Esta es la confusión que más daños causa. Robots.txt controla si un rastreador puede recuperar una página; noindex controla si puede conservarla. Operan en fases diferentes y no son intercambiables.
Para mantener una página fuera de los resultados de búsqueda, necesitas noindex, y el rastreador debe tener permiso para recuperar la página para poder detectarlo. Bloquearla en robots.txt, en cambio, puede hacer que una URL aparezca listada sin ninguna descripción, porque el buscador conoce la dirección, pero nunca ha tenido permiso para acceder a ella.
En el caso contrario —una página que sí quieres que se encuentre—, ambas directivas deben estar claras, y el noindex puede aparecer tanto en el HTML como en una cabecera HTTP. La versión en la cabecera es la que suele pasar desapercibida, ya que no es visible en el código fuente de la página.

Los rastreadores de IA son una decisión aparte en 2026

Las empresas de IA utilizan sus propios rastreadores con nombre, y bloquearlos es una decisión distinta de bloquear los motores de búsqueda. GPTBot, ClaudeBot, PerplexityBot y el resto siguen cada uno su propia directiva en robots.txt.
Muchos sitios los han bloqueado sin pretenderlo, a menudo al copiar un archivo robots.txt de otro lugar. Si para ti es importante que se cite tu sitio en las respuestas de la IA, conviene saberlo ahora en lugar de descubrirlo más adelante.
La postura contraria también es legítima. Si prefieres que tu contenido no se utilice para entrenar modelos o generar resúmenes, bloquear esos agentes es la forma de indicarlo; la cuestión es que debe ser una decisión, no un accidente.

Cómo comprobar la rastreabilidad de un sitio web con esta herramienta

Introduce una URL y la herramienta realiza once comprobaciones, informando de cada una por separado, en el orden en que un rastreador las encuentra:
  • Página accesible: el código de estado que devuelve la URL.
  • Motores de búsqueda bloqueados: si robots.txt impide el acceso a Googlebot.
  • Rastreadores de IA bloqueados: cuántos de los principales agentes de usuario de IA tienen el acceso bloqueado.
  • Etiqueta noindex: una directiva noindex en el HTML de la página.
  • Cabecera noindex: la misma directiva enviada como X-Robots-Tag.
  • Robots.txt: si el archivo existe y qué contiene.
  • Mapa del sitio XML: si existe uno para que los rastreadores puedan descubrir el resto del sitio.
  • Llms.txt: si está presente el archivo que buscan los asistentes de IA.
  • Etiqueta canónica: qué URL designa la página como la que se debe indexar.
  • Contenido renderizado: cuánto de la página puede ver un rastreador sin ejecutar JavaScript.
  • Errores de JavaScript: scripts que fallan en la página, lo que suele explicar que el contenido renderizado sea escaso.
Comprueba la URL individual que le proporciones en lugar de rastrear todo el sitio, así que prueba la rastreabilidad del sitio web en la página que realmente falta y no en la página de inicio; ambas suelen diferir y la página de inicio rara vez es la que presenta el problema.

Qué hacer a continuación

Si todo esto supera la comprobación y la página sigue sin aparecer, lo siguiente que debes revisar es su capacidad de descubrimiento. Comprueba que la página figure en tu Mapa del sitio XML, revisa el archivo robots.txt completo en lugar de solo las reglas para un agente y comprueba si alguna parte del sitio enlaza con ella mediante el comprobador de enlace interno.

Caja de herramientas SEO completa con más de 55 herramientas

Comprueba los títulos, las meta descripciones, los encabezados, los datos estructurados, las Core Web Vitals, el SSL y el archivo robots.txt. Genera metaetiquetas, mapas del sitio y reglas .htaccess, minimiza el CSS, el JS y el HTML, y redacta textos con nuestras herramientas de redacción con IA, al instante y gratis.

Más información

Más información
What is a Google Crawler?
You know when you use Google to search for a service, or find information? And once the page loads there is always one website at the very t...
AI Crawlability: Should You Let AI Bots Access Your Site and How Can You Check?
As more people use ChatGPT, Claude, Perplexity, and Google’s AI search features, AI crawlability is becoming increasingly important for webs...
Robots.txt – Guía actualizada
Robots.txt es un archivo en forma de texto que indica a los bots rastreadores que indexen o no ciertas páginas. También se le conoce como el...
How to Fix 'Indexed, though blocked by robots.txt' in Google Search Console
If you received the warning ‘Indexed, though blocked by robots.txt’ notification in Google Search Console, you’ll want to fix it as soon a...
What is Rendered Content and How it Affects AI Crawlers?
Key Takeaway   Rendered content refers to the version of a webpage that a browser displays after executing HTML, CSS, and JavaScript....
Crawl Depth in SEO: What is It & How to Improve It?
Crawl depth influences how efficiently Google can index your content.   Googlebot has limited time and server resources. Therefore, th...