Acerca de los archivos robots.txt
¿Qué es un archivo robots.txt?
Robots.txt es un archivo de texto sin formato ubicado en la raíz de un dominio que indica a los visitantes automatizados qué partes del sitio pueden solicitar. Es lo primero que piden la mayoría de los rastreadores, antes que cualquier página, y es la convención más antigua de la web para indicar qué debe dejar en paz una máquina.
La sintaxis es deliberadamente sencilla: indica un agente de usuario y, a continuación, enumera las rutas que puede rastrear o no. Esa sencillez también es la trampa, porque una sola barra mal colocada puede hacer que pases de bloquear una carpeta a bloquear todo un sitio. Un generador de robots.txt es importante principalmente porque produce el archivo con una estructura válida y predecible, en lugar de obligarte a recordar la escritura exacta de las directivas que utilizas una vez al año.
Controla el rastreo, no la indexación, y esa distinción confunde constantemente a la gente. Bloquear una URL impide que un rastreador la solicite, pero no mantiene la URL fuera de los resultados de búsqueda de forma fiable, porque una página puede indexarse gracias a los enlaces que apuntan a ella sin haber sido leída.
¿Sigue siendo importante el archivo robots.txt en 2026?
Su función tradicional no ha cambiado: mantener a los rastreadores alejados de las rutas de administración, los resultados de búsqueda internos, la navegación facetada y las interminables combinaciones de parámetros que, de otro modo, consumirían el presupuesto de rastreo en páginas a las que nadie debería llegar.
Su función más reciente es más importante. El archivo se ha convertido en el lugar donde los propietarios de sitios web deciden qué rastreadores de IA pueden acceder a su contenido, una cuestión que la mayoría nunca había tenido que plantearse antes. Actualmente, todas las grandes empresas de IA operan un rastreador con nombre propio, y la mayoría respeta el archivo.
Esto convierte a robots.txt en uno de los pocos archivos de un sitio web con consecuencias realmente importantes, y en uno que merece la pena revisar deliberadamente en lugar de aceptar sin más lo que una plataforma incluye por defecto.
Cómo se relaciona robots.txt con la búsqueda mediante IA
Tienes que tomar una decisión importante y no existe una respuesta universalmente correcta. Bloquear los rastreadores de IA protege tu contenido para que no se utilice como material de entrenamiento o para generar respuestas. También elimina cualquier posibilidad de que tu sitio se cite en las respuestas en las que un número cada vez mayor de personas confía ahora en lugar de hacer clic para consultar los resultados.
Los dos efectos no son simétricos. El bloqueo es prácticamente absoluto, mientras que ser citado es incierto, por lo que la elección depende de si tu contenido es el producto o el marketing del mismo. Un editor que vende suscripciones puede bloquear razonablemente; una empresa cuyas páginas existen para ser encontradas normalmente no lo hará.
Lo más importante es que el archivo indique lo que realmente pretendes. Un generador de robots.txt facilita expresar esas reglas explícitamente, en lugar de dejarlas implícitas por omisión.
Buenas prácticas para robots.txt
- Mantén el archivo en la raíz del dominio. En cualquier otro lugar, se ignorará por completo.
- No lo uses nunca para ocultar contenido sensible. El archivo es público, y leerlo es la forma más rápida de encontrar las rutas que querías ocultar.
- Usa una directiva noindex en lugar de un bloqueo del rastreo cuando el objetivo sea impedir que una página aparezca en los resultados.
- No combines ambos en la misma página. Una página bloqueada nunca puede leerse, por lo que su noindex nunca se detecta.
- Incluye la referencia a tu sitemap XML en el archivo para que los rastreadores lo encuentren sin necesidad de indicárselo por separado.
- Revisa las reglas para los rastreadores de IA como una decisión deliberada, no como una configuración predeterminada.
Errores comunes
- Bloquear el CSS o JavaScript impide que los motores de búsqueda rendericen la página tal y como la ve un visitante.
- Dejar una regla de la fase de desarrollo que bloquee todo el sitio después del lanzamiento. Este es el error de robots.txt más perjudicial.
- Suponer que una URL bloqueada desaparecerá de los resultados de búsqueda, cuando puede seguir apareciendo sin descripción.
- Escribir reglas para una cadena de agente de usuario que no existe, por lo que nada se ve afectado.
- Olvidar que los subdominios necesitan su propio archivo; una regla en el dominio principal no los cubre.
Usar el generador de robots.txt
Elige qué rastreadores quieres permitir o rechazar, añade los directorios que quieras excluir, establece un retraso de rastreo si tu servidor lo necesita e indica tu sitemap. El generador crea un archivo con el formato correcto que puedes guardar en la raíz de tu dominio.
Una vez que esté activo, verifícalo en lugar de darlo por hecho. Abre el archivo en un navegador para confirmar que se está sirviendo correctamente y comprueba en Search Console que las páginas que esperas que se puedan rastrear siguen siéndolo. Un archivo robots.txt que bloquee silenciosamente más páginas de las previstas puede tardar semanas en detectarse únicamente a través del tráfico.
Qué hacer a continuación