Acerca de Robots.txt
¿Qué es un archivo robots.txt?
Robots.txt es un archivo de texto sin formato situado en la raíz de un dominio que indica a los visitantes automatizados qué partes del sitio pueden solicitar. Es lo primero que piden la mayoría de los rastreadores, antes que cualquier página, y la convención más antigua de la web para indicar qué debe dejar una máquina sin tocar.
Controla el rastreo, no la indexación, y esta distinción confunde constantemente a muchas personas. Bloquear una URL impide que un rastreador la obtenga; no garantiza que dicha URL quede fuera de los resultados de búsqueda, ya que una página puede indexarse gracias a los enlaces que apuntan a ella sin haber sido leída nunca.
Vale la pena ejecutar un comprobador de robots.txt porque un solo carácter mal colocado cambia el significado de todo el archivo, y nada en el sitio indica que haya un problema hasta que el tráfico desaparece.
¿Sigue siendo importante el archivo robots.txt en 2026?
Su función tradicional no ha cambiado: mantener a los rastreadores alejados de las rutas de administración, los resultados de búsqueda internos, la navegación facetada y las interminables combinaciones de parámetros que, de otro modo, consumirían el presupuesto de rastreo en páginas a las que nadie debería llegar.
Su función más reciente es más importante. El archivo se ha convertido en el lugar donde los propietarios de sitios web deciden qué rastreadores de IA pueden acceder a su contenido, una cuestión que la mayoría nunca había tenido que plantearse antes. Actualmente, todas las grandes empresas de IA operan un rastreador con nombre propio, y la mayoría respeta el archivo.
Eso lo convierte en uno de los pocos archivos de un sitio con consecuencias reales, y en uno que merece revisarse deliberadamente en lugar de aceptar sin más lo que una plataforma haya enviado de forma predeterminada.
Cómo se relaciona robots.txt con la búsqueda mediante IA
Tienes que tomar una decisión importante y no existe una respuesta universalmente correcta. Bloquear los rastreadores de IA protege tu contenido para que no se utilice como material de entrenamiento o como fuente de respuestas. También elimina cualquier posibilidad de que se cite en las respuestas de las que ahora depende una proporción cada vez mayor de personas.
Los dos efectos no son simétricos. El bloqueo es prácticamente absoluto, mientras que las posibilidades de ser citado son inciertas, por lo que la elección depende de si tu contenido es el producto o el marketing del mismo.
Un editor que vende suscripciones puede bloquearlo razonablemente; una empresa cuyas páginas existen para ser encontradas normalmente no lo hará. Lo importante es que el archivo indique lo que realmente pretende.
Buenas prácticas para robots.txt
- Mantén el archivo en la raíz del dominio. En cualquier otro lugar, se ignorará por completo.
- No lo uses nunca para ocultar contenido sensible. El archivo es público, y leerlo es la forma más rápida de encontrar las rutas que querías ocultar.
- Usa una directiva noindex en lugar de un bloqueo del rastreo cuando el objetivo sea impedir que una página aparezca en los resultados.
- No combines ambos en la misma página. Una página bloqueada nunca puede leerse, por lo que su noindex nunca se detecta.
- Incluye la referencia a tu sitemap XML en el archivo para que los rastreadores lo encuentren sin necesidad de indicárselo por separado.
- Asigne a los subdominios su propio archivo; una regla del dominio principal no los cubre.
Errores comunes
- Dejar, después del lanzamiento, una regla de la etapa de desarrollo que bloquee todo el sitio, que es la versión más perjudicial de este error.
- Bloquear el CSS o JavaScript, lo que impide que los motores de búsqueda representen la página tal como la ve un visitante.
- Suponer que una URL bloqueada desaparece de los resultados de búsqueda, cuando puede seguir apareciendo sin una descripción.
- Escribir reglas para una cadena de agente de usuario que no existe, por lo que nada se ve afectado.
- Bloquear rutas de rastreo que tu propio sitemap envía después, transmitiendo instrucciones contradictorias.
Qué comprueba esta herramienta
El comprobador de robots.txt solicita el archivo desde la raíz del dominio e informa de si existe.
Confirma que existe, en lugar de evaluar las reglas, por lo que un archivo que bloquee accidentalmente todo tu sitio supera la comprobación exactamente igual que uno correcto. Lo importante es leer lo que realmente dice, y eso lleva aproximadamente un minuto.
Qué hacer a continuación