À propos de l’explorabilité d’un site Web
Que signifie « explorabilité » ?
Une page est explorable lorsqu’un moteur de recherche peut y accéder, est autorisé à la récupérer et y trouve quelque chose qui mérite d’être conservé une fois sur place. Si l’une de ces conditions n’est pas remplie, la page est en pratique invisible, quelle que soit la qualité de son contenu.
C’est l’étape qui précède toutes les autres. Le classement, les extraits et les citations générées par l’IA supposent tous que la page a d’abord été incluse dans un index. Ainsi, lorsqu’une page n’apparaît tout simplement pas, le premier réflexe logique consiste à tester l’explorabilité du site plutôt qu’à commencer par réécrire le contenu.
Le plus déroutant, c’est que chacune de ces défaillances est silencieuse. Rien ne tombe en panne, aucune erreur ne s’affiche, la page vous semble parfaite : elle n’apparaît tout simplement jamais.
Les quatre éléments qui empêchent une page d’être indexée
Presque tous les problèmes d’explorabilité relèvent de l’un de ces éléments, et ils interviennent dans un ordre précis :
- L’URL n’aboutit pas : erreur 404, erreur serveur ou chaîne de redirections qui n’aboutit pas.
- Le fichier robots.txt interdit l’exploration, la page n’est donc jamais récupérée.
- Une directive noindex indique au moteur de récupérer la page, mais de l’exclure des résultats.
- La page n’affiche presque rien sans JavaScript, il y a donc peu de contenu à indexer.
L’ordre compte lorsque vous corrigez ces problèmes. Un blocage dans le fichier robots.txt signifie que la balise noindex située en dessous n’est même jamais lue. Associer les deux produit donc l’effet inverse de celui escompté : la page reste bloquée à l’exploration et l’instruction de la supprimer n’est pas détectée.
Le fichier robots.txt et la directive noindex, ce n’est pas la même chose
C’est la confusion qui cause le plus de dégâts. Le fichier robots.txt contrôle si un robot peut explorer une page ; noindex contrôle s’il peut la conserver dans son index. Ils interviennent à des étapes différentes et ne sont pas interchangeables.
Pour exclure une page des résultats de recherche, vous devez utiliser noindex, et le robot doit être autorisé à explorer la page pour le détecter. La bloquer dans robots.txt peut au contraire laisser une URL apparaître sans aucune description, car le moteur connaît l’adresse, mais n’a jamais été autorisé à consulter la page.
À l’inverse, pour une page que vous souhaitez voir trouvée, les deux éléments doivent être clairs, et la directive noindex peut apparaître soit dans le code HTML, soit dans un en-tête HTTP. C’est la version dans l’en-tête qui prend les utilisateurs au dépourvu, car elle est invisible dans le code source de la page.
Les robots d’exploration IA constituent une décision distincte en 2026
Les entreprises d’IA utilisent leurs propres robots d’exploration nommés, et les bloquer est un choix différent de celui de bloquer les moteurs de recherche. GPTBot, ClaudeBot, PerplexityBot et les autres ont chacun leur propre ligne dans le fichier robots.txt.
De nombreux sites les ont bloqués sans vraiment le vouloir, souvent en copiant un fichier robots.txt trouvé ailleurs. Si le fait d’être cité dans des réponses générées par l’IA compte pour vous, mieux vaut le savoir maintenant plutôt que de le découvrir plus tard.
L’inverse est tout aussi légitime. Si vous préférez que votre contenu ne soit pas utilisé pour l’entraînement ou la synthèse, bloquer ces agents est la façon de l’indiquer — l’essentiel est que ce soit une décision, et non un accident.
Comment tester l’explorabilité d’un site web avec cet outil
Saisissez une URL et l’outil effectue onze vérifications, en présentant les résultats séparément, dans l’ordre dans lequel un robot d’exploration les rencontre :
- Page accessible - le code d’état renvoyé par l’URL.
- Moteurs de recherche bloqués - indique si robots.txt interdit l’accès à Googlebot.
- Robots d’exploration IA bloqués - le nombre de principaux agents utilisateurs IA dont l’accès est interdit.
- Balise noindex - une directive noindex dans le code HTML de la page.
- En-tête noindex - la même directive transmise via un en-tête X-Robots-Tag.
- Robots.txt - indique si le fichier existe et ce qu’il contient.
- Sitemap XML - indique si un sitemap existe pour permettre aux robots d’exploration de découvrir le reste du site.
- Llms.txt - indique si le fichier recherché par les assistants IA est présent.
- Balise canonique - indique quelle URL la page désigne comme étant celle à indexer.
- Contenu rendu - indique quelle quantité de contenu de la page un robot d’exploration voit sans exécuter JavaScript.
- Erreurs JavaScript - scripts qui échouent sur la page, ce qui explique souvent pourquoi le contenu rendu est limité.
L’outil vérifie l’URL que vous lui fournissez, plutôt que d’explorer l’ensemble du site. Testez donc l’explorabilité de la page qui pose réellement problème, et non celle de la page d’accueil : les deux diffèrent souvent, et la page d’accueil est rarement celle qui rencontre le problème.
Pour aller plus loin
Si tout est validé ici et que la page n’apparaît toujours pas, la découvrabilité est le prochain point à examiner. Vérifiez que la page figure dans votre
Sitemap XML, examinez l’intégralité du fichier
robots.txt plutôt que les règles d’un seul agent, et vérifiez si un lien sur le site y renvoie à l’aide de l’outil de vérification
lien interne.