Aller au contenu

Guide · Exploration et indexation

L'indexation, ou pourquoi une page explorée peut rester invisible

Une page peut être demandée par le robot et jugée indigne de l'index. C'est la situation la plus fréquente sur les sites de taille moyenne, et la moins bien diagnostiquée.

Par Camille Mis à jour le 3 min de lecture

L'indexation est la décision par laquelle un moteur conserve une page dans sa base et la rend éligible au classement. Elle suit l'exploration, et elle n'en découle pas automatiquement.

Pourquoi une page est refusée

Les motifs se regroupent en quatre familles.

Une directive explicite. Une balise noindex dans la page ou un en-tête HTTP équivalent. C'est le cas le plus simple, et parfois le plus surprenant quand la directive traîne depuis une recette.

Une page de référence ailleurs. Le moteur a identifié une autre URL comme canonique, soit parce que vous l'avez déclarée, soit parce qu'il a jugé que deux pages disaient la même chose. Le chapitre sur l'URL canonique traite ce cas en détail.

Une valeur ajoutée insuffisante. Formulation polie pour dire que la page n'apporte rien qui n'existe déjà ailleurs. C'est le motif le plus fréquent sur les pages générées automatiquement.

Un arbitrage de volume. Le moteur connaît la page, la juge acceptable, et choisit de ne pas l'indexer pour l'instant. Cela arrive sur les sites qui publient beaucoup plus que leur autorité ne le justifie.

Vérifier l'état réel d'une page

Une seule méthode donne une réponse fiable : l'inspection d'URL dans la Search Console. Elle indique si la page est indexée, quand elle a été explorée pour la dernière fois, quelle URL canonique le moteur a retenue, et le motif d'exclusion le cas échéant.

La commande site : tapée dans le moteur ne vaut rien comme diagnostic. Elle donne une estimation, filtre différemment selon les jours, et manque régulièrement des pages parfaitement indexées.

À l'échelle du site, le rapport d'indexation des pages classe toutes les URL connues par état et par motif. C'est là qu'un problème systémique se voit : cinq cents pages exclues pour le même motif signalent un gabarit défectueux, pas cinq cents accidents.

Débloquer, motif par motif

Directive noindex. Retirez-la, puis demandez une nouvelle exploration. Effet en quelques jours.

Canonique différente. Vérifiez que la page a bien une raison d'exister séparément. Si oui, différenciez son contenu et corrigez la déclaration. Si non, la situation est correcte et il n'y a rien à faire.

Contenu insuffisant. C'est le seul motif qui ne se corrige pas par un réglage. Réécrire, fusionner plusieurs pages faibles en une seule solide, ou assumer de ne pas indexer. Demander l'indexation en boucle ne change rien.

Découverte sans exploration. Le moteur connaît l'URL mais ne l'a pas demandée. Cause quasi systématique : un problème de capacité ou de lenteur du serveur, traité dans le chapitre sur l'exploration.

Le cas des pages qui disparaissent

Une page indexée depuis des mois qui sort de l'index sans modification technique signale en général l'un de ces trois cas : la page a perdu ses liens internes et n'est plus atteignable facilement, un contenu très proche a été publié ailleurs sur le site, ou le moteur a réévalué l'ensemble du domaine à l'occasion d'une mise à jour.

Le premier se vérifie en une minute avec un crawler. Le deuxième se vérifie en cherchant les phrases de la page dans le reste du site. Le troisième se vérifie en regardant si d'autres pages ont bougé au même moment.

Décider ce qui mérite l'index

Toutes les pages ne doivent pas être indexées, et un site qui l'oublie se pénalise lui-même.

Les pages de résultats de recherche interne, les pages de panier, les pages de compte, les versions imprimables et les pages de remerciement n'ont aucune raison d'y être. Elles consomment de l'exploration et diluent la perception de qualité du site.

Le tri se fait une fois, puis se maintient. La règle utile : une page mérite l'index si quelqu'un pourrait la chercher sans connaître votre site.