Aller au contenu

Guide · Exploration et indexation

URL canonique et contenus qui se ressemblent

Le même contenu accessible sous plusieurs adresses oblige le moteur à choisir. Vous pouvez lui indiquer votre préférence, il n'est pas tenu de la suivre.

Par Camille Mis à jour le 3 min de lecture

Un même contenu accessible sous plusieurs adresses est la situation normale d'un site, pas une anomalie. Un article joignable avec et sans slash final, avec et sans paramètre de campagne, en version imprimable, dans deux catégories : chaque variante est une URL distincte pour un moteur.

Ce que fait la balise canonique

Placée dans l'en-tête de la page, elle désigne l'adresse de référence.

<link rel="canonical" href="https://exemple.fr/mon-article/">

Le moteur consolide alors les signaux des variantes sur cette adresse, et n'indexe qu'elle.

C'est une indication, pas une instruction. Si le moteur juge qu'une autre URL mérite mieux ce rôle, par exemple parce qu'elle reçoit tous les liens externes, il retiendra la sienne. L'inspection d'URL de la Search Console indique toujours la canonique déclarée et la canonique retenue, et l'écart entre les deux est riche d'enseignements.

Les règles qui évitent les ennuis

Toute page déclare sa propre canonique, y compris la page de référence, qui pointe vers elle-même. Une page sans canonique laisse le moteur décider seul.

L'URL déclarée doit être absolue, avec le protocole et le domaine complets.

Elle doit répondre en 200. Pointer vers une page redirigée, en erreur, ou bloquée par le robots.txt, invalide le signal.

Elle doit être exacte au caractère près. Un slash final présent d'un côté et absent de l'autre désigne deux adresses différentes.

Une seule balise par page. Deux déclarations contradictoires font ignorer les deux.

La duplication interne, celle qui coûte

La crainte d'être pénalisé pour duplication entre sites est largement surestimée. Reprendre une fiche produit fournie par un fabricant ne déclenche pas de sanction : cela rend simplement la page interchangeable, donc difficile à distinguer.

La duplication qui coûte est interne. Quatre situations reviennent.

Les paramètres. Tri, pagination, filtres, identifiants de session, paramètres de campagne. Chacun crée une adresse.

Les variantes de protocole et de sous-domaine. Une page joignable en http et https, avec et sans www, fait quatre adresses pour un contenu. Cela se règle par redirection permanente, une fois pour toutes.

Les pages de catégorie recoupées. Un produit rangé dans trois catégories et accessible par trois chemins.

Les pages de ville quasi identiques. Le cas classique du référencement local mal fait, traité dans le chapitre sur le SEO local.

Choisir entre canonique, redirection et noindex

Trois outils, trois situations.

La redirection permanente quand une seule adresse doit survivre et que l'ancienne n'a plus lieu d'exister. C'est le plus net.

La balise canonique quand les variantes doivent rester accessibles aux visiteurs, mais qu'une seule doit être indexée. Le cas des filtres et des paramètres.

Le noindex quand la page doit rester accessible et ne jamais apparaître dans les résultats, sans qu'une autre page ne la remplace. Les pages de résultats internes, par exemple.

Les combiner sur une même URL produit des signaux contradictoires. Un noindex sur une page canonique d'un groupe désindexe tout le groupe : c'est une erreur que nous voyons plusieurs fois par an.

Vérifier à l'échelle du site

Un crawler donne en une passe la liste des pages sans canonique, des canoniques pointant vers une redirection, et des groupes de pages au contenu quasi identique.

Côté moteur, le rapport d'indexation classe les exclusions par motif. Une masse de pages en « URL alternative avec balise canonique appropriée » est normale. Une masse en « Google a choisi une URL canonique différente » signale que votre déclaration n'est pas suivie, et mérite une inspection page par page.