Guide · Exploration et indexation
Exploration : ce que le robot vient chercher, et ce qu'il laisse
Un robot d'exploration ne parcourt pas un site en entier à chaque passage. Il arbitre, et cet arbitrage se lit dans les journaux du serveur, nulle part ailleurs.
L'exploration est la première des quatre étapes d'un moteur. Un programme automatique demande des URL, enregistre ce que le serveur répond, et décide de la suite.
Ce qui décide de la fréquence
Deux facteurs, et un seul dépend de vous.
La capacité du serveur. Le moteur augmente son rythme tant que le serveur répond vite et sans erreur, et le réduit dès que les temps de réponse s'allongent ou que les erreurs apparaissent. Un hébergement saturé fait donc baisser l'exploration, et cette baisse se répercute sur la fraîcheur de l'index.
L'intérêt que le moteur porte au site. Un site qui publie souvent des contenus consultés est visité souvent. Un site figé depuis deux ans est visité rarement. Cet arbitrage ne se négocie pas, il se mérite.
Qui est réellement concerné par le budget de crawl
La notion de budget de crawl est surinvestie dans les conversations et sous-comprise dans les faits. Elle concerne trois situations.
Les sites de plusieurs dizaines de milliers d'URL, où le moteur ne peut matériellement pas tout voir à chaque passage.
Les sites qui génèrent des URL automatiquement : filtres, tris, paramètres de suivi, calendriers. Un moteur de recherche peut y explorer des millions de combinaisons sans intérêt, au détriment des pages qui comptent.
Les sites très lents, où chaque demande coûte cher au robot comme au serveur.
Un site vitrine de cinquante pages n'a pas de problème de budget de crawl. S'il n'est pas exploré, c'est pour une autre raison, et le chercher là fait perdre du temps.
Ce qui gaspille l'exploration
Par ordre de fréquence sur les sites que nous auditons.
Les paramètres d'URL non maîtrisés. Une même page accessible sous vingt combinaisons de tri et de filtre produit vingt demandes pour un seul contenu.
Les chaînes de redirection. Chaque saut est une demande supplémentaire. Une chaîne de quatre redirections coûte quatre fois le prix d'une page.
Les pages d'erreur molles. Une URL supprimée qui renvoie un code de succès avec une page vide est explorée indéfiniment, alors qu'un code d'erreur franc la retire de la liste.
Les espaces infinis. Un calendrier qui génère un lien vers le mois suivant, sans fin, est un piège classique.
Comment savoir ce qui se passe vraiment
Les outils externes estiment. Les journaux du serveur constatent. Ce sont deux choses différentes, et seule la seconde permet de décider.
Un journal contient, pour chaque demande, l'heure, l'URL, l'agent déclaré, le code de réponse et le temps de traitement. En les regroupant par jour et par type d'agent, on obtient trois réponses qu'aucun outil ne donne : quelles pages sont réellement explorées, lesquelles ne le sont jamais, et quelle part de l'exploration part dans des erreurs.
Nous avons consacré à cette méthode un guide pratique complet, avec les commandes et les regroupements utiles.
Vérifier qu'un robot est bien celui qu'il prétend être
N'importe quel programme peut se déclarer Googlebot. Une part non négligeable du trafic qui s'annonce ainsi n'en est pas.
La vérification se fait par résolution inverse de l'adresse IP : on demande le nom associé à l'adresse, puis on vérifie que ce nom pointe bien vers cette adresse. Les éditeurs publient aussi des plages d'adresses officielles, plus simples à utiliser dans un pare-feu.
C'est la même méthode pour les robots des moteurs de réponse, traités dans le chapitre autoriser ou bloquer les robots d'IA.
Ce qu'on peut décider
Trois leviers, du plus rentable au moins rentable.
Réduire les URL inutiles : paramètres, doublons, pages générées sans demande. C'est ce qui libère le plus de capacité, et c'est aussi le plus long.
Accélérer le serveur. Un temps de réponse divisé par deux double mécaniquement le nombre de pages qu'un robot accepte de demander dans le même temps.
Guider l'exploration par le fichier de plan du site et par le maillage interne. Cela ne crée pas de capacité, cela oriente celle qui existe.