Aller au contenu

Guide technique Actualité

Les robots d'IA qui explorent votre site, et ce que chacun fait

Une quinzaine de robots liés à l'IA visitent aujourd'hui les sites français. Certains collectent pour entraîner des modèles, d'autres alimentent la recherche, et les traiter comme un bloc conduit à des décisions coûteuses.

Videur de dos près d'un cordon de velours rouge, filtrant une file d'attente

La question revient à chaque comité de direction depuis trois ans : faut-il laisser les IA lire notre site ? Elle ne se tranche pas en un oui ou un non, parce que les robots concernés ne font pas le même travail.

Les robots d'entraînement

Ils collectent des pages pour constituer les corpus qui servent à entraîner les modèles. Les bloquer relève d'une décision sur la propriété intellectuelle, sans effet sur la visibilité immédiate.

GPTBot, d'OpenAI, documenté en août 2023. Google-Extended, de Google, qui contrôle l'usage pour Gemini sans toucher à l'indexation ni au classement dans la recherche. ClaudeBot, d'Anthropic. Applebot-Extended, d'Apple, sur le même principe que Google-Extended. meta-externalagent, de Meta.

Les robots de recherche

Ils récupèrent des pages au moment où un utilisateur pose une question, et permettent l'affichage d'un lien vers votre site. Les bloquer revient à disparaître des réponses.

OAI-SearchBot pour ChatGPT. PerplexityBot pour l'index de Perplexity. Claude-SearchBot pour Claude. DuckAssistBot pour l'assistant de DuckDuckGo. Bingbot, enfin, qui n'est pas un robot d'IA mais dont l'index alimente ChatGPT et Copilot, ce qui en fait le plus important de la liste.

Les robots déclenchés par un utilisateur

Ils interviennent quand quelqu'un demande explicitement à consulter une URL dans une conversation. ChatGPT-User et Perplexity-User entrent dans cette catégorie.

Les bloquer empêche un lecteur d'ouvrir votre page depuis l'assistant, ce qui est rarement l'intention recherchée.

Comment décider

Trois positions cohérentes existent, et une quatrième qui n'en est pas une.

Tout autoriser. C'est le choix d'un site dont l'objectif est la visibilité et qui n'a rien à monétiser directement dans ses contenus. La grande majorité des sites d'entreprise.

Refuser l'entraînement, accepter la citation. Bloquer GPTBot, Google-Extended, ClaudeBot, Applebot-Extended, et autoriser les robots de recherche. C'est la position de plusieurs groupes de presse en attendant des accords de licence.

Tout bloquer. Défendable pour un site dont l'accès aux contenus est payant.

La quatrième position, la plus répandue, consiste à avoir bloqué GPTBot en 2023 sans jamais réexaminer la décision, souvent sans savoir qu'OAI-SearchBot existait. Ce n'est pas un choix, c'est un oubli.

Vérifier ce que votre site fait vraiment

Ouvrez votresite.fr/robots.txt et cherchez les noms listés ci-dessus. Un fichier qui n'en mentionne aucun, avec un bloc générique permissif, autorise tout le monde.

Regardez ensuite vos logs serveur. Ils indiquent quels robots viennent réellement et sur quelles pages, ce qu'aucun outil externe ne peut vous dire. C'est l'objet de notre guide sur l'analyse de logs.

Vérifiez enfin les agents. N'importe quel outil peut se déclarer GPTBot. La vérification passe par la résolution DNS inverse de l'adresse IP, et par les plages d'adresses publiées par les éditeurs.

Ce que le robots.txt ne règle pas

Il ne protège rien juridiquement : c'est une convention, pas une barrière. Il n'efface pas ce qui a déjà été collecté. Et il n'empêche pas les mentions, puisqu'un modèle peut parler de votre marque à partir de ce que d'autres sites écrivent sur vous.

Pour une opposition qui a une portée juridique, le terrain est ailleurs : conditions d'utilisation, droit voisin, opposition à la fouille de textes et de données au sens de la directive européenne de 2019. Le cadre applicable est détaillé dans notre analyse sur ce que la loi impose déjà aux marques.

Écrire les directives sans se tromper

Trois erreurs de syntaxe annulent la moitié des fichiers robots.txt que nous ouvrons.

Le bloc générique qu'on croit universel. Un User-agent : * suivi d'un Disallow : / ne s'applique pas à un robot qui dispose de son propre bloc plus haut ou plus bas dans le fichier. Chaque robot lit le groupe le plus spécifique qui le concerne, et ignore le reste. Un site qui bloque tout le monde par principe, puis autorise Googlebot, n'a pas bloqué les robots d'IA : il les a laissés lire le bloc générique, ce qui était l'intention, mais l'inverse arrive tout aussi souvent.

La casse du nom d'agent. Elle n'est pas prise en compte pour la correspondance, mais un nom mal orthographié l'est. GPT-Bot ou OAI-Searchbot ne correspondent à rien et laissent passer le robot visé.

Le fichier servi en 404 ou en 500. Un robots.txt inaccessible est traité comme une autorisation générale par la plupart des robots, et parfois comme une interdiction générale, selon les implémentations. Servir un fichier vide vaut mieux que ne rien servir.

Une vérification suffit à écarter les trois : ouvrez le fichier dans un navigateur, en navigation privée, depuis une adresse extérieure à votre réseau.

Ce que change le passage d'un robot

Un robot qui passe ne garantit ni indexation, ni citation. Il garantit seulement que la page a été récupérée.

Ce que les journaux serveur montrent, en revanche, est utile immédiatement : quelles URL les robots d'IA demandent réellement sur votre domaine. La liste dit quels contenus ils jugent pertinents chez vous, et elle diffère souvent de celle que vous auriez proposée. La méthode de relevé est dans notre guide sur l'analyse de logs.

Sources

  • OpenAI, documentation des robots d'exploration
  • Google Search Central, documentation Google-Extended
  • Anthropic, documentation ClaudeBot
Yannis

Yannis

Yannis suit le GEO pour aifluence : robots des moteurs de réponse, extraction, mesure de la citation.

À lire aussi dans Actualité

Toute la rubrique