Aller au contenu

Guide · Être cité par les IA

Autoriser ou bloquer les robots d'IA

Trois familles de robots, trois conséquences très différentes. Les traiter comme un bloc est l'erreur la plus coûteuse du sujet.

Par Yannis Mis à jour le 4 min de lecture

Une quinzaine de robots liés à l'IA visitent aujourd'hui les sites français. Ils ne font pas le même travail, et les décisions qui les concernent n'ont pas les mêmes conséquences.

Les trois familles

Les robots d'entraînement. Ils collectent des pages pour constituer les corpus qui servent à entraîner les modèles. Les bloquer relève d'une décision sur la propriété intellectuelle. Aucun effet sur la visibilité immédiate.

Les robots de recherche. Ils récupèrent des pages au moment où quelqu'un pose une question, et permettent l'affichage d'un lien vers votre site. Les bloquer revient à disparaître des réponses.

Les robots déclenchés par un utilisateur. Ils interviennent quand quelqu'un demande explicitement à consulter une adresse dans une conversation. Les bloquer empêche un lecteur d'ouvrir votre page depuis l'assistant, ce qui est rarement l'intention recherchée.

La liste des agents de chaque famille évolue plusieurs fois par an. Nous la tenons à jour dans un article dédié, qui donne les noms exacts à utiliser dans le robots.txt.

Les quatre positions possibles

Tout autoriser. Le choix d'un site dont l'objectif est la visibilité et qui n'a rien à monétiser directement dans ses contenus. La grande majorité des sites d'entreprise.

Refuser l'entraînement, accepter la citation. Bloquer les robots d'entraînement, autoriser les robots de recherche. C'est la position de plusieurs groupes de presse en attendant des accords de licence.

Tout bloquer. Défendable pour un site dont l'accès aux contenus est payant, ou dont le modèle repose sur l'exclusivité.

La quatrième position, la plus répandue, consiste à avoir bloqué un robot en 2023 sans jamais réexaminer la décision, souvent sans savoir qu'un second robot du même éditeur alimentait la recherche. Ce n'est pas un choix, c'est un oubli.

Le chiffre qu'on cite pour justifier un blocage

Un ratio circule : le nombre de pages qu'un robot explore rapporté au nombre de visites qu'il renvoie. Les valeurs citées vont de quelques dizaines à plusieurs milliers pour une visite.

Son numérateur, tiré des journaux serveur, est fiable. Son dénominateur ne l'est pas : une part inconnue des visites issues des assistants arrive sans référent exploitable, lien copié, application mobile, client de messagerie. Le ratio est donc structurellement pessimiste, d'une ampleur que personne ne sait quantifier.

Il reste utile pour comparer deux robots entre eux sur le même site, à biais constant. Il ne permet pas de fonder une décision de blocage. Nous avons développé ce point dans une analyse dédiée.

Vérifier qu'un robot est bien celui qu'il prétend être

N'importe quel programme peut se déclarer sous n'importe quel nom d'agent. Une part non négligeable du trafic annoncé comme provenant de robots officiels n'en provient pas.

La vérification se fait par résolution inverse de l'adresse IP, puis résolution directe du nom obtenu pour confirmer qu'il pointe vers cette adresse. Les éditeurs publient aussi des plages d'adresses officielles, plus simples à utiliser dans une règle de pare-feu.

Ce que le robots.txt ne règle pas

Il ne protège rien juridiquement : c'est une convention, pas une barrière. Il n'efface pas ce qui a déjà été collecté. Et il n'empêche pas les mentions, puisqu'un modèle peut parler de votre marque à partir de ce que d'autres sites écrivent sur vous.

Pour une opposition qui a une portée juridique, le terrain est ailleurs : conditions d'utilisation, droit voisin, opposition à la fouille de textes et de données au sens de la directive européenne de 2019. Nous traitons ce cadre dans notre analyse sur ce que la loi impose déjà.

Vérifier ce que votre site fait vraiment

Ouvrez votresite.fr/robots.txt et cherchez les noms d'agents concernés. Un fichier qui n'en mentionne aucun, avec un groupe générique permissif, autorise tout le monde.

Regardez ensuite vos journaux serveur. Ils indiquent quels robots viennent réellement et sur quelles pages, ce qu'aucun outil externe ne peut vous dire.