Comment les moteurs de réponse choisissent leurs sources
Un moteur de réponse ne classe pas des pages, il enchaîne trois opérations : il récupère des documents, il en extrait des passages, il attribue une citation. Chaque étape se travaille séparément.
Poser deux fois la même question à ChatGPT donne rarement les mêmes sources. Cette instabilité décourage l'analyse, à tort : le mécanisme sous-jacent est stable, seule sa sortie varie. Il se décompose en trois étapes, et chacune se pilote avec des moyens différents.
Étape 1 : d'où viennent les documents récupérés
Un moteur de réponse ne parcourt pas le web au moment de la question. Il interroge un index constitué à l'avance, exactement comme un moteur de recherche.
ChatGPT et Copilot s'appuient sur l'index de Bing. La conséquence est directe et souvent ignorée : un site absent de Bing est invisible dans deux des principaux moteurs de réponse, quelle que soit sa position dans Google. Vérifier son indexation dans Bing Webmaster Tools est le geste au meilleur rapport effort sur résultat de tout le GEO, et nous lui consacrons un guide entier : pourquoi optimiser pour 10 % du marché.
Gemini et les AI Overviews utilisent l'index Google. Le travail SEO classique y produit ses effets, avec une nuance : les pages citées ne sont pas toujours celles du top 3 organique.
Perplexity maintient son propre index, alimenté par PerplexityBot, complété par des sources tierces.
Première conséquence pratique : le fichier robots.txt décide de la participation au jeu. Bloquer GPTBot par précaution, ce que beaucoup de sites ont fait en 2023 sans revenir dessus, revient à sortir du corpus. Bloquer OAI-SearchBot, qui sert la recherche et non l'entraînement, revient à sortir des réponses citées.
Étape 2 : quels passages sont extraits
Le système ne cite pas une page, il cite un passage. Les documents récupérés sont découpés, puis chaque fragment est évalué sur sa capacité à répondre seul.
Un passage extractible partage trois propriétés observables.
Il nomme son sujet. « Le GEO consiste à structurer un contenu pour qu'il soit cité » se prélève. « Il consiste à le structurer pour cela » ne se prélève pas, parce que le pronom perd son antécédent une fois le fragment isolé.
Il contient une information vérifiable. Une date, un chiffre, un nom d'acteur, une règle précise. Les formulations générales sont écartées parce qu'elles n'apportent rien à la réponse en construction.
Il tient en peu de mots. Un paragraphe de quinze lignes qui déroule un raisonnement sera rarement retenu face à trois phrases qui posent le fait.
Cette mécanique explique pourquoi certaines pages moyennement classées se retrouvent citées : leur rédaction est simplement plus facile à découper.
Étape 3 : à qui la citation est attribuée
Entre deux passages équivalents, le système tranche sur la source. Trois familles de signaux entrent en jeu.
L'identité de l'éditeur et de l'auteur : une page signée par une personne dotée d'une page auteur, elle-même reliée à des profils externes, se distingue d'une page anonyme. C'est le lien direct entre l'E-E-A-T et la citation.
La cohérence thématique du domaine : un site qui publie régulièrement sur un périmètre resserré devient une entité associée à ce sujet. Un site généraliste doit se battre page par page.
La fraîcheur : les dates de publication et de mise à jour, affichées et balisées, pèsent particulièrement sur les sujets mouvants, ce qui est le cas de tout ce qui touche à l'IA.
Pourquoi les résultats varient d'une exécution à l'autre
Trois causes se cumulent, et aucune ne relève d'un défaut de la page.
La génération est probabiliste : à contexte identique, le modèle ne produit pas exactement la même réponse.
La récupération dépend de la formulation : une reformulation interne de la requête, invisible pour l'utilisateur, change les documents remontés.
Le contexte de la session influence la suite : dans une conversation, les échanges précédents orientent les recherches suivantes.
D'où une règle méthodologique : une observation isolée ne prouve rien. Seule une mesure répétée sur un panel figé produit une donnée exploitable. C'est le principe de la part de voix IA.
Ce que cela change dans la production de contenu
Rien de spectaculaire, et c'est plutôt une bonne nouvelle. Les pratiques qui améliorent la citation améliorent aussi la lecture humaine : répondre avant d'expliquer, nommer les choses, dater les affirmations, citer ses sources.
Deux habitudes en revanche méritent d'être abandonnées. L'introduction qui repousse la réponse au troisième paragraphe, héritée d'une époque où le temps passé sur la page comptait. Et la structure en tunnel, où chaque section dépend de la précédente : elle interdit toute extraction autonome. La méthode de rédaction correspondante est détaillée dans notre guide sur la pyramide inversée.
Comment vérifier chaque étape sur son propre site
Les trois étapes se contrôlent séparément, avec des moyens qui n'ont rien de commun. C'est ce qui rend le diagnostic utile : un échec ne se situe jamais partout à la fois.
La récupération. Ouvrez votre fichier robots.txt et cherchez GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot et Google-Extended. Vérifiez ensuite l'indexation du domaine dans Bing Webmaster Tools et dans Search Console. Si une page importante n'est indexée nulle part, rien de ce qui suit n'a d'objet. Vos journaux serveur disent le reste : quels robots viennent réellement, sur quelles URL, à quelle fréquence. C'est l'objet de notre guide sur l'analyse de logs.
L'extraction. Prenez une section de votre page, sortez-la de son contexte, et lisez-la seule. Si elle commence par « il », « ce dernier » ou « cette approche », elle n'est pas extractible. Si elle ne contient ni date, ni chiffre, ni nom propre, elle n'apporte rien à une réponse en construction. Ce test se fait à la relecture, sans outil, et il suffit à écarter la plupart des cas.
L'attribution. Vérifiez qu'un lecteur, humain ou machine, peut répondre à trois questions depuis la page : qui a écrit, quand, et pour quelle organisation. Une signature reliée à une page auteur, une date de publication et de mise à jour visibles, et un balisage cohérent suffisent. Un moteur qui doit choisir entre deux affirmations contradictoires s'appuie sur ces éléments, faute de mieux.
Trois vérifications, une demi-journée, et un diagnostic qui dit lequel des trois étages bloque. C'est ce qui manque à la plupart des audits GEO vendus aujourd'hui.
Sources
- Lewis et al., « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks », 2020
- OpenAI, documentation des robots GPTBot et OAI-SearchBot
- Microsoft Bing Webmaster Tools, documentation d'indexation
Stéphane
Stéphane Delgado dirige la rédaction d'aifluence. Consultant SEO et GEO, il anime le podcast Parlons SEO GEO et a créé la méthode Passeport vers la Citation.