Aller au contenu

Guide · Être cité par les IA

Comment un moteur de réponse choisit ses sources

Trois mécanismes séparent une page de sa citation dans une réponse générée. Ils se travaillent séparément, et négliger le premier annule les deux autres.

Par Yannis Mis à jour le 3 min de lecture

Un moteur de réponse produit un texte et cite quelques sources. Entre votre page et cette citation, trois mécanismes s'enchaînent.

1. La récupération

Le système interroge un index pour ramener des documents candidats. Cet index n'est pas le même selon les assistants : celui de Bing pour plusieurs d'entre eux, celui de Google pour ses propres surfaces, des index propriétaires pour d'autres, et souvent une combinaison.

OpenAI a confirmé en 2026 disposer de son propre index, organisé en verticaux distincts : web général, actualité, finance, médical, shopping, images et d'autres. Nous avons détaillé cette architecture dans notre article sur l'index de ChatGPT.

Ce qu'on peut agir : tout ce qui relève de l'indexation classique, décrit dans la partie sur l'exploration et l'indexation. Un document absent de l'index interrogé n'a aucune chance, quelle que soit sa qualité.

2. L'extraction

Le système découpe les documents récupérés en passages et retient ceux qui répondent à une sous-question.

C'est l'étape où la plupart des pages échouent sans que personne ne s'en aperçoive, parce qu'elles sont bien classées par ailleurs. Un passage qui commence par « comme nous l'avons vu plus haut », qui dépend d'un tableau situé ailleurs, ou dont le sujet est un pronom, ne survit pas à l'extraction.

Ce qu'on peut agir : la forme du contenu, traitée dans le chapitre écrire pour être cité.

3. L'attribution

Le système doit citer sans se tromper. Il privilégie les sources qu'il peut identifier avec certitude : un éditeur nommé, un auteur avec une page, une date, une cohérence d'un bout à l'autre du domaine.

Une page anonyme, sans date, sur un site dont on ne sait pas qui l'édite, représente un risque que le système évite quand une alternative existe.

Ce qu'on peut agir : la signature, le balisage d'identité, la page d'entité de l'entreprise, la cohérence des informations publiées ailleurs. Le chapitre sur l'E-E-A-T couvre l'essentiel, et notre guide sur la page d'entité le complète.

Le query fan-out, et ce qu'il implique

Face à une question large, le système ne fait pas une recherche : il en fait plusieurs. Il décompose la demande en sous-questions, interroge l'index sur chacune, puis assemble.

Conséquence directe : une page qui répond parfaitement à une seule des sous-questions rate les autres. Une page qui couvre le sujet et ses ramifications a plusieurs occasions d'être retenue dans la même réponse.

C'est ce qui rend la profondeur plus rentable que le volume, et l'exhaustivité d'un sujet plus rentable que la multiplication de pages courtes.

Ce qui ne marche pas

Le bourrage de mots-clés pour IA. Il n'existe pas de densité qui déclenche une citation.

Les fichiers déclaratifs. Le fichier llms.txt, proposé en 2024, n'est repris par aucun moteur de réponse à ce jour. Il coûte peu si l'on automatise sa génération, et ne démontre aucun bénéfice.

Les schémas de balisage inventés. Aucun vocabulaire spécifique au GEO n'existe. Le balisage standard sert, parce qu'il lève des ambiguïtés d'identité.

Payer pour être cité. Les régies publicitaires des assistants vendent des emplacements identifiés comme publicitaires, distincts des citations organiques. Confondre les deux dans une offre commerciale serait trompeur.

L'ordre de travail

Vérifier l'indexation. Corriger les affirmations fausses que les modèles reprennent déjà sur votre marque. Restructurer les contenus existants pour l'extraction. Produire ensuite, et seulement ensuite.

Cet ordre n'est pas intuitif : il commence par de la vérification et de la correction, pas par de la production. C'est aussi celui qui produit des résultats en premier.

Le chapitre suivant le déroule en quatre phases datées, sous le nom de méthode Passeport vers la Citation.