Aller au contenu
Référencement

Être cité par ChatGPT et Perplexity : ce que ça demande à votre site

22 septembre 2026 6 min KOV

Les moteurs de réponse ne classent pas des pages, ils citent des passages. Ce qui se joue avant la réponse est mécanique bien plus qu'éditorial.

Synthèse vocale

Posez une question à ChatGPT ou à Perplexity : la réponse arrive avec trois ou quatre sources en dessous. Être l'une d'elles n'a plus grand-chose à voir avec être troisième sur Google. Il n'y a pas de deuxième page, pas de liste de dix résultats à parcourir, et souvent aucun clic.

La question n'est donc plus « comment me classer », mais « comment devenir une des sources que la machine reprend ». Ce n'est pas la même mécanique, et la plupart des sites échouent bien avant d'arriver à la partie éditoriale.

Ce n'est pas un nouveau référencement

Les moteurs de réponse n'explorent pas un web parallèle. Ils lisent les mêmes pages, par le même protocole, avec des robots qui se déclarent. Rien de ce que vous faites pour eux n'est perdu pour Google, et l'inverse est vrai aussi.

Ce qui change, c'est l'unité. Google indexe une page et la classe. Un moteur de réponse extrait un passage et l'attribue. Vous n'optimisez plus une page : vous produisez des passages qui survivent à l'extraction, lisibles seuls, sortis de leur contexte, sans le paragraphe qui les précédait.

Première condition : que la page existe sans JavaScript

Celle-là est purement mécanique, et c'est là que tombent beaucoup de sites récents. Un robot qui n'exécute pas votre JavaScript ne voit que le HTML renvoyé par le serveur. Si votre contenu est chargé après coup par le navigateur, il n'existe pas pour lui.

Le test tient en dix secondes et ne demande aucun outil : affichez le code source de la page (Ctrl+U), cherchez une phrase de votre texte. Si elle n'y est pas, aucun moteur de réponse ne la citera, quelle qu'en soit la qualité.

C'est une décision d'architecture, prise au moment du développement, et non un réglage qu'on ajoute après. Un site rendu côté serveur passe ce test par construction ; un site entièrement rendu côté navigateur ne le passe jamais.

Deuxième condition : une autorisation, et elle est mal comprise

Les robots se déclarent, et ils ne font pas tous le même travail. Côté OpenAI, on distingue notamment :

  • GPTBot : collecte destinée à l'entraînement des modèles.

  • OAI-SearchBot : constitution de l'index de recherche.

  • ChatGPT-User : récupération d'une page déclenchée par la question d'un utilisateur.

Perplexity déclare de son côté PerplexityBot et Perplexity-User, sur une logique comparable.

D'où le malentendu le plus répandu : beaucoup de sites bloquent GPTBot en pensant « se protéger de l'IA », puis s'étonnent de n'être jamais cités. Ce sont deux décisions distinctes. Refuser que vos pages nourrissent l'entraînement d'un modèle ne vous retire pas des réponses ; bloquer les agents de recherche et de récupération, si. Tranchez-les séparément, en sachant laquelle vous tranchez.

Cette liste évolue : les opérateurs ajoutent et renomment leurs agents. Avant d'écrire une règle dans votre robots.txt, allez lire la documentation de l'opérateur concerné plutôt qu'un article, celui-ci compris.

Un moteur de réponse ne cite pas un site. Il cite un passage. Écrivez des passages qui tiennent debout tout seuls.

Troisième condition : écrire des réponses, pas des pages

Une page qui traite huit sujets ne donne à extraire que du contexte. Une page qui traite une question donne une réponse.

Trois habitudes concrètes, dont aucune n'est technique :

  • Une question par page, et un titre qui est cette question.

  • La réponse dans le premier paragraphe, pas après six cents mots de mise en contexte. Le contexte vient ensuite, pour qui reste.

  • Aucun renvoi interne implicite : « comme on l'a vu plus haut » ne veut rien dire dans un passage cité, qui n'a pas de plus haut.

C'est exactement pour ça qu'une FAQ bien tenue fonctionne : c'est structurellement une collection de réponses autonomes. Et c'est le principe qui a guidé notre article sur les sites de conseillers en gestion de patrimoine : une question, posée en titre, traitée jusqu'au bout.

llms.txt : utile, mais pas magique

C'est un fichier texte placé à la racine du site, qui décrit en clair ce qu'est le site et liste ses pages importantes. Le nôtre est à /llms.txt, et il coûte dix minutes à écrire.

Ce qu'il n'est pas : un standard qu'un grand moteur se serait engagé à lire. Aucun opérateur majeur n'a annoncé s'en servir comme signal. Le coût est proche de zéro, l'attente devrait l'être aussi. Sa vraie valeur est ailleurs : écrire en dix lignes ce qu'est votre site est un exercice qui révèle très vite si vous le savez.

Avec un piège que nous venons de rencontrer chez nous : ce genre de fichier pourrit. Le nôtre annonçait encore qu'une page avait été retirée, alors qu'elle est revenue depuis. Une description qui contredit le site est pire que pas de description du tout. Si vous en tenez un, relisez-le à chaque refonte.

Ce qui ne marche pas

Placer le mot « ChatGPT » partout dans vos pages ne vous fera pas citer par ChatGPT. C'est le bourrage de mots-clés dans sa version de l'année, et il vieillira aussi bien que la précédente.

Inventer des chiffres pour paraître autoritaire est pire. Un moteur de réponse recoupe ses sources : un chiffre que personne d'autre n'avance fait de vous l'intrus, et une source contredite est une source qu'on cesse de reprendre. La rigueur n'est pas une posture morale ici, c'est une condition de survie.

Publier beaucoup sans avoir rien à dire, enfin, produit exactement ce qu'on y a mis.

Comment savoir si ça fonctionne

Il n'y a pas de tableau de bord, pas de position à relever. Deux méthodes honnêtes, et leurs limites :

Poser les questions vous-même. Interrogez les moteurs sur les sujets dont vous devriez être la réponse. Mais les réponses varient selon l'utilisateur, la session et le moment : traitez ça comme une observation répétée dans le temps, jamais comme une mesure.

Lire vos journaux serveur. Les agents s'identifient. Voir OAI-SearchBot ou PerplexityBot venir chercher vos pages vous dit que vous êtes lisible et autorisé, c'est-à-dire la partie que vous maîtrisez réellement.

Le reste, être choisi plutôt qu'un autre, ne se pilote pas. Autant le savoir avant d'y consacrer un budget.

Ce qu'il faut en retenir

Tout ce qui précède découle d'une seule chose : un site lisible par une machine et écrit pour être cité. Du HTML servi par le serveur, des autorisations décidées plutôt que subies, des réponses autonomes plutôt que des pages fourre-tout.

Ce n'est pas une nouvelle discipline. C'est l'ancienne, faite correctement, et c'est ce que recouvrent la stratégie et le développement dans notre façon de travailler. Si vous voulez savoir ce que votre site donne à lire aujourd'hui, écrivez-nous : on regarde, et on vous le dit.

À lire aussi

Menu