Ce glossaire explique chaque terme que vous rencontrerez dans un rapport GEO-Score ou ailleurs dans la recherche IA, en mots simples. Il couvre quatre groupes : les concepts derrière la recherche IA, les 22 métriques que nous mesurons, les termes schema.org et techniques, et les crawlers IA eux-mêmes.
Chaque définition est volontairement courte. Vous devez pouvoir lire une seule entrée et la comprendre sans lire le reste de la page.
Concepts de la recherche IA et du GEO
Les idées derrière la recherche IA. Commencez ici si tout ce domaine est nouveau pour vous.
GEO (Generative Engine Optimization)
Le GEO est la pratique consistant à structurer votre contenu et votre présence en ligne pour que les systèmes d'IA générative vous citent et vous recommandent dans leurs réponses. Ces systèmes incluent ChatGPT, Perplexity, Gemini, Claude et Google AI Overviews. Cela diffère de l'optimisation de recherche classique, qui vise une place dans une liste classée de liens.
AEO (Answer Engine Optimization)
L'AEO est la pratique consistant à structurer le contenu pour que les moteurs de réponse IA puissent l'extraire et le citer comme réponse autonome. Le terme a d'abord été utilisé pour la recherche vocale et les featured snippets. En 2026, le secteur considère généralement l'AEO comme faisant partie du GEO, ou comme un autre mot pour le désigner, plutôt que comme une discipline séparée — même si tout le monde n'est pas d'accord sur ce point.
LLM SEO
LLM SEO est un nom informel pour le GEO. Cela signifie la même chose : faire en sorte que les grands modèles de langage fassent remonter et citent votre contenu. Ce n'est pas une méthode séparée, juste une expression qui parle mieux à un public SEO.
AI Overview
Un AI Overview est le résumé rédigé par l'IA de Google, affiché au-dessus des résultats de recherche classiques pour de nombreuses requêtes. Il tire des informations de plusieurs sites web et y renvoie via des liens intégrés. C'est le nom d'un produit Google spécifique, pas un mot générique pour désigner toute réponse IA dans la recherche.
Answer Engine
Un answer engine (moteur de réponse) est un système de recherche ou d'IA qui vous donne une réponse directe et rédigée, plutôt qu'une simple liste de liens. Google AI Mode, ChatGPT et Perplexity sont des answer engines. Certains affichent des liens à côté de la réponse, d'autres non.
Generative Search
La generative search (recherche générative) est une expérience de recherche où un modèle d'IA rédige une réponse inédite à votre question, en temps réel. Il construit cette réponse à partir de contenu web qu'il récupère et de ce qu'il a déjà appris. Il ne se contente pas de renvoyer des liens ou un extrait copié.
RAG (Retrieval-Augmented Generation)
Le RAG est une architecture dans laquelle un modèle d'IA récupère d'abord des documents ou passages pertinents depuis une source externe, puis rédige sa réponse en les utilisant. Cette source peut être un index de recherche, une base de données vectorielle, ou le web en direct. C'est ainsi que la plupart des moteurs de réponse IA restent ancrés dans un contenu actuel et citable, au lieu de s'appuyer uniquement sur d'anciennes données d'entraînement.
Zero-Click Search
Une zero-click search (recherche sans clic) est une recherche où l'utilisateur obtient sa réponse directement sur la page de résultats et ne visite jamais de site web. Les featured snippets, les AI Overviews et les knowledge panels en sont tous la cause. La visite est perdue, mais une citation dans la réponse peut quand même mettre votre marque sous les yeux de l'utilisateur.
Hallucination (IA)
Une hallucination, c'est quand un modèle d'IA affirme quelque chose qui semble confiant et plausible, mais qui est faux ou non étayé. C'est une faiblesse connue de l'IA générative. Cela compte pour le GEO parce que des faits denses et des sources claires laissent moins de raisons au modèle de combler les vides avec des affirmations inventées.
Embeddings
Un embedding est un morceau de texte transformé en une liste de nombres qui capture son sens. Les machines utilisent les embeddings pour mesurer à quel point deux contenus se ressemblent, au lieu de comparer les mots exacts. Les embeddings sont ce qui rend possible la semantic search et la récupération RAG.
Semantic Search
La semantic search (recherche sémantique) fait correspondre le sens derrière une requête plutôt que les mots exacts qu'elle contient. Elle utilise les embeddings pour comparer le sens. C'est pourquoi une recherche pour « chaussures de running abordables » peut trouver une page sur les « baskets de sport économiques ».
Prompt
Un prompt est le texte que vous donnez à un grand modèle de langage pour obtenir une réponse. Cela peut être une question, une instruction, ou un bloc plus long d'informations de contexte. Un autre système peut aussi envoyer un prompt, pas seulement une personne.
Données d'entraînement vs. récupération
Les données d'entraînement sont ce qu'un modèle d'IA a appris pendant son entraînement et stocké dans ses poids, ce qui signifie qu'elles sont toujours quelque peu obsolètes. La récupération est un contenu récupéré en direct au moment de votre question et transmis au modèle comme contexte. Ce sont les deux façons dont un modèle peut « savoir » quelque chose, et c'est pourquoi les moteurs de recherche IA s'appuient autant sur la récupération.
Chunking
Le chunking consiste à découper un long document en passages plus courts avant son indexation pour la récupération. Un système de recherche ou de RAG peut alors extraire le seul paragraphe le plus pertinent, au lieu d'une page entière. C'est l'une des raisons concrètes pour lesquelles des titres clairs et des paragraphes autonomes vous aident à être cité.
Vector Database
Une vector database (base de données vectorielle) stocke des embeddings et les recherche par similarité plutôt que par correspondance exacte. Elle trouve les éléments les plus proches d'un sens donné. C'est l'infrastructure qui rend la semantic search et le RAG rapides à grande échelle.
Query Fan-Out
Le query fan-out est une technique du AI Mode de Google qui étend une seule question en plusieurs sous-questions liées. Google récupère des résultats pour chaque sous-question, puis les combine en une seule réponse. En pratique, une page qui couvre les questions de suivi d'un sujet a plus de façons d'être intégrée dans cette réponse qu'une page qui ne couvre que la question littérale posée.
Les 22 métriques GEO-Score
Ce sont les 22 signaux qu'un rapport GEO-Score mesure. Chacun a son propre guide, donc les entrées ici sont des pointeurs d'une ligne.
E-E-A-T
Le cadre de Google pour l'Expérience, l'Expertise, l'Autorité et la Confiance (Experience, Expertise, Authoritativeness, Trust), que les moteurs de recherche IA utilisent comme signal pour savoir si votre contenu est sûr à citer.
Autorité thématique
À quel point tout votre domaine couvre un sujet dans son ensemble, pas seulement une page — les moteurs IA favorisent les sites qui montrent une expertise sur l'ensemble d'un sujet.
Citabilité
À quel point un passage spécifique de votre contenu peut facilement être extrait et cité mot pour mot dans une réponse générée par l'IA.
Densité factuelle
Combien de faits vérifiables, de chiffres et de données se trouvent dans chaque paragraphe — un contenu dense est plus facile à citer qu'à paraphraser pour un modèle.
Clarté sémantique
À quel point un modèle de langage peut clairement lire le sens de votre page : entités nommées, relations simples, et le moins d'ambiguïté possible.
Correspondance du type de contenu
Si le format de votre page — liste, tableau, définition, guide pratique — correspond au format que les moteurs IA préfèrent extraire pour ce type de question.
Spécificité par plateforme
À quel point votre contenu s'adapte aux comportements différents des plateformes IA individuelles comme ChatGPT, Claude, Perplexity et Gemini.
Validateur Schema (données structurées)
Si le balisage JSON-LD schema.org de votre page est présent, valide et complet — l'un des signaux techniques les plus forts que les moteurs IA utilisent pour comprendre une page.
Sitemap et découvrabilité
Si les crawlers IA et de recherche peuvent trouver votre page, via votre sitemap.xml et vos liens internes.
Vitesse de la page
À quelle vitesse votre page répond — les pages lentes et les timeouts sont ignorés par les crawlers IA avant même que le contenu soit lu.
Complétude des réponses
Si une section répond à elle seule à une question probable, afin qu'elle puisse être extraite sans que le lecteur ait besoin du reste de la page.
Exhaustivité
À quel point votre page couvre en profondeur les sous-thèmes et questions de suivi d'un sujet, afin de satisfaire plusieurs angles d'une même requête.
Fraîcheur du contenu
Depuis quand votre contenu a été publié ou significativement mis à jour — un signal de récence que plusieurs moteurs IA prennent en compte, en particulier Perplexity et ChatGPT.
Structure du contenu
À quel point votre page est clairement organisée avec des titres, des listes et une hiérarchie, afin qu'un crawler IA puisse trouver rapidement la bonne section.
Texte alt des images
Les textes alternatifs descriptifs de vos images, qui permettent aux systèmes IA de comprendre un contenu visuel qu'ils ne peuvent pas voir.
Mots-clés sémantiques (mots-clés LSI)
Des termes et concepts liés qui apparaissent naturellement autour de votre sujet, signalant une profondeur aussi bien à la recherche classique qu'aux moteurs IA. Remarque : « LSI » (Latent Semantic Indexing) est une étiquette SEO héritée du passé — les systèmes modernes utilisent une compréhension sémantique basée sur les embeddings, pas l'algorithme LSI original des années 1990.
Lisibilité
À quel point votre page est facile à analyser, pour les modèles comme pour les personnes, généralement mesurée avec un score tel que le Flesch Reading Ease.
Cohésion du contenu (mots de transition)
Les mots et expressions qui relient vos idées entre les phrases et les paragraphes, aidant un modèle de langage à suivre votre logique.
Accès des bots IA
Si les crawlers IA comme GPTBot, ClaudeBot et PerplexityBot sont réellement autorisés à atteindre votre page, en fonction de votre robots.txt et des réponses de votre serveur.
Optimisation IA
Le score composite qui combine vos signaux de schema, de structure, de statistiques et de fraîcheur en une seule mesure globale de votre préparation à l'IA.
Citations et sources
Si votre page cite des sources externes et faisant autorité pour ses affirmations — un signal de confiance que les moteurs IA utilisent lorsqu'ils décident ce qu'ils vont eux-mêmes citer.
Knowledge Graph
Une base de données structurée d'entités et de leurs relations entre elles, comme le Knowledge Graph de Google, que les systèmes IA utilisent pour vérifier des faits et distinguer des sujets similaires.
Termes schema.org et techniques
Le balisage et les fichiers qui indiquent aux machines ce qu'est votre page. C'est la partie la plus technique du GEO, et aussi la plus facile à corriger.
Structured Data (données structurées)
Les structured data (données structurées) sont un balisage que vous ajoutez à une page pour étiqueter son contenu à destination des machines. Cela indique des choses comme « ceci est un prix », « ceci est un auteur », « ceci est une réponse de FAQ ». Cela supprime une ambiguïté qu'un crawler ou un modèle d'IA devrait sinon deviner.
JSON-LD
JSON-LD signifie JavaScript Object Notation for Linked Data. C'est la façon standard, recommandée par Google, d'insérer des données structurées schema.org dans une page, à l'intérieur d'une balise <script type="application/ld+json">. Il a remplacé les anciens formats microdata et RDFa pour la plupart des sites.
DefinedTerm (schema.org)
DefinedTerm est un type schema.org pour « un mot, un nom, un acronyme, une expression, etc. avec une définition formelle ». C'est le balisage correct pour une entrée de glossaire ou de dictionnaire. Chaque entrée de cette page est balisée comme telle.
DefinedTermSet (schema.org)
DefinedTermSet est un type schema.org pour un ensemble d'entrées DefinedTerm liées qui partagent un contexte. C'est le conteneur qui englobe tout un glossaire, chaque définition y figurant comme terme enfant.
FAQPage (schema.org)
FAQPage est un type schema.org pour une page contenant une liste de questions et réponses. Baliser vos questions-réponses avec ce type peut rendre chacune éligible aux résultats enrichis, et plus facile à extraire dans une réponse IA.
robots.txt
robots.txt est un fichier texte simple à la racine de votre site qui indique aux crawlers quelles parties ils peuvent ou ne peuvent pas visiter. Les crawlers IA sont désignés par leur propre nom de user-agent. C'est une demande, pas un verrou : cela ne bloque pas l'accès à lui seul, et tous les crawlers IA ne le respectent pas.
llms.txt
llms.txt est une convention proposée : un fichier Markdown organisé à la racine de votre site (/llms.txt) qui donne aux modèles de langage un aperçu lisible par machine de votre contenu le plus important. Il a été proposé par Jeremy Howard et Answer.AI en septembre 2024 et n'a jamais été formellement ratifié. Son adoption est réelle mais partielle, et ni OpenAI, ni Anthropic, ni Google, ni Perplexity n'ont officiellement confirmé que leurs crawlers l'utilisent.
Canonical URL et hreflang
Une canonical URL indique aux crawlers de recherche et d'IA quelle version d'une page est la copie de référence, lorsque le même contenu se trouve à plus d'une adresse. hreflang leur indique quelle version linguistique ou régionale servir à quel public. Les deux comptent dès que votre site a plusieurs langues ou des pages quasi-identiques.
Crawlers et bots IA
Ce sont les programmes qui récupèrent vos pages pour le compte des entreprises d'IA. Les noms et les règles changent souvent, vérifiez donc la documentation officielle du fournisseur avant d'agir sur cette base. Un même schéma traverse toute la liste. La plupart des entreprises d'IA exploitent au moins deux types de fetchers : un crawler d'entraînement ou d'indexation, qui visite selon son propre calendrier, et un fetcher à la demande, qui ne visite que lorsqu'un utilisateur interroge l'assistant à propos de votre page. Bloquer l'un ne bloque pas l'autre, et ils ont des effets très différents sur votre visibilité.
GPTBot
GPTBot est le crawler d'OpenAI pour collecter du contenu afin d'entraîner ses modèles d'IA. Le bloquer dans robots.txt signale que votre contenu doit être exclu des données d'entraînement d'OpenAI. Cela n'affecte pas la navigation en direct ou la recherche de ChatGPT, qui utilisent d'autres bots.
OAI-SearchBot
OAI-SearchBot est le crawler d'OpenAI pour afficher des sites web dans les fonctionnalités de recherche de ChatGPT. Si vous vous en excluez, votre site n'apparaîtra pas dans les réponses de recherche de ChatGPT. Il est distinct de GPTBot (entraînement) et de ChatGPT-User (navigation en direct).
ChatGPT-User
ChatGPT-User est le user-agent qu'OpenAI envoie lorsqu'un utilisateur de ChatGPT en direct déclenche une action qui visite une page, comme lui demander de naviguer vers une URL. Ce n'est pas un crawl automatique et programmé. Quelqu'un a demandé cette page spécifique.
ClaudeBot
ClaudeBot est le crawler d'Anthropic qui collecte du contenu web pouvant servir à entraîner les modèles Claude. Le bloquer signale que votre futur contenu doit être exclu des jeux de données d'entraînement d'Anthropic. Anthropic utilisait auparavant deux autres user-agents pour cela, Claude-Web et anthropic-ai, désormais obsolètes.
Claude-User
Claude-User est le user-agent d'Anthropic pour récupérer une page en direct lorsque quelqu'un pose à Claude une question qui en a besoin. Le bloquer peut réduire la fréquence à laquelle votre site apparaît dans les réponses de Claude aux utilisateurs.
Claude-SearchBot
Claude-SearchBot est le crawler d'Anthropic pour indexer du contenu afin d'améliorer la pertinence et l'exactitude des résultats de recherche de Claude. Il est distinct de ClaudeBot (entraînement) et de Claude-User (récupération en direct, page par page).
PerplexityBot et Perplexity-User
Perplexity exploite deux crawlers. PerplexityBot est un crawler d'indexation traditionnel, dont Perplexity affirme qu'il respecte le robots.txt. Perplexity-User est un fetcher à la demande, et Perplexity a publiquement pris la position qu'il s'agit d'un agent plutôt que d'un bot, et qu'il n'est donc pas tenu de respecter le robots.txt.
Cette position a mené à des différends publics avec des éditeurs et avec Cloudflare, qui a séparément rapporté que Perplexity utilisait des crawlers non déclarés faisant tourner user-agents et adresses IP pour contourner les blocages. Considérez cela comme un différend rapporté, pas comme un constat établi.
Google-Extended
Google-Extended n'est pas un crawler avec sa propre chaîne de user-agent, bien qu'il soit souvent présenté comme tel. C'est un jeton de contrôle robots.txt qui détermine si le contenu déjà exploré par Google peut aussi être utilisé pour entraîner les modèles Gemini et alimenter les fonctionnalités de Gemini et Vertex AI. Le bloquer n'affecte pas votre visibilité normale dans Google Search.
CCBot
CCBot est le crawler de Common Crawl, une organisation à but non lucratif qui maintient une archive ouverte du web. Il n'appartient à aucune entreprise d'IA. Son jeu de données est un composant largement utilisé dans les données d'entraînement de nombreux grands modèles de langage, ce qui explique pourquoi il compte pour le GEO, même si le bloquer ne cible aucun produit d'IA spécifique.
Le GEO est-il la même chose que le SEO ?
▼
Dois-je tout faire ?
▼
Que se passe-t-il si je bloque les crawlers IA ?
▼
Découvrez le score de votre page
Ce glossaire explique les signaux. Un rapport vous indique où vous en êtes sur chacun d'eux. Faites passer n'importe quelle page dans GEO-Score et obtenez un score sur les 22 métriques, avec la raison derrière chacune.
Analyser une page →