Configurer robots.txt pour les crawlers IA
Un tour d'horizon pratique de GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended et les autres : ce que fait chacun, et un robots.txt que vous pouvez réellement utiliser.
La plupart des sites bloquent les crawlers IA par accident, via une règle WAF héritée ou un modèle de robots.txt copié-collé, ou autorisent tout sans réfléchir à l'usage réel de chaque robot. Ce guide corrige les deux.
Vérifier l'accès de mes crawlersDeux types de crawlers IA, pas un seul
Les entreprises d'IA exploitent au moins deux types de crawlers différents, et les traiter comme une seule chose est l'erreur robots.txt la plus courante. Les crawlers d'entraînement, comme GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google) et CCBot (Common Crawl, utilisé indirectement par de nombreux modèles), visitent votre site selon leur propre calendrier pour collecter des données en vue d'une future version de modèle. Bloquer l'un d'eux ne retire rien de ce qui a déjà été appris lors d'un passage précédent ; cela ne fait que vous exclure du prochain.
Les crawlers de récupération en temps réel fonctionnent différemment : OAI-SearchBot et ChatGPT-User (OpenAI), PerplexityBot (Perplexity), et les récupérations connectées à la recherche que font Claude et Gemini, s'exécutent tous au moment où un utilisateur pose une question qui a besoin de votre page maintenant. Les bloquer a un effet immédiat : le moteur ne peut pas lire votre page pour cette réponse, point final, même si votre contenu était exactement ce dont il avait besoin.
C'est pourquoi une règle générale « bloquer tous les robots » est généralement une erreur, tout comme une règle générale « tout autoriser » sans réflexion derrière. Un bon robots.txt traite chaque crawler selon ce qu'il fait : autorisez ceux qui génèrent des citations et des réponses en temps réel, et faites un choix délibéré et informé, pas un défaut, concernant ceux dédiés uniquement à l'entraînement.
Ce qu'il faut décider avant de modifier robots.txt
Sachez quel type vous bloquez
Avant d'interdire quoi que ce soit, vérifiez s'il s'agit d'un crawler d'entraînement, qui n'affecte que les futures versions de modèle, ou d'un récupérateur en temps réel, qui affecte si vous êtes cité dans une réponse dès maintenant. Les deux ont des conséquences complètement différentes.
Vérifiez que le robot est réel
Une chaîne user-agent n'est que du texte — n'importe qui peut envoyer « GPTBot » dans un en-tête de requête. Pour tout ce qui va au-delà d'une règle robots.txt de base, comme un blocage WAF, vérifiez via les plages d'IP publiées ou une liste de robots vérifiés d'un CDN, pas la chaîne seule.
Vérifiez vos journaux serveur, pas seulement robots.txt
robots.txt est une demande, pas un verrou — les robots bien élevés le respectent, mais le seul moyen de savoir si vos règles fonctionnent vraiment est d'échantillonner régulièrement les journaux serveur à la recherche de réponses 200 (pas de rejets silencieux ni de défis WAF) des robots que vous vouliez autoriser.
Pourquoi cela vaut la peine d'être bien fait
Le blocage accidentel est la norme, pas l'exception
Une recherche indépendante d'Originality.ai a trouvé que GPTBot est bloqué par plus d'un tiers des 1 000 sites web les plus visités — et des entretiens avec des propriétaires de sites ont montré que beaucoup de ces blocages provenaient de règles WAF par défaut ou de modèles copiés-collés, pas d'une décision délibérée.
Généralement une correction de cinq minutes
Une fois que vous savez quels robots autoriser, la modification réelle de robots.txt tient en une poignée de lignes. La partie difficile est de savoir quoi écrire, pas de l'écrire.
Bloquer a un coût mesuré
Des études de cas analysées par Hack/Hackers ont trouvé que les sites qui bloquaient les crawlers IA ont ensuite connu une baisse notable du trafic de référence en provenance des moteurs de réponse IA. Le crawler que vous bloquez aujourd'hui est la citation que vous n'obtenez pas demain.
Configurer l'accès des crawlers IA en 3 étapes
Décidez robot par robot, pas tout ou rien
Listez les crawlers que vous voulez autoriser. La plupart des sites devraient autoriser par défaut les récupérateurs en temps réel — OAI-SearchBot, ChatGPT-User et PerplexityBot — puisque les bloquer vous retire immédiatement des réponses en direct.
Écrivez des règles Allow explicites
Ajoutez un bloc User-agent par robot plutôt que de compter sur une règle générique héritée d'un modèle. Des règles explicites remplacent les valeurs par défaut et rendent votre intention vérifiable plus tard.
Confirmez avec les journaux serveur
Après le déploiement, échantillonnez vos journaux pour les robots que vous avez autorisés. Cherchez des réponses 200, pas des 403 ou des défis WAF. Un robot qui respecte robots.txt mais qui est quand même bloqué ailleurs dans votre infrastructure a besoin d'une correction séparée.
FAQ AI Crawler Access
Quelle est la différence entre un crawler d'entraînement et un crawler de récupération en temps réel ?
Un crawler d'entraînement comme GPTBot, ClaudeBot ou Google-Extended collecte des données selon son propre calendrier pour améliorer une future version de modèle — le bloquer n'a aucun effet sur les citations qui se produisent aujourd'hui. Un crawler de récupération en temps réel comme OAI-SearchBot, ChatGPT-User ou PerplexityBot s'exécute au moment où la question d'un utilisateur a besoin de votre page — le bloquer signifie que cette réponse précise ne peut pas du tout utiliser votre contenu.
À quoi ressemble un robots.txt fonctionnel pour les crawlers IA ?
Un exemple minimal qui autorise les principaux robots pertinents pour les citations : User-agent: GPTBot, Allow: /; User-agent: OAI-SearchBot, Allow: /; User-agent: ChatGPT-User, Allow: /; User-agent: ClaudeBot, Allow: /; User-agent: PerplexityBot, Allow: /; User-agent: Google-Extended, Allow: /; suivi d'une ligne Sitemap pointant vers votre sitemap.xml. Ajustez quels robots reçoivent Allow ou Disallow selon votre propre décision concernant les données d'entraînement.
Devrais-je bloquer GPTBot pour tenir l'IA à l'écart de mon contenu ?
Pour la plupart des sites, non. GPTBot est le crawler d'entraînement d'OpenAI — le bloquer empêche les futurs modèles de s'entraîner sur du nouveau contenu, mais ne retire rien de déjà appris, et n'affecte pas les citations en temps réel de ChatGPT, qui proviennent plutôt d'OAI-SearchBot et ChatGPT-User. Le bloquer est une décision délibérée de désinscription, pas une mesure de sécurité, et les données d'études de cas suggèrent que cela peut coûter du vrai trafic de référence sans avantage clair pour la plupart des éditeurs.
Bloquer les crawlers IA affecte-t-il mon classement Google ?
Bloquer GPTBot, ClaudeBot ou PerplexityBot n'a aucun effet direct sur le classement Google Search — Googlebot est un crawler entièrement séparé. Bloquer spécifiquement Google-Extended est différent : cela empêche vos contenus d'être utilisés dans les propres fonctionnalités IA de Google, comme les AI Overviews et Gemini, sans toucher à votre classement de recherche habituel, régi par Googlebot.
Comment savoir si une requête prétendant être GPTBot l'est vraiment ?
Ne faites jamais confiance uniquement à la chaîne user-agent — elle est trivialement falsifiable. Pour tout ce qui va au-delà d'une règle robots.txt de base, vérifiez à partir des plages d'IP publiées du crawler (OpenAI, Anthropic et d'autres les publient) ou utilisez une liste de robots vérifiés d'un CDN, comme l'AI Crawl Control de Cloudflare, qui vérifie plus que le simple en-tête.
Ai-je aussi besoin d'un fichier llms.txt ?
llms.txt est une convention émergente et non officielle que certains sites utilisent pour orienter les crawlers IA vers un résumé sélectionné de leur contenu. Ce n'est pas une norme dont une grande entreprise d'IA ait confirmé la lecture, et cela ne remplace pas robots.txt, le véritable mécanisme de contrôle d'accès que les crawlers respectent. À surveiller, mais pas encore prioritaire par rapport à un robots.txt correctement configuré.
Vérifiez si les crawlers IA peuvent réellement lire votre site
GEO-Score inspecte votre robots.txt, les réponses serveur et le contenu rendu en JavaScript pour montrer exactement quels robots IA sont autorisés. Cinq vérifications de page par domaine sont gratuites tous les 30 jours.
Vérifier l'accès de mes crawlers