Robots d'IA, robots.txt et llms.txt : que faut-il autoriser ?
GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended : ce que fait chaque robot, comment les autoriser ou les bloquer, et ce qu'il faut penser du fichier llms.txt.
2 octobre 2026 · 3 min de lecture
Votre fichier robots.txt décide déjà qui peut explorer votre site. Avec l'arrivée des assistants IA, il a gagné une dizaine de nouveaux interlocuteurs, aux rôles très différents. Les bloquer tous par précaution peut vous rendre invisible dans les réponses qui consultent le web ; les autoriser tous sans réfléchir revient à laisser vos contenus servir à l'entraînement de modèles. Le bon réglage dépend de ce que vous voulez.
Trois usages à ne pas confondre
Les robots des fournisseurs d'IA servent en général à l'une de ces trois choses :
- L'entraînement : collecter des pages pour entraîner de futurs modèles.
- La recherche : indexer des pages pour que l'assistant puisse les trouver et les citer quand il consulte le web.
- La lecture à la demande : récupérer une page précise parce qu'un utilisateur l'a demandé pendant une conversation.
Pour la visibilité dans les réponses, ce sont surtout les deux derniers qui comptent. On peut tout à fait refuser l'entraînement tout en acceptant la recherche.
Les principaux robots
- OpenAI —
GPTBotpour l'entraînement,OAI-SearchBotpour la recherche dans ChatGPT,ChatGPT-Userpour les pages consultées à la demande d'un utilisateur. - Anthropic —
ClaudeBotpour l'entraînement,Claude-SearchBotpour la recherche,Claude-Userpour la lecture à la demande. - Perplexity —
PerplexityBotpour l'indexation de son moteur de réponse,Perplexity-Userpour les requêtes des utilisateurs. - Google —
Google-Extendedn'est pas un robot à part mais un jeton : il permet de refuser que vos contenus servent aux modèles Gemini, sans effet sur Google Search. Les AI Overviews, qui font partie de la recherche Google, s'appuient sur l'exploration habituelle de Googlebot. - Microsoft — Copilot s'appuie sur l'index de Bing, donc sur
Bingbot.
Les fournisseurs font évoluer ces noms et leurs rôles. Avant de modifier votre fichier, vérifiez la documentation officielle de chacun : c'est la seule référence qui fasse foi.
Un exemple de réglage
Voici un réglage courant pour une marque qui souhaite être citée dans les réponses mais pas servir à l'entraînement :
# Pas d'entraînement User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: Google-Extended Disallow: / # Recherche et lecture à la demande User-agent: OAI-SearchBot User-agent: ChatGPT-User User-agent: Claude-SearchBot User-agent: Claude-User User-agent: PerplexityBot User-agent: Perplexity-User Allow: /
Gardez en tête que robots.txt est une convention : les robots des grands fournisseurs déclarent la respecter, mais le fichier n'empêche techniquement rien. Et refuser l'entraînement n'efface pas ce qu'un modèle a déjà appris.
Vérifier ce qui se passe vraiment
Les journaux de votre serveur, ou de votre hébergeur, indiquent quels robots visitent réellement votre site, à quelle fréquence et sur quelles pages. C'est la meilleure façon de vérifier qu'un réglage produit l'effet attendu — et de découvrir parfois qu'un pare-feu ou un service anti-robots bloque des visiteurs que vous pensiez autoriser.
Et le fichier llms.txt ?
Proposé en 2024, llms.txt est un fichier placé à la racine d'un site qui résume, en Markdown, ses contenus principaux et renvoie vers les pages utiles, pour faciliter leur lecture par un modèle de langage. L'idée est séduisante, et le fichier est simple à produire.
À notre connaissance, aucun des grands fournisseurs d'assistants n'a toutefois annoncé l'utiliser pour choisir les sources de ses réponses. Il peut servir dans certains outils de développement ou agents qui le lisent explicitement, mais il ne remplace ni un site bien structuré, ni une présence dans les sources tierces. Le publier ne coûte presque rien ; en attendre un gain de visibilité mesurable est, pour l'instant, un pari.
En résumé
- Distinguez entraînement, recherche et lecture à la demande.
- Si vous voulez être cité, n'empêchez pas les robots de recherche et de lecture à la demande d'accéder à vos pages publiques.
- Vérifiez les noms dans la documentation officielle de chaque fournisseur, puis dans vos journaux.
- Considérez llms.txt comme un bonus éventuel, pas comme un levier.