Blog

Robots d'IA, robots.txt et llms.txt : que faut-il autoriser ?

GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended : ce que fait chaque robot, comment les autoriser ou les bloquer, et ce qu'il faut penser du fichier llms.txt.

2 octobre 2026 · 3 min de lecture

Votre fichier robots.txt décide déjà qui peut explorer votre site. Avec l'arrivée des assistants IA, il a gagné une dizaine de nouveaux interlocuteurs, aux rôles très différents. Les bloquer tous par précaution peut vous rendre invisible dans les réponses qui consultent le web ; les autoriser tous sans réfléchir revient à laisser vos contenus servir à l'entraînement de modèles. Le bon réglage dépend de ce que vous voulez.

Trois usages à ne pas confondre

Les robots des fournisseurs d'IA servent en général à l'une de ces trois choses :

  1. L'entraînement : collecter des pages pour entraîner de futurs modèles.
  2. La recherche : indexer des pages pour que l'assistant puisse les trouver et les citer quand il consulte le web.
  3. La lecture à la demande : récupérer une page précise parce qu'un utilisateur l'a demandé pendant une conversation.

Pour la visibilité dans les réponses, ce sont surtout les deux derniers qui comptent. On peut tout à fait refuser l'entraînement tout en acceptant la recherche.

Les principaux robots

  • OpenAI — GPTBot pour l'entraînement, OAI-SearchBot pour la recherche dans ChatGPT, ChatGPT-User pour les pages consultées à la demande d'un utilisateur.
  • Anthropic — ClaudeBot pour l'entraînement, Claude-SearchBot pour la recherche, Claude-User pour la lecture à la demande.
  • Perplexity — PerplexityBot pour l'indexation de son moteur de réponse, Perplexity-User pour les requêtes des utilisateurs.
  • Google — Google-Extended n'est pas un robot à part mais un jeton : il permet de refuser que vos contenus servent aux modèles Gemini, sans effet sur Google Search. Les AI Overviews, qui font partie de la recherche Google, s'appuient sur l'exploration habituelle de Googlebot.
  • Microsoft — Copilot s'appuie sur l'index de Bing, donc sur Bingbot.

Les fournisseurs font évoluer ces noms et leurs rôles. Avant de modifier votre fichier, vérifiez la documentation officielle de chacun : c'est la seule référence qui fasse foi.

Un exemple de réglage

Voici un réglage courant pour une marque qui souhaite être citée dans les réponses mais pas servir à l'entraînement :

# Pas d'entraînement
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Recherche et lecture à la demande
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Allow: /

Gardez en tête que robots.txt est une convention : les robots des grands fournisseurs déclarent la respecter, mais le fichier n'empêche techniquement rien. Et refuser l'entraînement n'efface pas ce qu'un modèle a déjà appris.

Vérifier ce qui se passe vraiment

Les journaux de votre serveur, ou de votre hébergeur, indiquent quels robots visitent réellement votre site, à quelle fréquence et sur quelles pages. C'est la meilleure façon de vérifier qu'un réglage produit l'effet attendu — et de découvrir parfois qu'un pare-feu ou un service anti-robots bloque des visiteurs que vous pensiez autoriser.

Et le fichier llms.txt ?

Proposé en 2024, llms.txt est un fichier placé à la racine d'un site qui résume, en Markdown, ses contenus principaux et renvoie vers les pages utiles, pour faciliter leur lecture par un modèle de langage. L'idée est séduisante, et le fichier est simple à produire.

À notre connaissance, aucun des grands fournisseurs d'assistants n'a toutefois annoncé l'utiliser pour choisir les sources de ses réponses. Il peut servir dans certains outils de développement ou agents qui le lisent explicitement, mais il ne remplace ni un site bien structuré, ni une présence dans les sources tierces. Le publier ne coûte presque rien ; en attendre un gain de visibilité mesurable est, pour l'instant, un pari.

En résumé

  • Distinguez entraînement, recherche et lecture à la demande.
  • Si vous voulez être cité, n'empêchez pas les robots de recherche et de lecture à la demande d'accéder à vos pages publiques.
  • Vérifiez les noms dans la documentation officielle de chaque fournisseur, puis dans vos journaux.
  • Considérez llms.txt comme un bonus éventuel, pas comme un levier.