Crawlers IA : que faut-il autoriser dans le robots.txt pour GPTBot, ClaudeBot et PerplexityBot
Mis à jour: 4 août 2026
Si votre robots.txt bloque les crawlers IA, votre contenu n'atteint jamais les modèles et vous êtes invisible dans leurs réponses. Pour être vu, autorisez explicitement les principaux : GPTBot et OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot et Google-Extended. C'est une modification de quelques lignes à effet immédiat.
Quel bot fait quoi
Ils ne font pas tous le même travail, et la distinction compte au moment de décider ce que vous autorisez :
- GPTBot — collecte du contenu pour l'entraînement des modèles d'OpenAI.
- OAI-SearchBot — alimente la recherche en direct de ChatGPT (c'est ce qui influence ce que voit l'utilisateur aujourd'hui).
- ChatGPT-User — intervient lorsqu'un utilisateur demande explicitement à ChatGPT d'ouvrir votre page.
- ClaudeBot — l'équivalent d'Anthropic pour Claude.
- PerplexityBot — pour le moteur de réponses de Perplexity.
- Google-Extended — ce n'est pas un crawler, mais un interrupteur qui contrôle l'usage de votre contenu dans les produits IA de Google.
Le problème que vous ne voyez pas
Beaucoup de sites bloquent ces bots sans le savoir : réglage par défaut d'une extension de sécurité, paramètre du CDN, ou robots.txt copié sur internet.
Le résultat est silencieux — aucune erreur, vous n'apparaissez simplement jamais dans les réponses. Cela vaut la peine de le vérifier avant toute autre chose.
Exemple de robots.txt autorisant l'IA
La logique est simple : un groupe par bot avec une autorisation explicite. Pour l'essentiel :
- User-agent: GPTBot / Allow: /
- User-agent: OAI-SearchBot / Allow: /
- User-agent: ChatGPT-User / Allow: /
- User-agent: ClaudeBot / Allow: /
- User-agent: PerplexityBot / Allow: /
- User-agent: Google-Extended / Allow: /
- Et n'oubliez pas la ligne Sitemap: avec l'URL complète de votre sitemap.
Faut-il tous les autoriser ?
C'est une décision commerciale, pas technique. Si vous vivez du fait que des clients vous trouvent, la réponse est presque toujours oui — bloquer les bots vous rend invisible là précisément où la recherche se déplace.
Si vous avez du contenu payant ou des archives que vous ne voulez pas voir utilisés pour l'entraînement, vous pouvez autoriser les bots de recherche (OAI-SearchBot, PerplexityBot) et restreindre ceux d'entraînement. C'est un compromis légitime.
À vérifier maintenant
- Ouvrez votre site en ajoutant /robots.txt à la fin et lisez ce qui s'y trouve.
- Cherchez les Disallow concernant les user-agents ci-dessus.
- Assurez-vous qu'une ligne Sitemap est présente.
- Vérifiez aussi votre CDN ou pare-feu — il peut bloquer les bots avant même le robots.txt.
Questions fréquentes
Si j'autorise les bots, « volent-ils » mon contenu ?
Ils l'utilisent pour produire des réponses, souvent en citant la source. La question pratique est : préférez-vous être cité, ou que ce soit votre concurrent ? Pour la plupart des entreprises, la visibilité vaut davantage.
Le robots.txt est-il contraignant ?
C'est une convention que les grands fournisseurs respectent. Ce n'est pas une barrière technique — pour un blocage réel, il faut des règles au niveau du serveur ou du CDN.
En combien de temps le changement se voit-il ?
Le déblocage est une condition, pas une garantie. Les bots doivent repasser et les modèles se rafraîchir — comptez des semaines à des mois.
Voyez où vous en êtes dans l'IA — gratuit
Le micro-audit gratuit vous montre en 2 minutes si ChatGPT vous cite pour vos propres mots-clés.
Lancer le check gratuit →