Nouveau Livada SEO v1.29.5 · Renforcement sécurité · Découvrir
Livada.io
Blog
AEO · · 9 min de lecture

robots.txt et IA : la liste exhaustive des bots à autoriser en 2026

Beaucoup de sites sont parfaitement invisibles pour ChatGPT — pas à cause de leur contenu, mais parce qu'ils renvoient une erreur 403 aux robots d'IA. Voici la liste exhaustive des bots à autoriser et comment vérifier.

Florin Livada
Fondateur Livada.io · Made in France

Vous avez le meilleur contenu de votre secteur. Vous êtes bien placé sur Google. Et pourtant ChatGPT ne vous mentionne jamais. Dans la moitié des cas, ce n'est pas un problème de contenu — c'est votre robots.txt ou votre CDN qui ferme la porte aux robots d'IA sans que personne ne s'en rende compte.

On a eu le cas sur l'un de nos propres sites : livada.fr renvoyait des 403 à GPTBot, ClaudeBot et PerplexityBot à cause d'une règle CDN par défaut. Site impeccable, porte fermée. Voici la liste exhaustive des bots à autoriser en 2026, comment le faire proprement, et comment vérifier que ça marche.

Pourquoi votre site peut être invisible aux IA sans raison apparente

Trois sources possibles de blocage, souvent cumulées :

  • Votre robots.txt contient un Disallow: / ciblé sur certains user-agents — parfois posé il y a des années par un plugin SEO « anti-scraping ».
  • Votre CDN ou hébergeur (Cloudflare, Hostinger, OVH, certains managés) bloque les bots d'IA par défaut au niveau pare-feu, avant même que le robots.txt ne soit lu.
  • Un WAF (Web Application Firewall) déclenche un challenge sur les user-agents non-navigateurs.

Résultat : l'IA reçoit un 403 ou un challenge JavaScript et abandonne. Votre site existe pour Google, pas pour l'IA.

Les deux familles de bots IA — et pourquoi la distinction compte

Les robots d'IA se divisent en deux familles bien distinctes. Les bloquer ensemble est une erreur fréquente.

1. Les bots de citation live (à autoriser absolument)

Ces robots viennent lire votre site au moment où un utilisateur pose une question à l'IA. Si vous les bloquez, vous ne serez jamais cité dans la réponse — quelle que soit la qualité de votre contenu.

  • OAI-SearchBot — moteur de recherche d'OpenAI (ChatGPT Search).
  • ChatGPT-User — déclenché quand un utilisateur de ChatGPT clique « rechercher sur le web ».
  • Claude-User — déclenché quand un utilisateur de Claude.ai active la recherche web.
  • Claude-SearchBot — composant Anthropic dédié à la recherche.
  • PerplexityBot — moteur Perplexity (citations en temps réel).
  • Perplexity-User — fetch déclenché par un utilisateur Perplexity.

2. Les bots d'entraînement / grounding (selon votre stratégie)

Ces robots collectent du contenu pour entraîner ou enrichir les modèles. Les autoriser augmente vos chances que votre marque soit connue de l'IA comme entité. Les bloquer protège vos contenus payants ou propriétaires. À arbitrer selon votre activité.

  • GPTBot — crawler d'entraînement OpenAI.
  • ClaudeBot — crawler d'entraînement Anthropic.
  • Google-Extended — signal Google pour Gemini/AI Overviews (ne pas confondre avec Googlebot — bloquer Google-Extended n'affecte pas le SEO Google classique).
  • Applebot-Extended — équivalent Apple pour Apple Intelligence.
  • CCBot — Common Crawl (utilisé par de nombreux modèles open-source).
  • Bytespider, Amazonbot, Meta-ExternalAgent — équivalents ByteDance/Amazon/Meta.

Un robots.txt propre, prêt à coller

Voici un modèle équilibré : ouvert aux bots de citation live (indispensable pour être cité), ouvert aux principaux bots d'entraînement (pour être reconnu comme entité), et bloquant les scrapers SEO commerciaux qui consomment de la bande passante sans contrepartie.

User-agent: *
Allow: /

# === Bots IA — citation live (à autoriser) ===
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /

# === Bots IA — entraînement / grounding ===
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: CCBot
Allow: /

# === Scrapers SEO commerciaux (au choix) ===
User-agent: AhrefsBot
Disallow: /
User-agent: SemrushBot
Disallow: /
User-agent: MJ12bot
Disallow: /

Sitemap: https://votresite.com/sitemap.xml

L'erreur 403 silencieuse — vérifiez votre CDN

Avoir un robots.txt permissif ne suffit pas. Si votre CDN bloque le user-agent au niveau pare-feu, le robot ne lira jamais votre robots.txt — il recevra un 403 et passera son chemin.

Cloudflare

Dashboard Cloudflare → votre domaine → Overview → panneau « Control AI crawlers ». Mettre « Block AI training bots » sur Do not block. Et passer « Manage your robots.txt » sur Disable robots.txt configuration pour que votre fichier soit la seule source.

Hostinger, OVH et hébergements mutualisés

Vérifier les règles WAF et les listes d'user-agents bloqués dans le panneau. Demander explicitement au support de débloquer GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot.

Comment vérifier que ça marche (en 30 secondes)

Trois façons, de la plus rapide à la plus complète :

1. Test ligne de commande (immédiat)

Depuis un terminal :

curl -A "GPTBot" -I https://votresite.com/
curl -A "ClaudeBot" -I https://votresite.com/
curl -A "PerplexityBot" -I https://votresite.com/

Vous voulez voir un HTTP/2 200. Si vous obtenez un 403, un 429 ou un challenge HTML, le robot est bloqué.

2. Outil gratuit — Livada Radar

L'un des signaux mesurés par Livada Radar est précisément l'accès des robots d'IA à votre site. Vous entrez votre URL, et l'outil vous dit en clair quels bots peuvent entrer et lesquels sont bloqués. Gratuit, 30 secondes.

→ Tester l'accès des bots d'IA sur mon site

3. Audit complet avec Livada SEO

Livada SEO publie sur WordPress un robots.txt propre dès l'installation, vérifie l'accès des bots en continu, et déclenche un avertissement si un nouveau blocage apparaît côté CDN.

Une fois la porte ouverte, qu'est-ce qui change ?

Ouvrir l'accès aux robots d'IA est une condition nécessaire mais pas suffisante. Pour passer du statut « visible » au statut « cité », il faut aussi :

  • Des données structurées propres (schema LocalBusiness, Hotel, Campground, FAQ).
  • Une identité d'entité ancrée (Wikidata, sameAs, llms.txt).
  • Du contenu qui répond aux questions réelles de vos clients (pas des fiches services génériques).

Mais sans la porte ouverte, rien de tout cela n'a d'effet. Commencez par là.

Be found by Google. And by AI.

« Trouvé par Google. Cité par l'IA. » En 2026, un site invisible aux robots d'IA est un site qui rate la moitié des intentions d'achat. Le diagnostic prend 30 secondes — testez votre site.

Envie d'arrêter de perdre du temps ?

Livada SEO + Cockpit vous donnent les outils pros pour passer à l'action — testés sur des vrais hôtels et campings.