Crawler IA (robot d'intelligence artificielle)
Un crawler IA est un robot exploité par un fournisseur de modèles pour parcourir le web. Ils se répartissent en deux familles aux conséquences opposées : ceux qui collectent des données d'entraînement, et ceux qui récupèrent une page en temps réel pour la citer dans une réponse. Bloquer les seconds rend un site invisible dans les réponses générées.
Dernière révision :
La distinction qui coûte cher
GPTBot, ClaudeBot ou CCBot collectent pour l'entraînement : les bloquer est un choix éditorial défendable. OAI-SearchBot, Claude-SearchBot, PerplexityBot et les agents en -User récupèrent une page au moment où quelqu'un pose une question, pour la citer. Un blocage global « anti-IA » recopié depuis un article de 2024 attrape les deux familles, et fait disparaître le site des réponses sans que rien ne l'annonce.
Les jetons qui ne sont pas des robots
Google-Extended et Applebot-Extended n'explorent rien : ce sont des jetons de refus d'entraînement à écrire dans robots.txt. Refuser Google-Extended n'a aucun effet sur la présence dans les résultats de Google ni dans ses réponses IA, contrairement à ce que beaucoup de guides laissent entendre.
Le pare-feu compte autant que robots.txt
Un robots.txt parfaitement écrit ne sert à rien si une protection anti-robot au niveau du CDN renvoie un refus aux robots vérifiés. C'est un incident documenté y compris sur des robots de moteurs classiques, et il ne laisse aucune trace visible côté site : la seule façon de le voir est d'inspecter une URL depuis l'outil du moteur concerné.
Termes liés
Et pour votre entreprise ?
Définir les mots ne dit pas où vous en êtes. Le contrôle de lisibilité est gratuit et sans compte, et l'audit complet mesure ce que les moteurs répondent réellement à vos clients.