Les robots IA lisent-ils votre site ?
Avant qu'un moteur de réponse puisse vous citer, un robot doit avoir lu vos pages. Trois familles de robots visitent votre site, et elles ne jouent pas le même rôle : en bloquer une est un choix, en bloquer une autre revient à refuser d'être cité. Voici qui vient, pour quoi faire, et comment le vérifier.
Entraînement de modèles
un choix de politiqueCes robots collectent des pages pour entraîner de futurs modèles. Les bloquer est une décision d'éditeur — vous protégez votre contenu, vous ne perdez pas de visibilité aujourd'hui.
Index de recherche IA
être trouvable, ou pasCes robots alimentent l'index dans lequel un moteur de réponse cherche ses sources. Les bloquer, c'est sortir de la bibliothèque : le moteur ne peut plus ni vous trouver, ni vous citer.
Consultation en direct
répondre présent au moment de la questionCes robots viennent lire une page au moment précis où un utilisateur pose sa question. Les bloquer, c'est laisser la réponse se construire sans vous, même quand vos pages étaient la bonne source.
Le vérifier, plutôt que le supposer
En 60 secondes, gratuitement
Le contrôle de lisibilité vérifie, entre autres, que votre robots.txt autorise les robots des moteurs de réponse — sans compte, sans e-mail.
Faire le contrôle gratuit →Sur votre vrai journal d'accès
L'onglet « Robots IA » du tableau de bord analyse votre access log — dix-neuf robots reconnus — et croise leurs passages avec les pages que les moteurs ont réellement citées dans vos réponses. Le fichier est analysé en mémoire puis jeté.
Auditer mon site — 49 € →Questions fréquentes
Faut-il bloquer GPTBot ?
C'est un choix d'éditeur, pas une règle. GPTBot collecte pour l'entraînement de modèles : le bloquer protège votre contenu sans vous retirer des réponses d'aujourd'hui. Ce qu'il ne faut pas bloquer si vous voulez être cité, ce sont les robots d'index (OAI-SearchBot, PerplexityBot, Bingbot…) et de consultation en direct (ChatGPT-User, Perplexity-User…) — eux sont le chemin par lequel une réponse arrive jusqu'à vous.
Google-Extended est-il un robot ?
Non — c'est un jeton d'opt-out qu'on écrit dans robots.txt, jamais un User-Agent qui visite votre site. Une analyse de logs qui prétendrait l'avoir « vu passer » mentirait. C'est exactement pourquoi notre analyse ne le compte pas.
Comment savoir quels robots IA visitent déjà mon site ?
Votre journal d'accès (access log) le sait déjà : chaque visite y porte le nom du robot. Le tableau de bord CitezMoi analyse ce fichier — dix-neuf robots IA reconnus, chez OpenAI, Anthropic, Perplexity, Google, Microsoft, Meta, Amazon, Apple, ByteDance, Common Crawl, DuckDuckGo et Mistral — et croise leurs passages avec les pages que les moteurs ont réellement citées dans vos réponses.
Que devient mon fichier de logs après l'analyse ?
Il est analysé en mémoire puis jeté : un journal d'accès contient les adresses IP de vos visiteurs, et nous ne conservons que des agrégats par robot — jamais une ligne brute, jamais un visiteur. Une limite honnête au passage : l'attribution se fait par User-Agent, déclaratif et falsifiable ; l'écran le dit aussi.
Pour la vue d'ensemble du référencement dans les moteurs de réponse : le GEO, expliqué.