Get Found, le premier échelon

Vérifiez quels crawlers IA votre site refuse

Une page qu'un crawler IA ne peut pas lire ne sera jamais citée. Beaucoup ratent cet échelon sans le savoir : un robots.txt écrit pour Googlebot refuse encore GPTBot.

À retenir

Quand une citation arrive sans crawl correspondant, elle vient des données d'entraînement, pas de la récupération. Réécrire la page n'y changera rien. Bloquer l'entraînement en autorisant la récupération est une position cohérente ; tout bloquer avec un wildcard hérité est ce qui arrive le plus souvent.
Une citation sans trace de crawl ne se corrige pas en éditant la page

Quatre questions auxquelles vos logs répondent et pas votre suivi de positions

La détection se fait server-side dans la couche de tracking first-party, donc c'est du trafic observé et non une estimation tierce.

Quel moteur a réellement récupéré la page

Nommez le moteur derrière chaque visite. Chaque user-agent de crawler IA connu est rattaché à ce qu'il alimente, OpenAI, Claude, Gemini, Perplexity, Mistral, DeepSeek, Meta AI et les autres, et une visite non attribuable est étiquetée non taggée plutôt que discrètement écartée.

S'il est venu entraîner ou récupérer

Décidez ce que vous bloquez à dessein plutôt que par accident. Chaque bot porte une finalité, corpus d'entraînement, index de recherche, récupération à la demande ou mixte, et bloquer l'entraînement en autorisant la récupération est une stratégie cohérente que presque personne ne fait tourner.

Quelles de vos pages sont refusées

Voyez quelles pages stratégiques votre propre robots.txt refuse. La moitié ou plus bloquant les bots IA plafonne l'échelon Get Found à faible quel que soit le crawl du reste du site, parce qu'une page bloquée ne peut pas être citée.

Combien de temps un crawl met à devenir une citation

Cessez de deviner combien de temps attendre. Par page et par moteur, vous obtenez l'écart entre premier crawl et première citation sur 90 jours, donc vous savez si un changement de publication a eu le temps d'atterrir.

Les quatre issues d'un crawl

Les enregistrements de crawl et de citation sont joints en full outer join, pour que les cas où un côté manque survivent au lieu de disparaître. Chacun est un problème différent.

Crawlé et cité

Les deux côtés sont présents, donc la latence entre eux est mesurable. C'est le cas nominal, et la distribution de cette latence par moteur vous dit à quelle vitesse votre catégorie bouge.

Crawlé, non cité

Le moteur a récupéré la page et ne l'a pas citée en 90 jours. La récupération n'est pas le problème. C'est un problème d'extractibilité ou d'autorité, donc les échelons 3 et 4, et l'audit de page est l'étape suivante.

Cité sans trace de crawl

Le moteur cite la page sans l'avoir jamais récupérée dans votre historique. Cela signifie en général que la citation vient des données d'entraînement plutôt que d'une récupération en direct, ce qui est un actif très différent : il ne se met pas à jour quand vous éditez la page.

Historique insuffisant

Moins de 14 jours depuis le premier événement, donc aucune conclusion n'est tirée. La ligne affiche historique insuffisant plutôt qu'un zéro, parce qu'une page crawlée hier n'a pas échoué à être citée.

Nombre de visites par bot

Première vue, dernière vue et nombre de visites par bot et par page sur 90 jours, pour qu'un crawler qui a cessé de venir apparaisse comme un changement plutôt qu'une absence à remarquer.

Agrégats par moteur

Volume de crawl par moteur dans le temps, pour voir un moteur devenir silencieux pendant que les autres tiennent, ce qui relève en général d'un robots ou d'une limite de débit plutôt que du contenu.

Ce que vous en faites

Les données de crawl ne servent que si elles changent une décision. Voici les trois qu'elles changent le plus souvent.

Corriger robots.txt avec des preuves

Transformez le débat robots en liste. La plupart des blocages de bots IA sont hérités plutôt que choisis, un wildcard écrit pour les scrapers ou un défaut de plugin, et voir quels bots nommés sont refusés sur quelles pages met fin à la discussion.

Séparer un problème de récupération d'un problème de contenu

Sachez laquelle de trois semaines de travail différentes vous vivez. Crawlé mais non cité est un problème de contenu, jamais crawlé un problème d'accès, et cité sans trace de crawl un actif d'entraînement dans lequel vous ne pouvez ni entrer ni sortir en éditant.

Savoir quand cesser d'attendre

Sachez quand un changement a vraiment échoué. La latence crawl-vers-citation observée sur vos propres pages et moteurs vous dit combien de temps l'absence doit durer avant de signifier quelque chose, mesurée et non supposée.

Face aux méthodes habituelles

La plupart des équipes lisent les logs à la main ou supposent que tout va bien.

Visites de crawlers IA identifiées server-side

TrustData

GA4

Autres outils

Outils de logs, non classés

Bot rattaché au moteur qu'il alimente

TrustData

GA4

Autres outils

Entraînement contre récupération contre à la demande

TrustData

GA4

Autres outils

robots.txt confronté à vos pages stratégiques

TrustData

GA4

Autres outils

Manuel

Latence crawl vers citation

TrustData

GA4

Autres outils

Questions fréquentes

Les réponses directes.

Essai gratuit 14 jours

Découvrez qui lit vraiment votre site

Essai gratuit 14 jours. Le suivi des crawlers fait partie de la Visibilité IA, incluse dans chaque formule.