[{"data":1,"prerenderedAt":138},["ShallowReactive",2],{"product-/product/ai-crawlability-fr":3},{"id":4,"title":5,"body":6,"description":6,"extension":7,"meta":8,"navigation":94,"path":132,"seo":133,"stem":136,"__hash__":137},"content_fr/1.product/ai-crawlability.yml","Ai Crawlability",null,"yml",{"category":9,"hero":10,"takeaway":20,"features":24,"technical":44,"benefits":72,"comparison":88,"faq":106,"cta":122},"Features",{"eyebrow":11,"headline":12,"description":13,"links":14},"Get Found, le premier échelon","Vérifiez quels crawlers IA [votre site refuse]{class='text-primary'}","Une page qu'un crawler IA ne peut pas lire ne sera jamais citée. Beaucoup ratent cet échelon sans le savoir : un robots.txt écrit pour Googlebot refuse encore GPTBot.",[15],{"label":16,"to":17,"size":18,"color":19},"Essai gratuit 14 jours","https://app.trustdata.tech","lg","primary",{"label":21,"text":22,"attribution":23},"À retenir","Quand une citation arrive sans crawl correspondant, elle vient des **données d'entraînement**, pas de la récupération. Réécrire la page n'y changera rien. Bloquer l'entraînement en autorisant la récupération est une position cohérente ; tout bloquer avec un wildcard hérité est ce qui arrive le plus souvent.","Une citation sans trace de crawl ne se corrige pas en éditant la page",{"title":25,"description":26,"items":27},"Quatre questions auxquelles vos logs répondent et pas votre suivi de positions","La détection se fait server-side dans la couche de tracking first-party, donc c'est du trafic observé et non une estimation tierce.",[28,32,36,40],{"title":29,"description":30,"icon":31},"Quel moteur a réellement récupéré la page","Nommez le moteur derrière chaque visite. Chaque user-agent de crawler IA connu est rattaché à ce qu'il alimente, OpenAI, Claude, Gemini, Perplexity, Mistral, DeepSeek, Meta AI et les autres, et une visite non attribuable est étiquetée non taggée plutôt que discrètement écartée.","i-lucide-radar",{"title":33,"description":34,"icon":35},"S'il est venu entraîner ou récupérer","Décidez ce que vous bloquez à dessein plutôt que par accident. Chaque bot porte une finalité, corpus d'entraînement, index de recherche, récupération à la demande ou mixte, et bloquer l'entraînement en autorisant la récupération est une stratégie cohérente que presque personne ne fait tourner.","i-lucide-split",{"title":37,"description":38,"icon":39},"Quelles de vos pages sont refusées","Voyez quelles pages stratégiques votre propre robots.txt refuse. La moitié ou plus bloquant les bots IA plafonne l'échelon Get Found à faible quel que soit le crawl du reste du site, parce qu'une page bloquée ne peut pas être citée.","i-lucide-shield-off",{"title":41,"description":42,"icon":43},"Combien de temps un crawl met à devenir une citation","Cessez de deviner combien de temps attendre. Par page et par moteur, vous obtenez l'écart entre premier crawl et première citation sur **90 jours**, donc vous savez si un changement de publication a eu le temps d'atterrir.","i-lucide-timer",{"title":45,"description":46,"features":47},"Les quatre issues d'un crawl","Les enregistrements de crawl et de citation sont joints en full outer join, pour que les cas où un côté manque survivent au lieu de disparaître. Chacun est un problème différent.",[48,52,56,60,64,68],{"title":49,"description":50,"icon":51},"Crawlé et cité","Les deux côtés sont présents, donc la latence entre eux est mesurable. C'est le cas nominal, et la distribution de cette latence par moteur vous dit à quelle vitesse votre catégorie bouge.","i-lucide-circle-check",{"title":53,"description":54,"icon":55},"Crawlé, non cité","Le moteur a récupéré la page et ne l'a pas citée en **90 jours**. La récupération n'est pas le problème. C'est un problème d'extractibilité ou d'autorité, donc les échelons 3 et 4, et l'audit de page est l'étape suivante.","i-lucide-file-x",{"title":57,"description":58,"icon":59},"Cité sans trace de crawl","Le moteur cite la page sans l'avoir jamais récupérée dans votre historique. Cela signifie en général que la citation vient des données d'entraînement plutôt que d'une récupération en direct, ce qui est un actif très différent : il ne se met pas à jour quand vous éditez la page.","i-lucide-brain",{"title":61,"description":62,"icon":63},"Historique insuffisant","Moins de **14 jours** depuis le premier événement, donc aucune conclusion n'est tirée. La ligne affiche historique insuffisant plutôt qu'un zéro, parce qu'une page crawlée hier n'a pas échoué à être citée.","i-lucide-hourglass",{"title":65,"description":66,"icon":67},"Nombre de visites par bot","Première vue, dernière vue et nombre de visites par bot et par page sur **90 jours**, pour qu'un crawler qui a cessé de venir apparaisse comme un changement plutôt qu'une absence à remarquer.","i-lucide-activity",{"title":69,"description":70,"icon":71},"Agrégats par moteur","Volume de crawl par moteur dans le temps, pour voir un moteur devenir silencieux pendant que les autres tiennent, ce qui relève en général d'un robots ou d'une limite de débit plutôt que du contenu.","i-lucide-chart-no-axes-column",{"title":73,"description":74,"items":75},"Ce que vous en faites","Les données de crawl ne servent que si elles changent une décision. Voici les trois qu'elles changent le plus souvent.",[76,80,84],{"title":77,"description":78,"icon":79},"Corriger robots.txt avec des preuves","Transformez le débat robots en liste. La plupart des blocages de bots IA sont hérités plutôt que choisis, un wildcard écrit pour les scrapers ou un défaut de plugin, et voir quels bots nommés sont refusés sur quelles pages met fin à la discussion.","i-lucide-file-cog",{"title":81,"description":82,"icon":83},"Séparer un problème de récupération d'un problème de contenu","Sachez laquelle de trois semaines de travail différentes vous vivez. Crawlé mais non cité est un problème de contenu, jamais crawlé un problème d'accès, et cité sans trace de crawl un actif d'entraînement dans lequel vous ne pouvez ni entrer ni sortir en éditant.","i-lucide-git-branch",{"title":85,"description":86,"icon":87},"Savoir quand cesser d'attendre","Sachez quand un changement a vraiment échoué. La latence crawl-vers-citation observée sur vos propres pages et moteurs vous dit combien de temps l'absence doit durer avant de signifier quelque chose, mesurée et non supposée.","i-lucide-timer-reset",{"title":89,"description":90,"items":91},"Face aux méthodes habituelles","La plupart des équipes lisent les logs à la main ou supposent que tout va bien.",[92,97,99,101,104],{"feature":93,"trustdata":94,"ga4":95,"other":96},"Visites de crawlers IA identifiées server-side",true,false,"Outils de logs, non classés",{"feature":98,"trustdata":94,"ga4":95,"other":95},"Bot rattaché au moteur qu'il alimente",{"feature":100,"trustdata":94,"ga4":95,"other":95},"Entraînement contre récupération contre à la demande",{"feature":102,"trustdata":94,"ga4":95,"other":103},"robots.txt confronté à vos pages stratégiques","Manuel",{"feature":105,"trustdata":94,"ga4":95,"other":95},"Latence crawl vers citation",[107,110,113,116,119],{"label":108,"content":109,"defaultOpen":94},"Comment TrustData voit-il les visites de crawlers IA ?","La détection se fait server-side dans la couche de tracking first-party, qui inspecte le user-agent de chaque requête avant toute exécution JavaScript. Les crawlers IA n'exécutent pas de JavaScript, donc un outil d'analytics client-side ne peut pas les voir du tout. C'est pourquoi l'activité des crawlers est absente de la plupart des dashboards plutôt qu'affichée à zéro : la mesure n'a jamais eu lieu.",{"label":111,"content":112},"Pourquoi la finalité d'un crawler compte-t-elle ?","Parce que les décisions sont différentes. Un crawler d'entraînement construit un corpus qui sera figé dans un modèle futur. Un crawler d'index maintient un index qui répond aux questions aujourd'hui. Une récupération à la demande a lieu parce qu'un utilisateur vient de demander quelque chose et que le moteur est allé lire votre page pour cette réponse. Bloquer l'entraînement en laissant passer la récupération est une position défendable sur vos droits de contenu. Bloquer les trois parce qu'une règle wildcard les a attrapés est ce qui arrive d'ordinaire, et cela vous coûte des citations sans décision réfléchie.",{"label":114,"content":115},"Que signifie une page citée mais jamais crawlée ?","En général que la citation vient des données d'entraînement du modèle plutôt que d'une récupération en direct. C'est utile à savoir parce que le comportement diffère : éditer la page ne changera pas ce que dit le modèle, et la citation peut disparaître lors d'un rafraîchissement de modèle que vous ne contrôlez pas. C'est aussi pourquoi les sondes tournent dans deux modes, avec et sans recherche web. Une marque forte sans recherche et faible avec existe dans le modèle mais n'est pas récupérée ; l'inverse signifie le contraire.",{"label":117,"content":118},"Comment la latence crawl vers citation est-elle mesurée ?","Les événements de crawl et les enregistrements de citation sont joints par page et par moteur sur 90 jours d'historique, en full outer join pour conserver les pages où un seul côté existe au lieu de les écarter. Quand les deux côtés existent, l'écart entre le premier crawl et la première citation est la latence. Quand un seul existe, la ligne est classée : crawlée mais non citée, ou citée sans trace de crawl. En dessous de 14 jours depuis le premier événement, rien n'est conclu et la ligne affiche historique insuffisant.",{"label":120,"content":121},"Bloquer les crawlers IA nuit-il à ma visibilité ?","Côté récupération, directement et totalement : un moteur qui ne peut pas récupérer une page ne peut pas la citer, ce qui explique que l'échelon Get Found plafonne à faible quand la moitié ou plus de vos pages stratégiques auditées bloquent les bots IA. Côté entraînement, c'est un véritable arbitrage plutôt qu'une erreur, et certaines marques le font délibérément. Le rôle de TrustData est de s'assurer que c'en est un. Le cas courant que nous voyons n'est ni l'un ni l'autre : une règle écrite il y a des années pour un autre problème, qui refuse encore discrètement les crawlers qui comptent maintenant.",{"title":123,"description":124,"links":125},"Découvrez qui lit vraiment votre site","Essai gratuit 14 jours. Le suivi des crawlers fait partie de la Visibilité IA, incluse dans chaque formule.",[126,128],{"label":16,"to":17,"size":127,"color":19},"xl",{"label":129,"to":130,"variant":131,"size":127},"Voir l'échelle de maturité complète","/product/ai-visibility","outline","/product/ai-crawlability",{"title":134,"description":135},"Accès des crawlers IA, depuis vos logs","Voyez quels crawlers IA atteignent vos pages, s'ils viennent entraîner ou récupérer, et combien de temps un crawl met à devenir une citation.","1.product/ai-crawlability","H02SN7Up3ap5yFqJyIfhD0q59NBAmhv_7F_krPZpkEI",1786740891984]