~80%
72%un an plus tôt
Part de l'exploration par IA destinée à l'entraînement plutôt qu'à la récupération
Les crawlers d'IA collectent-ils des données d'entraînement ou répondent-ils à des questions ?
L'entraînement représentait près de 80 % de l'activité des bots d'IA en juillet 2025, contre 72 % un an plus tôt.
~80%Part de l'exploration par IA destinée à l'entraînement plutôt qu'à la récupération
À tenir soigneusement à l'écart de la question de la visibilité, car les deux tirent en sens inverse. Un site qui bloque les crawlers d'entraînement ne devient pas pour autant plus visible dans les réponses, et un site qui veut apparaître dans les réponses n'est pas tenu de livrer des données d'entraînement. Chez tous les grands éditeurs, les deux réglages sont distincts.
Source
- Période de référence
- Zone géographique
- Monde
- Type de preuve
- Télémétrie de plateforme
- Échantillon
- Share of AI bot activity Cloudflare classifies as training rather than search or user action. Dominated by one bot, OpenAI's GPTBot
- Pour comparaison
- un an plus tôt: 72%
- Dernière vérification
Nous n'avons pas consulté l'instrument primaire de ce chiffre : il provient du résumé de l'éditeur lui-même ou d'un document qui le cite. Le niveau est donc indicatif.
Méthode
Cloudflare, jusqu'à juillet 2025 environ. La répartition repose sur la classification par Cloudflare de la finalité déclarée de chaque user-agent, la taxonomie comporte une catégorie non déclarée, et l'agrégat est dominé par un seul bot, le GPTBot d'OpenAI. L'énoncé porte donc davantage sur OpenAI que sur l'exploration par IA en général.
Questions liées
Indicateurs liés
Aucune
Exigences techniques supplémentaires pour apparaître dans les AI Overviews de Google
3 sur 4
1 of 4ne déclarent aucune exceptionÉditeurs d'assistants dont la documentation écarte robots.txt pour les requêtes déclenchées par l'utilisateur
4.2%
4.5%Googlebot seulPart des bots d'IA dans les requêtes HTML
~14%
312domaines bloquant GPTBotDomaines dotés de directives robots.txt propres à l'IA
25.9%
13.3%Anthropic et Common CrawlPart des tokens d'entraînement de haute valeur fermés aux crawlers d'OpenAI
55.3%