Aller au contenu

Question

Bloquer les crawlers d'IA dans robots.txt tient-il mon hôtel à l'écart de ChatGPT ?

Réponse courte

Cela arrête les crawlers programmés. Cela n'arrête pas de façon fiable une requête déclenchée par une personne, car trois des quatre grands éditeurs d'assistants publient que robots.txt peut ne pas s'y appliquer.

Deux choses différentes portent le même nom. Un crawler d'entraînement passe selon un calendrier pour collecter du contenu ; une requête déclenchée par un utilisateur se produit quand quelqu'un pose une question et que l'assistant va voir. Le premier respecte robots.txt chez tous les grands éditeurs. C'est sur la seconde que les documentations divergent.

OpenAI écrit que, ces actions étant déclenchées par un utilisateur, les règles de robots.txt peuvent ne pas s'appliquer. Google écrit que ses collecteurs déclenchés par l'utilisateur ignorent généralement robots.txt. Perplexity écrit la même chose de Perplexity-User. Anthropic déclare que ses bots respectent robots.txt et ne nomme aucune exception, ce qui n'équivaut pas à s'engager à ne pas en avoir.

Pour un établissement, la conséquence pratique est qu'un blocage général est une décision sur les données d'entraînement, pas sur la visibilité. Il gardera vos contenus hors des futurs poids de modèle. Il n'empêchera pas de façon fiable la lecture de votre page quand un voyageur s'informe sur vous, et chez OpenAI comme chez Perplexity les réglages de recherche et d'entraînement sont explicitement séparés : vous pouvez autoriser l'un et refuser l'autre.

C'est cette séparation qui mérite une décision. Autoriser le bot de recherche tout en interdisant le bot d'entraînement est une configuration documentée et prise en charge chez les deux, et elle correspond à ce que veulent réellement la plupart des hôtels bien mieux que l'un ou l'autre extrême.

Pourquoi des sources sérieuses divergent

Les quatre éditeurs décrivent leur propre comportement et personne ne les audite. Cloudflare a accusé Perplexity d'explorer depuis des agents non déclarés après avoir été bloqué ; Perplexity répond que Cloudflare a attribué à tort le trafic d'un tiers. Aucun des deux n'a publié de preuve reproductible, et tous deux ont quelque chose à vendre dans cette affaire.