Vai al contenuto

Domanda

Bloccare i crawler AI nel robots.txt tiene il mio hotel fuori da ChatGPT?

Risposta breve

Ferma i crawler programmati. Non ferma in modo affidabile un prelievo avviato da una persona, perché tre dei quattro principali produttori di assistenti dichiarano che a quei prelievi il robots.txt può non applicarsi.

Due cose diverse vengono chiamate con lo stesso nome. Un crawler di addestramento passa secondo una pianificazione per raccogliere contenuti; un prelievo avviato dall'utente avviene quando qualcuno fa una domanda e l'assistente va a guardare. Il primo rispetta il robots.txt presso tutti i principali produttori. È sul secondo che le documentazioni divergono.

OpenAI scrive che, poiché quelle azioni sono avviate da un utente, le regole del robots.txt possono non applicarsi. Google scrive che i prelievi attivati dall'utente in genere ignorano le regole del robots.txt. Perplexity scrive la stessa cosa di Perplexity-User. Anthropic dichiara che i propri bot rispettano il robots.txt e non nomina eccezioni, che non è la stessa cosa che prometterne l'assenza.

La conseguenza pratica per una struttura è che un blocco generalizzato è una decisione sui dati di addestramento, non sulla visibilità. Terrà i vostri contenuti fuori dai pesi dei modelli futuri. Non terrà in modo affidabile la vostra pagina al riparo dalla lettura quando un viaggiatore chiede di voi, e presso OpenAI e Perplexity i controlli su ricerca e addestramento sono esplicitamente separati: si può autorizzare l'uno e rifiutare l'altro.

È questa separazione la parte su cui conviene agire. Autorizzare il bot di ricerca e vietare quello di addestramento è una configurazione documentata e supportata da entrambi, e si avvicina a quello che la maggior parte degli hotel vuole davvero più di quanto facciano i due estremi.

Perché le fonti attendibili divergono

I quattro produttori descrivono il proprio comportamento e nessuno li verifica. Cloudflare ha accusato Perplexity di scansionare da agenti non dichiarati dopo essere stata bloccata; Perplexity sostiene che Cloudflare abbia attribuito male il traffico di un terzo. Nessuna delle due ha pubblicato prove riproducibili, ed entrambe hanno qualcosa da vendere in quella disputa.