25.9%
13.3%Anthropic e Common Crawl
Quota di token di addestramento di alto valore preclusi ai crawler di OpenAI
Quanta parte del web di qualità è stata chiusa all'addestramento dell'AI?
Ad aprile 2024 il 25,9% dei token nella testa del corpus C4 risultava precluso ai crawler di OpenAI, contro il 13,3% per Anthropic e Common Crawl.
25.9%
Quota di token di addestramento di alto valore preclusi ai crawler di OpenAI
Aprile 2024 · Globale
13.3%
Anthropic e Common Crawl
Per confronto
L'unica misurazione non commerciale su questo fronte, e la prova più chiara che i token di opt-out hanno cambiato i comportamenti: le restrizioni si sono ridistribuite in modo netto subito dopo l'introduzione di GPTBot e Google-Extended. È anche il dato più vecchio di questo gruppo, e la direzione è quasi certamente proseguita da allora.
Fonte
- Periodo di riferimento
- Area geografica
- Globale
- Tipo di evidenza
- Analisi
- Campione
- Tokens in Head C4, the 3,950 highest-token domains of the C4 corpus. Audit of 14,000 web domains with longitudinal robots.txt collection
- Per confronto
- Anthropic e Common Crawl: 13.3%
- Ultima verifica
Metodo
Data Provenance Initiative, "Consent in Crisis": audit di 14.000 domini web alla base di C4, RefinedWeb e Dolma, con raccolta longitudinale dei robots.txt da snapshot archiviati e annotazione umana. La testa di C4 sono i 3.950 domini con più token. I dati si fermano ad aprile 2024, quindi vanno letti come il punto di svolta storico e non come lo stato attuale. Le proiezioni in avanti del paper sono previsioni e qui non vengono usate.
Domande collegate
Indicatori collegati
42%
29%verificano a volteConsumatori che verificano sempre quanto dice l'AI
25%
Viaggiatori che hanno ricevuto informazioni di viaggio obsolete o sbagliate dall'AI
70%
Imprese turistiche che già usano l'AI
94%
60%strutture con meno di 10 dipendentiDivario di preparazione alla cybersecurity per dimensione della struttura
52%
Dirigenti che dichiarano agenti AI in produzione
6