Vai al contenuto

25.9%

13.3%Anthropic e Common Crawl

Quota di token di addestramento di alto valore preclusi ai crawler di OpenAI

Quanta parte del web di qualità è stata chiusa all'addestramento dell'AI?

Ad aprile 2024 il 25,9% dei token nella testa del corpus C4 risultava precluso ai crawler di OpenAI, contro il 13,3% per Anthropic e Common Crawl.

ValoreAprile 2024 · Globale
  • 25.9%

    Quota di token di addestramento di alto valore preclusi ai crawler di OpenAI

    Aprile 2024 · Globale

  • 13.3%

    Anthropic e Common Crawl

    Per confronto

L'unica misurazione non commerciale su questo fronte, e la prova più chiara che i token di opt-out hanno cambiato i comportamenti: le restrizioni si sono ridistribuite in modo netto subito dopo l'introduzione di GPTBot e Google-Extended. È anche il dato più vecchio di questo gruppo, e la direzione è quasi certamente proseguita da allora.

Fonte

Periodo di riferimento
Area geografica
Globale
Tipo di evidenza
Analisi
Campione
Tokens in Head C4, the 3,950 highest-token domains of the C4 corpus. Audit of 14,000 web domains with longitudinal robots.txt collection
Per confronto
Anthropic e Common Crawl: 13.3%
Ultima verifica

Metodo

Data Provenance Initiative, "Consent in Crisis": audit di 14.000 domini web alla base di C4, RefinedWeb e Dolma, con raccolta longitudinale dei robots.txt da snapshot archiviati e annotazione umana. La testa di C4 sono i 3.950 domini con più token. I dati si fermano ad aprile 2024, quindi vanno letti come il punto di svolta storico e non come lo stato attuale. Le proiezioni in avanti del paper sono previsioni e qui non vengono usate.

Metodo →

Domande collegate

Indicatori collegati