Zum Inhalt springen

25.9%

13.3%Anthropic und Common Crawl

Anteil der hochwertigen Trainings-Token, die OpenAIs Crawlern verschlossen sind

Wie viel des guten Webs ist dem KI-Training verschlossen worden?

25,9 % der Token im Kopf des C4-Korpus waren bis April 2024 für OpenAIs Crawler gesperrt, gegenüber 13,3 % für Anthropic und Common Crawl.

WertApril 2024 · Weltweit
  • 25.9%

    Anteil der hochwertigen Trainings-Token, die OpenAIs Crawlern verschlossen sind

    April 2024 · Weltweit

  • 13.3%

    Anthropic und Common Crawl

    Zum Vergleich

Die einzige nichtkommerzielle Messung dazu, und der klarste Beleg, dass die Opt-out-Token das Verhalten verändert haben: Die Beschränkungen verschoben sich sprunghaft, kurz nachdem GPTBot und Google-Extended eingeführt wurden. Es ist zugleich die älteste Zahl dieser Gruppe, und die Richtung hat sich seither mit großer Wahrscheinlichkeit fortgesetzt.

Quelle

Bezugszeitraum
Geografischer Raum
Weltweit
Art des Belegs
Analyse
Stichprobe
Tokens in Head C4, the 3,950 highest-token domains of the C4 corpus. Audit of 14,000 web domains with longitudinal robots.txt collection
Zum Vergleich
Anthropic und Common Crawl: 13.3%
Zuletzt geprüft

Methode

Data Provenance Initiative, "Consent in Crisis", Audit von 14.000 Web-Domains, die C4, RefinedWeb und Dolma zugrunde liegen, mit längsschnittlicher Erhebung der robots.txt aus archivierten Snapshots und menschlicher Annotation. Head C4 sind die 3.950 Domains mit den meisten Token. Die Daten enden im April 2024, nehmen Sie das also als historischen Wendepunkt und nicht als heutigen Stand. Die Vorausschätzungen der Arbeit sind Prognosen und werden hier nicht verwendet.

Methode →

Verwandte Fragen

Verwandte Indikatoren