25.9%
13.3%Anthropic und Common Crawl
Anteil der hochwertigen Trainings-Token, die OpenAIs Crawlern verschlossen sind
Wie viel des guten Webs ist dem KI-Training verschlossen worden?
25,9 % der Token im Kopf des C4-Korpus waren bis April 2024 für OpenAIs Crawler gesperrt, gegenüber 13,3 % für Anthropic und Common Crawl.
25.9%
Anteil der hochwertigen Trainings-Token, die OpenAIs Crawlern verschlossen sind
April 2024 · Weltweit
13.3%
Anthropic und Common Crawl
Zum Vergleich
Die einzige nichtkommerzielle Messung dazu, und der klarste Beleg, dass die Opt-out-Token das Verhalten verändert haben: Die Beschränkungen verschoben sich sprunghaft, kurz nachdem GPTBot und Google-Extended eingeführt wurden. Es ist zugleich die älteste Zahl dieser Gruppe, und die Richtung hat sich seither mit großer Wahrscheinlichkeit fortgesetzt.
Quelle
- Bezugszeitraum
- Geografischer Raum
- Weltweit
- Art des Belegs
- Analyse
- Stichprobe
- Tokens in Head C4, the 3,950 highest-token domains of the C4 corpus. Audit of 14,000 web domains with longitudinal robots.txt collection
- Zum Vergleich
- Anthropic und Common Crawl: 13.3%
- Zuletzt geprüft
Methode
Data Provenance Initiative, "Consent in Crisis", Audit von 14.000 Web-Domains, die C4, RefinedWeb und Dolma zugrunde liegen, mit längsschnittlicher Erhebung der robots.txt aus archivierten Snapshots und menschlicher Annotation. Head C4 sind die 3.950 Domains mit den meisten Token. Die Daten enden im April 2024, nehmen Sie das also als historischen Wendepunkt und nicht als heutigen Stand. Die Vorausschätzungen der Arbeit sind Prognosen und werden hier nicht verwendet.
Verwandte Fragen
Verwandte Indikatoren
42%
29%prüfen manchmal nachVerbraucher, die KI-Antworten immer überprüfen
25%
Reisende mit veralteten oder falschen KI-Reiseinformationen
70%
Tourismusbetriebe, die bereits KI einsetzen
94%
60%Betriebe mit weniger als 10 MitarbeitendenLücke in der Cybersicherheits-Bereitschaft nach Betriebsgröße
52%
Führungskräfte mit KI-Agenten im Produktivbetrieb
6