25.9%
13.3%Anthropic y Common Crawl
Porción de tokens de entrenamiento de alto valor restringida a los crawlers de OpenAI
¿Cuánta web buena se ha cerrado al entrenamiento de IA?
El 25,9% de los tokens de la cabecera del corpus C4 estaba restringido a los crawlers de OpenAI en abril de 2024, frente al 13,3% para Anthropic y Common Crawl.
25.9%
Porción de tokens de entrenamiento de alto valor restringida a los crawlers de OpenAI
Abril de 2024 · Global
13.3%
Anthropic y Common Crawl
Para comparar
Es la única medición no comercial de esto y la prueba más clara de que los tokens de exclusión cambiaron comportamientos: las restricciones se redistribuyeron de golpe justo después de que aparecieran GPTBot y Google-Extended. También es la cifra más antigua de este grupo, y la tendencia casi con seguridad ha continuado desde entonces.
Fuente
- Periodo de referencia
- Ámbito geográfico
- Global
- Tipo de evidencia
- Análisis
- Muestra
- Tokens in Head C4, the 3,950 highest-token domains of the C4 corpus. Audit of 14,000 web domains with longitudinal robots.txt collection
- Para comparar
- Anthropic y Common Crawl: 13.3%
- Última verificación
Método
Data Provenance Initiative, «Consent in Crisis», auditoría de 14.000 dominios web que sustentan C4, RefinedWeb y Dolma, con recogida longitudinal de robots.txt a partir de capturas archivadas y anotación humana. Head C4 son los 3.950 dominios con más tokens. Los datos acaban en abril de 2024, así que hay que tratarlo como el punto de inflexión histórico y no como el estado actual. Las proyecciones a futuro del artículo son previsiones y aquí no se usan.
Preguntas relacionadas
Indicadores relacionados
42%
29%verifican a vecesConsumidores que siempre verifican lo que dice la IA
25%
Viajeros que recibieron información de viaje obsoleta o incorrecta de la IA
70%
Empresas turísticas que ya usan IA
94%
60%establecimientos con menos de 10 empleadosBrecha de preparación en ciberseguridad por tamaño del establecimiento
52%
Directivos que declaran agentes de IA en producción
6