Ir al contenido

25.9%

13.3%Anthropic y Common Crawl

Porción de tokens de entrenamiento de alto valor restringida a los crawlers de OpenAI

¿Cuánta web buena se ha cerrado al entrenamiento de IA?

El 25,9% de los tokens de la cabecera del corpus C4 estaba restringido a los crawlers de OpenAI en abril de 2024, frente al 13,3% para Anthropic y Common Crawl.

ValorAbril de 2024 · Global
  • 25.9%

    Porción de tokens de entrenamiento de alto valor restringida a los crawlers de OpenAI

    Abril de 2024 · Global

  • 13.3%

    Anthropic y Common Crawl

    Para comparar

Es la única medición no comercial de esto y la prueba más clara de que los tokens de exclusión cambiaron comportamientos: las restricciones se redistribuyeron de golpe justo después de que aparecieran GPTBot y Google-Extended. También es la cifra más antigua de este grupo, y la tendencia casi con seguridad ha continuado desde entonces.

Fuente

Periodo de referencia
Ámbito geográfico
Global
Tipo de evidencia
Análisis
Muestra
Tokens in Head C4, the 3,950 highest-token domains of the C4 corpus. Audit of 14,000 web domains with longitudinal robots.txt collection
Para comparar
Anthropic y Common Crawl: 13.3%
Última verificación

Método

Data Provenance Initiative, «Consent in Crisis», auditoría de 14.000 dominios web que sustentan C4, RefinedWeb y Dolma, con recogida longitudinal de robots.txt a partir de capturas archivadas y anotación humana. Head C4 son los 3.950 dominios con más tokens. Los datos acaban en abril de 2024, así que hay que tratarlo como el punto de inflexión histórico y no como el estado actual. Las proyecciones a futuro del artículo son previsiones y aquí no se usan.

Método →

Preguntas relacionadas

Indicadores relacionados