Articulo de referencia

Rastreo común

La Fundación Common Crawl ( Common Crawl ) es una organización sin fines de lucro 501(c)(3) que rastrea la web y proporciona gratuitamente sus archivos y conjuntos de datos al p...

La Fundación Common Crawl ( Common Crawl ) es una organización sin fines de lucro 501(c)(3) que rastrea la web y proporciona gratuitamente sus archivos y conjuntos de datos al público. [ 1 ] [ 2 ] El acceso a los datos es gratuito en Amazon Web Services , pero los usuarios pueden incurrir en costos de almacenamiento y computación. [ 3 ]

Common Crawl fue fundada por Gil Elbaz . [ 1 ] [ 2 ]

Los datos habían sido utilizados principalmente por investigadores y algunas empresas emergentes hasta la década de 2020, cuando las empresas de IA comenzaron a entrenar grandes modelos de lenguaje utilizando dichos datos. [ 4 ] En noviembre de 2025, una investigación de The Atlantic reveló que Common Crawl engañó a los editores al afirmar que respetaba los muros de pago en su extracción de datos y que no atendía las solicitudes de los editores para que su contenido fuera eliminado de sus bases de datos. [ 4 ]

Historia

Common Crawl se fundó en 2007 en San Francisco. [ 5 ] Comenzó a publicar sus rastreos en 2011. [ 6 ]

Para 2013, sitios como TinEye estaban desarrollando sus productos a partir de Common Crawl. [ 7 ] [ 8 ] El rastreo reduce la dependencia de las empresas e investigadores de Google, que tiene el conjunto de datos más grande. [ 7 ] [ 8 ] Common Crawl fue diseñado para tener más datos y más recientes que fueran más eficientes para analizar y utilizar que la Wayback Machine creada por Internet Archive . [ 8 ] [ 7 ]

Para 2015, 1.800 millones de páginas web estaban en Common Crawl, que comenzó rastreando una lista de URL donadas por el motor de búsqueda Blekko . [ 9 ] Utilizan Amazon Web Services , que proporciona algunos de sus servicios de forma gratuita, lo que permite que los costos de computación promedien entre 2 y 4000 dólares al mes. [ 9 ] El sitio web de Common Crawl enumeraba 30 estudios basados ​​en datos de Common Crawl. [ 9 ]

Antes de 2023, Common Crawl no era muy conocido fuera de los investigadores académicos que utilizan los datos. [ 5 ] Common Crawl recibió sus primeras solicitudes para censurar información en 2023 y cada vez más su rastreador, CCBot, comenzó a ser bloqueado. [ 5 ] En 2023, comenzó a recibir un apoyo financiero significativo de empresas de IA, incluidas Anthropic y OpenAI , cada una de las cuales donó $250,000. [ 4 ] También se utilizó para entrenar el gran modelo de lenguaje Gemini de Google DeepMind . [ 10 ] Para abril de 2023, Common Crawl estaba capturando 3.1 mil millones de páginas web, con un estimado del 5% de las páginas antes de 2021 que contenían discurso de odio o insultos. [ 11 ]

En 2024, Common Crawl había sido citado en más de 10 000 estudios académicos. [ 12 ] Para 2024, The Pile y Common Crawl eran los dos principales conjuntos de datos de entrenamiento utilizados para entrenar modelos de IA. [ 13 ] [ 14 ]

En noviembre de 2025, una investigación del periodista tecnológico Alex Reisner para The Atlantic reveló que Common Crawl engañó a los editores al afirmar que respetaba los muros de pago en su extracción de datos y al decir que atendía las solicitudes de los editores para que su contenido fuera eliminado de sus bases de datos. [ 4 ] Incluía resultados engañosos en la función de búsqueda pública de su sitio web que no mostraban entradas para los sitios web que habían solicitado la eliminación de sus archivos, cuando en realidad esos sitios seguían incluidos en sus extracciones utilizadas por empresas de IA. [ 4 ] En 2025, Reisner descubrió que CCBot era el bot más bloqueado por los 1000 sitios web más importantes. [ 4 ]

Un artículo de 2026 en LWN.net analizó una ventaja de servicios como Common Crawl, ya que puede limitar los costos de extracción de datos para los sitios web al permitir que las empresas e investigadores descarguen los datos de Common Crawl en lugar de extraerlos ellos mismos. [ 15 ]

En abril de 2026, Common Crawl comenzó experimentalmente a distribuir sus datos a través de Hugging Face Storage Bucket , además de su almacenamiento estándar en Amazon S3 . [ 16 ]

Organización

Peter Norvig y Joi Ito han formado parte del consejo asesor. [ 8 ] Rich Skrenta es el director ejecutivo. [ 4 ]

Recibió financiación casi exclusivamente de la Fundación Familiar Elbaz hasta 2023, cuando comenzó a recibir donaciones de la industria de la IA. [ 4 ]

Versiones refinadas

Varias organizaciones toman datos brutos de Common Crawl y los refinan en conjuntos de datos que excluyen contenido controvertido o que son de mayor calidad para sus propósitos, como FineWeb, DCLM y C4. [ 4 ]

Corpus colosalmente limpio y arrastrado

La versión de Google del Common Crawl se llama Colossal Clean Crawled Corpus , o C4 para abreviar. Fue construido para el entrenamiento de la serie de modelos de lenguaje T5 en 2019. [ 17 ] A partir de 2023, hubo algunas preocupaciones sobre el contenido con derechos de autor en el C4, así como contenido racista. [ 18 ] [ 17 ] Un estudio de 2024 encontró que el 45% del contenido estaba explícitamente restringido por los términos de servicio de los sitios web para ser utilizado para fines como el entrenamiento de IA por empresas con fines de lucro. [ 12 ]

Véase también

Referencias

  1. 1 2 Rosanna Xia (5 de febrero de 2012). "El emprendedor tecnológico Gil Elbaz triunfó en Los Ángeles" Los Angeles Times . Consultado el 31 de julio de 2014. Su organización sin fines de lucro, Common Crawl Foundation, "busca hacer que una copia de la Web sea accesible para un científico de datos, una empresa emergente, un investigador o un analista que simplemente quiera mejorar el mundo".
  2. 1 2 "Gil Elbaz y Common Crawl" . NBC News . 4 de abril de 2013. Archivado del original el 13 de abril de 2013. Recuperado el 31 de julio de 2014 .
  3. "Common Crawl - Descripción general" . commoncrawl.org . Consultado el 18 de junio de 2026 .
  4. 1 2 3 4 5 6 7 8 9 Reisner, Alex (2025-11-04). "La empresa canaliza discretamente artículos de pago a desarrolladores de IA" . The Atlantic . Recuperado el 2025-11-14 .
  5. 1 2 3 Knibbs, Kate (13 de junio de 2024). "Editores atacan a Common Crawl en una lucha por los datos de entrenamiento de IA" . Wired . ISSN 1059-1028 . Recuperado el 10 de diciembre de 2025 . 
  6. Potts, Jason; Torrance, Andrew; Harhoff, Dietmar; von Hippel, Eric (marzo de 2024). "Beneficios derivados de los recursos comunes de datos: teoría, evidencia e implicaciones estratégicas" . Strategy Science . 9 (1): 1–17 . doi : 10.1287/stsc.2021.0080 . ISSN 2333-2050 . 
  7. 1 2 3 Brandom, Russell (2013-03-01). "Common Crawl: cómo competir con Google con un presupuesto sin fines de lucro" . The Verge . Recuperado el 2025-12-10 .
  8. 1 2 3 4 Tom Simonite (23 de enero de 2013). "Una base de datos gratuita de toda la web podría dar origen al próximo Google" . MIT Technology Review. Archivado del original el 26 de junio de 2014. Recuperado el 31 de julio de 2014 .
  9. 1 2 3 Hayes, Brian (2015). "Ciencia de la computación: avanzando lentamente hacia una web más sabia" . American Scientist . 103 (3): 184– 187. ISSN 0003-0996 . 
  10. ^ Cuesta, Albert (15 de noviembre de 2025). "L'FBI, a la caça del web arxivat que incomoda els mitjans" . Ara (en catalán). Archivado desde el original el 17 de noviembre de 2025 . Consultado el 2 de marzo de 2026 .
  11. Soos, Carlin; Haroutunian, Levon (2024). "Sobre la cuestión de la autoría en los grandes modelos de lenguaje" . Organización del conocimiento . 51 (2): 83– 95. doi : 10.5771/0943-7444-2024-2-83 . ISSN 0943-7444 . 
  12. 1 2 Roose, Kevin (19 de julio de 2024). "Los datos que impulsan la IA están desapareciendo rápidamente" . New York Times .
  13. Gilbertson, Annie (16 de julio de 2024). "Apple, Nvidia y Anthropic utilizaron miles de vídeos de YouTube robados para entrenar IA" . Wired . ISSN 1059-1028 . Consultado el 29 de enero de 2026 . 
  14. Anthony, Aubra; Sharma, Lakshmee; Noor, Elina (30 de abril de 2024). "Impulsando una agenda más global para una inteligencia artificial confiable" . Carnegie Endowment for International Peace . Recuperado el 29 de enero de 2026 .
  15. Alden, Daroc (12 de febrero de 2026). "Envenenando robots raspadores con iocaína" . LWN.net . Consultado el 9 de mayo de 2026 .
  16. "Common Crawl - Blog - Archivo de rastreo de abril de 2026 ya disponible en un contenedor de almacenamiento de Hugging Face" . commoncrawl.org . Consultado el 24 de mayo de 2026 .
  17. 1 2 Quach, Katyanna (2023-04-20). "Los datos de entrenamiento de C4 ML de Google se extrajeron de 4chan y fuentes racistas" . theregister . Recuperado el 2026-05-09 .
  18. Hern, Alex (2023-04-20). "Nuevas preocupaciones planteadas sobre las fuentes de material de capacitación para sistemas de IA" . The Guardian . ISSN 0261-3077 . Recuperado el 21 de abril de 2023 . 
  • Sitio web oficial
  • Repositorio de Common Crawl en GitHub con el rastreador, las bibliotecas y el código de ejemplo.
  • Página de ProPublica Nonprofit Explorer : contiene 990 declaraciones.