
Common Crawl
United States"Démocratiser l'accès aux données du web"
À propos
Common Crawl est une organisation à but non lucratif 501(c)(3) qui maintient un dépôt ouvert de données de crawl web. Depuis sa création en 2008 par le scientifique informatique Gil Elbaz, l'organisation a systématiquement parcouru Internet et mis à disposition gratuitement des pétaoctets de HTML brut, de métadonnées et de texte extrait. Les données sont hébergées dans des buckets S3 publics d'Amazon Web Services ; les utilisateurs ne paient que leurs propres coûts de calcul et de stockage. Le corpus de Common Crawl est le plus grand ensemble de données web accessible publiquement, utilisé par les chercheurs, les journalistes, les startups et les grands laboratoires d'IA. Dans les années 2020, il est devenu la principale source d'entraînement pour les grands modèles de langage, y compris GPT-3, GPT-4 et LLaMA. Une enquête de novembre 2025 menée par The Markup et Wired a examiné comment les entreprises d'IA utilisent les données, suscitant des débats sur le consentement et le droit d'auteur.
Mission
La mission de Common Crawl est de démocratiser l'accès aux données du web en parcourant Internet et en fournissant le contenu résultant gratuitement à quiconque. L'objectif est d'abaisser les barrières à l'analyse de données à l'échelle du web, de favoriser l'innovation et de préserver un historique ouvert du web.
Histoire
Gil Elbaz a commencé à construire le premier robot d'exploration en 2007, animé par la conviction que les données ouvertes du web étaient essentielles pour un Internet sain. Le premier ensemble de données de crawl public, contenant environ 2 milliards de pages, a été publié en 2008. L'infrastructure initiale reposait sur des serveurs donnés et des subventions. En 2012, Common Crawl s'est associé à Amazon Web Services pour héberger les données dans des buckets S3 publics, rendant l'accès gratuit et évolutif. L'ensemble de données News Crawl a été lancé en 2015, fournissant un flux d'articles de presse mis à jour en continu. En 2017, le corpus avait atteint 3,5 milliards de pages, le plus grand ensemble de données web publiquement disponible à l'époque. Le boom de l'IA au début des années 2020 a considérablement augmenté la demande ; Common Crawl est devenu le corpus d'entraînement de facto pour les grands modèles de langage. En réponse aux préoccupations concernant le droit d'auteur et le consentement soulevées par une enquête de 2025, l'organisation a annoncé son intention de développer un système de retrait et un meilleur suivi de la provenance.
Personnalités notables
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
Directeur exécutif · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
Étapes clés
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
Départements
Infos de l'organisation
- Fondé
- +2008
- Siège social
- San Francisco, California, United States
- Pays
- United States
- Executive Director
- Rich Skrenta
- Type
- Non-profit
- Fondé
- +2008
- Pays
- États-Unis
- Fondateur
- Gil Elbaz
- Annual Budget
- $1–2 million
- Employés
- 5–10
- Data Size
- Petabytes
Finances
- Chiffre d'affaires
- $0.0 billion
- Budget
- $1–2 million
- Employés
- 5–10
Site officiel
commoncrawl.org/
Rejoindre la communauté
fans en discussion