Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "Démocratiser l'accès aux données du web"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta

    À propos

    Common Crawl est une organisation à but non lucratif 501(c)(3) qui maintient un dépôt ouvert de données de crawl web. Depuis sa création en 2008 par le scientifique informatique Gil Elbaz, l'organisation a systématiquement parcouru Internet et mis à disposition gratuitement des pétaoctets de HTML brut, de métadonnées et de texte extrait. Les données sont hébergées dans des buckets S3 publics d'Amazon Web Services ; les utilisateurs ne paient que leurs propres coûts de calcul et de stockage. Le corpus de Common Crawl est le plus grand ensemble de données web accessible publiquement, utilisé par les chercheurs, les journalistes, les startups et les grands laboratoires d'IA. Dans les années 2020, il est devenu la principale source d'entraînement pour les grands modèles de langage, y compris GPT-3, GPT-4 et LLaMA. Une enquête de novembre 2025 menée par The Markup et Wired a examiné comment les entreprises d'IA utilisent les données, suscitant des débats sur le consentement et le droit d'auteur.

    Mission

    La mission de Common Crawl est de démocratiser l'accès aux données du web en parcourant Internet et en fournissant le contenu résultant gratuitement à quiconque. L'objectif est d'abaisser les barrières à l'analyse de données à l'échelle du web, de favoriser l'innovation et de préserver un historique ouvert du web.

    Histoire

    Gil Elbaz a commencé à construire le premier robot d'exploration en 2007, animé par la conviction que les données ouvertes du web étaient essentielles pour un Internet sain. Le premier ensemble de données de crawl public, contenant environ 2 milliards de pages, a été publié en 2008. L'infrastructure initiale reposait sur des serveurs donnés et des subventions. En 2012, Common Crawl s'est associé à Amazon Web Services pour héberger les données dans des buckets S3 publics, rendant l'accès gratuit et évolutif. L'ensemble de données News Crawl a été lancé en 2015, fournissant un flux d'articles de presse mis à jour en continu. En 2017, le corpus avait atteint 3,5 milliards de pages, le plus grand ensemble de données web publiquement disponible à l'époque. Le boom de l'IA au début des années 2020 a considérablement augmenté la demande ; Common Crawl est devenu le corpus d'entraînement de facto pour les grands modèles de langage. En réponse aux préoccupations concernant le droit d'auteur et le consentement soulevées par une enquête de 2025, l'organisation a annoncé son intention de développer un système de retrait et un meilleur suivi de la provenance.

    Personnalités notables

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    Directeur exécutif · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    Étapes clés

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    Départements

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    Infos de l'organisation

    Fondé
    +2008
    Siège social
    San Francisco, California, United States
    Pays
    United States
    Executive Director
    Rich Skrenta
    Type
    Non-profit
    Fondé
    +2008
    Pays
    États-Unis
    Fondateur
    Gil Elbaz
    Annual Budget
    $1–2 million
    Employés
    5–10
    Data Size
    Petabytes

    Finances

    Chiffre d'affaires
    $0.0 billion
    Budget
    $1–2 million
    Employés
    5–10

    Site officiel

    commoncrawl.org/

    Rejoindre la communauté

    fans en discussion