Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training
Ce papier présente Common Corpus, le plus grand ensemble de données ouvert et éthique pour l'entraînement de modèles de langage, composé de deux billions de tokens multilingues et de code, afin de répondre aux besoins juridiques et scientifiques tout en démontrant son efficacité pour l'entraînement préliminaire.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
🌍 L'Histoire du "Grand Panier de Légumes" de l'IA
Imaginez que vous voulez faire le meilleur ragoût du monde (un Grand Modèle de Langage ou LLM, comme ceux qui font parler les robots). Pour cela, vous avez besoin d'une énorme quantité d'ingrédients (des données).
Pendant longtemps, les géants de la technologie ont pris leurs ingrédients directement dans les supermarchés du web (tous les sites internet, livres, articles). Le problème ? Beaucoup de ces ingrédients sont volés (droits d'auteur), empoisonnés (contenus haineux) ou protégés par des cadenas (conditions d'utilisation interdites). De plus, les propriétaires des supermarchés commencent à fermer les portes et à interdire aux robots de cuisiner avec leurs produits.
C'est là qu'intervient l'équipe de PleIAs avec leur nouvelle création : Common Corpus.
🛠️ Qu'est-ce que Common Corpus ?
C'est le plus grand panier de légumes 100% bio et légal jamais créé pour nourrir les intelligences artificielles.
Au lieu de voler des ingrédients, ils ont soigneusement récolté des produits qui appartiennent à tout le monde ou qui sont offerts gratuitement avec une autorisation explicite.
- La taille : C'est gigantesque ! Ils ont réuni environ 2 billions de "mots" (des tokens). C'est comme remplir des millions de bibliothèques.
- La diversité : Ce n'est pas juste du français ou de l'anglais. C'est un marché mondial ! On y trouve des langues européennes, mais aussi des langues rares et des codes informatiques.
🗂️ Les 6 Rayons du Supermarché Common
Pour bien comprendre ce qu'il y a dedans, imaginez que Common Corpus est un immense supermarché divisé en 6 rayons spéciaux :
- 🏛️ Le Rayon "Gouvernement Ouvert" : C'est la bibliothèque des lois, des budgets et des documents officiels. Imaginez tous les documents que l'État vous donne gratuitement. C'est parfait pour apprendre à l'IA à comprendre le droit et l'administration.
- 📚 Le Rayon "Culture Ouverte" : C'est le grenier à souvenirs du monde. On y trouve des vieux livres, des journaux du 19ème siècle, des poèmes et des romans dont les droits d'auteur sont expirés. C'est comme si on avait accès à la mémoire de l'humanité sans payer de droits d'entrée. Cela permet à l'IA d'apprendre à écrire de manière créative et pas juste comme un robot.
- 🔬 Le Rayon "Science Ouverte" : C'est la bibliothèque de la recherche. Des millions d'articles scientifiques, de thèses et d'études médicales. C'est crucial pour que l'IA soit intelligente et précise sur des sujets complexes.
- 💻 Le Rayon "Code Ouvert" : C'est l'atelier des programmeurs. Des millions de lignes de code informatique (Java, Python, etc.) écrites par des gens qui ont dit : "Vous pouvez utiliser mon code". C'est essentiel pour apprendre à l'IA à coder elle-même.
- 🌐 Le Rayon "Web Ouvert" : C'est une sélection de sites web fiables comme Wikipédia, des forums de questions-réponses (StackExchange) et des transcriptions de vidéos YouTube autorisées. Pas de spam, pas de publicités, juste du savoir utile.
- 🧠 Le Rayon "Sémantique" (Wikidata) : C'est le cerveau logique. Au lieu de simples phrases, c'est une base de données de faits (ex: "Paris est la capitale de la France"). C'est comme un dictionnaire géant qui aide l'IA à ne pas halluciner.
🧹 Le Grand Nettoyage (La Cuisine)
Récupérer ces ingrédients ne suffit pas. Il faut les laver et les trier ! L'équipe a développé des outils spéciaux (comme des robots de cuisine intelligents) pour :
- Corriger les erreurs de numérisation : Beaucoup de vieux livres ont été scannés avec des machines qui font des fautes (ex: "l" au lieu de "1"). Leurs robots réparent ces erreurs.
- Enlever les informations privées : Comme on ne veut pas que l'IA apprenne les numéros de téléphone ou les adresses de quelqu'un, ils ont effacé toutes ces données sensibles.
- Filtrer la toxicité : Ils ont retiré les contenus haineux ou dangereux, même s'ils étaient dans des vieux livres, pour que l'IA soit polie et sûre.
🏆 Le Résultat : Des Petits Robots, Mais Très Intelligents
L'équipe a pris ce panier de données et a entraîné deux petits robots (des modèles de 350 millions et 1,2 milliard de paramètres).
- Le verdict : Même s'ils sont "petits" comparés aux géants comme GPT-4, ils parlent aussi bien, voire mieux, que d'autres modèles de leur taille qui ont été entraînés sur des données volées ou floues.
- La leçon : On n'a pas besoin de voler pour être fort. Avec des données propres, légales et variées, on peut créer des IA puissantes et éthiques.
🚀 Pourquoi c'est important pour nous ?
Aujourd'hui, beaucoup de projets de recherche sont bloqués parce qu'ils ont peur des procès ou parce que les données disparaissent (comme des livres qu'on retire des étagères).
Common Corpus est une infrastructure publique. C'est comme un parc public où tout le monde peut venir jouer, étudier et construire, sans craindre qu'un garde-champêtre vienne tout fermer demain.
C'est une preuve que l'avenir de l'intelligence artificielle peut être ouvert, transparent et légal, au lieu d'être un secret gardé par quelques grandes entreprises. C'est un pas de géant vers une science ouverte pour tous.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.