A Bitter Lesson for Data Filtering
Ce papier remet en cause la sagesse conventionnelle selon laquelle le filtrage des données est essentiel pour le préentraînement des grands modèles, démontrant par le biais d'études de mise à l'échelle dans des régimes à forte capacité de calcul et à pénurie de données que les grands modèles suffisamment entraînés bénéficient en réalité de l'inclusion de données de faible qualité et de données distractives plutôt que de leur exclusion.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'Idée Principale : La Règle « Sans Filtre »
Imaginez que vous essayez d'enseigner à un étudiant surdoué (un Modèle de Langage à Grande Échelle) tout ce qu'il y a à savoir sur le monde. La méthode traditionnelle consiste à agir comme un bibliothécaire strict. Vous parcourez une immense bibliothèque (l'internet/Common Crawl), vous jetez les livres mal écrits, désordonnés ou répétitifs, et vous ne donnez à l'étudiant que les 1 % « meilleurs » de la collection.
Ce papier soutient que si vous avez assez de temps et d'énergie (puissance de calcul) pour enseigner à l'étudiant pendant très longtemps, vous devriez en fait arrêter d'être bibliothécaire.
Les auteurs ont découvert que si vous laissez l'étudiant lire tout – les bons livres, les mauvais livres, les listes répétitives et le bruit aléatoire – il finira par apprendre mieux que si vous aviez filtré les livres pour lui. En fait, les données « déchets » s'avèrent utiles, et non nuisibles, pour un modèle suffisamment grand et bien entraîné.
Les Expériences : L'Analogie de la « Salle de Sport »
Pour tester cela, les chercheurs ont mis en place une série d'expériences qui agissent comme une salle de sport pour les modèles d'IA.
1. Le Régime « Propre vs Désordonné »
Ils ont pris un énorme tas de texte internet (le « Bassin ») et en ont créé différentes versions :
- Le Bassin : Le texte internet brut, non filtré.
- Les Filtres : Des versions où ils ont supprimé des éléments spécifiques, comme le texte non anglais, les paragraphes répétitifs ou les mots qui ne sont pas des mots anglais courants. Certains filtres étaient très stricts (ne gardant que 2 % du texte), tandis que d'autres étaient plus souples.
Ils ont entraîné des modèles de différentes tailles (de minuscules à gigantesques) sur ces différents régimes.
- Le Résultat : Pour les petits modèles ou les sessions d'entraînement courtes, le « Régime Propre » (données filtrées) fonctionnait mieux. C'est comme un petit enfant qui apprend mieux avec un livre d'images qu'avec un dictionnaire.
- La Surprise : À mesure qu'ils ont rendu les modèles plus grands et les ont entraînés plus longtemps (plus de « calcul »), le « Régime Désordonné » (le Bassin complet, non filtré) a commencé à l'emporter. Les modèles entraînés sur le bassin complet ont fini par surpasser ceux entraînés sur les données filtrées, même si les données filtrées étaient de « meilleure qualité ».
2. L'Injection de « Malbouffe »
Pour voir à quel point ces modèles sont robustes, les chercheurs ont délibérément ajouté de la « saleté » au régime :
- Chaînes Aléatoires : Des mots inventés comme « htb hqovl bwdws ».
- Phrases Mélangées : Prendre de vraies phrases et brouiller l'ordre des mots (par exemple, « Paris France de capitale est Le »).
La Surprise : Même avec ce mélange de déchets, les grands modèles ne se sont pas brisés. Ils ont appris à ignorer le bruit. Dans un retournement étrange, les modèles ont en fait appris mieux à partir des phrases mélangées que des données propres dans certains cas. Pourquoi ? Parce que même lorsque les mots sont brouillés, le modèle peut toujours voir que « Paris » et « France » apparaissent souvent ensemble, l'aidant à apprendre le lien entre eux. Les « déchets » ont agi comme un entraînement difficile qui a rendu le modèle plus fort.
La « Leçon Amère »
Le papier fait référence à un concept célèbre appelé « The Bitter Lesson » par Richard Sutton. La leçon est la suivante : L'intuition humaine échoue souvent lorsque nous mettons les choses à l'échelle.
Nous, humains, pensons : « Nous devons sélectionner les données car elles sont trop désordonnées. » Mais le papier suggère que, à mesure que nous obtenons des ordinateurs plus puissants, l'approche simple de « donnez-lui juste tout » bat nos règles compliquées, conçues par l'homme, pour nettoyer les données. Le modèle est assez intelligent pour déterminer par lui-même ce qui est utile et ce qui est du bruit, à condition qu'il ait assez de temps pour apprendre.
Le Problème : Cela Coûte Beaucoup d'Énergie
Il y a une condition majeure pour que cela fonctionne : le Calcul.
Le papier calcule que pour que l'approche « lire tout » batte l'approche « filtrer tout », vous avez besoin d'une quantité massive de puissance de calcul. Ils estiment que pour l'ensemble de données Common Crawl complet (240 billions de mots), vous pourriez avoir besoin d'environ 1e+30 FLOPs (une unité de calcul) pour que les données non filtrées deviennent le gagnant clair.
- Pensez-y ainsi : Si vous avez un petit budget, engager un éditeur professionnel pour nettoyer vos données est la décision intelligente. Mais si vous avez un budget d'un milliard de dollars, vous pouvez vous permettre d'engager un million de stagiaires pour lire chaque page d'internet, et le volume pur de lecture enseignera à l'IA plus que l'éditeur ne l'aurait jamais pu.
La Conclusion
Le papier conclut que pour l'avenir des modèles d'IA géants, nous devrons peut-être arrêter d'essayer d'être des sélectionneurs parfaits. Au lieu de dépenser d'énormes ressources pour filtrer les « mauvaises » données, nous devrions nous concentrer sur la construction de modèles plus grands et leur entraînement plus longtemps sur l'internet brut, désordonné et non filtré. Les modèles sont étonnamment résilients ; ils peuvent gérer le bruit et même l'utiliser pour mieux apprendre.
En bref : Si vous avez assez de puissance, le meilleur filtre est aucun filtre du tout.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.