Benign interpolation and Occam's razor
Cet article soutient que les tentatives récentes visant à expliquer le succès de la généralisation des modèles d'apprentissage profond interpolants par un recours au rasoir d'Occam créent un fossé explicatif en confondant les propriétés non prouvées de modèles individuels avec le lien rigoureux, fondé sur des théorèmes, entre la simplicité de la classe de modèles et la généralisation établie dans la théorie classique de l'apprentissage.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot à reconnaître des photos de chats et de chiens. Vous lui montrez des milliers de photos, et il apprend à voir la différence. Dans l'ancien temps de l'informatique, il existait une règle d'or appelée « le Rasoir d'Occam ». Elle disait essentiellement : « Restez simple ». Si deux théories expliquent les données, choisissez la plus simple. Pourquoi ? Parce que si un modèle devient trop complexe, il commence à mémoriser les photos d'entraînement comme un perroquet au lieu d'apprendre réellement ce qu'est un chat. C'est ce qu'on appelle le « surapprentissage » (overfitting), et c'est un désastre. Si le robot voit une nouvelle image, il échoue parce qu'il était trop occupé à mémoriser les anciennes.
Pendant des décennies, les scientifiques ont utilisé cette règle pour construire une IA sûre et fiable. Ils pensaient que pour rendre un robot intelligent, il fallait limiter sa puissance cérébrale pour qu'il ne s'embrouille pas. Mais ensuite, quelque chose d'étrange s'est produit. L'IA moderne, plus précisément le « deep learning » (apprentissage profond), a commencé à enfreindre toutes les règles. Ces nouveaux robots ont des cerveaux si gigantesques qu'ils peuvent mémoriser parfaitement chaque photo d'entraînement, même si vous mélangez les étiquettes et leur dites qu'un chat est un grille-pain. Selon toutes les anciennes règles, ils devraient être terribles pour deviner de nouvelles images. Pourtant, ils sont incroyables à cela. Ils s'adaptent parfaitement aux données désordonnées mais prédisent tout de même l'avenir avec justesse. Ce phénomène étrange est appelé « interpolation bénigne », et il a laissé les scientifiques perplexes, se demandant comment un robot peut être à la fois un mémorisateur parfait et un prédicteur brillant.
Cet article, écrit par Tom F. Sterkenburg, Daniel A. Herrmann et Jan-Willem Romeijn, plonge dans ce mystère pour voir si les nouvelles explications de ce miracle tiennent la route. Les auteurs agissent essentiellement comme des détectives, enquêtant sur une nouvelle théorie populaire qui a émergé pour expliquer pourquoi ces modèles d'IA géants fonctionnent si bien.
La nouvelle théorie suggère que même si ces modèles d'IA sont énormes et complexes, la façon dont ils apprennent (en utilisant une méthode appelée « descente de gradient stochastique ») les pousse secrètement vers la solution la plus « simple » parmi tous les ajustements parfaits. C'est comme un randonneur qui aurait un million de sentiers pour atteindre un sommet ; la théorie affirme que les chaussures du randonneur le guident naturellement vers le sentier le plus lisse et le plus direct, ignorant les sentiers escarpés et rocheux. Les partisans de cette idée appellent cela un « biais de simplicité » et disent qu'il s'agit d'une version moderne du Rasoir d'Occam qui vient sauver la mise. Ils soutiennent que l'IA choisit le modèle le plus simple qui s'adapte aux données, ce qui explique pourquoi elle généralise si bien.
Cependant, les auteurs de cet article soutiennent que cette explication comporte une faille majeure. Ils soulignent que l'ancien « Rasoir d'Occam » était une règle mathématiquement prouvée concernant des groupes de modèles (classes de modèles). Il prouvait que si vous choisissez un groupe de modèles petit et simple, vous êtes garanti de réussir. Mais la nouvelle théorie parle de modèles individuels. Elle dit : « Ce modèle spécifique est simple parce qu'il possède une faible "norme" (une mesure mathématique de taille) ou qu'il est "lisse" ».
Le problème, expliquent les auteurs, est qu'il n'existe aucune preuve mathématique reliant la simplicité d'un modèle individuel à sa capacité à prédire l'avenir. Dans l'ancien temps, les mathématiques garantissaient que les groupes simples fonctionnaient. Dans la nouvelle histoire, les auteurs affirment que les scientifiques se contentent de qualifier ces modèles spécifiques de « simples » en espérant que le nom d'« Occam's Razor » fasse le plus gros du travail. C'est comme dire : « Cette pierre est une pierre magique parce que je l'ai appelée une pierre magique », sans aucune preuve que les pierres magiques existent réellement.
L'article suggère que bien que ces nouvelles idées soient intéressantes, elles laissent un vide. Ils n'ont pas réellement prouvé pourquoi choisir un modèle individuel « simple » mène à de bonnes prédictions. Les auteurs soutiennent que la nouvelle théorie repose essentiellement sur une hypothèse majeure non prouvée : que le monde est rempli de motifs simples que ces modèles d'IA se trouvent à trouver. Ils ne disent pas que cette hypothèse est fausse, mais ils insistent sur le fait que les explications actuelles ne sont que des suppositions. Ils utilisent le nom d'un principe célèbre (le Rasoir d'Occam) pour faire passer une hypothèse audacieuse pour un fait scientifique solide.
Alors, quel est le verdict ? L'article ne dit pas que la nouvelle IA est défaillante ; il dit que nous ne comprenons pas encore pleinement pourquoi elle fonctionne. Les auteurs suggèrent que la réponse n'est peut-être pas une règle universelle sur la simplicité, mais quelque chose de plus spécifique aux données que nous collectons ou aux tâches spécifiques que nous demandons à l'IA d'accomplir. Tant que quelqu'un ne pourra pas prouver le lien entre « modèles individuels simples » et « bonnes prédictions », le mystère de l'interpolation bénigne restera cela même : un mystère. La nouvelle théorie est une piste prometteuse, mais ce n'est pas la réponse finale.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.