First-Order Predictable but Pairwise Fragile: Local Task Adaptation in Trained Transformers
Cet article évalue systématiquement huit propriétés d'adaptation locale à travers neuf modèles transformer et constate que, bien que les perturbations de tâches individuelles restent prévisibles au premier ordre dans une fenêtre de validité partagée, la composition de tâches par paires est hautement fragile en raison de la sensibilité à l'ordre, de la rotation des sous-espaces et d'une absence d'additivité universelle ou de correspondance de pilotage.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous êtes un chef étoilé qui vient de perfectionner un ragoût massif et complexe. Il est délicieux, mais vous voulez l'ajuster légèrement : peut-être ajouter une pincée de sel pour plus de saveur, ou une touche de poivre pour un peu de piquant. Dans le monde de l'intelligence artificielle, ce « ragoût » est un cerveau informatique géant (un modèle Transformer) qui a déjà appris à parler, écrire et raisonner. La « pincée de sel » est un minuscule ajustement de ses paramètres internes, appelé ajustement fin (fine-tuning). Les scientifiques ont longtemps cru que si l'on effectuait ces ajustements de manière suffisamment petite, les changements seraient prévisibles, comme marcher en ligne droite sur un champ plat. Ils pensaient que si vous vouliez mélanger deux saveurs différentes (comme rendre une IA douée à la fois en mathématiques et en poésie), vous pouviez simplement additionner les « ajustements mathématiques » et les « ajustements poétiques », et le résultat serait un mélange parfait. Cette idée, appelée « linéarité locale », est le fondement de nombreux outils modernes utilisés pour personnaliser l'IA sans avoir à la réentraîner de zéro.
Cependant, tout comme en cuisine, la cuisine pourrait ne pas être aussi plate qu'elle en a l'air. Cette nouvelle recherche jette un regard microscopique et profond sur ce qui se passe lorsque nous effectuons ces minuscules ajustements dans les cerveaux d'IA. Les scientifiques voulaient savoir : à quel point un changement doit-il être petit pour rester prévisible ? Est-ce que l'addition de deux changements fonctionne toujours ? Et est-ce que cela importe d'ajouter le sel avant le poivre, ou le poivre avant le sel ? Ils ont testé cela sur neuf modèles d'IA différents, allant de modèles petits à des modèles massifs avec des milliards de paramètres, en utilisant un ensemble rigoureux d'expériences pré-planifiées pour s'assurer qu'ils ne faisaient pas que deviner.
L'histoire que raconte l'article est celle d'une « rue à sens unique » qui devient soudainement un « embouteillage » lorsque l'on tente de changer de voie. Les chercheurs ont découvert que si vous poussez une IA dans une seule direction (comme la rendre meilleure pour une tâche unique), les résultats sont étonnamment prévisibles et stables. Vous pouvez marcher assez loin — jusqu'à une échelle de dans leurs mesures — avant que l'IA ne commence à s'embrouiller ou que les mathématiques ne cessent de fonctionner. C'est comme marcher dans un long couloir droit où chaque pas semble exactement le même. C'est une excellente nouvelle pour ceux qui veulent effectuer des ajustements simples pour une tâche unique ou utiliser le hasard pour trouver des améliorations, car le « couloir » est large et sûr.
Mais au moment où vous essayez de faire deux choses à la fois, ou de les faire dans un ordre spécifique, le sol devient glissant. L'article révèle que la règle de l'« additivité » (où ) est fragile. Si vous essayez de combiner deux mises à jour de tâches différentes, l'ordre dans lequel vous les appliquez importe énormément, et ce problème peut commencer bien plus tôt que la zone de sécurité pour les tâches uniques. En fait, pour plus d'un tiers des combinaisons de modèles et de tâches mesurées, l'ordre commence à importer à une échelle strictement comprise à l'intérieur de cette fenêtre de sécurité. L'apparition de cette sensibilité varie considérablement, couvrant trois ordres de grandeur entre différentes paires, ce qui signifie que certaines combinaisons s'effondrent presque immédiatement tandis que d'autres tiennent plus longtemps. Les scientifiques ont découvert que ce chaos est causé par ce qu'on appelle un « crochet de Lie », une façon mathématique élégante de décrire comment la courbure du paysage d'apprentissage de l'IA se tord lorsque l'on tourne à gauche puis à droite, par rapport à l'inverse.
L'équipe a également testé certains raccourcis populaires utilisés par d'autres chercheurs. Ils ont vérifié si l'espace d'apprentissage de l'IA était « de faible dimension » (comme une feuille de papier plate) et ont découvert que, contrairement à certaines croyances antérieures, il ne s'agissait pas d'une simple feuille plate ; c'était plutôt comme une boule de papier froissée qui changeait de forme à mesure que l'on se déplaçait. Ils ont également testé s'ils pouvaient prédire le résultat d'un nouvel ajustement à partir d'un petit échantillon de données et ont constaté que, bien que les mathématiques fonctionnent parfaitement lorsqu'ils utilisent exactement les mêmes données pour la prédiction et le test, elles échouaient complètement lorsqu'ils essayaient d'utiliser des données différentes. Cela signifie que si nous pouvons prédire ce qui se passe dans un environnement contrôlé avec les mêmes données, nous ne pouvons pas encore prédire de manière fiable comment un ajustement se comportera sur de nouvelles données non vues simplement en regardant un petit échantillon.
En fin de compte, l'article ne dit pas que l'ajustement fin est brisé, mais il dit que les « règles de la route » sont plus compliquées que nous ne le pensions. Il existe une zone de sécurité pour les ajustements simples en ligne droite, mais dès que vous essayez de combiner des tâches ou de changer l'ordre des opérations, vous entrez dans une zone où la géométrie interne de l'IA se tord et tourne de manière imprévisible. Les scientifiques concluent que nous devons être beaucoup plus prudents : nous ne pouvons pas simplement supposer que l'ajout de deux correctifs fonctionnera, ou que l'ordre n'importe pas. Au contraire, nous devons vérifier la « courbure » spécifique de notre IA et de nos tâches spécifiques avant de commencer à mélanger et assortir, car la distance de sécurité pour une tâche peut être un désastre pour une paire de tâches.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.