← Derniers articles
💻 computer science

LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models

L'article présente LEAP, une méthode d'élagage adaptatif apprenable de bout en bout qui utilise une relaxation par sigmoïde de Gumbel d'une loi de Bernoulli par poids pour permettre un apprentissage de la parcimonie non structurée dans les grands modèles de langage, surpassant nettement les références existantes par couche en termes de précision en zéro-shot à des niveaux de parcimonie élevés.

Auteurs originaux : Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

Publié 2026-05-19
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une bibliothèque massive et incroyablement intelligente (un modèle de langage de grande taille) qui connaît presque tout. Mais cette bibliothèque est si vaste qu'elle occupe tout un entrepôt, nécessite une centrale électrique géante pour fonctionner et est trop lente pour être utilisée régulièrement sur un ordinateur standard.

Pour résoudre ce problème, vous voulez jeter 50 % à 60 % des livres (les « poids » ou connexions du modèle) afin de la rendre plus petite et plus rapide. L'objectif est de maintenir la bibliothèque tout aussi intelligente, même avec la moitié des livres.

C'est ici que l'article LEAP intervient. Voici l'histoire de la résolution de ce problème, expliquée simplement :

Le Problème : Le Piège du « Trop de Choix »

Pendant longtemps, les scientifiques ont tenté d'éliminer des livres en utilisant deux stratégies principales :

  1. L'Approche « Couche par Couche » (L'Ancienne Méthode) : Imaginez un bibliothécaire examinant une étagère à la fois et décidant : « Ce livre semble inutile, jetez-le. » Il procède ainsi pour chaque étagère sans discuter avec les autres étagères.

    • Le Défaut : Parfois, un livre semble inutile sur son étagère isolée, mais est en réalité crucial pour une histoire qui s'étend à toute la bibliothèque. En examinant les étagères de manière isolée, cette méthode jette accidentellement des connexions importantes, rendant la bibliothèque moins intelligente.
  2. L'Approche « Motif » (La Méthode Plus Récente, Mais Défectueuse) : Récemment, certains chercheurs ont tenté d'examiner toute la bibliothèque d'un seul coup. Ils ont dit : « Apprenons exactement quels livres garder. » Mais ils ont essayé de le faire en regroupant les livres en petits ensembles (comme 4 livres à la fois) et en demandant : « Quel motif parmi ces 4 devons-nous garder ? »

    • Le Défaut : Cela fonctionne très bien pour de petits groupes. Mais si vous essayez de faire cela pour une rangée entière de 4 000 livres (ce que possèdent les modèles d'IA modernes), le nombre de « motifs » possibles devient un chiffre si énorme qu'il est impossible à écrire. C'est comme essayer de lister chaque combinaison possible de numéros de loterie pour un milliard de tickets. L'ordinateur s'étouffe ; les mathématiques s'effondrent.

La Solution : LEAP (Le Système de « Vote Individuel »)

Les auteurs de cet article, LEAP, ont réalisé qu'ils avaient besoin d'une nouvelle façon de voter sur quels livres garder sans être submergés par les mathématiques.

Au lieu de demander : « Quel motif de groupe gardons-nous ? » (ce qui est impossible pour des groupes énormes), ils ont posé une question beaucoup plus simple pour chaque livre individuel : « Ce livre spécifique doit-il rester ou partir ? »

  • L'Analogie : Imaginez une élection massive où chaque électeur (chaque poids du modèle) reçoit un bulletin de vote minuscule. Au lieu de voter pour une « stratégie d'équipe » complexe, ils votent simplement « Oui » (garder) ou « Non » (rejeter).
  • Le Tour de Magie : Pour rendre cela possible, ils ont utilisé un tour de passe-passe mathématique (appelé « Gumbel-sigmoid ») qui permet à l'ordinateur de « deviner » les votes de manière fluide au début, puis de rendre ces devinettes progressivement plus dures et plus nettes jusqu'à ce que chaque vote soit un « Oui » ou un « Non » clair.

Comment Ils Ont Fait (La Recette)

Ils n'ont pas commencé de zéro. Ils ont utilisé un point de départ intelligent :

  1. Le Démarrage à Chaud : Ils ont d'abord utilisé une méthode rapide et simple (appelée Wanda) pour obtenir une idée approximative des livres susceptibles d'être inutiles. Ils l'ont utilisée comme un « départ anticipé » afin que l'ordinateur n'ait pas à deviner à l'aveugle.
  2. L'Entraînement : Ils ont laissé l'ordinateur « apprendre » le meilleur ensemble de votes en lisant une petite quantité de texte (un flux d'étalonnage) et en ajustant les votes « Oui/Non » pour maintenir l'intelligence de la bibliothèque à un niveau élevé.
  3. Le Gel des Livres : De manière cruciale, ils n'ont pas changé les mots à l'intérieur des livres (les poids du modèle). Ils ont seulement changé la décision de quels livres garder. Cela préserve la « personnalité » et les connaissances originales de la bibliothèque, simplement dans un format plus compact.

Les Résultats : Plus Intelligent, Plus Rapide, Plus Économe

Ils ont testé cette méthode sur cinq modèles d'IA célèbres différents (allant de petits à très grands) et les ont réduits de 50 % et 60 %.

  • Le Tableau de Bord : Ils ont comparé LEAP aux meilleures méthodes existantes.
  • La Victoire : LEAP s'est constamment révélé supérieur. En moyenne, il a amélioré la précision du modèle de 2,59 points par rapport à la meilleure méthode précédente. Dans certains cas, l'amélioration a atteint 5,40 points.
  • La Vitesse : Parce qu'ils ont réduit le modèle d'une manière qui s'intègre parfaitement aux nouvelles puces informatiques rapides (GPU) conçues pour ce travail précis, le modèle résultant fonctionne beaucoup plus vite sans perdre en intelligence.

Pourquoi Cela Compte

Avant cela, si vous vouliez rendre un modèle d'IA énorme plus petit et plus rapide, vous deviez choisir entre :

  • Option A : Le garder précis mais énorme et lent.
  • Option B : Le rendre petit et rapide, mais stupide.

LEAP montre que vous pouvez avoir votre gâteau et le manger aussi. Il offre un moyen pratique de réduire de moitié ces cerveaux d'IA massifs, en les gardant tout aussi intelligents, afin qu'ils puissent s'exécuter sur des ordinateurs ordinaires plutôt que de nécessiter un supercalculateur.

En bref : LEAP est une nouvelle et plus intelligente façon de modifier un modèle d'IA géant en laissant chaque connexion individuelle voter sur le fait qu'elle doit rester, aboutissant à une IA plus petite, plus rapide et toujours très intelligente.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →