← Derniers articles
🤖 machine learning

Compressing LLMs with MoP: Mixture of Pruners

L'article présente MoP (Mixture of Pruners), un cadre itératif qui unifie l'élagage de la profondeur et de la largeur pour surpasser les méthodes existantes à dimension unique en termes de précision et de réduction de la latence sur les modèles LLaMA et LLaVA.

Auteurs originaux : Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jorda
Publié 2026-07-28
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de transporter une bibliothèque massive et lourde dans un sac à dos. Cette bibliothèque contient la somme des connaissances humaines, écrite dans une langue si complexe que seuls les ordinateurs les plus intelligents peuvent la lire. Ces « bibliothèques » sont appelées Grands Modèles de Langage (LLM). Elles sont incroyables pour écrire des histoires, résoudre des problèmes mathématiques et même discuter comme un ami. Mais il y a un piège : elles sont si volumineuses et lourdes qu'elles nécessitent des quantités énormes d'électricité et des ordinateurs ultra-rapides juste pour ouvrir le livre et lire une seule phrase. Si vous voulez les utiliser sur un ordinateur portable ordinaire ou un téléphone, elles sont souvent trop lentes et trop lourdes à transporter.

Pour corriger cela, des scientifiques essaient de rendre ces bibliothèques plus petites sans jeter les livres importants. Une façon de faire cela s'appelle l'« élagage » (pruning). Pensez à l'élagage comme au jardinage. Vous avez un buisson géant et trop touffu (le gros modèle informatique), et vous voulez le tailler pour lui donner une forme plus nette et plus petite. Vous pouvez couper des branches entières (pour rendre le buisson plus court), ou vous pouvez tailler les feuilles des branches (pour rendre le buisson plus fin). Pendant longtemps, les jardiniers devaient choisir : soit couper des branches entières, soit tailler les feuilles, mais pas les deux en même temps. La question était : quelle méthode permet de rendre le buisson plus petit tout en le gardant sain et capable de porter des fruits ?

Ce document présente un nouvel outil de jardinage appelé MoP, qui signifie Mixture of Pruners (Mélange d'Élagueurs). Au lieu de choisir une seule méthode pour tailler, MoP est un jardinier intelligent et itératif qui essaie les deux méthodes à chaque étape. Imaginez que vous taillez votre buisson. À chaque coupe, MoP pose deux questions : « Si je coupe cette branche entière, à quoi ressemble le buisson ? » et « Si je taille seulement les feuilles de cette branche à la place, à quoi ressemble-t-il ? ». Il choisit ensuite la version qui fait que le buisson ressemble le plus à la plante originale et saine. Il répète ce processus, alternant entre la coupe des branches et la taille des feuilles, jusqu'à ce que le buisson soit assez petit pour entrer dans votre sac à dos.

Les chercheurs ont testé cette méthode sur certains des cerveaux informatiques les plus intelligents au monde, comme les modèles LLaMA-2 et LLaMA-3. Ils ont découvert que MoP est bien meilleur pour rétrécir ces modèles qu'en utilisant une seule méthode seule. Lorsqu'ils ont réduit les modèles de 40 % (les rendant 40 % plus petits), MoP a permis aux modèles de rester aussi intelligents que la concurrence, mais a également permis de les rendre nettement plus rapides. En fait, les modèles sont devenus 39 % plus rapides pour répondre aux questions. Plus surprenant encore, ils ont testé cela sur un modèle capable de voir des images et de lire du texte (appelé LLaVA-1.5). Ils ont découvert que même s'ils n'ont « appris » au modèle élagué qu'avec du texte (pas d'images), le modèle pouvait toujours comprendre les images presque aussi bien qu'avant. Cela suggère que le mélange des deux stratégies de taille crée un cerveau informatique plus petit, plus rapide et plus intelligent qui ne perd pas le fil, même lorsqu'il devient très petit.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →