← Derniers articles
💬 NLP

GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs

GLASS est un cadre sans entraînement qui améliore l'épuration à l'inférence pour les grands modèles de langage en agrégeant, via une agrégation de rangs, les activations locales spécifiques aux prompts et les priors globaux intrinsèques au modèle, stabilisant ainsi l'élagage dynamique des FFN et améliorant considérablement la fidélité de génération et la vitesse de décodage, en particulier dans les scénarios à prompts courts et de longue forme.

Auteurs originaux : Amirmohsen Sattarifard, Sepehr Lavasani, Kunlin Zhang, Amirhossein Rajabpour, Hanlin Xu, Fengyu Sun, Negar Hassanpour, Chao Gao

Publié 2026-05-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Amirmohsen Sattarifard, Sepehr Lavasani, Kunlin Zhang, Amirhossein Rajabpour, Hanlin Xu, Fengyu Sun, Negar Hassanpour, Chao Gao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une bibliothèque géante et incroyablement intelligente (un modèle de langage de grande taille, ou LLM) capable d'écrire des histoires, de répondre à des questions et de résoudre des problèmes. Mais cette bibliothèque est si massive qu'elle ne rentre ni sur votre téléphone ni sur votre ordinateur portable. Elle est trop lourde, trop lente et nécessite trop d'énergie pour fonctionner.

Pour la faire fonctionner sur votre appareil, vous devez la « élaguer » — essentiellement, vous devez lui demander d'ignorer 50 % de ses cellules cérébrales internes (neurones) pendant qu'elle réfléchit, afin qu'elle fonctionne plus vite et utilise moins de mémoire.

Le Problème : Le « Jeu de Devinettes » des Prompts Courts
Les méthodes existantes tentent de décider quels neurones conserver en examinant la toute première chose que vous tapez (le « prompt »). Elles disent : « D'accord, vous avez posé une courte question, nous allons donc maintenir l'activité de ces neurones spécifiques. »

L'article soutient que cela revient à essayer de planifier tout un voyage routier en se basant sur le premier pas que vous faites en franchissant la porte.

  • Prompts Courts : Si vous posez une courte question, le modèle n'a pas assez d'informations pour savoir quels neurones sont réellement importants pour la longue réponse qu'il est sur le point de générer.
  • Réponses Longues : Au fur et à mesure que le modèle commence à écrire une longue histoire, l'« importance » des neurones change. Ceux qui semblaient importants pour la courte question peuvent devenir inutiles pour le reste de l'histoire.
  • Le Résultat : Le modèle se confond, fait des erreurs et la qualité de l'écriture diminue car il a conservé les mauvais neurones et désactivé les bons.

La Solution : GLASS (Agrégation Globale-Local)
Les auteurs proposent une nouvelle méthode appelée GLASS. Imaginez GLASS comme un gestionnaire intelligent qui prend des décisions en utilisant deux sources d'information différentes, plutôt qu'une seule.

  1. La Vue Locale (Le Signal « Tout de Suite ») : Celle-ci examine ce que vous venez de taper. Elle se demande : « Sur la base de cette question spécifique, quels neurones s'activent en ce moment ? » C'est bon pour le contexte, mais peu fiable pour les questions courtes.
  2. La Vue Globale (Le Signal « Intrinsèque ») : C'est la grande innovation de l'article. Avant même que le modèle ne voie votre question, les chercheurs ont effectué un test spécial où ils ont laissé le modèle parler à lui-même en utilisant un prompt vide (juste un espace vide). Ils ont demandé : « Quels neurones ce modèle utilise-t-il toujours, peu importe ce qui se passe ? » Cela crée une « feuille de triche » des cellules cérébrales les plus importantes et fiables du modèle.

Comment GLASS Fonctionne : L'Analogie du « Classement »
GLASS ne choisit pas l'un ou l'autre. Il utilise un système de vote astucieux appelé Agrégation de Classement.

Imaginez que vous sélectionnez une équipe pour un match de sport :

  • L'Entraîneur Local dit : « Le Joueur A est excellent pour ce match spécifique. »
  • L'Entraîneur Global dit : « Le Joueur A est le meilleur joueur que nous ayons, point final, basé sur toute sa carrière. »

Si vous n'écoutez que l'Entraîneur Local, vous risquez de choisir un joueur qui est bon pour une seule action mais mauvais pour tout le match. Si vous n'écoutez que l'Entraîneur Global, vous risquez de choisir une star qui ne correspond pas à la stratégie spécifique.

GLASS combine les deux. Il prend la liste « Locale » et la liste « Globale » et les fusionne. Si un neurone est classé haut par les deux entraîneurs, il reste définitivement. Si un entraîneur est incertain (comme lorsque le prompt est court), l'opinion de l'autre entraîneur sauve la mise.

L'Astuce de la « Stimulation par Prompt Null » (NPS)
Pour obtenir cette « feuille de triche » Globale sans avoir besoin d'un ensemble de données massif de livres ou d'articles Wikipédia, les auteurs ont utilisé une astuce appelée Stimulation par Prompt Null.

  • Au lieu de donner un livre au modèle à lire, ils lui ont simplement permis de générer du texte à partir de rien (un prompt « null »).
  • Cela force le modèle à se fier entièrement à son propre câblage interne. C'est comme demander à un musicien de jouer une gamme sans partition pour voir quels doigts il utilise naturellement le plus. Cela fournit une carte pure et non biaisée des neurones les plus critiques du modèle.

Les Résultats : Plus Rapide et Plus Intelligent
L'article a testé GLASS sur de nombreux modèles différents (comme Llama, Gemma et Mistral) et a constaté :

  • Meilleure Qualité : Lorsqu'il est demandé d'écrire de longues histoires à partir de prompts courts, GLASS commet beaucoup moins d'erreurs que les méthodes précédentes. Il se rapproche beaucoup plus de la qualité du modèle complet, non élagué.
  • Vitesse Accrue : Sur un Samsung Galaxy S25 Ultra (un téléphone haut de gamme), GLASS a permis au modèle de fonctionner jusqu'à 11 fois plus vite dans certains cas. Cela s'est produit parce que le modèle est devenu assez petit pour tenir entièrement dans la mémoire rapide du téléphone, évitant ainsi le processus lent d'échange constant de données.

En Résumé
GLASS est un outil « plug-and-play » qui permet de faire fonctionner de grands modèles d'IA sur de petits appareils. Il résout le problème de la « mauvaise devinette » sur les questions courtes en combinant ce que le modèle fait maintenant avec ce que le modèle est naturellement bon à faire, garantissant ainsi que l'IA reste intelligente et rapide, même lorsqu'elle travaille avec des ressources limitées.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →