← Derniers articles
🤖 machine learning

Low-Rank Ternary Adaptation for Fine-Tuning Transformers

Cet article propose l'« adaptation multiplicative ternaire », une nouvelle méthode de bas rang qui permet un ajustement fin efficace des transformateurs ternaires en représentant les mises à jour de poids discrètes par de petites matrices ternaires, préservant ainsi le domaine ternaire et permettant une fusion directe sans déquantification tout en récupérant de manière significative les performances à travers les modèles de langage et de vision.

Auteurs originaux : Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

Publié 2026-08-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'intelligence artificielle moderne repose sur de vastes programmes informatiques appelés « transformers », qui sont devenus le moteur de tout, des assistants d'écriture aux générateurs d'images. Ces programmes sont incroyablement puissants, mais ils sont aussi lourds, nécessitant de vastes quantités de mémoire informatique et d'énergie pour fonctionner. Pour les rendre utilisables sur des appareils plus petits comme les téléphones ou les ordinateurs portables, les chercheurs passent des années à essayer de les réduire. Une stratégie populaire consiste à compresser les nombres à l'intérieur du programme, en transformant leurs valeurs complexes et de haute précision en versions plus simples et à faible nombre de bits. Imaginez que vous preniez une photographie haute résolution et que vous la réduisiez à quelques couleurs seulement ; l'image devient plus petite et plus rapide à traiter, bien qu'un certain niveau de détail soit inévitablement perdu. La forme la plus agressive de cette compression consiste à limiter les nombres internes du programme à seulement trois valeurs possibles : moins un, zéro et plus un. Cette approche, connue sous le nom de quantification ternaire, réduit la mémoire nécessaire d'un facteur dix, transformant potentiellement un modèle qui nécessitait autrefois un gros serveur en quelque chose qui pourrait fonctionner sur un ordinateur portable standard.

Cependant, un problème important a freiné les progrès de ces modèles ultra-compacts. Bien que les modèles soient petits et efficaces, il est difficile de leur enseigner de nouvelles tâches. Les méthodes standards pour enseigner à ces programmes consistent à effectuer de minuscules ajustements continus sur leurs nombres. Mais lorsqu'un modèle est restreint à seulement trois valeurs, il ne peut pas faire de petits ajustements ; il peut seulement basculer un nombre de négatif à positif, ou l'éteindre complètement. Les techniques existantes pour enseigner ces modèles compressés nécessitent souvent d'élargir temporairement les nombres pour revenir à leur taille complète et lourde afin d'effectuer les changements, puis de les compresser à nouveau. Ce processus d'expansion et de re-compression introduit des erreurs qui dégradent les performances du modèle, rendant souvent le résultat final moins bon que si aucun enseignement n'avait eu lieu.

Une équipe de chercheurs de l'Université de technologie de Delft et d'Amazon a développé une nouvelle façon d'enseigner à ces modèles ultra-compacts qui évite ce cycle d'expansion et d'erreur. Au lieu d'essayer d'ajouter de petits nombres continus au modèle, leur méthode travaille directement au sein du système strict à trois valeurs. Ils ont conçu un système qui agit comme un ensemble d'interrupteurs, permettant au modèle de basculer le signe de ses nombres internes ou de les éteindre entièrement, sans jamais quitter l'état compressé. Pour rendre cela efficace, ils n'ont pas essayé d'ajuster chaque nombre individuellement. Au lieu de cela, ils ont utilisé une structure mathématique qui permet à quelques motifs simples et restreints de contrôler de vastes sections du modèle à la fois. Cette approche, qu'ils appellent une adaptation ternaire de bas rang (low-rank ternary adaptation), permet au modèle d'apprendre de nouvelles compétences tout en restant parfaitement compressé.

Les chercheurs ont testé cette méthode sur plusieurs types différents d'intelligence artificielle, incluant des modèles de langage capables de raisonner et des modèles de vision qui reconnaissent des images. Ils ont commencé avec des modèles qui avaient déjà été compressés à la limite des trois valeurs, puis ont appliqué leur nouvelle technique d'enseignement. Les résultats ont montré que les modèles récupéraient une grande partie de la précision perdue lors de la compression initiale. Dans des tests impliquant des tâches de langage, les modèles adaptés ont performé de manière nettement supérieure aux tentatives précédentes qui tentaient de forcer le modèle à apprendre par expansion et re-compression. Par exemple, sur un modèle de langage de trois milliards de paramètres, la nouvelle méthode a amélioré la précision moyenne sur neuf tâches différentes, passant d'environ 32 % à 38 %, tout en rendant les prédictions du modèle beaucoup plus confiantes.

Peut-être plus important encore, le résultat final de ce processus est un modèle unique et unifié qui conserve sa forme ultra-compacte. Contra l'autre méthode qui laisse derrière elle un ensemble séparé et lourd d'instructions qui doit être chargé aux côtés du petit modèle, cette nouvelle approche fusionne l'apprentissage directement dans les poids minuscules. Les chercheurs ont découvert que pour les tâches de vision, telles que l'identification d'objets dans des images, leur méthode produisait un modèle bien plus précis que ceux créés par re-compression après l'apprentissage. Ils ont également découvert que le processus d'apprentissage fonctionnait en redistribuant les signes des nombres existants plutôt qu'en essayant de ramener à la vie les nombres mis à zéro. Cela signifie que le modèle apprend en réorganisant ce qu'il possède déjà, plutôt qu'en essayant de créer de nouvelles connexions là où aucune n'existait.

Ce travail démontre qu'il est possible d'enseigner à des modèles d'intelligence artificielle hautement compressés sans sacrifier leur efficacité ou leur précision. En respectant les limites strictes du système à trois valeurs et en trouvant un moyen d'apprendre à l'intérieur de ces frontières, les chercheurs ont montré que ces petits modèles peuvent être tout aussi capables que leurs homologues plus grands pour de nombreuses tâches. La méthode ne nécessite ni mémoire supplémentaire ni puissance de calcul lors de l'utilisation, car l'apprentissage est pleinement intégré à la structure du modèle. Cela ouvre la voie à l'exécution d'une intelligence artificielle sophistiquée sur des appareils dotés de ressources très limitées, apportant des capacités puissantes dans des lieux où leur déploiement était auparavant impossible.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →