← Derniers articles
🤖 machine learning

SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs

SelectInfer est un cadre d'optimisation au niveau du neurone qui permet une inférence efficace de modèles de langage de grande taille sur l'appareil en utilisant un profileur hors ligne pour identifier et charger sélectivement, ainsi que calculer, uniquement les neurones les plus importants, réduisant ainsi considérablement les coûts de mémoire et de calcul sans compromettre la performance des tâches.

Auteurs originaux : Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow, Lin Wang

Publié 2026-07-21
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow, Lin Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une bibliothèque de connaissances géante, si vaste qu'elle contient la réponse à presque toutes les questions que vous pourriez poser. C'est ce que les scientifiques appellent un Grand Modèle de Langage (LLM). Voyez cela comme un cerveau de robot super intelligent qui a lu presque tous les livres d'Internet. Mais il y a un piège : ce cerveau est si énorme et lourd qu'il nécessite généralement un centre de données massif et coûteux avec des superordinateurs puissants pour fonctionner. C'est comme essayer de transporter une bibliothèque entière dans votre sac à dos ; cela ne rentre pas.

Récemment, les gens ont voulu mettre cette « bibliothèque » dans des appareils plus petits, comme les gadgets intelligents dans vos poches ou les ordinateurs des voitures autonomes. Ce sont ce qu'on appelle des « appareils de bord » (edge devices). Le problème est que ces gadgets ont un espace et une puissance de batterie très limités. Si vous essayez de forcer toute la bibliothèque sur eux, l'appareil plante ou devient si lent qu'il est inutile. Les scientifiques ont essayé de rétrécir la bibliothèque en écrasant les livres (en les rendant plus petits mais plus difficiles à lire) ou en jetant des étagères entières (ce qui fait que le robot oublie des choses). Mais ces vieilles astuces brisent souvent la capacité du robot à réfléchir clairement. La grande question est : pouvons-nous faire tenir ce cerveau géant dans un petit sac à dos sans perdre son génie ?

Entrez dans SelectInfer, une nouvelle idée de chercheurs de l'Université de Paderborn qui suggère une manière ingénieuse de résoudre ce casse-tête. Au lieu d'essayer de rétrécir toute la bibliothèque ou de jeter des livres au hasard, SelectInfer agit comme un bibliothécaire très intelligent qui sait exactement de quels livres vous avez besoin en ce moment même.

Voici comment cela fonctionne, en utilisant une histoire simple. Imaginez que votre cerveau de robot est une immense usine avec des milliers de travailleurs (appelés « neurones »). Dans une usine normale, chaque travailleur se présente chaque jour, même s'il n'a rien à faire. Cela gaspille de l'espace et de l'énergie. Les chercheurs ont découvert que ces travailleurs se divisent en deux groupes. Certains sont des « Généralistes » qui se présentent toujours, peu importe la tâche — comme les personnes qui assurent l'éclairage et le fonctionnement de la machine à café. Les autres sont des « Spécialistes » qui ne se présentent que pour des tâches spécifiques, comme l'équipe qui répare la plomberie ou l'équipe qui peint les murs.

L'article montre que pour n'importe quelle tâche donnée, vous n'avez pas besoin de tous les spécialistes, et vous n'avez certainement pas besoin de ceux qui ne travaillent pas aujourd'hui. SelectInfer utilise un tour de magie en deux étapes pour faire fonctionner l'usine sur un petit appareil :

  1. Chargement Sélectif (Le tour du sac à dos) : Avant même que le robot ne commence à travailler, les chercheurs utilisent un « profileur hors ligne » (une sorte d'éclaireur) pour déterminer quels Généralistes et Spécialistes sont les plus importants. Ensuite, quand le robot est prêt à partir, il ne charge dans son sac à dos (mémoire) que ces travailleurs spécifiques. Il laisse les autres derrière lui. C'est comme ne préparer que les outils dont vous avez besoin pour un voyage de camping au lieu de tout le magasin de bricolage. Cela permet au robot de tenir dans des appareils qui étaient auparavant trop petits pour le contenir. Par exemple, sur un appareil doté de seulement 8 Go de mémoire (comme un NVIDIA Jetson Orin Nano), un modèle qui nécessite habituellement 9 Go d'espace peut désormais se faire une place car il ne transporte que l'essentiel de ses 70 % de travailleurs.

  2. Calcul Sélectif (Le tour du « sur demande ») : Même avec un sac à dos plus léger, le robot doit encore demander à chaque travailleur de faire son travail, ce qui prend du temps. SelectInfer ajoute une deuxième règle : une fois que le robot a commencé à travailler, il ne demande qu'aux travailleurs les plus pertinents d'effectuer le calcul pour ce moment précis. Si le robot écrit un poème, il n'a pas besoin que l'équipe de plomberie calcule la rime. Il réveille seulement les poètes. Cela rend le robot beaucoup plus rapide pour réfléchir.

Les chercheurs ont testé cela sur trois cerveaux de robots différents (Llama3.2-3B, Llama3.2-1B et Qwen2.5-3B) sur une petite puce informatique. Ils ont constaté qu'en utilisant cette méthode, ils pouvaient faire fonctionner ces modèles géants sur des appareils qui étaient auparavant impossibles à utiliser. Pour le modèle de 3 milliards de paramètres, SelectInfer l'a rendu environ 1,53 fois plus rapide que la meilleure méthode actuelle d'écrasement des données (quantification 4-bit) et plus de 13 fois plus rapide qu'en essayant de tirer des données d'un disque lent.

Crucialement, l'article soutient que cela ne rend pas le robot « plus bête ». En fait, pour de nombreuses tâches comme la traduction et le résumé d'histoires, SelectInfer était en réalité plus précis que d'autres méthodes qui tentaient d'économiser de l'espace. Les chercheurs ont trouvé que tandis que d'autres méthodes économisaient soit la mémoire mais fonctionnaient lentement, soit étaient rapides mais oubliaient des choses, SelectInfer réussissait à équilibrer les trois : il économisait la mémoire, accélérait la réflexion et maintenait la précision des réponses.

L'article exclut explicitement l'idée que vous devez jeter tout le modèle ou le réentraîner à partir de zéro pour le faire tenir. Il montre également que le simple fait de choisir des travailleurs au hasard pour les laisser derrière (chargement aléatoire) fait échouer complètement le robot, prouvant qu'il faut une carte intelligente pour savoir qui garder. Bien que la méthode nécessite une phase de « reconnaissance » unique pour déterminer quels travailleurs sont importants, les résultats suggèrent que c'est un moyen pratique et puissant d'apporter une IA super intelligente aux petits gadgets de nos poches sans avoir besoin d'un supercalculateur dans le cloud.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →