← Derniers articles
🤖 machine learning

NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching

NeuroPrefetcher est un système d'inférence de LLM sensible au stockage qui réalise des accélérations significatives sur les appareils de bord à mémoire limitée en exploitant la localité temporelle de l'activité des neurones MLP pour précharger de manière prédictive uniquement les deltas de poids nécessaires depuis le stockage, plutôt que de s'appuyer sur une pagination à la demande réactive.

Auteurs originaux : Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

Publié 2026-08-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les modèles de langage de grande taille sont les moteurs de l'intelligence artificielle moderne, capables d'écrire, de raisonner et de traduire avec une fluidité qui semblait autrefois impossible. Ces systèmes fonctionnent en traitant le texte mot par mot, en prédisant le mot suivant dans une séquence sur la base des vastes motifs qu'ils ont appris lors de leur entraînement. Pour ce faire, ils s'appuient sur de vastes bibliothèques numériques de nombres, appelés poids, qui sont stockés dans la mémoire de l'ordinateur. Plus le modèle est grand et performant, plus il nécessite de mémoire. Cependant, un écart important est apparu : alors que ces modèles ont grandi de manière exponentielle en taille, la mémoire disponible dans les appareils portables comme les ordinateurs portables, les tablettes et les ordinateurs de bord spécialisés n'a pas suivi le même rythme. Cela crée un problème fondamental pour l'exécution d'une intelligence avancée en dehors des centres de données massifs. Lorsqu'un modèle est trop volumineux pour tenir dans la mémoire d'un appareil, le système doit constamment échanger des données entre la mémoire rapide et le disque de stockage, plus lent, un processus qui paralyse généralement les performances.

Des chercheurs de la Kennesaw State University et de Samsung ont développé une nouvelle approche à ce problème, créant un système appelé NeuroPrefetcher qui permet à ces modèles surdimensionnés de fonctionner efficacement sur des appareils dotés d'une mémoire très limitée. Au lieu d'essayer de réduire la taille du modèle ou de le forcer à entrer dans l'espace disponible, leur système accepte que le modèle soit plus grand que la mémoire disponible et traite le disque de stockage comme une partie active du processus de calcul. La clé de leur succès réside dans une observation simple sur la façon dont ces modèles réfléchissent. Lorsqu'un modèle génère un mot, il active un ensemble spécifique de voies internes. Lorsqu'il génère le mot suivant, il utilise presque exactement les mêmes voies. Les chercheurs ont découvert qu'entre 82 et 85 % des voies actives restent les mêmes d'un mot à l'autre. Cela signifie que pour la grande majorité du travail, les données nécessaires sont déjà présentes dans la mémoire de l'appareil, attendant d'être utilisées.

L'innovation de NeuroPrefetcher réside dans la gestion de la petite quantité de données qui change. Les systèmes traditionnels attendent que le modèle ait besoin d'une donnée avant d'aller chercher cette donnée sur le disque de stockage, un processus réactif qui provoque une pause et une attente de l'ordinateur. NeuroPrefetcher fonctionne différemment en regardant vers l'avant. Il utilise un petit prédicteur spécialisé qui analyse le mot actuel et devine exactement quelles nouvelles voies seront nécessaires pour le mot suivant. Parce qu'il sait ce qui arrive, il peut récupérer uniquement les morceaux spécifiques de données manquantes sur le disque de stockage pendant que l'ordinateur est occupé à calculer le mot actuel. Cela transforme un processus chaotique de type "stop-and-go" en un flux continu et fluide. Le système précharge essentiellement la infime fraction de nouvelles informations requises, ignorant la masse énorme de données qui est déjà résidente en mémoire.

Pour tester cette idée, l'équipe a construit un système complet et l'a testé sur un appareil de bord puissant connu sous le nom de Jetson AGX Orin, qui possède une architecture de mémoire unifiée partagée entre son processeur et son unité graphique. Ils ont testé le système avec des modèles de langage de grande taille comme Mistral-7B et Llama-3-8B sous des limites de mémoire strictes, simulant des conditions où le modèle était nettement plus grand que la mémoire disponible. Dans ces conditions difficiles, la méthode standard d'exécution de ces modèles, qui repose sur le système d'exploitation pour gérer l'échange de données, a donné de mauvais résultats, provoquant souvent le blocage de l'appareil. En revanche, NeuroPrefetcher a maintenu le mouvement de l'appareil, atteignant une accélération près de huit à douze fois plus rapide que la méthode standard. Le système a réussi à générer des mots à un rythme de plus de trois par seconde, alors que l'approche standard peinait à produire ne serait-ce qu'un mot par seconde.

Les chercheurs ont également examiné comment le système se comportait lorsque la mémoire disponible changeait. Ils ont constaté que le système pouvait s'adapter en déplaçant davantage le travail du modèle vers le disque de stockage lorsque la mémoire était faible, et en déplaçant davantage le travail vers la mémoire rapide lorsqu'il y avait plus d'espace. Même dans les conditions de mémoire les plus tendues, le système a maintenu des performances élevées car il a évité les transferts de données massifs qui ralentissent habituellement ces opérations. Au lieu de déplacer des couches entières du cerveau du modèle d'avant en arrière, il a déplacé uniquement les petites tranches de données changeantes. Cette approche s'est avérée si efficace que le système est resté l'option la plus rapide, même comparé à d'autres outils avancés, dont beaucoup n'ont même pas réussi à s'exécuter sous ces contraintes spécifiques.

Une partie critique de ce travail consistait à s'assurer que les gains de vitesse ne se faisaient pas au détriment de l'intelligence. Les chercheurs ont mesuré la qualité du texte produit par le système et ont constaté qu'elle restait très proche de la qualité du modèle complet non compressé. Le système a préservé la précision des prédictions du modèle, conservant plus de 90 % de la performance originale même en utilisant les paramètres d'économie de mémoire les plus agressifs. Cela a confirmé que la stratégie consistant à ne déplacer que les données nécessaires n'a pas dégradé la capacité du modèle à comprendre et à générer du langage. Le système a appris efficacement à ignorer les données qui n'étaient pas nécessaires pour l'étape suivante immédiate, concentrant ses ressources uniquement sur ce qui comptait.

L'étude souligne un changement dans la façon dont nous pourrions envisager l'exécution de l'intelligence artificielle sur les appareils du quotidien. Pendant des années, la solution pour faire fonctionner de grands modèles sur du petit matériel a été de rendre les modèles plus petits ou de les compresser, ce qui peut parfois réduire leurs capacités. NeuroPrefetcher suggère une autre voie : garder le modèle complet intact et gérer le mouvement de ses données avec une précision extrême. En prédisant ce dont le modèle a besoin ensuite et en récupérant uniquement ce changement spécifique, le système transforme le disque de stockage d'un goulot d'étranglement en un partenaire utile. Cette approche permet à une intelligence puissante de fonctionner sur des appareils qui étaient auparavant trop petits pour la contenir. Cela ouvre la porte à une IA avancée capable de fonctionner localement sans avoir besoin d'une connexion à un serveur distant. Les résultats montrent qu'avec une bonne gestion du flux de données, les limites physiques de la mémoire peuvent être surmontées sans sacrifier la puissance du modèle lui-même.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →