Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection
Cet article introduit PRECOG et SMC, un système de génération augmentée par récupération pour les modèles d'espace d'états qui pré-encode des corpus de documents en états cachés de taille fixe pour parvenir à une injection de contexte en , permettant des modèles de langage de bord interactifs avec des accélérations massives par rapport au RAG traditionnel basé sur les Transformers.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot super intelligent à répondre à des questions en lui fournissant une immense bibliothèque de livres. Dans le monde de l'intelligence artificielle, la méthode la plus populaire pour faire cela revient à donner au robot une pile de papiers en lui disant : « Lis chaque mot de ces papiers avant de répondre à ma question. » Cela fonctionne, mais c'est lent. Si la pile est énorme, le robot doit passer beaucoup de temps simplement à lire le contexte avant même de pouvoir dire « Bonjour ». De plus, le robot doit se souvenir de chaque mot qu'il vient de lire, ce qui occupe beaucoup de mémoire, comme essayer de garder toute une encyclopédie dans sa tête pendant qu'on parle.
Les scientifiques cherchent un moyen de rendre ce processus plus rapide et plus léger, surtout pour les robots qui vivent sur de petits appareils comme des téléphones ou des appareils électroménagers intelligents, où la mémoire est limitée et où la vitesse est primordiale. Ils explorent un autre type d'architecture cérébrale appelé « Modèle d'Espace d'État » (SSM - State-Space Model). Voyez le SSM non pas comme un robot qui lit un livre page par page et mémorise chaque mot, mais comme un robot qui lit un livre puis compresse instantanément toute l'histoire en une seule, minuscule et magique carte de résumé. Cette carte contient la signification de ce qui a été lu, mais pas les mots eux-mêmes, et peu importe où dans le livre l'histoire s'est déroulée. La grande question que les chercheurs posent est la suivante : pouvons-nous utiliser cette astuce de la « carte de résumé » pour sauter l'étape de la lecture lente ? Si nous le pouvons, nous pourrions créer une IA capable de répondre instantanément, même sur de petits appareils, sans avoir besoin d'un ordinateur massif dans le cloud.
Ce document présente une astuce ingénieuse appelée PRECOG (qui signifie Pre-Computed Context Injection ou Injection de Contexte Pré-Calculée) qui répond par l'affirmative : « Oui, nous le pouvons. » Les auteurs, travaillant avec un type spécifique de modèle d'IA appelé TENNs-LLM, ont trouvé comment prendre un bloc de texte, le faire passer une fois dans l'IA pour créer cette minuscule « carte de résumé » (un état caché), puis la sauvegarder. Plus tard, lorsqu'un utilisateur pose une question, au lieu de faire relire le texte par l'IA, le système extrait simplement la carte de résumé sauvegardée et l'injecte directement dans le cerveau de l'IA. C'est comme sauter la partie lecture d'un examen pour simplement donner à l'élève les notes préparées qu'il a déjà étudiées.
Les résultats sont époustouflants en termes de vitesse. Sur le matériel spécifique de bord (edge hardware) testé par l'équipe, l'ancienne méthode de « lecture » du contexte a pris environ 27 secondes juste pour obtenir la première réponse. Avec PRECOG, ce temps est tombé à moins de 6 millisecondes. C'est une accélération d'environ 4 500 fois, transformant un processus qui était inutilisable en un processus qui semble instantané et interactif. Le document prouve mathématiquement que ce raccourci ne rend pas l'IA « bête » ; les réponses sont tout aussi bonnes que si elle avait lu le texte mot par mot, car la façon dont ce type spécifique d'IA fonctionne permet à la carte de résumé d'être un remplacement parfait pour le texte.
Le document présente également une seconde fonctionnalité appelée SMC (Structured Memory Consolidation ou Consolidation de Mémoire Structurée). Si PRECOG concerne la mémorisation d'une bibliothèque de livres, la SMC concerne la mémorisation de la vie d'une personne. Elle organise les mémoires à long terme de l'IA (comme vos préférences ou vos conversations passées) en différents « dossiers » ou grappes, comme « Émotions », « Faits » ou « Lieux ». Elle peut ensuite charger instantanément le bon dossier dans le cerveau de l'IA lorsque vous commencez une conversation, de sorte que l'IA se souvienne de qui vous êtes et de ce que vous aimez sans que vous ayez à le lui rappeler à chaque fois. Tout ce système est conçu pour fonctionner sur de petits appareils à faible consommation, rendant possible l'existence d'un assistant IA super intelligent et riche en mémoire, directement dans votre poche.
Les auteurs sont très confiants dans leurs calculs. Ils ont prouvé que pour ce type spécifique d'IA, la méthode de la « carte de résumé » n'est pas une approximation ou une supposition ; elle est mathématiquement identique à la lecture du texte. Cependant, ils soulignent également que cette astuce ne fonctionne que pour ce type spécifique d'architecture d'IA. Les modèles d'IA plus courants (appelés Transformers) sont construits différemment ; ils s'emmêlent dans l'ordre des mots, on ne peut donc pas simplement remplacer le texte par une carte de résumé. Pour ces modèles, vous devez toujours relire le texte à chaque fois. Mais pour l'avenir de l'IA de bord, petite et rapide, ce document suggère une voie où nous pouvons disposer d'une mémoire puissante sans le bagage lourd d'une lecture lente.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.