← Derniers articles
💬 NLP

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

Cet article introduit Engram, un module de mémoire conditionnelle évolutif qui modernise les plongements NN-gramme pour une recherche en O(1)O(1), révélant une loi d'allocation de parcimonie en forme de U qui optimise le compromis entre calcul neuronal et mémoire statique pour améliorer significativement les performances de raisonnement, de codage et de récupération de contexte long dans les grands modèles de langage.

Auteurs originaux : Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Z
Publié 2026-07-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Zhang, Yixu Wei, M. Y Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de résoudre un puzzle géant et complexe. Pendant longtemps, les solveurs de puzzles les plus intelligents (les modèles d'IA) ont été construits comme de gigantesques usines. Ils possèdent des milliers de travailleurs spécialisés (appelés « Mixture-of-Experts » ou MoE) qui n'interviennent que lorsqu'ils sont nécessaires pour résoudre une logique complexe ou de nouvelles idées. C'est excellent pour la réflexion, mais c'est un peu maladroit lorsqu'il s'agit de se souvenir de faits simples et ennuyeux.

Voyez cela ainsi : si vous demandiez à un mathématicien brillant : « Quelle est la capitale de la France ? », il ne se contenterait pas de dire « Paris ». Il devrait lancer une simulation mentale complète, redérivant la réponse à partir de zéro à chaque fois, dépensant ainsi énormément d'énergie cérébrale juste pour se rappeler quelque chose qu'il sait depuis toujours. C'est comme utiliser un superordinateur pour chercher un numéro de téléphone dans sa propre tête.

La Grande Découverte : Une « Fiche de Révision » pour le Cerveau
Les chercheurs de DeepSeek-AI et de l'Université de Pékin se sont demandé : Et si nous donnions à ces modèles une « fiche de révision » dédiée pour les choses qu'ils ont juste besoin de mémoriser ?

Ils ont introduit un nouvel outil appelé Engram. Au lieu de forcer l'IA à « réfléchir » à chaque mot, l'Engram agit comme une table de recherche ultra-rapide, en O(1) (ce qui signifie qu'il prend le même temps infime que l'on cherche un mot ou un million de mots). Il est basé sur une idée de l'ancienne école appelée N-grammes (regarder des groupes de mots ensemble), mais ils l'ont modernisée avec une technologie de pointe pour qu'elle fonctionne parfaitement à l'intérieur d'une IA géante.

Le Secret de la « Forme en U »
L'équipe a découvert une règle fascinante sur la façon de construire ces modèles, qu'ils appellent une loi d'échelle en forme de U.

Imaginez que vous ayez un budget fixe de « puissance cérébrale » (étapes de calcul). Vous pouvez dépenser tout votre budget pour les « travailleurs de la pensée » (MoE), ou vous pouvez tout dépenser pour la « fiche de révision de mémoire » (Engram).

  • Si vous dépensez 100 % pour les travailleurs de la pensée, le modèle est bon en logique mais mauvais pour se souvenir des faits.
  • Si vous dépensez 100 % pour la fiche de révision, le modèle se souvient des faits mais ne peut pas bien raisonner.
  • Le Point d'Équilibre : L'étude a montré que la meilleure performance se produit lorsque l'on répartit le budget. Vous avez besoin des deux. Plus précisément, ils ont découvert que prendre environ 20 à 25 % du budget de mémoire « disponible » aux travailleurs de la pensée pour le donner au module de mémoire Engram rend l'ensemble du système plus intelligent. C'est comme réaliser qu'un génie a besoin d'une bonne bibliothèque, et pas seulement d'un cerveau rapide.

Que s'est-il réellement passé ? (La Preuve)
Ils ont construit un modèle appelé Engram-27B et l'ont comparé à un modèle standard de « pensée seule » de taille et de vitesse identiques. Les résultats ont été étonnamment probants :

  • Connaissances : Il s'est amélioré sur les questions de culture générale et les faits (obtenant par exemple +3,4 sur MMLU et +4,0 sur CMMLU).
  • Raisonnement : Plus surprenant encore, il s'est nettement amélioré en raisonnement général et en énigmes logiques (obtenant +5,0 sur BBH et +3,7 sur ARC-Challenge).
  • Mathématiques et Code : Il s'est également amélioré en codage et en mathématiques (comme +3,0 sur HumanEval).

L'article suggère que cela se produit parce que le module Engram gère les choses « ennuyeuses » (comme se souvenir qu'« Alexandre le Grand » est un nom spécifique) afin que le cerveau principal n'ait pas à perdre de temps à reconstruire cette information. Cela libère les couches profondes de l'IA pour qu'elles puissent se concentrer sur une réflexion complexe et profonde. C'est comme avoir un secrétaire qui gère tous les rendez-vous pour que le PDG puisse se concentrer sur la stratégie.

L'Astuce de la « Mémoire Longue »
L'un des effets secondaires les plus cool est la manière dont ces modèles gèrent les histoires longues. Parce que le module Engram saisit instantanément les détails locaux, l'IA principale dispose de plus d'« attention » pour se souvenir de l'histoire du début à la fin. Dans les tests, le modèle Engram a pu trouver une aiguille spécifique dans une botte de foin textuelle 97,0 % du temps, alors que le modèle standard n'a réussi que 84,2 %.

La Magie du Matériel
Enfin, l'article soutient qu'il ne s'agit pas seulement d'une astuce logicielle, mais aussi d'une astuce compatible avec le matériel. Comme la « fiche de révision » utilise des adresses fixes (identifiants déterministes), l'ordinateur peut commencer à récupérer la prochaine partie de la mémoire pendant qu'il effectue encore les calculs pour la partie actuelle. Cela signifie qu'ils peuvent stocker une table massive de 100 milliards de paramètres sur le disque dur d'un ordinateur ordinaire (mémoire hôte) et obtenir des résultats presque aussi rapides que s'ils étaient sur le GPU ultra-rapide. La pénalité de vitesse était négligeable, moins de 3 %.

Ce qu'ils disent explicitement que ce n'est PAS
L'article est très clair sur ce que ce n'est pas :

  • Ce n'est pas simplement un vocabulaire plus large. Ils ont essayé d'agrandir le vocabulaire (OverEncoding), et cela n'a pas fonctionné aussi bien qu'Engram.
  • Ce n'est pas un remplacement de la partie « pensée ». Si vous supprimez entièrement les travailleurs de la pensée (MoE), le modèle échoue dans son raisonnement. La mémoire est une aide, pas un remplacement.
  • Ce n'est pas une solution miracle pour tout. L'article note que bien qu'il aide pour les faits et le raisonnement, la « structure dorsale » (l'IA principale) reste celle qui fait le gros du travail pour des choses comme la compréhension de texte, qui repose davantage sur le contexte que sur la mémoire statique.

À quel point en sont-ils sûrs ?
Les auteurs sont très confiants dans leurs mesures. Ils ne se sont pas contentés de simuler cela ; ils ont entraîné de vrais modèles sur 262 milliards de tokens de données et les ont testés sur des benchmarks réels. Ils ont démontré que la règle de la « forme en U » se vérifie pour différentes tailles et que les gains de performance sont réels, mesurables et reproductibles. Ils ont même visualisé les « portes » (gates) à l'intérieur du modèle pour montrer qu'il active réellement la mémoire spécifiquement pour des éléments comme les noms et les expressions, exactement comme ils l'avaient conçu.

En résumé, l'article suggère que l'avenir de l'IA ne consiste pas seulement à créer des cerveaux plus gros, mais à donner à ces cerveaux un moyen plus rapide, plus efficace et plus intelligent de chercher l'information.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →