← Derniers articles
💬 NLP

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

Ce document introduit le Décodage Caché (Hidden Decoding), une nouvelle méthode de mise à l'échelle qui améliore les grands modèles de langage en étendant le calcul des jetons le long de la dimension de la longueur de séquence par factorisation de flux, permettant des gains de performance significatifs aux échelles frontières sans modifier l'architecture fixe du Transformer ni engendrer de coûts d'entraînement prohibitifs.

Auteurs originaux : Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Sh
Publié 2026-07-10
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Shi, Jing Lei, Junjie Zhang, Laiyi Li, Le Tian, Linhao Zhang, Miao Fan, Sijun Zhang, Wei Jia, Weiwei Shi, Wenhan Li, Wentao Zhao, Wenteng Liang, Xiao Zhou, Xiaojin Zhou, Xihuai Wang, Xinyu Gao, Xuanliang Wang, Xuyang Ao, Yang Yu, Yangxiu You, Yinuo Zhao, Yufei Kuang, Yufei Wang, Yuan Liu, Yuan Liu, Yuwen Chen, Zhencong Tian, Zhongyin Zhao, Zilin Yu, Zitao Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez un cerveau de robot super intelligent (un grand modèle de langage) qui est déjà assez incroyable. Habituellement, pour le rendre encore plus intelligent, les scientifiques essaient d'agrandir le cerveau — en ajoutant plus de couches, plus de neurones, plus de tout. Mais c'est comme essayer de construire un gratte-ciel sur un gratte-ciel : cela coûte une fortune, cela prend un temps infini, et parfois l'équipe de construction (les ordinateurs d'entraînement) ne peut tout simplement pas gérer une telle taille.

L'équipe IA de WeChat a posé une question différente : Et si nous gardions le cerveau exactement de la même taille, mais que nous lui donnions plus de temps pour réfléchir à chaque mot ?

Le problème de la « boucle »

Certains chercheurs ont essayé de résoudre cela en faisant « boucler » la réflexion du robot. Imaginez un étudiant lisant une phrase, puis la relisant, puis encore une fois, utilisant les mêmes cellules cérébrales encore et encore pour obtenir une meilleure réponse. C'est ce qu'on appelle un modèle « bouclé » ou « récurrent ».

Mais voici le hic : quand vous essayez d'entraîner les plus gros robots (ceux qui possèdent des centaines de milliards de paramètres), cette idée de boucle casse la chaîne de montage. Les ordinateurs qui entraînent ces modèles fonctionnent selon un pipeline, où chaque partie du cerveau fait son travail une seule fois et passe le témoin. Si vous faites en sorte que le robot s'arrête et relise la même phrase, toute la ligne s'immobilise, et les ordinateurs coûteux restent inactifs. C'est comme une usine dont le tapis roulant s'arrêterait sans cesse pour laisser un ouvrier refaire la même vis ; l'usine s'arrête net.

La solution : le « Décodage Caché » (La chaîne de montage secrète)

L'équipe de WeChat a trouvé une astuce ingénieuse appelée Décodage Caché (Hidden Decoding). Au lieu de faire lire le mot au robot plusieurs fois en boucle, ils font lire le mot plusieurs fois à la fois, mais dans des voies secrètes parallèles.

Pensez à une équipe de course automobile. Au lieu d'envoyer une seule voiture faire trois tours de piste pour obtenir le meilleur temps, ils envoient quatre voitures identiques (des flux) sur la piste simultanément.

  1. La configuration : Quand le robot voit un mot (comme « pomme »), il ne le transforme pas seulement en un code. Il le transforme en quatre codes différents, chacun allant dans sa propre voie secète.
  2. Le travail secret : Ces quatre voies traversent les couches du cerveau. Les trois premières voies sont « cachées ». Elles font tout le gros du travail, de la réflexion et du raisonnement, mais elles n'ont pas encore le droit de donner la réponse. Elles sont comme l'équipe de réflexion dans la salle arrière.
  3. Le dernier mot : Seule la quatrième voie (le flux final) est autorisée à crier le mot suivant. Le cerveau n'est évalué que sur cette réponse finale.
  4. La mémoire : Crucialement, le cerveau se souvient de ce que les trois premières voies ont pensé. Il conserve leurs notes (appelées « caches Clé-Valeur ») afin que le mot suivant puisse lire les notes de réflexion du mot précédent.

De cette façon, le robot obtient quatre fois plus de puissance de réflexion pour chaque mot, mais il n'a pas besoin de construire un cerveau plus grand ni d'arrêter la chaîne de montage. Il traite simplement une séquence de données plus longue en une seule fois.

Rendre cela abordable : l'astuce de la « Factorisation par Flux »

Vous pourriez penser : « Attendez, si j'ai quatre voies qui se parlent, est-ce que les mathématiques ne vont pas devenir incroyablement compliquées ? » Si chaque voie essayait de parler à toutes les autres à chaque étape, le coût exploserait (il serait multiplié par 16 !).

Pour correr cela, l'équipe a utilisé une méthode appelée Attention Factorisée par Flux (Stream-Factorized Attention).

  • La plupart du temps : Les voies restent dans leurs propres bulles. La voie 1 parle à la voie 1, la voie 2 à la voie 2. Elles ne se dérangent pas.
  • Parfois : Seules quelques couches spécifiques permettent aux voies d'échanger des notes et de mélanger leurs idées.

Cela permet de maintenir un coût bas. Au lieu que le coût ne soit multiplié par 16, il n'augmente que d'environ 4,4 à 5,1 fois (ce qui est proche de l'augmentation de 4x des voies). Cela rend possible l'entraînement de ces modèles super-grands sans se ruiner.

Est-ce que ça a marché ?

L'équipe a testé cela sur deux modèles massifs : un avec 80 milliards de paramètres et un géant de 617 milliards. Ils n'ont pas changé la taille du cerveau ; ils ont simplement activé le mode « 4 voies ».

  • Les résultats : Les modèles sont devenus plus intelligents. Sur des tests difficiles de mathématiques et de sciences, le modèle de 617 milliards a amélioré son score au test « GPQA Diamond » de 89,1 à 91,2. Sur le test de physique « PHYBench », il est passé de 75,3 à 76,3.
  • La tendance : Ils ont également testé avec 2 voies, 4 voies et 8 voies. À mesure qu'ils ajoutaient des voies, les scores continuaient de grimper. Cela suggère que l'ajout de « voies de réflexion » est un véritable moyen de rendre les modèles plus intelligents sans reconstruire de nouveaux modèles.

Ce qu'ils ont écarté

L'équipe a pris soin de vérifier s'il ne s'agissait pas d'un simple coup de chance. Ils ont testé d'autres façons d'utiliser les voies supplémentaires :

  • Forcer chaque voie à deviner : S'ils forçaient les trois premières voies à prédire aussi la réponse (au lieu de seulement la dernière), le modèle devenait en fait moins bon.
  • Mélanger les réponses : S'ils faisaient simplement la moyenne des pensées des quatre voies, cela ne fonctionnait pas aussi bien que de laisser la voie finale décider.
  • Partager les notes : S'ils faisaient en sorte que les voies partagent les mêmes notes de mémoire au lieu de garder leurs propres notes, le modèle était légèrement moins précis.

Cela prouve que la recette secrète consiste à laisser les premières voies effectuer une réflexion silencieuse et privée et à garder leurs notes séparées, afin que la voie finale puisse utiliser cette sagesse profonde et accumulée pour faire la meilleure supposition.

L'essentiel

Le Décodage Caché montre que vous n'avez pas toujours besoin d'un cerveau plus gros pour être plus intelligent. Parfois, vous avez juste besoin de donner au cerveau plus de temps pour réfléchir en parallèle. En transformant un seul mot en une chaîne de montage secrète de pensées, l'équipe de WeChat a trouvé un moyen d'augmenter l'intelligence des modèles de pointe sans le coût massif de la construction d'un nouveau cerveau plus grand. C'est une manière pratique et adaptée à l'ingénierie d'extraire plus d'intelligence des modèles que nous possédons déjà.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →