← Derniers articles
💬 NLP

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

L'article propose Pair-In, Pair-Out (PIPO), un cadre unifié qui combine la compression d'entrée latente avec la prédiction de sortie multi-jetons et un mécanisme d'acceptation léger basé sur la confiance pour obtenir des accélérations significatives de la latence et une amélioration des performances de raisonnement dans les grands modèles de langage, sans la surcharge d'un passage de vérification distinct.

Auteurs originaux : Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

Publié 2026-05-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un grand modèle de langage (LLM) comme un scribe très intelligent, mais très lent, qui écrit des histoires un mot à la fois. Pour résoudre un problème mathématique difficile ou écrire un code complexe, ce scribe doit réfléchir à voix haute, générant une longue « chaîne de pensée » avant d'écrire la réponse finale. Le problème est que écrire un mot, s'arrêter, réfléchir, puis écrire le mot suivant est incroyablement lent et coûteux.

L'article présente une nouvelle méthode appelée PIPO (Pair-In, Pair-Out) pour rendre ce scribe beaucoup plus rapide sans le faire commettre davantage d'erreurs. Voici comment cela fonctionne, en utilisant des analogies simples :

1. Le Problème : Le Goulot d'Étranglement « Un Pas à la Fois »

Actuellement, le scribe fonctionne comme une personne tapant sur une machine à écrire : elle tape une lettre, appuie sur « Entrée », attend que la machine traite, tape la lettre suivante, et ainsi de suite. Même si le scribe est intelligent, la machine est lente car elle ne peut traiter qu'une seule lettre par cycle.

2. La Solution : Le Bus « À Double Étage » (PIPO)

PIPO change les règles de la route. Au lieu que le scribe traite un mot à la fois, PIPO lui permet de traiter deux mots à la fois.

  • Pair-In (La Compression) : Imaginez que le scribe reçoit une pile de deux lettres (par exemple « T » et « h »). Au lieu de les introduire séparément dans la machine, un « compresseur » spécial les plie ensemble en un seul paquet compact (une représentation latente). C'est comme plier une grande carte en un petit mouchoir de poche pour qu'elle passe par une porte étroite.
  • Le Voyage : La machine traite ce seul paquet « plié ».
  • Pair-Out (Le Dépliement) : Une fois que la machine a terminé, elle ne crache pas seulement une lettre. Elle possède une tête spéciale de « dépliement » qui prend le résultat et produit instantanément deux lettres : le mot suivant attendu et un mot brouillon prédit (par exemple « e » et « »).

Le Résultat : Le scribe écrit désormais deux lettres pour chaque cycle unique de la machine. Cela double efficacement la vitesse d'écriture.

3. Le Risque : Le « Jeu de Devinettes »

Il y a un piège. Prédire le deuxième mot est une devinette. Si la devinette est fausse, toute la phrase pourrait devenir du non-sens.

  • Ancienne Méthode (Décodage Spéculatif) : Auparavant, pour vérifier si une devinette était juste, le scribe devait s'arrêter, exécuter un énorme test de « vérification » (comme un rédacteur en chef relisant tout le brouillon), puis décider si la devinette était bonne. Cette étape de vérification était si lente qu'elle annulait les gains de vitesse.
  • La Méthode de PIPO (La Tête de Confiance) : PIPO installe un tout petit « compteur de confiance » ultra-rapide juste à côté du scribe. Ce compteur est entraîné à regarder les deux mots et à dire instantanément : « Je suis sûr à 95 % que ce deuxième mot est correct », ou « Je ne suis pas sûr, sautons-le ».
    • Si le compteur dit « Allez », le scribe garde les deux mots.
    • Si le compteur dit « Non », le scribe garde le premier mot et remplace le deuxième par un « vide » (remplissage) pour maintenir le rythme.

4. L'Ingrédient Secret : Apprendre des Erreurs (Distillation On-Policy)

Comment le « compteur de confiance » apprend-il à être si précis sans un éditeur lent ?

L'article utilise une astuce d'entraînement ingénieuse appelée Distillation On-Policy.

  • Imaginez que le scribe (l'élève) essaie d'écrire une histoire.
  • Un professeur ultra-intelligent (un modèle plus grand, pré-entraîné) écrit également l'histoire.
  • Le système compare la devinette de l'élève avec la réponse du professeur.
  • La Magie : Le système réalise que le « professeur » fait exactement le même travail que l'« éditeur » dans l'ancienne méthode. Ainsi, au lieu d'exécuter une vérification d'éditeur lente à chaque fois, le système utilise les réponses du professeur pour entraîner le petit « compteur de confiance » pendant la phase d'apprentissage.
  • Une fois entraîné, le compteur de confiance sait exactement quand faire confiance à la devinette et quand être prudent, le tout sans avoir besoin de l'éditeur lent pendant le processus d'écriture réel.

5. Les Résultats : Plus Rapide et Plus Intelligent

L'article a testé cela sur des tâches mathématiques et de codage difficiles (comme la compétition mathématique AIME et des benchmarks de codage).

  • Vitesse : Parce qu'il traite deux mots à la fois et saute la vérification lente de l'éditeur, PIPO est 2 à 2,6 fois plus rapide que la méthode standard. Il produit le premier mot beaucoup plus rapidement et maintient le flux en mouvement.
  • Précision : Étonnamment, il ne s'est pas seulement accéléré ; il est devenu meilleur. En intégrant plus de « pensée » dans la même quantité d'espace (car il compresse l'entrée), le modèle pouvait générer des chaînes de raisonnement plus longues et plus complètes. Sur certains tests, le taux de réussite a bondi de plus de 7 points par rapport aux méthodes normales.

Résumé

PIPO est comme la mise à niveau d'un camion de livraison d'une route à une seule voie vers une autoroute à deux voies.

  1. Compresser la cargaison (entrée) pour faire entrer deux colis dans un seul emplacement.
  2. Livrer deux colis à la fois (sortie).
  3. Utiliser un capteur intelligent (tête de confiance) pour décider si le deuxième colis est sûr à garder, entraîné par un professeur qui connaît déjà la réponse.

Cela permet à l'IA de réfléchir plus longtemps et de répondre plus vite, résolvant des problèmes complexes sans le ralentissement habituel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →