← Derniers articles
🤖 machine learning

Fast and Expressive Multi-Byte Prediction with Probabilistic Circuits

Cet article introduit MTPC, un cadre basé sur les circuits probabilistes pour la prédiction multi-jetons qui optimise le compromis entre expressivité et latence en encodant des distributions conjointes sur les jetons futurs, accélérant ainsi considérablement la génération de LLM au niveau des octets et des sous-mots tout en préservant les performances du modèle original.

Auteurs originaux : Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo Ponti, Antonio Vergari

Publié 2026-06-03
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo Ponti, Antonio Vergari

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'écrire une histoire, mais que vous avez une règle très stricte : vous ne pouvez écrire qu'une seule lettre à la fois. Chaque fois que vous tapez une lettre, vous devez vous arrêter, réfléchir et demander à votre cerveau super intelligent (l'IA) ce qui vient ensuite. C'est ainsi que fonctionne la plupart des grands modèles de langage (LLM) actuels. C'est précis, mais c'est incroyablement lent, surtout si vous écrivez en "octets" (les blocs de construction bruts du texte) plutôt qu'en mots entiers, car vous devez taper des milliers de lettres pour écrire une seule phrase.

Le document présente une nouvelle méthode appelée MTPC (Multi-Token Prediction Circuits) pour résoudre ce problème de vitesse sans perdre la qualité de l'histoire.

Voici comment cela fonctionne, en utilisant quelques analogies de la vie quotidienne :

1. Le Problème : Le "Jeu de Devinettes" vs La "Boule de Cristal"

Pour accélérer les choses, les chercheurs ont tenté une astuce appelée Multi-Token Prediction (MTP). Au lieu de deviner une seule lettre, l'IA essaie de deviner un bloc entier de lettres d'un coup (comme deviner les 8 prochaines lettres d'un mot).

  • L'Ancienne Méthode (Hypothèse d'Indépendance) : Imaginez que vous devinez les 8 prochaines lettres d'un mot, mais que vous traitez chaque lettre comme si elle n'avait aucune relation avec les autres. Vous devinez la première lettre, puis la deuxième, puis la troisième, en ignorant complètement que si la première est un "C", la deuxième est peu probable d'être un "Z".

    • Le Résultat : C'est rapide, mais cela mène à l'absurde. Vous pourriez obtenir "Cretoria" au lieu de "Pretoria" ou "Craporia" parce que le modèle n'a pas réalisé que ces lettres devaient s'assembler. C'est comme essayer de construire une maison en choisissant des briques au hasard sans vérifier si elles s'emboîtent.
  • La Nouvelle Méthode (MTPC) : Les auteurs disent : "Arrêtons de deviner des lettres de manière isolée. Devinons tout le bloc comme un groupe connecté." Ils utilisent un outil mathématique appelé Circuit Probabiliste.

    • L'Analogie : Considérez l'ancienne méthode comme une file de personnes se passant un mot, où chacun chuchote un mot aléatoire. La nouvelle méthode est comme un chef d'orchestre dirigeant un orchestre. Le chef (le circuit) sait que si le premier instrument joue un accord de Do majeur, les instruments suivants doivent jouer des notes qui s'accordent avec cet accord. Il comprend les dépendances entre les lettres.

2. La Boîte à Outils : L'"Architecte de Circuits"

Le document propose un cadre flexible (MTPC) qui vous permet de choisir à quel point les lettres doivent être "connectées". Ils proposent différentes "architectures" (formes de circuits) pour équilibrer vitesse et intelligence :

  • FF (Entièrement Factorisé) : Le mode "Devinette Aléatoire". Rapide, mais stupide. (Les membres de l'orchestre jouent seuls).
  • CP (Polyadique Canonique) : Un "Devinage de Groupe". Ils devinent quelques thèmes principaux et construisent les lettres autour de ceux-ci. Un peu plus intelligent.
  • HMM (Modèle de Markov Caché) : Une "Réaction en Chaîne". La première lettre influence la seconde, qui influence la troisième, et ainsi de suite. C'est très intelligent mais lent car vous devez attendre qu'une lettre soit terminée avant de commencer la suivante.
  • BTree (Arbre Binaire) : Le "Rassemblement d'Équipe". C'est la star du document. Imaginez diviser les 8 lettres en deux groupes de 4. Le modèle devine le premier groupe et le second groupe en même temps, mais ils sont liés par un "chef d'équipe" (une variable cachée) qui garantit qu'ils s'accordent sur le thème général.
    • Pourquoi c'est génial : Cela obtient l'intelligence de la "Réaction en Chaîne" mais la vitesse de la "Devinette Aléatoire" car il fait deux choses à la fois.

3. Le Filet de Sécurité : Le "Décodage Spéculatif"

Vous pourriez vous inquiéter : "Si l'IA devine un bloc entier d'un coup, et qu'elle se trompe ?"

Le document utilise une technique appelée Décodage Spéculatif.

  • L'Analogie : Imaginez un coureur rapide (le Modèle de Brouillon) et un juge lent mais ultra-précis (le Vérificateur).
    1. Le coureur rapide sprinte devant et devine les 8 prochaines lettres.
    2. Le juge lent vérifie ces lettres une par une.
    3. Si le juge est d'accord avec la supposition du coureur, parfait ! Nous gardons ces lettres.
    4. Si le juge n'est pas d'accord, nous nous arrêtons pile là, nous écartons les mauvaises suppositions, et nous ne gardons que celles que le juge a approuvées.

Parce que le Modèle de Brouillon (MTPC) est si bon pour comprendre comment les lettres se connectent (grâce au circuit BTree), le juge est d'accord avec le coureur beaucoup plus souvent qu'auparavant. Cela signifie que nous pouvons garder plus de suppositions rapides, accélérant ainsi tout le processus.

4. Les Résultats : Accélérer sans rien casser

Les auteurs ont testé cela sur deux modèles d'IA spécifiques :

  1. EvaByte : Un modèle qui écrit déjà en octets.
  2. Llama 3.2 3B (Byte) : Un modèle populaire converti pour écrire en octets.

Les Conclusions :

  • Accélération Massive : Comparée à l'ancienne méthode "une lettre à la fois", la MTPC a rendu EvaByte 5,15 fois plus rapide et Llama 2,24 fois plus rapide.
  • Meilleur que l'astuce de l'"Indépendance" : Même comparée à d'autres méthodes rapides qui devinent simplement les lettres de manière indépendante, la MTPC était 1,17 fois plus rapide.
  • Aucune Perte de Qualité : Crucialement, grâce au "Filet de Sécurité" (Décodage Spéculatif), la qualité de la sortie finale est exactement la même que si l'IA l'avait écrite une lettre à la fois. Vous ne perdez pas de précision pour gagner de la vitesse.

Résumé

Le document présente une nouvelle façon de rendre la génération de texte par l'IA plus rapide en apprenant à l'IA à deviner des blocs de texte comme un groupe connecté plutôt que comme des lettres isolées. En utilisant une structure intelligente de "Binaire Tree" (BTree) pour organiser ces devinettes et un "Juge" pour les vérifier, ils ont obtenu un boost de vitesse massif (jusqu'à 5x) tout en garantissant que le texte reste parfait. C'est comme apprendre à un dactylo à taper des mots entiers d'un coup, mais avec un filet de sécurité qui attrape instantanément les fautes de frappe.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →