← Derniers articles
🤖 machine learning

Approximate Speculative Decoding

Cet article introduit l'Approximate Speculative Decoding (ASD), une méthode sans entraînement qui accélère la génération autorégressive en acceptant sélectivement les décalages de jetons de brouillon basés sur un budget de regret afin de réutiliser des suffixes valides, améliorant ainsi le débit sans nécessiter de nouveaux modèles de brouillon ou de réglage fin.

Auteurs originaux : Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

Publié 2026-08-05
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'écrire une histoire avec un ami très intelligent, mais incroyablement lent. Chaque fois que vous voulez ajouter un nouveau mot à votre histoire, vous devez attendre que votre ami réfléchisse intensément, consulte toute sa bibliothèque de connaissances et vous dise exactement quel mot vient ensuite. C'est ainsi que fonctionnent les modèles de langage IA modernes : ils génèrent du texte un mot à la fois, et la partie « réflexion » prend la majeure partie du temps, ce qui donne l'impression de regarder la peinture sécher. Pour accélérer cela, les scientifiques ont inventé une astuce appelée « décodage spéculatif ». Imaginez que vous avez un assistant junior rapide qui devine les prochains mots pour vous. Vous demandez ensuite à votre ami expert, plus lent, de vérifier rapidement si ces suppositions sont correctes. Si l'expert est d'accord, vous pouvez écrire plusieurs mots à la fois au lieu d'un seul, ce qui permet de gagner un temps précieux.

Cependant, il y a un piège. Votre ami expert est un adepte des règles. Si l'assistant devine même un seul mot qui n'est pas le choix absolument parfait que l'expert aurait choisi, l'expert interrompt immédiatement tout le processus. Il jette tous les autres mots que l'assistant a devinés pour ce tour, même si la plupart d'entre eux étaient parfaits. C'est comme un professeur qui corrige une copie et arrête de lire dès qu'il voit une seule erreur, jetant le reste de la feuille à la poubelle. Cette règle du « tout ou rien » maintient la perfection de l'histoire, mais elle gaspille une grande partie du travail acharné de l'assistant.

Ce document présente une nouvelle méthode appelée Approximate Speculative Decoding (ASD), qui agit comme un professeur plus intelligent et plus flexible. Au lieu de jeter tout l'examen à cause d'une petite erreur, l'ASD demande : « Est-ce que cette erreur est minime ? Et l'assistant a-t-il quand même réussi les mots suivants ? » Si la réponse est oui, l'ASD accepte la petite erreur, conserve les bons mots qui suivent, et continue. C'est comme un professeur qui dirait : « Tu as mal orthographié "parce que", mais tu as parfaitement écrit les dix mots suivants, alors corrigeons juste le mot et continuons. » Les chercheurs ont découvert qu'en étant légèrement plus indulgents avec les petites erreurs, ils pouvaient faire écrire l'IA beaucoup plus vite sans altérer la qualité de l'histoire.

L'histoire de l'assistant « budgétisé »

L'idée centrale de l'ASD est de ne plus traiter chaque erreur comme une catastrophe. Dans l'ancienne méthode, si votre assistant devinait un mot qui n'était pas le premier choix, le système s'arrêtait immédiatement. Mais les auteurs ont réalisé que parfois, la supposition « erronée » de l'assistant est en réalité très proche de la bonne, et que les mots qui suivent sont toujours parfaits.

Pour corriger cela, l'équipe a créé un système avec un budget. Imaginez que vous avez un bocal de « jetons d'erreur ». Vous êtes autorisé à commettre quelques petites erreurs, mais vous devez les payer en utilisant votre bocal.

  1. La Porte Locale (Local Gate) : Avant d'accepter une erreur, le système vérifie à quel point elle est « mauvaise ». Si la supposition de l'assistant est seulement légèrement moins probable que le mot parfait, c'est une erreur peu coûteuse. S'il s'agit d'une erreur énorme, elle coûte trop de jetons, et le système dit « non ».
  2. Le Plafond de Bloc (Block Cap) : Vous ne pouvez pas faire trop d'erreurs dans un seul lot de suppositions. Cela empêche l'assistant de devenir trop imprécis d'un seul coup.
  3. Le Budget de Requête (Request Budget) : Il s'agit du bocal total de jetons pour toute la conversation. Une fois que vous avez épuisé vos jetons, vous devez revenir à la perfection (en suivant strictement les anciennes règles) pour le reste de l'histoire.

La magie opère lorsque le système accepte une petite erreur. Parce que les prochaines suppositions de l'assistant étaient en fait parfaites (elles correspondaient à ce que l'expert aurait choisi), le système peut les « réutiliser ». Il n'a pas besoin de demander à l'expert lent de les vérifier à nouveau. Il les accepte simplement et avance. Cela transforme un moment de « arrêt et rejet » en un moment de « correction et continuation ».

Ce qu'ils ont découvert

Les chercheurs ont testé cette idée en utilisant des modèles d'IA très populaires (comme Qwen3 et DeepSeek) sur une variété de tâches, allant de la résolution de problèmes mathématiques à l'écriture de code. Ils n'ont pas eu besoin de réentraîner les modèles ni d'apprendre quoi que ce soit de nouveau à l'assistant ; ils ont simplement changé la façon dont le « professeur » (le vérificateur) corrigeait le travail.

Les résultats sont très prometteurs. En utilisant cette approche budgétisée, le système est devenu plus rapide sans nécessiter d'entraînement supplémentaire.

  • Sur un ensemble de sept tâches différentes, le système a été 7,78 % plus rapide en moyenne par rapport à la méthode ancienne et stricte.
  • Dans les meilleurs cas, comme sur le jeu de données MATH-500, la vitesse a augmenté de 11,73 %.
  • Lorsqu'ils l'ont testé sur un modèle massif appelé DeepSeek-V4-Flash, ils ont constaté que les taux d'acceptation (le nombre de suppositions conservées par le système) augmentaient d'environ 10 % à 16 %.

Le document précise avec prudence que ce n'est pas une baguette magique qui rend tout parfait. Les auteurs affirment explicitement que cette méthode modifie le chemin emprunté par l'IA pour parvenir à la réponse. Parfois, l'histoire peut être légèrement différente, ou le « hash » (l'empreinte numérique du texte) peut changer, même si la réponse finale est correcte. Par exemple, sur certains tests de codage, la précision a légèrement chuté (de moins de 1,5 point de pourcentage), mais sur de nombreuses autres tâches, la précision est restée exactement la même ou s'est même légèrement améliorée.

Pourquoi cela importe

La beauté de ce document est qu'il ne nécessite pas de construire une nouvelle IA plus rapide ou d'entraîner un nouvel assistant. Il change simplement les règles du jeu pour celui que vous avez déjà. C'est comme réaliser qu'un policier de la circulation très strict ralentit toute la ville parce qu'il arrête les voitures pour chaque infraction mineure, alors qu'une approche plus flexible permettrait de maintenir la circulation fluide avec des risques minimes et gérables.

Les auteurs suggèrent que cette méthode est un excellent moyen d'extraire plus de vitesse des systèmes d'IA actuels. Ils soulignent que, bien que les gains de vitesse soient réels et mesurables (jusqu'à 15,26 % dans certains cas), les utilisateurs doivent être conscients qu'ils troquent une part de perfection stricte contre beaucoup de vitesse. C'est un compromis calculé : vous faites écrire votre histoire beaucoup plus vite, et pour la plupart des gens, les légères différences de formulation n'auront aucune importance. Le document conclut que cette approche « budgétisée » est un moyen pratique, sans réentraînement, de rendre la génération par IA plus rapide, à condition de vérifier les résultats pour s'assurer que la qualité est toujours suffisante pour vos besoins.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →