← Derniers articles
🤖 machine learning

Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding

Cet article introduit Set Diffusion, une nouvelle classe de modèles de langage qui combine la génération de ensembles de jetons de type ordre arbitraire et flexible avec le support du cache KV pour parvenir à une inférence plus rapide et des compromis vitesse-qualité supérieurs par rapport aux approches autorégressives et de diffusion par blocs existantes.

Auteurs originaux : Marianne Arriola, Volodymyr Kuleshov

Publié 2026-07-03
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Marianne Arriola, Volodymyr Kuleshov

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vue d'ensemble : Le problème de l'« Ordre »

Imaginez que vous essayez d'écrire une histoire ou de résoudre un problème mathématique. Il existe deux manières principales de le faire :

  1. L'Écrivain Rigoureux (Autorégressif) : Vous écrivez un mot à la fois, strictement de gauche à droite. Vous ne pouvez pas écrire la fin avant d'avoir terminé le début. C'est très qualitatif et précis, mais c'est lent car vous ne pouvez pas faire deux choses à la fois.
  2. L'Artiste du Chaos (Diffusion Standard) : Vous commencez avec une page remplie de charabia (bruit) et vous essayez de tout corriger d'un coup. Vous pouvez deviner de nombreux mots simultanément, ce qui est rapide, mais il est difficile de garder une histoire logique. De plus, vous ne pouvez pas facilement « vous souvenir » de ce que vous avez écrit précédemment pour vous aider à écrire la partie suivante, donc vous devez relire toute la page à chaque fois que vous effectuez un changement.

Le Problème : Les tentatives précédentes pour mélanger ces deux approches (appelées « Block Diffusion » ou Diffusion par Blocs) étaient comme écrire par blocs rigides. Vous pouviez écrire une phrase à la fois au lieu d'un mot, mais vous deviez toujours terminer toute cette phrase avant de passer à la suivante. Si vous vouliez corriger un mot au milieu de l'histoire, vous deviez attendre que tout le bloc soit terminé.

La Solution : Set Diffusion

Les auteurs introduisent la Set Diffusion. Ne voyez pas cela comme l'écriture en ligne, mais comme le remplissage d'un puzzle avec des pièces flexibles.

Au lieu d'être forcé d'écrire mot par mot (trop lent) ou bloc par bloc (trop rigide), la Set Diffusion vous permet de choisir n'importe quel groupe de mots à générer ensuite, tant que vous respectez un ensemble de règles spécifiques.

L'analogie de la « Fenêtre Glissante »

Imaginez que vous peignez une longue fresque murale.

  • L'ancienne méthode (Block Diffusion) : Vous peignez une section de 1,2 mètre, vous attendez qu'elle soit complètement sèche, puis vous passez à la section suivante. Vous ne pouvez pas retoucher la première section tant que tout le bloc n'est pas terminé.
  • La nouvelle méthode (Set Diffusion) : Vous avez une fenêtre de peinture glissante. Vous pouvez peindre le premier mètre, puis vous pouvez faire glisser cette fenêtre pour peindre le 2e, le 3e et le 4e mètre simultanément avec le 5e, le 6e et le 7e mètre. Vous pouvez même revenir en arrière pour corriger un endroit au milieu de la fenêtre pendant que vous peignez le bord.

Explication simple des caractéristiques clés

1. Des « Ensembles de Tokens » flexibles (Les pièces du puzzle)
Dans ce modèle, un « token » est simplement un mot ou un morceau de code.

  • L'innovation : Le modèle ne se contente pas de deviner le mot suivant. Il devine un ensemble de mots.
  • La magie : Vous pouvez dire au modèle : « Devine les 3 prochains mots », ou « Devine le mot à la position 5 et à la position 10 ». Il peut gérer des groupes de tailles différentes et dans des ordres différents. Cela lui permet d'être rapide (en devinant de nombreuses choses à la fois) tout en restant intelligent (en gardant l'ordre en mémoire).

2. La « Banque de Mémoire » (KV Caching)
En IA, le « KV Caching » est comme un bloc-notes où le modèle note le contexte de ce qu'il a déjà généré pour ne pas avoir à le recalculer à chaque fois.

  • Le vieux problème : Dans la diffusion standard, le modèle devait relire l'intégralité du texte à chaque fois qu'il faisait une supposition. C'était comme lire un livre entier juste pour se souvenir du nom du personnage principal.
  • La nouvelle solution : La Set Diffusion met à jour son « bloc-notes » après chaque étape. Dès qu'elle devine un ensemble de mots, elle les enregistre en mémoire. Cela la rend incroyablement rapide, semblable à l'écrivain rigoureux, mais avec la vitesse de l'artiste du chaos.

3. La stratégie de la « Fenêtre Glissante »
Le papier introduit une manière spécifique de choisir quels mots deviner ensuite, appelée l'approche par Fenêtre Glissante (Sliding-Window).

  • Imaginez un projecteur qui balaie une scène. Le projecteur peut éclairer un seul acteur, ou il peut éclairer trois acteurs à la fois.
  • Le modèle utilise ce projecteur pour décider : « Je vais générer les mots qui se trouvent à l'intérieur de ce projecteur en ce moment même. »
  • En ajustant la taille du projecteur, vous pouvez contrôler l'équilibre entre la vitesse (grand projecteur, on devine beaucoup de mots) et la précision (petit projecteur, on devine moins de mots pour être plus prudent).

Qu'ont-ils prouvé ?

Les auteurs ont testé cette nouvelle méthode sur trois tâches principales :

  1. Raisonnement Mathématique : Résoudre des problèmes de logique (comme le jeu de données GSM8K).
  2. Résumé (Summarization) : Condenser de longs articles en résumés courts.
  3. Infilling (Remplissage) : Remplir les parties manquantes d'une histoire (comme un jeu de « texte à trous »).

Les Résultats :

  • Vitesse vs Qualité : La Set Diffusion a trouvé un « point d'équilibre » que les modèles précédents avaient manqué. Elle était plus rapide que les modèles rigides par blocs et plus précise que les modèles de diffusion chaotiques.
  • Infilling : Elle est nettement meilleure pour remplir les parties manquantes d'une histoire que la méthode précédente de « Block Diffusion ».
  • Flexibilité : Elle peut générer du texte de n'importe quelle longueur et dans n'importe quel ordre, ce qui est crucial pour des tâches comme l'édition d'un document ou la correction de code au milieu d'un fichier.

Métaphore de synthèse

Si l'Autoregressif est une course de relais (un coureur passe le témoon au suivant, strictement dans l'ordre) et la Diffusion Standard est un joyeux désordre (tout le monde court en même temps, mais c'est chaotique), alors la Set Diffusion est une troupe de danseurs bien coordonnée.

Les danseurs (tokens) peuvent se déplacer en groupes (ensembles). Ils peuvent se déplacer de gauche à droite, ou ils peuvent sauter partout pour combler les vides, mais ils savent toujours exactement qui est à côté d'eux et quels étaient les mouvements précédents, grâce à leur mémoire partagée (KV cache). Cela leur permet d'exécuter des routines complexes (mathématiques, histoires) beaucoup plus rapidement et avec plus de flexibilité que l'équipe de relais, sans le chaos du désordre total.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →