← Derniers articles
🤖 machine learning

DiffGRM: Diffusion-based Generative Recommendation Model

Ce document présente DiffGRM, un modèle de recommandation générative basé sur la diffusion qui surmonte les limites des méthodes autorégressives en employant un cadre de diffusion discrète masquée avec des stratégies de tokenisation, d'entraînement et d'inférence spécialisées afin de permettre un contexte bidirectionnel et une supervision équilibrée pour une précision de recommandation améliorée.

Auteurs originaux : Zhao Liu, Yichen Zhu, Yiqing Yang, Xiao Lv, Guoping Tang, Rui Huang, Qiang Luo, Ruiming Tang, Kun Gai, Guorui Zhou

Publié 2026-08-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhao Liu, Yichen Zhu, Yiqing Yang, Xiao Lv, Guoping Tang, Rui Huang, Qiang Luo, Ruiming Tang, Kun Gai, Guorui Zhou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous déambulez dans une bibliothèque immense et infinie où chaque livre possède un code secret à la place d'un titre. Pour trouver le prochain livre que vous aimerez, un ordinateur doit deviner ce code, chiffre par chiffre. C'est le monde de la Recommandation Générative, une branche de l'intelligence artificielle qui tente de prédire ce que vous voulez voir ensuite — qu'il s'agisse d'une vidéo, d'une chanson ou d'un produit — en « écrivant » le code secret de cet article à partir de zéro.

Pendant longtemps, ces ordinateurs fonctionnaient comme un professeur strict lisant une histoire à haute voix, de gauche à droite. Ils devinaient le premier chiffre du code, puis le deuxième, puis le troisième, sans jamais regarder en arrière. Mais cette méthode présente un défaut : elle traite chaque partie du code comme si elle était également importante et aussi difficile à deviner. En réalité, certaines parties du code sont des indices faciles (comme « c'est une chaussure »), tandis que d'autres sont des détails complexes (comme « c'est une chaussure gauche de pointure 42 »). L'ancienne méthode se retrouvait souvent bloquée sur les parties difficiles car elle ne pouvait ni anticiper ni vérifier son travail, et elle perdait du temps à trop s'exercer sur les parties faciles. La question que les chercheurs se posaient était la suivante : pouvons-nous construire un système plus intelligent qui voit l'ensemble de l'image d'un coup, identifie les parties complexes et comble les lacunes plus efficacement ?

Voici DiffGRM, une nouvelle approche issue de chercheurs de Kuaishou, qui remplace l'ancien style de lecture « de gauche à droite » par quelque chose qui ressemble davantage à un groupe de détectives résolvant un mystère ensemble. Au lieu de deviner un chiffre à la fois, DiffGRM utilise une technique appelée diffusion discrète. Imaginez un jeu où vous commencez avec une page de texte qui a été complètement recouverte d'encre noire (des masques). Votre tâche est de découvrir quels étaient les mots originaux. L'ordinateur commence par deviner ce qui se trouve sous l'encre partout à la fois. Il ne devine pas aveuglément ; il examine toute la phrase pour voir quels mots sont les plus susceptibles d'être corrects.

L'article présente trois astuces ingénieuses pour rendre cela plus efficace que les anciennes méthodes. Premièrement, ils ont changé la façon dont les « codes secrets » sont créés. Au lieu d'une chaîne où un chiffre dépend du précédent, ils utilisent une méthode appelée Codage Sémantique Parallèle. Pensez à cela comme si l'on donnait à chaque détective une fiche d'indices séparée et indépendante. De cette façon, aucun indice n'est coincé en attendant un autre, et l'ordinateur peut deviner tous les chiffres en même temps sans être perturbé par une mauvaise supposition faite plus tôt dans la ligne.

Deuxièmement, l'équipe a réalisé que tous les devinettes ne se valent pas. Certaines parties du code sont faciles à déchiffrer, tandis que d'autres sont un véritable casse-tête. L'ancienne méthode traitait tout de la même manière, gaspillant ainsi de l'énergie pour les choses faciles. DiffGRM utilise une stratégie appelée Bruitage Cohérent On-policy. Imaginez un professeur qui sait exactement quels élèves sont en difficulté. Au lieu de poser les mêmes questions faciles à toute la classe, ce professeur concentre le temps de pratique spécifiquement sur les élèves qui rencontrent le plus de difficultés. L'ordinateur fait la même chose : il identifie les chiffres « difficiles » du code et concentre sa puissance d'apprentissage sur eux, ignorant les parties faciles qu'il maîtrise déjà.

Enfin, lorsqu'il est temps de faire la recommandation finale, l'ordinateur doit vous donner une liste d'options, et non pas une seule. L'ancienne méthode choisissait la meilleure supposition unique et s'arrêtait là. DiffGRM utilise le Débruitage Parallèle Guidé par la Confiance. C'est comme une équipe de détectives qui crient tous leurs meilleures suppositions en même temps. Le chef d'équipe choisit ensuite les suppositions les plus confiantes en premier, les complète, puis utilise cette nouvelle information pour résoudre le reste de l'énigme. Cela permet au système de générer une liste diversifiée de recommandations de premier plan rapidement et avec précision.

Les chercheurs ont testé ce nouveau système sur des données réelles provenant d'Amazon, dans des catégories telles que le Sport, la Beauté et les Jouets. Ils ont constaté que DiffGRM était nettement meilleur que les méthodes précédentes les plus performantes. Dans leurs tests, il a amélioré la précision des recommandations de 6,9 % à 15,5 % par rapport aux modèles existants les plus robustes. L'article suggère qu'en permettant à l'ordinateur de regarder l'ensemble du code à la fois et en concentrant son énergie sur les parties difficiles, nous pouvons construire des systèmes de recommandation qui nous comprennent mieux et nous offrent des choix plus pertinents. Ce n'est pas seulement un petit ajustement ; c'est un changement fondamental dans la façon dont nous apprenons aux ordinateurs à deviner ce que nous voulons ensuite.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →