← Derniers articles
🤖 machine learning

Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning

Cet article présente un cadre unifié et agnostique du modèle pour optimiser l'engagement à long terme des utilisateurs dans les systèmes de recommandation à grande échelle en identifiant les comportements de session prédictifs précoces et en dérivant des signaux de récompense en aval, lesquels ont été déployés avec succès sur plusieurs surfaces de Pinterest pour améliorer les mesures de rétention.

Auteurs originaux : Dingsu Wang, Filip Ryzner, Kelly He, Armando Ordorica, David Woo, Aditya Mantha, Liyao Lu, Usha Amrutha Nookala, Haoran Guo, Jiacong He, Olafur Gudmundsson, Matt Chun, Krystal Benitez, Dhruvil Deven B
Publié 2026-07-17
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dingsu Wang, Filip Ryzner, Kelly He, Armando Ordorica, David Woo, Aditya Mantha, Liyao Lu, Usha Amrutha Nookala, Haoran Guo, Jiacong He, Olafur Gudmundsson, Matt Chun, Krystal Benitez, Dhruvil Deven Badani, Yijie Dylan Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous déambulez dans une bibliothèque immense et infinie où les étagères se réorganisent en fonction de ce que vous regardez. C'est le monde des systèmes de recommandation, ces moteurs invisibles derrière des applications comme Pinterest, TikTok et Netflix. Leur travail consiste à deviner ce qui vous plaira ensuite. Pendant longtemps, ces systèmes étaient comme des guides touristiques impatients : ils ne se souciaient que du fait que vous vous arrêtiez regarder une exposition à un instant T. Si vous cliquiez sur une image, ils vous en montraient immédiatement dix autres identiques. Mais voici le problème : si l'on ne montre aux gens que ce qu'ils connaissent déjà, ils s'ennuient et finissent par ne plus visiter la bibliothèque du tout. La grande question que les scientifiques tentent de résoudre est la suivante : Comment recommander des choses qui incitent les gens à revenir pendant des mois ou des années, et pas seulement pour les cinq prochaines minutes ?

Pour répondre à cela, les chercheurs doivent faire face à une réalité complexe : nous ne pouvons pas facilement voir l'avenir. Nous ne pouvons pas attendre de voir si un utilisateur reviendra dans un mois pour décider de ce qu'il faut lui montrer aujourd'hui. Ainsi, au lieu de deviner l'avenir directement, ils cherchent des « indices » dans le présent — de petits comportements qui surviennent généralement juste avant qu'une personne ne décide de rester fidèle. Ce document traite de la manière de trouver ces indices et d'apprendre au guide de la bibliothèque à les suivre, transformant une visite courte et ennuyeuse en une aventure longue et passionnante.


Le Problème : Le « Piège du Clic »

Imaginez que vous êtes à une fête foraine. Un stand de jeux vous offre un bonbon gratuit si vous faites tourner une roue. Vous faites tourner la roue, vous obtenez votre bonbon, et vous partez. Le propriétaire du stand est heureux parce que vous avez fait tourner la roue, mais vous ne reviendrez jamais. C'est ce qui arrive lorsque les systèmes de recommandation ne s'intéressent qu'aux signaux à court terme comme un clic rapide ou un regard d'une seconde. Ils obtiennent beaucoup de « tours de roue », mais les utilisateurs s'ennuient et quittent la fête foraine pour toujours.

Les auteurs de ce document, travaillant chez Pinterest, ont réalisé que l'optimisation pour les clics immédiats nuisait en réalité à la santé à long terme de leur plateforme. Ils voulaient construire un système qui ne disait pas seulement : « Voici quelque chose sur lequel vous pourriez cliquer », mais plutôt : « Voici quelque chose qui vous fera rester, explorer et revenir demain ».

La Solution : Le Détective du « Terrier de Lapin »

L'équipe a trouvé une idée ingénieuse : au lieu d'attendre de voir si un utilisateur reviendra la semaine prochaine (ce qui est rare et difficile à suivre), ils allaient chercher des Récompenses en Aval (Downstream Rewards). Voyez cela comme un détective cherchant des empreintes de pas. Si un utilisateur plonge profondément dans un « terrier de lapin » (rabbit hole) de contenus connexes, enregistre une image ou passe beaucoup de temps à explorer, ce sont des empreintes fortes qui disent : « Cette personne passe un excellent moment et reviendra probablement ».

Le document propose un cadre agnostique au modèle (model-agnostic). « Agnostique au modèle » est une façon sophistiquée de dire qu'« il fonctionne avec n'importe quel type de moteur de recommandation », qu'il s'agisse d'une liste simple ou d'une IA complexe. Ils ne se sont pas contentés de deviner quels comportements étaient bons ; ils ont mené un processus de screening hors ligne massif pour identifier les actions spécifiques qui prédisaient réellement la fidélité à long terme.

Les Trois Indices d'Or

À travers leur analyse, ils ont identifié trois principaux types de « récompenses » (indices) qui mènent à des utilisateurs heureux et fidèles :

  1. L'Immersion Profonde (Engagement de Session Approfondi) :
    Il ne s'agit pas seulement de cliquer, mais de la profondeur de votre exploration. Le document a révélé que si un utilisateur clique sur une Épingle (Pin) puis plonge immédiatement dans un « terrier de lapin P2P » (une chaîne d'Épingles liées), l'enregistre ou la télécharge, c'est une victoire majeure.

    • La Métaphore : C'est la différence entre jeter un coup d'œil dans une pièce et s'y installer réellement. Le système a appris à récompenser les utilisateurs qui prennent le temps d'explorer le « terrier de lapin » plutôt que de simplement survoler la surface.
    • Le Résultat : Ils ont constaté que ces actions profondes sont fortement liées au retour des utilisateurs. En fait, les sessions comportant ces actions profondes ont conduit les utilisateurs à revenir sur l'application nettement plus tôt.
  2. La Pénalité du « Faire semblant » (Récompenses Négatives) :
    Tous les clics ne sont pas bons. L'équipe a découvert que certains « gros plans » (zooms sur une image) sont en réalité des signes d'ennui. Si un utilisateur zoome pendant moins d'une seconde puis repart immédiatement, il s'agit d'un « gros plan superficiel ».

    • La Métaphore : Imaginez quelqu'un entrant dans un magasin, saisissant un article, l'examinant une fraction de seconde, puis le reposant immédiatement. Il n'est pas intéressé ; il perd juste son temps.
    • La Correction : Le système traite désormais ces regards de l'instant comme une récompense négative. C'est comme si le guide disait : « Hé, ne présente plus cet article à cette personne ; elle n'a clairement pas aimé ». Ils ont même découvert que différents types d'utilisateurs nécessitent des règles différentes : les utilisateurs « de base » (core) ont besoin d'un seuil d'une seconde pour être considérés comme superficiels, tandis que les utilisateurs « non-essentiels » (non-core) n'ont besoin que de 0,5 seconde.
  3. La Nouvelle Aventure (Adoption de Cas d'Usage) :
    Parfois, les utilisateurs restent bloqués dans une boucle de leurs intérêts habituels. Le document introduit une récompense pour l'Adoption de Cas d'Usage. Cela se produit lorsqu'un utilisateur s'engage avec quelque chose de totalement nouveau qui ne correspond pas à ses habitudes.

    • La Métaphore : Si un utilisateur regarde habituellement des « vidéos de chats », et que le système lui montre une vidéo « comment réparer un vélo », et qu'il la regarde et l'enregistre, c'est une victoire. Cela signifie que le système a réussi à élargir ses horizons.
    • L'Objectif : Cela encourage l'IA à montrer aux utilisateurs des choses qu'ils ne savaient pas qu'ils voulaient, les aidant ainsi à construire de nouveaux passe-temps et intérêts, ce qui les maintient plus longtemps sur la plateforme.

La Salle des Machines : Comment ils l'ont mis en œuvre

Vous vous demandez peut-être : « Comment calculez-vous tout cela sans ralentir l'application ? » Les auteurs ont construit une nouvelle infrastructure appelée DRv2.

  • L'Ancienne Méthode : Ils calculaient auparavant toutes ces récompenses par lots massifs, ce qui prenait des semaines pour se mettre à jour. S'ils voulaient tester une nouvelle idée, ils devaient attendre des semaines.
  • La Nouvelle Méthode : Ils ont construit un système qui calcule ces récompenses à la volée, au moment même où les données sont lues. Cela a réduit le temps nécessaire pour tester de nouvelles idées de 3 semaines à 2 jours. C'est comme passer de la préparation d'un gâteau de zéro à chaque fois que l'on veut une part, à l'utilisation d'une machine magique qui assemble instantanément une part fraîche dès que vous la demandez.

Les Résultats : Est-ce que cela fonctionne vraiment ?

L'équipe a testé ces idées dans le monde réel en utilisant des tests A/B (montrant l'ancien système à un groupe et le nouveau à un autre). Les résultats ont été cohérents et positifs :

  • Sessions plus réussies : Le nombre de sessions où les utilisateurs ont accompli une action significative (comme enregistrer ou télécharger) a augmenté de +0,36 % de manière générale.
  • Plus de temps passé : Les utilisateurs ont passé plus de temps sur l'application, avec un temps total augmentant de +0,10 %.
  • Meilleure rétention : Plus important encore, le nombre d'Utilisateurs Actifs Hebdomadaires (WAU) a augmenté de +0,1 % pour les utilisateurs de base. Cela prouve que le système n'a pas seulement piégé les gens pour qu'ils cliquent, mais qu'il leur a réellement donné envie de revenir.
  • Succès sur les différentes surfaces : Ils n'ont pas seulement corrigé le « Fil d'actualité » (Homefeed). Ils ont appliqué la même logique à la Recherche, aux Épingles liées et aux Notifications. Dans la Recherche, le « taux de satisfaction » (la fréquence à laquelle une recherche menait à une action réelle) a augmenté de +0,25 %.

La Conclusion

Ce document suggère que le secret pour garder les utilisateurs heureux n'est pas seulement de leur montrer ce qu'ils aiment déjà, mais de les guider vers des interactions plus profondes et plus significatives. En récompensant les « immersions profondes », en pénalisant les « clics de façade » et en encourageant les « nouvelles aventures », le système peut transformer un simple regard en une relation à long terme.

Les auteurs précisent avec prudence que ce n'est pas une solution miracle qui résoudra tout pour toujours, mais c'est un outil puissant et flexible qui fonctionne sur différentes parties de l'application. En se concentrant sur la qualité du voyage plutôt que sur la seule vitesse du clic, ils ont réussi à construire un système de recommandation qui ressemble moins à un distributeur automatique et plus à un ami serviable qui sait comment faire durer la conversation.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →