Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation
Cet article présente Shape Your Feed (SYF), un système agentique basé sur les LLM qui remplace le classement passif par une co-curation conversationnelle en temps réel grâce à une architecture à trois niveaux, démontrant des améliorations significatives de la pertinence du flux et du sentiment des utilisateurs via l'exactitude de l'alignement hors ligne et des tests A/B en ligne à grande échelle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que votre téléphone soit un buffet de contenus magique et infini — vidéos, publications et stories — servi par un chef très occupé et invisible. Pendant des années, ce chef a travaillé dans l'obscurité, devinant ce que vous aimez en se basant uniquement sur ce que vous avez déjà consommé. Si vous avez traîné sur une photo de chat, le chef suppose que vous voulez mille autres chats. Si vous avez passé rapidement une recette, il suppose que vous détestez la cuisine. C'est ce qu'on appelle le « classement passif » et, bien qu'il soit doué pour deviner, il passe souvent à côté de la plaque car il ne peut pas vous entendre parler. Il ne sait pas si vous vouliez vraiment voir ce chat, ou si vous vous êtes juste arrêté pour le caresser du regard.
Récemment, un nouveau type de technologie appelé Modèles de Langage Étendus (LLM) est arrivé. Voyez-les comme des assistants super intelligents et bavards qui peuvent comprendre non seulement ce sur quoi vous cliquez, mais aussi ce que vous dites. Ils peuvent écouter votre voix, lire vos messages textuels et comprendre les nuances de votre humeur. La grande question pour les scientifiques qui construisent des systèmes de recommandation est la suivante : pouvons-nous apprendre à cet assistant bavard à prendre le relais en cuisine ? Pouvons-nous vous laisser dire au chef : « En fait, je suis fatigué des chats aujourd'hui ; apporte-moi des faits sur l'espace », et faire en sorte que le chef change instantanément le menu ? C'est le défi de la « recommandation conversationnelle » — passer d'un système qui devine vos goûts à un système qui écoute vos commandes.
Le système « Shape Your Feed » : Un chef qui écoute
Dans leur article, une équipe de chercheurs de Meta présente un nouveau système appelé Shape Your Feed (SYF). Ils ont construit une cuisine numérique où le chef ne se contente pas de deviner ; il écoute, apprend et ajuste le menu en temps réel selon vos instructions directes. Au lieu d'un système passif qui attend que vous cliquiez sur « ne pas aimer », SYF est un système « agentique », une façon sophistiquée de dire qu'il agit comme un assistant intelligent capable de prendre des mesures en votre nom.
Les chercheurs ont découvert qu'en combinant une IA bavarde avec un moteur de recommandation traditionnel, ils pouvaient créer un flux qui ressemble beaucoup plus à votre flux. Ils ont montré que lorsque les utilisateurs pouvaient parler au système ou utiliser des boutons intelligents pour dire exactement ce qu'ils voulaient, le système devenait bien meilleur pour leur montrer les bons contenus.
Comment la magie opère : La cuisine à trois flux
Le système SYF fonctionne comme une équipe de trois parties dans une cuisine, chacune ayant un travail spécifique :
1. Le Flux de Perception (Les oreilles et le cerveau)
C'est ici que le système vous écoute. Vous pourriez taper « Je veux plus de vidéos de cuisine mais pas de nourriture épicée », utiliser votre voix pour dire « Montre-moi moins de politique », ou appuyer sur un bouton intelligent qui dit « Je m'ennuie de ce sujet ». Le Flux de Perception prend ces instructions humaines désordonnées et les transforme en un « Profil Sémantique » clair et organisé. Voyez cela comme le chef écrivant une liste de courses soignée basée sur votre commande confuse. Il se souvient de votre historique, donc si vous avez dit « pas de politique » hier et « plus de tech » aujourd'hui, il met la liste à jour en conséquence. Il va même chercher discrètement de nouveaux « ingrédients » (vidéos ou publications) qui correspondent à votre nouvelle liste pendant que vous parlez encore.
2. Le Flux de Service (Le dressage et le service)
Une fois la liste prête, le Flux de Service prend le relais. Il examine l'énorme pile de contenus que le système proposerait habituellement (le « bassin de candidats ») et commence à les trier. Il utilise la nouvelle liste de courses du chef pour :
- Ajouter : Faire entrer de nouveaux éléments qui correspondent à vos nouveaux intérêts.
- Élaguer : Écarter tout ce qui viole vos règles (comme ces publications politiques que vous avez bannies).
- Reclasser : Réorganiser l'assiette pour que les choses que vous avez demandées soient tout en haut.
Crucialement, cela se passe très rapidement. Le système ne se contente pas de deviner ; il utilise une méthode de notation intelligente pour décider à quel point votre nouvelle requête doit modifier l'ordre. Il mélange vos ordres explicites avec les connaissances habituelles du système sur ce que vous aimez, garantissant que vous ne perdez pas tout votre contenu préféré juste parce que vous avez demandé un petit changement.
3. Le Flux d'Auto-Évolution (Le goûteur)
C'est la partie qui rend le système plus intelligent au fil du temps. Après que le système vous a servi un repas, il observe ce que vous faites. Avez-vous mangé la nouvelle vidéo de cuisine ? Avez-vous jeté le post sur la tech ? Il utilise également une équipe d'IA « juges » pour vérifier si les décisions du système étaient bonnes. Si le système fait une erreur, il en tire les leçons. Les chercheurs ont utilisé une technique appelée Optimisation de Préférence Directe (DPO), ce qui revient à faire pratiquer le chef avec un critique culinaire strict jusqu'à ce qu'il obtienne le goût parfait. Cette boucle garantit que le système ne se contente pas de suivre les ordres une fois, mais qu'il s'améliore chaque fois qu'il les suit.
Ce qu'ils ont trouvé : La preuve est dans le pudding
Les chercheurs n'ont pas seulement construit cela ; ils l'ont testé pour voir si cela fonctionnait réellement.
Les tests hors ligne (L'entraînement)
D'abord, ils ont testé le module de « score d'alignement » de leur système — la partie qui décide si un post correspond à votre requête. Ils ont comparé leur nouveau système à des méthodes plus anciennes qui se contentaient de deviner sur la base de quelques exemples.
- L'ancienne méthode « few-shot » a pris environ 83,84 % des décisions correctement.
- Leur nouveau système, après avoir été entraîné avec les IA « juges » puis affiné avec de réelles données d'utilisateurs (SFT + DPO), a pris 98,85 % des décisions correctement.
- Il a également été incroyablement rapide, ne prenant que 323 millisecondes pour noter une liste d'éléments, ce qui est assez rapide pour éviter que votre téléphone ne rame.
Les tests en ligne (Le vrai repas)
Ensuite, ils ont déployé SYF auprès de vrais utilisateurs aux États-Unis et au Canada pendant plusieurs mois. Ils ont divisé les utilisateurs en deux groupes : un groupe utilisait l'ancien système, et l'autre utilisait le nouveau système « Shape Your Feed ».
- Les utilisateurs ont adoré les nouveaux contrôles : Lorsqu'on leur a donné le choix entre les anciens boutons statiques et les nouveaux « Context-Aware Feedback Pills » (des boutons intelligents qui changent en fonction de ce que vous regardez), 76,02 % des utilisateurs ont choisi les nouveaux boutons plus intelligents.
- Moins de choses détestées : Le nouveau système a réussi à réduire le nombre de publications que les utilisateurs ignoraient ou n'aimaient pas. Le taux de « Rejet de publication » a chuté de 1,70 %, et le taux de « Déplaisir de publication » a baissé de 2,74 %. Cela signifie que le système était meilleur pour filtrer les choses que les utilisateurs ne voulaient pas.
- Plus de découverte : Les utilisateurs ont commencé à explorer de nouveaux intérêts plus souvent, avec une augmentation de 0,16 % de la « Consommation d'Intérêt ». Cela suggère que le système ne faisait pas que cacher des choses ; il aidait les utilisateurs à trouver de nouvelles choses qu'ils aimaient vraiment.
Ce que cela signifie
L'article montre que nous pouvons nous éloigner des systèmes qui se contentent de deviner ce que nous voulons en fonction de nos clics passés. En ajoutant une couche d'IA capable de comprendre nos mots et d'agir sur eux, nous pouvons créer des flux qui semblent plus personnels et moins frustrants. Les chercheurs ont constaté que cette approche fonctionne bien dans le monde réel, rendant les utilisateurs plus heureux et réduisant la quantité de contenu qu'ils doivent ignorer.
Cependant, les auteurs précisent avec prudence que ce système repose sur le fait que vous preniez la parole. Si vous ne dites jamais au système ce que vous voulez, il revient par défaut à l'ancienne méthode de devinette passive. Ils suggèrent que les versions futures pourraient devoir être encore plus proactives, peut-être en vous posant des questions avant même que vous ne réalisiez que vous vous ennuyez, afin d'aider ceux qui n'aiment pas donner de feedback. Mais pour l'instant, Shape Your Feed prouve qu'un système de recommandation qui écoute est un système qui fonctionne mieux.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.