← Derniers articles
🤖 machine learning

Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting

Cet article présente un système de classement multi-objectif évolutif pour la recommandation de streaming en direct qui équilibre efficacement les signaux utilisateurs récents et différés grâce à un module de ciblage sensible aux segments et une architecture Multi-gate Mixture-of-Experts (MMoE) économe en paramètres, entraînant des améliorations significatives du nombre de spectateurs actifs quotidiens, de l'engagement et des revenus à travers divers segments d'utilisateurs.

Auteurs originaux : Xiaoyi Gu, Julia Tavares, Eder Santana, Carlos Mendoza-Cardenas, Nikita Mishra, Saad Ali

Publié 2026-08-06
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xiaoyi Gu, Julia Tavares, Eder Santana, Carlos Mendoza-Cardenas, Nikita Mishra, Saad Ali

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous déambulez dans une immense et trépidante place de village numérique où des milliers de personnes sont constamment en train de se produire, de discuter et de partager des histoires. C'est le monde du streaming en direct, un lieu où la magie opère en temps réel. Mais pour les personnes qui gèrent cette place de village, il y a un casse-tête complexe : comment décider quel artiste montrer à quel visiteur ? C'est le travail d'un « système de recommandation », un entremetteur numérique qui tente de deviner ce que vous aimerez ensuite.

Par le passé, ces entremetteurs étaient comme des bibliothécaires enthousiastes qui ne se souciaient que du livre que vous preniez en main à l'instant présent. Mais dans le streaming en direct, l'histoire est plus complexe. Parfois, un spectateur regarde un streamer pendant quelques minutes, discute un peu, puis s'en va. Il peut ne pas revenir avant plusieurs jours, ou décider soudainement de s'abonner ou d'envoyer de l'argent quelques semaines plus tard. Ces actions sont comme des graines plantées dans le sol ; elles ne germent pas immédiatement. Si l'entremetteur ne regarde que ce qui se passe dans les cinq prochaines minutes, il manque les graines qui pousseront plus tard. De plus, la place de village est remplie de différents types de personnes : certains sont de nouveaux touristes qui veulent juste voir un spectacle rapide, tandis que d'autres sont des habitués qui veulent nouer des amitiés profondes avec les artistes. Traiter tout le monde exactement de la même manière conduit souvent à de mauvaises recommandations. Ce document explore comment construire un entremetteur plus intelligent qui comprenne à la fois l'excitation immédiate et la croissance à long terme de ces relations.


Le Défi : Le Problème de l'Attente (« Wait-and-See »)

Les auteurs de ce document, travaillant chez Twitch, ont été confrontés à un mal de tête unique. Dans le commerce en ligne, si vous cliquez sur un produit et que vous ne l'achetez pas, vous ne l'achèterez probablement pas plus tard. Mais dans le streaming en direct, un spectateur peut cliquer sur une chaîne, regarder un moment, puis revenir trois jours plus tard pour suivre le streamer ou même payer un abonnement.

Le problème est que ces « grandes » actions (comme suivre ou dépenser de l'argent) sont rares et arrivent lentement. Si l'ordinateur essaie d'apprendre de ces actions immédiatement, il ne voit principalement que des réponses « non », ce qui confond le système. C'est comme essayer d'apprendre à cuisiner un gâteau en ne regardant que les cinq premières minutes du processus ; vous ne sauriez jamais si le gâteau est finalement réussi. De plus, le système devenait biaisé. Parce que les « super-fans » (qui discutent et dépensent beaucoup) génèrent énormément de données, l'ordinateur apprenait à leur plaire si bien qu'il en oubliait les nouveaux spectateurs occasionnels qui voulaient simplement tâter le terrain.

La Solution : Une Stratégie en Trois Parties

Pour corrir cela, l'équipe a construit un nouveau système de classement avec trois astuces ingénieuses, agissant comme une équipe de détectives spécialisés.

1. La Fenêtre de Voyage dans le Temps (Signaux Différés)
D'abord, ils ont réalisé qu'ils devaient arrêter de juger l'intérêt d'un spectateur trop rapidement. Au lieu de demander : « Aiment-ils cela maintenant ? », ils ont demandé : « Aiment-ils cela au cours des deux prochaines semaines ? ». Ils ont créé une « fenêtre différée » de 14 jours. Si un spectateur cliquait sur une chaîne et que, dans les deux semaines suivantes, il décidait de discuter, de suivre ou de dépenser de l'argent, le système comptait cela comme un « oui ». Cela a transformé des événements rares et dispersés en une image plus claire, aidant l'ordinateur à comprendre qu'une réaction lente peut tout de même être une réaction positive.

2. L'Approche des Deux Équipes (Frais vs Différé)
Ensuite, ils ont réalisé que toutes les actions ne sont pas les mêmes. Certaines choses, comme cliquer ou regarder pendant quelques minutes, se produisent instantanément. D'autres, comme suivre ou dépenser, prennent du temps. Ils ont donc divisé le travail.

  • L'Équipe Fraîche (FSM) : Cette équipe se concentre sur les réactions immédiates. Elle observe ce que le spectateur fait en ce moment même pour prédire s'il restera quelques minutes.
  • L'Équipe Différée (DSM) : Cette équipe joue le long terme. Elle utilise cette fenêtre de 14 jours pour prédire si un spectateur finira par suivre ou dépenser de l'argent.
    En ayant deux équipes distinctes, le système ne s'embrouille pas. Il ne confond pas un « clic » rapide avec un « abonnement » profond.

3. Le Coach Personnalisé (Ciblage Sensible aux Segments)
Enfin, ils ont remarqué que les nouveaux spectateurs et les super-fans ont des besoins différents. Un nouveau spectateur a besoin d'être accroché par un contenu excitant et court pour qu'il revienne. Un super-fan est prêt pour des connexions plus profondes et peut vouloir soutenir financièrement le streamer.
Le système agit désormais comme un coach qui connaît le niveau du joueur. Pour les nouveaux spectateurs, il donne la priorité au visionnage et à la discussion. Pour les fans dévoués, il donne la priorité à la découverte de chaînes qu'ils voudront soutenir. Il y parvient en ajustant le « score » des recommandations en fonction de qui regarde, sans avoir besoin de construire un système entièrement nouveau pour chaque groupe.

La Recette Secrète : Le MMoE

Pour faire fonctionner tout cela sans ralentir l'ordinateur, ils ont utilisé une architecture intelligente appelée Multi-gate Mixture-of-Experts (MMoE). Imaginez un restaurant avec un chef de cuisine et plusieurs sous-chefs spécialisés.

  • Un sous-chef est expert en « amuse-bouches rapides » (clics immédiats).
  • Les autres sous-chefs sont experts en « plats principaux complexes » (engagement profond et dépenses).
    La « porte » (gate) est le serveur qui décide de l'avis de quel chef écouter pour un client spécifique. Cela a permis au système d'apprendre de tous ces objectifs différents en même par le temps, tout en gardant les calculs efficaces. En fait, en utilisant cette méthode, ils ont réduit le nombre de paramètres informatiques (les « cellules cérébrales » du modèle) de 41,9 % par rapport à l'exécution de modèles séparés pour tout, tout en obtenant de meilleurs résultats.

Les Résultats : Une Victoire pour Tout le Monde

L'équipe a testé ce nouveau système auprès de millions d'utilisateurs réels. Les résultats sont prometteurs :

  • Plus de Spectateurs : Le nombre de spectateurs actifs quotidiens (DAV) a augmenté de 0,09 %. Bien que cela semble faible, dans un monde comptant des millions d'utilisateurs, cela se traduit par des millions de « jours de visionnage » supplémentaires chaque année.
  • Des Fans Heureux : Pour les fans dévoués, le « revenu moyen par utilisateur plafonné » (ARPU) a augmenté de 0,56 %, ce qui signifie que les utilisateurs les plus engagés ont dépensé un peu plus pour soutenir leurs streamers préférés.
  • De Nouveaux Amis : Le système a aidé les nouveaux spectateurs à rester, augmentant leur engagement de 0,15 %.
  • Plus d'Abonnements : Le nombre de nouveaux abonnements aux chaînes a augmenté de 0,27 %.

Mieux encore, le système était rapide. Il pouvait prendre ces décisions complexes en moins de 110 millisecondes (c'est plus rapide qu'un clin d'œil), prouvant que l'on peut être intelligent et rapide à la fois. Ils l'ont même testé sur l'application mobile et ont constaté une augmentation de 1,12 % des interactions positives comme les clics et les « likes ».

Ce Qu'Ils N'Ont Pas Fait

Les auteurs ont pris soin de noter ce qui n'a pas fonctionné. Ils ont essayé de corriger le biais contre les nouveaux spectateurs en donnant plus de poids à leurs données lors de la phase d'apprentissage (en criant plus fort à l'ordinateur au sujet des nouveaux utilisateurs), mais cela n'a pas aidé et a rendu les choses compliquées. Au lieu de cela, ils ont découvert qu'ajuster les poids après l'entraînement du modèle (au moment de la recommandation) était la clé. Ils ont également constaté qu'essayer de mettre tous les objectifs dans un seul et même modèle géant rendait le système moins performant pour prédire l'engagement immédiat, prounant que garder les signaux « frais » et « différés » séparés était crucial.

En résumé, ce document montre que pour construire un excellent système de recommandation de streaming en direct, il faut être assez patient pour attendre que les graines germent, assez intelligent pour traiter différemment les nouveaux et les anciens fans, et assez efficace pour faire tout cela en un clin d'œil.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →