Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations
Ce document présente AIR (Atomic Intent Reasoning), un cadre de recommandation cross-domaine de classe industrielle qui comble le fossé sémantique entre le contenu et l'e-commerce en exploitant l'inférence LLM hors ligne et une recherche en ligne efficace pour parvenir à une accélération significative de l'inférence et à des améliorations substantielles du GMV lors du déploiement réel de Kuaishou.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un personnel de vente très intelligent, mais incroyablement lent et coûteux, nommé « LLM ». Ce vendeur est brillant pour comprendre les désirs humains. Si vous lui dites : « J'ai regardé une vidéo d'un chat mignon, puis j'ai acheté de la nourriture pour chat », il peut instantanément déduire : « Ah, cette personne aime les chats et pourrait vouloir un arbre à chat ensuite. »
Cependant, il y a un problème : ce vendeur prend 8 secondes pour vous donner une réponse. Dans le monde du shopping en ligne (comme sur Kuaishou, une application chinoise massive), vous avez besoin d'une réponse en millisecondes. Si le vendeur est trop lent, le client a déjà quitté le magasin. De plus, embaucher ce vendeur pour chaque interaction utilisateur coûte une fortune.
Cette publication présente un nouveau système appelé AIR (Atomic Intent Reasoning) pour résoudre cela. Considérez AIR comme un architecte et un bibliothécaire brillant qui travaille avant l'arrivée du client, afin que l'acte d'achat soit instantané.
Voici comment fonctionne AIR, décomposé en étapes simples :
1. La préparation « Pré-match » (Phase hors ligne)
Au lieu de demander au « vendeur LLM » lent de réfléchir en temps réel, AIR effectue toute la réflexion lourde hors ligne (quand personne ne regarde).
- La décomposition atomique : Le système prend l'historique désordonné d'un utilisateur (regarder des vidéos, cliquer sur des publicités, acheter des choses) et demande au LLM de le décomposer en minuscules et clairs « atomes d'intention ».
- Analogie : Au lieu de dire : « J'ai regardé une vidéo de chat, puis une vidéo de voiture, puis j'ai acheté de la nourriture pour chat », le système traduit cela en cartes spécifiques et étiquetées :
[Action : Regarder] + [Objet : Vidéo de Chat] = Intention : Amoureux des chats.
- Analogie : Au lieu de dire : « J'ai regardé une vidéo de chat, puis une vidéo de voiture, puis j'ai acheté de la nourriture pour chat », le système traduit cela en cartes spécifiques et étiquetées :
- La bibliothèque : Ces « cartes d'intention » sont organisées dans une bibliothèque massive et hautement organisée (un Arbre d'Intention) et stockées. C'est comme précuire un repas et le congeler, afin de ne pas avoir à cuisiner à partir de zéro lorsqu'un client commande.
2. Le service « Flash » (Phase en ligne)
Lorsqu'un utilisateur visite réellement l'application, le système n'appelle pas le LLM lent. Au lieu de cela, il agit comme un bibliothécaire super rapide.
- La recherche : Le système regarde ce que l'utilisateur fait en ce moment même (par exemple, il regarde une raquette de « Badminton »).
- La récupération : Il court instantanément à la bibliothèque et extrait uniquement les « cartes d' intention » qui correspondent au Badminton. Il ignore tout ce qui est non pertinent (comme les vidéos de chats regardées le mois dernier, à moins qu'elles ne soient pertinentes).
- L'assemblage : Il empile rapidement ces cartes pertinentes pour former une image claire de ce que l'utilisateur veut maintenant.
3. Le filtre à bruit
Les données de comportement des utilisateurs sont souvent désordonnées et massives (comme une bibliothèque avec des millions de livres, dont la plupart sont non pertinents).
- La métaphore : Imaginez essayer de trouver une aiguille spécifique dans une botte de foin. L'ancienne méthode consistait à regarder toute la botte de foin. AIR utilise un aimant (Récupération orientée vers la cible) qui ne tire que les aiguilles (intentions pertinentes) et ignore le foin (le bruit).
- Cela permet au système de gérer des quantités massives de données sans être confus ou lent.
4. Le résultat : Vitesse et Intelligence
En faisant la « réflexion » à l'avance et la « récupération » instantanément, AIR atteint deux choses incroyables :
- Vitesse : Il est 400 fois plus rapide que l'appel direct au LLM. Il passe de 8 secondes à seulement 20 millisecondes.
- Précision : Parce qu'il utilise le « cerveau » du LLM pour comprendre la signification derrière les actions (et pas seulement les chiffres), il prédit bien mieux ce que les utilisateurs veulent acheter que les anciens systèmes.
Preuve en conditions réelles
Les auteurs ont testé cela sur Kuaishou, une plateforme géante avec des centaines de millions d'utilisateurs.
- Le test : Ils ont mené une expérience réelle (test A/B) où la moitié des utilisateurs utilisaient l'ancien système et l'autre moitié utilisait AIR.
- La victoire : Le groupe AIR a généré 3,4 % de revenus supplémentaires (GMV) pour l'entreprise. Dans le monde des grandes entreprises, c'est une victoire massive. Cela a également aidé les utilisateurs qui avaient peu d'historique (le problème du « démarrage à froid » ou cold start) en devinant leurs intérêts grâce aux « cartes d'intention » créées par le LLM.
En résumé :
AIR est une astuce intelligente qui permet aux entreprises d'utiliser le cerveau « super intelligent » d'un grand modèle de langage sans payer le prix « lent et coûteux ». Il pré-digère les données des utilisateurs en cartes faciles à lire, de sorte que lorsqu'un utilisateur clique, le système peut instantanément dire : « Je sais exactement ce que vous voulez », en un clin d'œil.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.