← Derniers articles
🤖 machine learning

Modelling Customer Trajectories with Reinforcement Learning for Practical Retail Insights

Ce papier propose un cadre d'apprentissage par renforcement à entropie maximale pour modéliser les trajectoires des clients dans les espaces de vente au détail, démontrant qu'il surpasse les heuristiques traditionnelles telles que le TSP et le PNN en fournissant des insights plus précis et fondés sur le comportement pour l'optimisation de la disposition des magasins et la maximisation des profits, sans nécessiter de collecte coûteuse de données réelles.

Auteurs originaux : Ken Ming Lee, Paul Barde, Maxime C. Cohen, Derek Nowrouzezahrai

Publié 2026-05-19
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ken Ming Lee, Paul Barde, Maxime C. Cohen, Derek Nowrouzezahrai

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une petite épicerie. Votre objectif est simple : gagner le plus d'argent possible. Vous savez que les gens achètent souvent des choses qu'ils n'avaient pas prévues d'acheter — comme une barre de chocolat ou un soda — simplement parce qu'ils les ont vues en marchant dans l'allée. On appelle cela un « achat impulsif ».

Pour inciter les gens à acheter ces articles, vous devez savoir exactement où ils marchent. Si vous placez la barre de chocolat directement sur leur chemin, ils la saisiront. Si vous la cachez dans un coin qu'ils ne visitent jamais, ils ne l'achèteront pas.

Le Problème : Le « Jeu de Devinettes » contre l'« Espion Coûteux»
Pour déterminer où les clients se déplacent, vous avez deux mauvaises options :

  1. L'Espion (Données réelles) : Vous engagez des personnes pour suivre les clients avec des caméras et des cartes. Cela vous donne une information parfaite, mais c'est incroyablement cher et intrusif. La plupart des petites épiceries ne peuvent pas se le permettre.
  2. La Devinette (Heuristiques) : Vous utilisez de simples règles mathématiques pour deviner le parcours.
    • La Règle du « Chemin le plus court » (TSP) : Elle suppose que les clients sont des robots qui empruntent toujours l'itinéraire absolument le plus court pour obtenir leurs articles.
    • La Règle du « Voisin le plus proche » (PNN) : Elle suppose que les clients sont un peu aléatoires, mais choisissent quand même principalement l'article le plus proche d'eux.

L'article a révélé que ces règles de « devinette » sont erronées dans 28 % des cas. Les vrais humains sont désordonnés. Ils errent, font des détours et ne prennent pas toujours le chemin le plus court. Parce que les devinettes sont si éloignées de la réalité, les propriétaires d'épiceries finissent par placer les produits aux mauvais endroits, manquant ainsi des ventes.

La Solution : Un Élève « Jeu Vidéo »
Les auteurs ont créé une nouvelle méthode pour prédire les parcours des clients en utilisant l'Apprentissage par Renforcement (RL). Imaginez cela comme entraîner un personnage de jeu vidéo (un « agent ») à se comporter comme un vrai client.

Au lieu de simplement dire au personnage de « prendre le chemin le plus court », ils lui ont enseigné une leçon plus humaine :

  • Obtenir les articles : Vous gagnez des points pour acheter ce dont vous avez besoin.
  • Être un peu imprévisible : Vous gagnez également des points pour explorer différents itinéraires, pas seulement le même chemin ennuyeux à chaque fois.

Ceci s'appelle l'apprentissage de « l'Entropie Maximale ». Cela force l'ordinateur à réaliser que les humains ne sont pas des robots ; nous avons une « rationalité limitée ». Nous faisons des erreurs, nous nous laissons distraire et nous empruntons différents chemins même lorsque nous achetons les mêmes choses.

Ce qu'ils ont fait
Ils ont utilisé de vraies données provenant d'une épicerie (où ils ont suivi plus de 3 000 vrais clients) pour entraîner leur « élève jeu vidéo ». Ensuite, ils ont demandé à l'élève de simuler 10 000 courses.

Les Résultats : L'Élève Gagne
Lorsqu'ils ont comparé les parcours de l'« élève jeu vidéo » à ceux des vrais humains :

  • La règle du « Chemin le plus court » a lamentablement échoué. Elle a manqué des sections entières du magasin car elle ne cherchait que l'itinéraire le plus rapide.
  • La règle du « Voisin le plus proche » était meilleure, mais elle manquait toujours le comportement d'« errance » des vrais humains.
  • L'Élève RL était le plus proche de la réalité. Il a compris que parfois, les gens traversent le bas du magasin même si le haut est plus court, simplement parce que c'est ainsi qu'ils aiment faire leurs courses.

Pourquoi cela compte pour votre portefeuille
L'article a testé cela en essayant de déplacer un produit spécifique (comme des boissons gazeuses) vers un nouvel étagère pour gagner plus d'argent.

  • Si vous utilisiez les devinettes du Chemin le plus court ou du Voisin le plus proche, elles vous auraient dit de déplacer le produit vers une étagère qui était en fait vide et rarement visitée. Cela aurait été un gaspillage d'espace.
  • L'Élève RL a correctement identifié les étagères fréquentées et à fort trafic que les vrais humains traversent réellement.

Lorsqu'ils ont déplacé le produit vers l'endroit suggéré par l'élève RL, le magasin a réalisé presque autant de profit supplémentaire que s'ils avaient utilisé les coûteuses données de l'« Espion ». Les simples règles de devinette ont échoué à trouver le bon endroit.

Le Conclusion
Cet article montre que vous n'avez pas besoin de dépenser une fortune pour suivre chaque client avec des caméras afin d'optimiser votre magasin. À la place, vous pouvez utiliser un modèle informatique intelligent qui apprend à « penser » comme un vrai client. Il comble le fossé entre « trop simple pour être vrai » (les règles de devinette) et « trop cher pour être pratique » (données réelles), offrant aux propriétaires d'épiceries un moyen peu coûteux et précis d'agencer leurs étagères pour un profit maximal.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →