Modelling Customer Trajectories with Reinforcement Learning for Practical Retail Insights
Este artículo propone un marco de aprendizaje por refuerzo de máxima entropía para modelar las trayectorias de los clientes en espacios minoristas, demostrando que supera a los heurísticos tradicionales como el TSP y el PNN al ofrecer insights más precisos y fundamentados en el comportamiento para la optimización de la disposición de la tienda y la maximización de beneficios, sin requerir costosa recopilación de datos en el mundo real.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres dueño de una pequeña tienda de conveniencia. Tu objetivo es simple: ganar la mayor cantidad de dinero posible. Sabes que las personas a menudo compran cosas que no tenían planeado comprar, como una barra de chocolate o un refresco, simplemente porque las vieron mientras caminaban por el pasillo. Esto se llama "compra por impulso".
Para lograr que las personas compren estos artículos, necesitas saber exactamente por dónde caminan. Si colocas la barra de chocolate justo en su camino, la tomarán. Si la escondes en una esquina a la que nunca van, no lo harán.
El Problema: El "Juego de Adivinanzas" frente al "Espía Costoso"
Para descubrir por dónde caminan los clientes, tienes dos malas opciones:
- El Espía (Datos Reales): Contratas personas para que sigan a los clientes con cámaras y mapas. Esto te proporciona información perfecta, pero es increíblemente costoso e invasivo. La mayoría de las tiendas pequeñas no pueden permitírselo.
- La Adivinanza (Heurísticas): Utilizas reglas matemáticas simples para adivinar el camino.
- La Regla del "Camino Más Corto" (TSP): Asume que los clientes son robots que siempre toman la ruta absolutamente más corta para obtener sus artículos.
- La Regla del "Vecino Más Cercano" (PNN): Asume que los clientes son un poco aleatorios, pero aún así eligen principalmente el artículo más cercano a ellos.
El estudio encontró que estas reglas de "adivinación" son incorrectas el 28% de las veces. Las personas reales son desordenadas. Se desvían, toman desvíos y no siempre toman el camino más corto. Debido a que las suposiciones son tan erróneas, los dueños de tiendas terminan colocando productos en lugares equivocados, perdiendo ventas.
La Solución: Un Estudiante "de Videojuego"
Los autores crearon una nueva forma de predecir los caminos de los clientes utilizando Aprendizaje por Refuerzo (RL). Piensa en esto como entrenar a un personaje de videojuego (un "agente") para que actúe como un comprador humano real.
En lugar de simplemente decirle al personaje que "tome el camino más corto", le enseñaron una lección más humana:
- Obtén los artículos: Obtienes puntos por comprar lo que necesitas.
- Sé un poco impredecible: También obtienes puntos por explorar diferentes rutas, no siempre la misma aburrida.
Esto se llama aprendizaje de "Máxima Entropía". Obliga a la computadora a darse cuenta de que los humanos no son robots; tenemos "racionalidad acotada". Cometemos errores, nos distraemos y tomamos diferentes caminos incluso cuando compramos las mismas cosas.
Lo Que Hicieron
Tomaron datos reales de una tienda de conveniencia (donde rastrearon a más de 3.000 compradores reales) y los utilizaron para entrenar a su "estudiante de videojuego". Luego, pidieron al estudiante que simulara 10.000 viajes de compras.
Los Resultados: El Estudiante Gana
Cuando compararon los caminos del "estudiante de videojuego" con los caminos reales de los humanos:
- La regla del "Camino Más Corto" falló miserablemente. Se perdió secciones enteras de la tienda porque solo buscaba la ruta más rápida.
- La regla del "Vecino Más Cercano" fue mejor, pero aún se perdió el comportamiento de "deambular" de las personas reales.
- El Estudiante RL fue la coincidencia más cercana. Descubrió que a veces las personas caminan por la parte inferior de la tienda incluso si la parte superior es más corta, simplemente porque así es como les gusta comprar.
Por Qué Esto Importa para Tu Cartera
El estudio lo probó intentando mover un producto específico (como las Bebidas Suaves) a un estante nuevo para ganar más dinero.
- Si usabas las suposiciones de Camino Más Corto o Vecino Más Cercano, te decían que movieras el producto a un estante que en realidad estaba vacío y al que rara vez iban. Esto habría sido un desperdicio de espacio.
- El Estudiante RL identificó correctamente los estantes concurridos y de alto tráfico por los que realmente caminan los humanos.
Cuando movieron el producto al lugar que sugirió el estudiante RL, la tienda obtuvo casi tanto beneficio extra como si hubieran utilizado los costosos datos del "Espía". Las reglas simples de adivinanza fallaron al encontrar el lugar correcto.
La Conclusión
Este estudio muestra que no necesitas gastar una fortuna rastreando a cada cliente con cámaras para optimizar tu tienda. En su lugar, puedes usar un modelo informático inteligente que aprende a "pensar" como un comprador humano. Cierra la brecha entre "demasiado simple para ser cierto" (las reglas de adivinanza) y "demasiado costoso para ser práctico" (datos reales), ofreciendo a los dueños de tiendas una forma barata y precisa de organizar sus estantes para maximizar las ganancias.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.