Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce
Este artículo presenta la Optimización Secuencial de Evidencia Multimodal (SMEO, por sus siglas en inglés), un marco de dos etapas que optimiza el orden secuencial de medios de productos heterogéneos en el comercio electrónico mediante el aprendizaje de utilidades de trayectoria a partir de registros sesgados y el entrenamiento de una política de clasificación autorregresiva para ayudar a los clientes a alcanzar decisiones de compra con menos interacciones y mayores tasas de conversión estimadas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En los estantes digitales de las tiendas en línea modernas, el camino hacia una compra rara vez es una sola mirada. En cambio, es un viaje a través de un carrusel de imágenes, videos y modelos tridimensionales interactivos que un cliente debe deslizar uno por uno. Debido a que los compradores no pueden tocar ni sostener el producto, dependen de esta secuencia de pistas visuales para construir una imagen de lo que están comprando. Acumulan evidencia, pieza por pieza, hasta que se sienten lo suficientemente seguros para comprar o deciden que el esfuerzo es demasiado grande y se van. El desafío para las plataformas que venden estos bienes es que el orden en el que aparecen estas pistas importa inmensamente. Si la información más convincente está enterrada en la parte inferior de la lista, un cliente podría rendirse antes de verla. Esto no se trata solo de captar la atención; se trata de guiar a una persona a través de una historia que conduzca a una decisión.
Investigadores de Amazon, liderados por Prasenjit Dey, Frank McIntyre y Arnab Sinha, han desarrollado una nueva forma de resolver este rompecabezas. Llaman a su enfoque Optimización de Evidencia Multimodal Secuencial, o SMEO (por sus siglas en inglés). En lugar de tratar cada imagen o video como un elemento aislado que compite por un clic, ven toda la colección de medios para un solo producto como un equipo cooperativo que trabaja junto para contar una historia completa. Su objetivo era encontrar el orden específico que ayude a un cliente a alcanzar una decisión de "sí" con la menor cantidad de esfuerzo. Al analizar millones de sesiones de compra reales, descubrieron que los sistemas existentes a menudo fallan porque se enfocan en reacciones a corto plazo, como cuánto tiempo permanece un usuario en una pantalla, en lugar del resultado final de si realmente se produjo una venta.
Los investigadores descubrieron que los métodos actuales suelen cometer el error de pensar que una imagen llamativa que recibe muchos clics es la más importante para mostrar primero. Sin embargo, un clic no siempre significa una compra. Un cliente puede hacer clic en una foto brillante por curiosidad, pero aun así irse sin comprar porque nunca vio los detalles técnicos o la demostración en video que lo habrían convencido. El nuevo sistema, SMEO, aprende de la historia de lo que los clientes realmente hicieron. Observa la secuencia de medios que un cliente visualizó antes de comprar el artículo o de dejar de buscar. Luego, determina qué piezas de evidencia fueron las más persuasivas en ese contexto específico. Por ejemplo, puede aprender que para una cafetera, un video que muestra la máquina en acción es mucho más crítico que una foto estática de la caja, y que este video debe mostrarse temprano en la secuencia para evitar que el cliente se vaya.
Para lograr esto, el equipo construyó un proceso de dos pasos. Primero, entrenaron un modelo para comprender el valor de una secuencia de medios basándose en si esta conducía a una venta. Este modelo aprendió a ignorar el sesgo de dónde se colocaban los elementos en el pasado, enfocándose en su lugar en el contenido real y en cómo ayudaba al cliente a decidir. Segundo, utilizaron este entendimiento para enseñar a un programa informático cómo organizar los medios para cualquier producto nuevo. Este programa actúa como un editor, eligiendo el mejor orden para las imágenes y los videos. Prioriza mostrar la información de toma de decisiones más importante lo antes posible, asegurando que el cliente vea la prueba más importante antes de que se canse de deslizar.
Los resultados de probar este sistema a gran escala fueron significativos. Cuando los investigadores compararon su nuevo método con las reglas estándar utilizadas por las tiendas en línea, encontraron que el nuevo sistema aumentó la tasa estimada de compras exitosas en un 5.5 por ciento. Más importante aún, ayudó a los clientes a alcanzar esa decisión un 15 por ciento más rápido, lo que significa que necesitaron deslizar a través de menos imágenes para encontrar lo que buscaban. El estudio también reveló que el sistema aprendió a reconocer patrones sin que se le dijera explícitamente qué buscar. Por ejemplo, descubrió que para los muebles, los modelos tridimensionales eran mucho más valiosos que para otros tipos de productos, mientras que para la ropa, los videos que mostraban cómo se movía la tela eran los más persuasivos. Esto permitió que el sistema adaptara automáticamente la presentación de la evidencia a las necesidades específicas de diferentes categorías de productos.
Uno de los aspectos más poderosos de este trabajo es que resuelve un problema que ha sido difícil de medir: ¿cuánto crédito debería recibir una imagen o video específico por una venta? En el pasado, era difícil saber si una compra fue causada por la primera foto o el quinto video. El nuevo sistema proporciona una forma de mirar hacia atrás y comprender la contribución de cada pieza de medio, incluso sin etiquetas directas que digan "esta imagen causó la venta". Lo hace simulando qué habría pasado si una pieza de medio fuera eliminada o movida, permitiendo al sistema ver cómo habría cambiado el viaje del cliente. Esta visión ayuda a los dueños de las tiendas a entender qué activos son verdaderamente valiosos y cuáles son redundantes, permitiéndoles mejorar sus páginas de productos de manera más efectiva.
Los investigadores probaron sus ideas rigurosamente utilizando datos de millones de sesiones de compra reales en diversas categorías, desde electrónica hasta productos de belleza. Compararon su método con varios otros enfoques, incluyendo reglas simples basadas en la popularidad y otros sistemas avanzados de clasificación. Su método superó consistentemente a estas alternativas, demostrando que tratar los medios como una historia secuencial es más efectivo que tratarlos como una lista de elementos que compiten entre sí. El sistema está diseñado para trabajar de forma offline, lo que significa que el orden de las imágenes se prepara con antelación y se almacena, por lo que no ralentiza el sitio web cuando un cliente lo visita. Esto lo hace práctico para su uso a gran escala, donde millones de productos necesitan ser organizados cada día.
En última instancia, este trabajo cambia el enfoque de simplemente captar el ojo de un cliente a respetar su tiempo e intención. Al organizar la evidencia visual de una manera que construya confianza rápidamente, el sistema reduce la fricción de las compras en línea. Reconoce que la atención de un cliente es un recurso limitado y que el objetivo es ayudarlo a encontrar la información que necesita con la menor cantidad de pasos posibles. Los hallazgos sugieren que cuando las tiendas digitales se organizan teniendo en cuenta el proceso de toma de decisiones del cliente, el resultado es una mejor experiencia para el comprador y un mercado más eficiente para el vendedor. El estudio confirma que el orden de la información no es solo un detalle cosmético, sino una parte fundamental de cómo las personas toman decisiones en el mundo digital.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.