Don't Contrast the Impossible: Region-Constrained Batching for Contrastive User Modeling on a Local Community Platform
Este artículo propone el Muestreo de Lote Restringido por Región (RCBS, por sus siglas en inglés), un nuevo método de procesamiento por lotes para plataformas de comunidades locales que reemplaza los negativos geográficamente imposibles por otros factibles para mejorar el modelado de contraste de usuarios, mejorando así el rendimiento de la recomendación y la publicidad en producción.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando enseñarle a un robot a entender lo que le gusta a la gente. En el mundo de la informática, esto se llama "sistemas de recomendación", y el cerebro del robot está construido utilizando una técnica llamada "aprendizaje contrastivo". Piensa en esto como un juego de "encuentra las diferencias". Para enseñarle al robot lo que le gusta a un usuario, le muestras la imagen de algo en lo que hizo clic (un "positivo") y luego le muestras un montón de otras imágenes en las que no hizo clic (los "negativos"). El robot aprende al darse cuenta de: "Ah, al usuario le gusta esto, pero no aquellas otras cosas".
Para que este juego funcione bien, las imágenes "negativas" que le muestres al robot deben ser cosas que el usuario podría haber visto pero que simplemente decidió ignorar. Si le muestras la imagen de un pingüino a un usuario que vive en medio de un desierto y que nunca ha visto un pingüino, el robot no aprende nada útil. El usuario no lo ignoró porque no le gustara; lo ignoró porque era imposible que lo viera. Este artículo aborda un problema específico donde el "tablero de juego" tiene reglas estrictas sobre quién puede ver qué, y el robot se estaba confundiendo al mostrarle cosas imposibles.
El Problema: Enseñando a un Robot con Elecciones Imposibles
En una aplicación de comunidad local como Karrot (un lugar popular en Corea del Sur para comprar y vender cerca de ti), las reglas del juego son muy diferentes a las de una tienda global como Amazon. En Karrot, solo puedes ver artículos que estén cerca de ti. Si vives en Seúl, no verás una bicicleta a la venta en Busan, incluso si es la bicicleta más genial del mundo. La aplicación está diseñada de tal manera que la distancia actúa como un muro; los artículos al otro lado del muro son simplemente invisibles para ti.
Los investigadores descubrieron que la forma estándar de entrenar al robot estaba cometiendo un gran error. El robot estaba siendo entrenado utilizando "mini-batches" (lotes de datos), que son simplemente pequeños grupos de usuarios y artículos mezclados de forma aleatoria. Debido a que la mezcla era aleatoria, el robot a menudo recibía artículos que eran físicamente imposibles para un usuario específico de ver. Por ejemplo, podría mostrarle a un usuario en un vecindario un artículo de un vecindario a 50 kilómetros de distancia.
El artículo llama a estos "negativos imposibles". Cuando el robot ve que un usuario ignora un artículo que era imposible de ver, piensa: "¡De acuerdo, a este usuario definitivamente le disgusta este artículo!". Pero eso es erróneo. El usuario no lo odiaba; simplemente no podía verlo. Esto es como regañar a un estudiante por no responder a una pregunta que está escrita en un idioma que el estudiante no habla. El artículo argumenta que llenar el juego de entrenamiento con estas elecciones "imposibles" diluye el aprendizaje del robot, haciéndolo malo para adivinar lo que la gente realmente quiere.
La Solución: La Regla del "Mismo Vecindario"
Para solucionar esto, los autores, Seungho Han, Byeongchang Kim y Jin Yu, propusieron una nueva forma de organizar el juego de entrenamiento llamada Muestreo de Lotes Restringido por Región (RCBS, por sus siglas en inglés).
En lugar de echar a todos en el mismo cubo grande, el RCBS actúa como una estricta vigilancia vecinal. Cuando crea un grupo de usuarios para entrenar al robot, solo elige usuarios que vivan en la misma zona (o zonas muy cercanas). Debido a que todos en el grupo viven cerca, cada artículo mostrado en el grupo es algo que cualquiera en ese grupo podría teóricamente ver.
Este simple cambio tiene un efecto poderoso. Ahora, cuando el robot ve que un usuario ignora un artículo, sabe con certeza que el usuario podría haberlo visto. Si aun así no hizo clic, es una señal real de que no está interesado. Estos se llaman "negativos factibles". El artículo sugiere que estas elecciones "factibles" son en realidad más difíciles e informativas para que el robot aprenda que las fáciles "imposibles". Es como mejorar el entrenamiento del robot de "adivinar qué hay en una caja cerrada con llave" a "adivinar qué hay en una caja que tienes justo delante de ti".
Lo que Encontraron: Un Mejor Robot
El equipo probó esta idea de dos maneras: primero, realizando simulaciones fuera de línea (como un partido de práctica) y, segundo, probándola en la aplicación real con usuarios reales (una prueba A/B en vivo).
En las simulaciones, midieron cuántas elecciones "imposibles" había en los grupos de entrenamiento. Con el método aleatorio antiguo, un asombroso 98% de las elecciones negativas eran imposibles de ver para el usuario. Con su nuevo método RCBS, lograron reducir ese número a un 30%.
Los resultados fueron claros. El robot entrenado con la nueva "regla del vecindario" se volvió mucho mejor entendiendo a los usuarios.
- Pruebas fuera de línea: El nuevo robot mejoró su capacidad para encontrar los artículos correctos en aproximadamente un 7.56% para las búsquedas en el feed de inicio y un 4.61% para el ranking de anuncios, en comparación con el robot antiguo.
- Pruebas en vivo: Cuando pusieron el nuevo robot en la aplicación real, los resultados fueron aún más emocionantes. El número de clics en el feed de inicio aumentó un 10.0%, y el número de personas que ven el feed (impresiones) aumentó un 5.12%. Incluso los anuncios funcionaron mejor, con un aumento del 7.46% en las personas que hacen clic en ellos.
La Conclusión
El artículo concluye que, para las plataformas de comunidad local, no puedes simplemente mezclar y combinar usuarios e artículos de forma aleatoria. Tienes que respetar la geografía. Al asegurar que el robot solo aprenda de cosas que los usuarios realmente podrían ver, el robot aprende mucho más rápido y de forma más inteligente. Los autores ya han implementado este nuevo método en Karrot, y ahora está ayudando a millones de usuarios a encontrar las cosas que realmente quieren, justo en sus propios vecindarios. Sugieren que, si bien este es un gran paso adelante, podría haber más formas de ajustar estas reglas de "vecindario" en el futuro, pero por ahora, el simple arreglo de "no contrastar lo imposible" ha demostrado ser un ganador.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.