Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL
Dit artikel introduceert CQ-SID en EG-GRPO, een praktisch generatief zoekraamwerk voor e-commerce dat hiërarchische semantische cluster-ID's en door experts geleide versterkende leer gebruikt om aanzienlijke verbeteringen te realiseren in herroepings-efficiëntie, rangschikkingsalignatie en belangrijke bedrijfsmetrieken zoals GMV in echte productiesystemen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, chaotische magazijn binnenloopt (zoals een gigantische e-commerce site) op zoek naar een specifiek item, bijvoorbeeld een "rode hardloopschoen". In de oude tijden zou de magazijnmanager eerst een bibliothecaris vragen om een lijst met mogelijke schoenen te vinden (Recall), vervolgens een sorteerder om ze te ordenen (Ranking), en tot slot een verkoper om je de beste te tonen. Dit proces is snel, maar mist soms de perfecte schoen omdat de bibliothecaris slechts een paar trefwoorden kent.
Recent hebben wetenschappers een nieuw idee geprobeerd: in plaats van een bibliothecaris, huurden ze een superslimme AI in die de exacte schoen die je wilt droomt en deze direct uit het rek haalt. Dit heet Generatieve Retrieval. Echter, in een magazijn met honderden miljoenen items raakt deze AI overweldigd. Het probeert de exacte naam van elke enkele schoen te raden, wat te lang duurt en vaak tot fouten leidt.
Dit artikel presenteert een nieuwe, slimmere manier om deze "dromende AI" te laten werken in een echt, gigantisch magazijn. Hier is hoe ze dat deden, simpel uitgelegd:
1. Het Probleem: Te Veel Namen, Niet Genoeg Tijd
De oude manier om deze AI te gebruiken was alsof je vroeg om het unieke serienummer van elke enkele schoen in het magazijn uit het hoofd te leren. Als er 100 miljoen schoenen zijn, moet de AI elke keer als je een vraag stelt kiezen uit 100 miljoen opties. Het is alsof je een speld in een hooiberg probeert te vinden door elk stukje hooi één voor één te controleren. Het is te traag en te duur.
2. De Oplossing: Groeperen op "Vibe" (CQ-SID)
In plaats van elke schoen een uniek serienummer te geven, besloten de auteurs om schoenen te groeperen in Semantische Clusters.
- De Analogie: Stel je voor dat het magazijn niet is georganiseerd op individuele schoenserialnummers, maar op "vibes" of "buurten". Alle "rode hardloopschoenen" wonen in de "Rode Hardloper Buurt". Alle "blauwe sandalen" wonen in de "Blauwe Sandaal Buurt".
- Hoe het werkt: Ze creëerden een systeem genaamd CQ-SID. In plaats van de AI te vragen de exacte schoen te raden, vragen ze de AI om de buurt (het cluster-ID) te raden waar de schoen woont.
- Het Voordeel: De AI hoeft slechts te kiezen tussen enkele duizenden buurten in plaats van honderden miljoenen schoenen. Dit is alsof je je zoekopdracht verengt van "Vind de exacte schoen" naar "Vind de Rode Hardloper Buurt". Het is veel sneller en vereist minder rekenkracht.
3. De Training: Een Vierstapschool voor de AI
Je kunt deze AI niet zomaar een lijst met buurten geven en verwachten dat ze ze kent. De auteurs trainden het in vier progressieve stappen, zoals een student die afstudeert van de basisschool tot de universiteit:
- Item-naar-SID: Eerst leert de AI om naar de beschrijving van een schoen te kijken en te zeggen: "Ah, dit hoort in de Rode Hardloper Buurt."
- Query-naar-SID: Vervolgens leert het om te kijken naar wat een mens heeft getypt ("rode hardloopschoen") en direct de buurt te raden.
- Gepersonaliseerd: Daarna leert het om te kijken naar wie er vraagt. Als een professionele hardloper vraagt, raadt het een high-tech hardloopbuurt; als een recreatieve wandelaar vraagt, raadt het een comfortbuurt.
- De "Expert" Coach (EG-GRPO): Dit is de laatste, belangrijkste stap.
4. De "Expert" Coach (EG-GRPO)
Hier zit het lastige deel: De AI is goed in het raden van buurten, maar soms kiest het een buurt die sommige goede schoenen heeft, maar de beste mist. In de oude dagen werd de AI alleen beloond als het de exacte schoen raadde waarop de gebruiker klikte. Maar in een enorm magazijn kan de AI de klik missen alleen omdat het niet de exacte juiste schoen raadde, zelfs als het de juiste buurt koos.
De auteurs introduceerden een methode genaamd Expert-Guided RL.
- De Analogie: Stel je voor dat de AI een videospel speelt. Normaal gesproken krijgt het alleen een "Game Over" als het het doel mist. Maar hier treden de auteurs op als een Coach.
- Hoe het werkt: Tijdens de training fluistert de Coach stiekem naar de AI: "Hé, ik weet dat je deze keer de klik gemist hebt, maar kijk! Het werkelijke winnende item zat in deze buurt. Onthoud dat voor de volgende keer."
- Het Resultaat: De AI leert niet alleen om achter de enkele klik aan te jagen, maar om een bredere variëteit aan goede buurten te verkennen. Dit voorkomt dat de AI "lui" wordt en alleen de populairste items kiest (wat een veelvoorkomend probleem is dat het "Matthew-effect" wordt genoemd).
5. De Resultaten: Sneller, Slimmer en Meer Verkoop
Toen ze dit testten in de echte Tmall-app (een enorm Chinees winkelplatform):
- Snelheid: Ze konden een veel smaller "zoekstraal" gebruiken (alsof je naar minder opties kijkt) en toch de juiste items vinden. Dit halveerde de zoektijd.
- Nauwkeurigheid: De AI vond de juiste "buurten" veel vaker dan het oude systeem.
- Bedrijfsimpact: Omdat de AI sneller betere items vond, kochten mensen meer. Het systeem verhoogde de omzet (GMV) met 1,15% en het percentage mensen dat klikt om te kopen (UCTCVR) met 0,40%.
- Dominantie: Dit nieuwe "dromende" kanaal werd het belangrijkste onderdeel van hun zoekfunctie, verantwoordelijk voor meer dan 72% van alle aankopen die via hun zoeksysteem werden gedaan.
Samenvattend:
De auteurs probeerden niet het hele zoeksysteem te vervangen door een magische AI. In plaats daarvan gaven ze de AI een betere kaart (items groeperen in buurten) en een betere coach (Expert-Guided RL) om het te helpen leren. Dit maakte de zoekfunctie sneller, nauwkeuriger en aanzienlijk winstgevender voor het bedrijf.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.