Image Score: Learning and Evaluating Human Preferences for Mercari Search
Dit artikel presenteert een kosteneffectieve, door LLM's aangedreven aanpak met Chain-of-Thought-prompting om afbeeldingskwaliteitslabels te genereren die correleren met menselijk gedrag op het e-commerceplatform van Mercari, wat uiteindelijk leidt tot aanzienlijke omzetgroei door verbeterde zoekrelevantie en verklaarbaarheid.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je Mercari voor als een enorme, drukke digitale vlooienmarkt waar miljoenen mensen van alles kopen en verkopen, van vintage kleding tot gebruikte elektronica. In deze markt is het allerbelangrijkste voor een verkoper hun "etalage"—de foto die ze van hun item maken. Als de foto wazig, donker of rommelig is, scrollen kopers er direct langs, zelfs als de prijs perfect is. Als de foto helder, duidelijk en professioneel oogt, stoppen kopers en klikken ze.
Het team bij Mercari wilde een specifiek probleem oplossen: Hoe kunnen we automatisch vertellen welke foto's "goed" zijn en welke "slecht", zonder een leger van menselijke beoordelaars in te huren?
Hier is het verhaal van hoe ze dat deden, eenvoudig uitgelegd:
1. Het Probleem: De "Stille" Koper
In een normale winkel kun je een vriend vragen: "Vind je dit shirt leuk?" Op een online markt zeggen kopers niets. Ze klikken gewoon of ze klikken niet. Dit heet "impliciete feedback".
- De Uitdaging: Als een koper op een item klikt, is dat omdat het item precies is wat ze wilden (relevantie), of gewoon omdat de foto er geweldig uitzag?
- Het Doel: Het team wilde de factor "goede foto" scheiden van de factor "juist product". Ze wilden weten: Als twee items dezelfde prijs en hetzelfde type hebben, krijgt degene met de betere foto dan meer klikken?
2. De Oplossing: De "AI-Kunstkriticus"
Normaal gesproken heb je duizenden mensen nodig om een computer te leren hoe een "goede foto" eruitziet, door ze foto's te laten bekijken en cijfers te geven. Dat is traag en duur.
In plaats daarvan gebruikte het Mercari-team een Groot Taalmodel (LLM)—een super slimme AI die afbeeldingen kan "zien". Denk aan deze AI als een virtuele kunstkriticus.
- Het Proces: Ze namen groepen vergelijkbare items (zoals vijf verschillende advertenties voor hetzelfde type spijkerbroek) en vroegen de AI: "Kijk naar deze foto's. Vergelijk ze met elkaar. Welke ziet er het beste uit? Waarom?"
- De Geheime Ingrediënt (Chain-of-Thought): Ze vroegen niet alleen om een score. Ze vroegen de AI om "hardop na te denken" (Chain-of-Thought). De AI moest uitleggen waarom een foto goed was: "De belichting is helder", "De kleuren passen bij elkaar", "De achtergrond is schoon". Dit hielp de AI om veel nauwkeurigere scores te geven die overeenkwamen met wat echte mensen zouden denken.
3. Het Trainen van de "Slimme Sorteerder"
De AI-kriticus is geweldig, maar te traag en duur om op elk enkel item in de markt te gebruiken telkens als iemand zoekt. Het is alsof je een beroemde kunstkriticus inhuurt om elke foto in een bibliotheek te beoordelen; dat zou eeuwig duren.
Dus gebruikten ze de cijfers van de AI-kriticus om een lichtgewicht, snel computermodel te trainen (een "Slimme Sorteerder").
- De Analogie: Stel je voor dat de AI-kriticus een meesterkok is die een gerecht proeft en een gedetailleerde recensie schrijft. De "Slimme Sorteerder" is een junior-kok die kijkt hoe de meesterkok veel gerechten proeft, de patronen leert, en vervolgens snel de kwaliteit van nieuwe gerechten kan raden zonder elke keer de hulp van de meesterkok nodig te hebben.
- Het Resultaat: Dit nieuwe model leerde voorspellen welke foto's klikken zouden krijgen, gebaseerd op de "cijfers" die de AI-kriticus hen gaf.
4. De Grote Test: In de Praktijk
Ze testten dit systeem in de echte wereld op de Mercari-website. Ze splitsten gebruikers in twee groepen:
- Groep A (De Controle): Zie de zoekresultaten zoals gewoonlijk.
- Groep B (De Test): Zie zoekresultaten waarbij items met "hoogwaardige foto's" naar boven werden geschoven, zelfs als ze iets minder relevant waren voor de zoekterm.
Het Resultaat:
- Op het Web: De testgroep kocht bijna 7% meer dan de controlegroep. De "Slimme Sorteerder" slaagde erin de mooiste foto's voor de kopers te plaatsen, en de kopers reageerden door meer te klikken en te kopen.
- Op Mobiel: Interessant genoeg werkte dit minder goed op mobiele telefoons. De auteurs suggereren dat dit misschien komt omdat telefoonschermen kleiner zijn, waardoor gebruikers zich minder zorgen maken om kleine visuele details in vergelijking met mensen die op grote computerschermen browsen.
5. De Haken en Ogen: De "Valse" Foto's
Het artikel noemt ook een grappig neveneffect. Omdat de AI houdt van mooie plaatjes, begonnen sommige verkopers AI-genereren afbeeldingen (door computers gemaakt kunst) te plaatsen in plaats van echte foto's van hun items. Deze nepbeelden kregen perfecte scores en schoten naar de top van de lijst, zelfs al waren het geen echte producten.
- De Les: Het systeem heeft een "waarheidsdetector" nodig om ervoor te zorgen dat de mooie plaatjes echt items zijn en niet gewoon digitale kunst.
Samenvatting
Het Mercari-team bouwde een systeem dat een slimme AI gebruikt om productfoto's te beoordelen, een sneller model leert om die beoordeling na te bootsen, en die beoordelingen gebruikt om de best uitziende items eerst te tonen. Het resultaat? Op de website kochten mensen meer omdat de items er beter uitzagen. Het is een beetje zoals een supermarkt herschikken zodat de versste, kleurrijkste groenten altijd op ooghoogte staan—natuurlijk kopen mensen er meer van.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.