← Nieuwste papers
💻 computer science

Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs

Dit artikel presenteert een schaalbaar, kostenefficiënt systeem voor productkoppeling dat een cascade-architectuur hanteert waarbij een gedestilleerde cross-encoder matches met een hoge mate van zekerheid oplost en een agentisch vision-language model ambigue gevallen afhandelt, waardoor de dekking wordt gemaximaliseerd terwijl de computationele kosten en de vereisten voor menselijke annotatie worden geminimaliseerd.

Oorspronkelijke auteurs: Jian Wang, Steven Xu, Sanjyot Thete, Maryam Barouti, Tom Tang, Elaine Wu, Charu Sareen, Kyle MacDonald

Gepubliceerd 2026-08-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jian Wang, Steven Xu, Sanjyot Thete, Maryam Barouti, Tom Tang, Elaine Wu, Charu Sareen, Kyle MacDonald

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de uitgestrekte, chaotische marktplaats van het moderne internet vermelden miljoenen onafhankelijke verkopers dezelfde artikelen onder verschillende namen, met verschillende foto's en soms met ontbrekende of verwarrende details. Een enkel product, zoals een specifiek merk koffiezetapparaat, kan duizenden keren in een catalogus verschijnen, waarbij elke vermelding net iets anders is dan de vorige. Voor de computers die zoekmachines en aanbevelingen aandrijven, creëert dit een verwarrende mist. Als het systeem niet kan herkennen dat twee verschillende vermeldingen eigenlijk hetzelfde artikel zijn, kan het hun beoordelingen niet combineren, hun verkopen niet bijhouden of ze niet aan de juiste klanten tonen. Het doel van "productlinking" is om deze mist op te klaren, als een digitale bibliothecaris die door de ruis heen sorteert om de enkele, correcte identiteit van elk item op de plank te vinden. Dit is niet alleen een kwestie van organisatie; het is het fundament van hoe webwinkels begrijpen wat ze verkopen.

Een team onderzoekers bij DoorDash heeft een nieuw systeem gebouwd om dit probleem op enorme schaal op te lossen, waarbij miljarden records worden afgehandeld zonder de bank te breken. Ze realiseerden zich dat het verspillen van middelen door elk enkel item op dezelfde manier te behandelen, een verspilling is. Sommige artikelen zijn gemakkelijk te identificeren omdat hun namen en codes perfect overeenkomen, terwijl andere als tweelingen zijn die bij de geboorte van elkaar gescheiden zijn, wat een diepgaand onderzoek vereist om ze uit elkaar te houden. In plaats van een krachtige, dure computerhersenen te gebruiken om elk item te controleren, hebben ze een driestappenproces gecreëerd dat pas meer inspanning levert wanneer dat echt nodig is. Eerst verkleint het systeem de mogelijkheden snel tot een kleine lijst van waarschijnlijke overeenkomsten. Vervolgens controleert een snel, lichtgewicht computerprogramma deze paren. Als de overeenkomst overduidelijk is, accepteert het systeem deze onmiddellijk. Als de overeenkomst duidelijk fout is, wijst het deze af. Maar als het programma onzeker is, escaleert het het moeilijke geval naar een meer geavanceerde kunstmatige intelligentie-agent.

Deze geavanceerde agent is het hart van de nieuwe ontdekking. In tegen tegenstelling tot het snelle programma dat alleen tekst leest, kan deze agent ook productfoto's bekijken en, cruciaal, het open internet doorzoeken naar extra aanwijzingen. Wanneer het systeem een verwarrend paar vermeldingen tegenkomt waarbij de namen vergelijkbaar zijn maar de details vaag zijn, treedt de agent op als een detective. Het kan bijvoorbeeld naar een foto van een pan kijken om te zien of deze van gietijzer of roestvrij staal is gemaakt, of het kan het web doorzoeken met behulp van een streepjescode om de officiële beschrijving van de fabrikant te vinden. Dit vermogen om bewijs te verzamelen van buiten de oorspronkelijke records stelt het systeem in staat om gevallen op te lossen die een simpel tekstvergelijkingstool zouden verbazen. De onderzoekers ontdekten dat door dit "escalatiestrategie" te gebruiken, ze bijna 77 procent van alle producten automatisch konden koppelen, een aanzienlijke sprong ten opzichte van de 68 procent die ze alleen met de goedkopere, snellere tools konden bereiken.

Het team ontdekte ook een verrassende waarheid over hoe je deze systemen traint. In plaats van duizenden mensen in te huren om miljoenen voorbeelden te labelen, gebruikten ze twee verschillende geavanceerde kunstmatige intelligentie-modellen om dezelfde artikelen te beoordelen. Ze hielden alleen de antwoorden aan waar beide modellen het met elkaar eens waren, waardoor ze een zeer betrouwbare set trainingsdata creëerden. Deze methode stelde hen in staat om het snelle, lichtgewicht programma te leren beslissingen te nemen met dezelfde zekerheid als de dure, trage versie, maar tegen een fractie van de kosten. Ze ontdekten ook dat het simpelweg voeren van de ruwe cijfers van een streepjescode aan het systeem beter werkte dan het geven van een vooraf ingesteld "match" of "geen match" vlag, omdat de computer zelf patronen van gedeeltelijke overeenkomsten en fouten kon leren herkennen. Ze moesten echter voorzichtig zijn, aangezien te veel vertrouwen op streepjescodes kon leiden tot fouten wanneer twee verschillende producten per ongeluk dezelfde code deelden. Ze losten dit op door het systeem te leren de productnaam te dubbelchecken wanneer de streepjescode overeenkwam, om er zeker van te zijn dat het niet werd misleid door zeldzame fouten.

Door een snelle filter te combineren met een slimme, webzoekende agent, hebben de onderzoekers een systeem gecreëerd dat zowel accuraat als betaalbaar is. Ze vervingen een kostbare, gesloten AI door een zelfgehoste versie die ongeveer een zevende minder kost om te draaien, terwijl ze nog steeds een hoge nauwkeurigheid behielden. Deze aanpak betekent dat online marktplaatsen hun catalogi grondiger kunnen opschonen, zodat klanten een enkele, heldere vermelding voor elk product zien in plaats van een verspreide bende duplicaten. Het resultaat is een slimmere, efficiëntere manier om de wereldwijde goederen te organiseren, wat bewijst dat de beste manier om een enorm probleem op te lossen niet altijd is om de grootste hamer voor elke spijker te gebruiken, maar om precies te weten wanneer je de expert moet oproepen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →