← Nieuwste papers
💬 NLP

ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons

Dit artikel introduceert ComboShoppingBench, een nieuwe benchmark die is ontworpen om LLM-agenten te evalueren op complexe, budgetbeperkte winkelmandtaken door semantische beoordeling te combineren met deterministische validatie om de uitdagingen aan te pakken van het verifiëren van haalbare, met coupons geoptimaliseerde en compatibele productcombinaties.

Oorspronkelijke auteurs: Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu

Gepubliceerd 2026-08-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om boodschappen te doen. In de begindagen zou je de robot kunnen vragen om "een specifiek merk melk" te vinden. Dat is een eenvoudige taak: kijken, vinden, pakken. Maar het echte leven is zelden zo simpel. Vaak moet je een hele "combo" maaltijd samenstellen: een hoofdgerecht, een bijgerecht dat er perfect bij past, een drankje dat goed combineert, terwijl je binnen een specifiek budget blijft en een stapel verwarrende coupons gebruikt die elkaar misschien wel opheffen. Dit is de wereld van LLM Agents (Large Language Models die optreden als digitale assistenten). Dit zijn slimme computerprogramma's die je verzoek kunnen lezen, door miljoens producten kunnen zoeken en een aankoop kunnen proberen te doen. De grote vraag die wetenschappers stellen is: kunnen deze digitale shoppers daadwerkelijk omgaan met de rommelige, ingewikkelde realiteit van het samenstellen van een volledige winkelmandje zonder in de war te raken, te veel uit te geven of dingen te kopen die niet bij elkaar passen?

Maak kennis met ComboShoppingBench, een nieuwe "examen" ontworpen door onderzoekers van JD.com om te testen hoe goed deze AI-shoppers echt zijn. Zie deze benchmark niet als een simpele quiz, maar als een hindernisbaan met hoge inzet. De onderzoekers creëerden een gesimuleerde wereld vol met echte producten, coupons en strikte regels. Ze vroegen de AI niet alleen om een paar artikelen te kiezen; ze gaven het complexe missies zoals "Bouw een gaming PC die in een kleine behuizing past" of "Bestel een maaltijd voor een groep van vijf personen waarbij de drankjes uit dezelfde winkel komen als het eten." De crux is dat de AI ervoor moet zorgen dat elk item werkt met elk ander item (zoals ervoor zorgen dat de computeronderdelen in elkaar passen), de coupons zo slim mogelijk moet gebruiken om geld te besparen, en binnen een strak budget moet blijven. Het is alsof je een robot vraagt om tegelijkertijd een meesterkok, een budgetboekhouder en een coupon-snijding-wizard te zijn.

De resultaten van dit examen waren een beetje een reality check voor de techwereld. De onderzoekers testten 11 verschillende AI-agents, incluscept wat de krachtigste modellen van dit moment. Zelfs de "sterleerling", een model genaamd GPT-5.5 met zijn denkmodus ingeschakeld, slaagde voor de volledige test slechts ongeveer 61,2% van de tijd. Dat betekent dat het bijna 4 van de 10 taken faalde. Het artikel suggereert dat hoewel deze AI's beter worden in het vinden van individuele artikelen, ze nog steeds moeite hebben met het "combo"-gedeelte van de baan. Ze missen vaak de subtiele connecties tussen producten (zoals een telefoonhoesje kopen dat niet bij het telefoonmodel past) of raken in de knoop met de wiskunde van het stapelen van coupons. Ze kiezen misschien de juiste artikelen, maar falen in het correct berekenen van de eindprijs, of ze kiezen een coupon die op papier goed lijkt, maar uiteindelijk meer kost.

De onderzoekers bouwden deze test met een slimme "solution-first" methode. In plaats van te raden of een boodschappenlijstje mogelijk is, liet een computeragent eerst een werkend mandje met artikelen vinden. Daarna werkten ze terug om de bestelling, het budget en de coupons te creëren op basis van dat werkende mandje. Dit zorgt ervoor dat de test eerlijk en oplosbaar is. Ze gebruikten ook een mix van mensachtige beoordelaars (andere AI-modellen) en strikte regelcontroleurs om de antwoorden te beoordelen. De regelcontroleurs fungeerden als een strenge cassière, die controleerde of de wiskunde klopte en de coupons legaal waren, terwijl de beoordelaars controleerden of de boodschappenlijst daadwerkelijk zinvol was voor de gebruikersaanvraag.

De studie kwam tot de conclusie dat het moeilijkste deel voor de AI niet het vinden van een enkel product was, maar het regelen van meerdere beperkingen tegelijkertijd. Wanneer een taak van de AI vereiste om te onthouden dat "Item A moet passen bij Item B" en dat "Item C uit dezelfde winkel moet komen als Item D" en dat "Het totaal onder de $100 moet blijven", liet de AI vaak een van die regels vallen. De "denkmodus" hielp sommige agents beter te plannen, maar het loste niet alles op. Sterker nog, voor sommige modellen maakte te diep nadenken hen zelfs slechter in het gebruiken van hun rekenmachine-tools, wat leidde tot meer rekenfouten. Het artikel concludeert dat hoewel we vooruitgang boeken, de huidige shopping agents nog lang niet de betrouwbare, alwetende persoonlijke shoppers zijn waar we op hopen. Ze zijn als enthousiaste stagiairs die veel weten van producten, maar nog steeds een mens nodig hebben om de bon te controleren en te control je maken of de puzzelstukjes daadwerkelijk in elkaar passen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →