← Nieuwste papers
💬 NLP

ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?

ShoppingComp is een nieuwe benchmark die aantoont dat huidige grote taalmodellen nog tekortschieten in complexe e-commerce taken zoals productretrieval, rapportage en veilige besluitvorming.

Oorspronkelijke auteurs: Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia

Gepubliceerd 2026-02-10
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super slimme robot-assistent hebt die voor je naar de winkel mag. Je zegt: "Ik zoek een nieuwe koffiezetapparaat voor een klein appartement, het moet ook kunnen bakken, veilig zijn voor mijn allergieën, en niet te veel lawaai maken."

Je verwacht dat die robot precies het juiste apparaat meeneemt, uitlegt waarom het perfect is, en — heel belangrijk — niet per ongeluk een apparaat adviseert dat je huis in brand kan steken.

De kern van dit onderzoek: Zijn AI-modellen (zoals ChatGPT) eigenlijk wel klaar om jouw winkelmandje te vullen?

De onderzoekers van ByteDance hebben ontdekt dat het antwoord op dit moment nog een harde "Nee" is. Ze hebben hiervoor een test gedaan genaamd ShoppingComp.

Hier is de uitleg van wat ze hebben gedaan, in gewone mensentaal:

1. De "Ultieme Supermarkt-test" (De Benchmark)

De onderzoekers hebben niet zomaar een lijstje met simpele vragen gemaakt (zoals: "zoek een rode pen"). Dat is te makkelijk. Ze hebben 35 experts ingeschakeld om scenario's te bedenken die echt lastig zijn.

Denk aan de test als een hindernisbaan voor robots:

  • De Obstakelbaan (Producten vinden): De robot moet niet alleen een product vinden, maar een product dat aan alle kleine eisen voldoet (bijv. precies de juiste maat, de juiste techniek én de juiste prijs).
  • De Verhalenverteller (Rapporten schrijven): De robot moet niet alleen een linkje sturen, maar ook een goed rapport schrijven: "Ik raad dit aan omdat het precies past in jouw kleine keuken en de knoppen makkelijk zijn voor je oma."
  • De Brandweerman (Veiligheid): Dit is de belangrijkste. Als jij vraagt om een waterkoker, mag de robot niet per ongeluk een apparaat aanraden dat gevaarlijk is om in een badkamer te plaatsen.

2. De Resultaten: De robot struikelt over zijn eigen voeten

De onderzoekers lieten de slimste AI-modellen van dit moment (zoals GPT-5 en Gemini) de test doen. De resultaten waren schokkend slecht:

  • De "Vergeetachtige Assistent": De robots vonden vaak wel producten, maar ze vergaten de helft van je eisen. Het is alsof je vraagt om een blauwe auto met vier deuren, en de robot komt terug met een rode auto met twee deuren en zegt: "Kijk eens wat een mooie auto!"
  • De "Onbetrouwbare Expert": Als de robots uitleg gaven, klopten de feiten vaak niet. Ze verzinnen soms details over een product die er helemaal niet zijn. Het is alsof een verkoper zegt: "Deze stofzuiger is superstil," terwijl hij eigenlijk een ronkende tractor voor je neus zet.
  • De "Gevaarlijke Adviseur": Dit is het grootste probleem. Bij de veiligheidstests scoorden de robots heel laag. Ze herkenden de gevaarlijke situaties (de "vallen") vaak niet. In de test was dit alsof je een robot vraagt om een cadeau te kopen, en hij adviseert je om een elektrische kachel in een houten hutje te zetten zonder te zeggen dat dat brandgevaarlijk is.

3. Waarom gaat het mis? (De Metafoor)

De onderzoekers zeggen eigenlijk dat AI-modellen momenteel werken als een student die alleen uit een tekstboek leert, maar nooit echt een winkel heeft bezocht.

Ze kunnen heel goed praten over producten, maar zodra ze echt op het "internet-plein" moeten gaan zoeken naar de allerkleinste details (zoals de exacte afmetingen van een muis of de veiligheidscertificaten van een apparaat), raken ze de weg kwijt in de enorme hoeveelheid informatie. Ze zien door de bomen het bos niet meer.

Conclusie

De paper concludeert: "Wacht nog maar even met het geven van je creditcard aan de AI."

Hoewel de technologie razendsnel gaat, zijn de huidige AI-modellen nog niet betrouwbaar genoeg om zelfstandig beslissingen te nemen die belangrijk of zelfs gevaarlijk zijn voor jou. Ze zijn nog een beetje als een enthousiaste, maar onhandige stagiair: ze willen je heel graag helpen, maar je moet alles drie keer controleren!

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →