← Nieuwste papers
🤖 AI

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services

Dit artikel introduceert LocalSearchBench, de eerste uitgebreide benchmark en verenigde omgeving voor het evalueren van agentische zoekopdrachten binnen het complexe, ambigue domein van lokale levensdiensten, waarbij wordt onthuld dat zelfs de meest geavanceerde grote redeneermodellen worstelen met multi-hop redeneren, volledigheid en getrouwheid in real-world scenario's.

Oorspronkelijke auteurs: Hang He, Chuhuai Yue, Chengqi Dong, Mingxue Tian, Hao Chen, Zhenfeng Liu, Jiajun Chai, Xiaohan Wang, Yufei Zhang, Qun Liao, Guojun Yin, Wei Lin, Chengcheng Wan, Haiying Sun, Ting Su

Gepubliceerd 2026-06-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hang He, Chuhuai Yue, Chengqi Dong, Mingxue Tian, Hao Chen, Zhenfeng Liu, Jiajun Chai, Xiaohan Wang, Yufei Zhang, Qun Liao, Guojun Yin, Wei Lin, Chengcheng Wan, Haiying Sun, Ting Su

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer intelligente, erudiete bibliothecaris vraagt om je te helpen bij het plannen van een perfecte dag uit in een drukke stad. Je wilt niet alleen een lijst met boeken; je wilt een complexe routebeschrijving: "Zoek een plek om bordspellen te spelen, dan een restaurant in de buurt voor het diner, en tot slot een karaoke-locatie, allemaal op loopafstand van elkaar in Shanghai."

Dit is precies de uitdaging waar het paper LocalSearchBench zich mee bezighoudt. Hier is een eenvoudige uiteenzetting van wat de onderzoekers hebben gedaan, gebruikmakend van alledaagse analogieën.

1. Het Probleem: De "Slimme" Bibliothecaris Raakt Verdwaald

In de afgelopen jaren hebben we AI-"agenten" gebouwd (zoals superintelligente bibliothecarissen) die het internet kunnen doorzoeken, meerdere websites kunnen lezen en de verbanden kunnen leggen om moeilijke vragen te beantwoorden. Ze kunnen bijvoorbeeld uitzoeken wie de regisseur was van een film die in hetzelfde jaar een Oscar won als een raket werd gelanceerd.

Echter, deze AI-agenten zijn geweldig in algemene trivia, maar verschrikkelijk in lokale diensten. Als je hen vraagt om een specifiek type koffiebar te vinden bij een specifieke metrostation die op een specifiek tijdstip open is, raken ze vaak in de war. Ze worstelen met:

  • Het begrijpen dat "nabij" loopafstand betekent, en niet alleen "in dezelfde stad".
  • Het aan elkaar koppelen van meerdere stappen (bijv. Zoek het museum \rightarrow Zoek een café nabij het museum \rightarrow Zoek een gemakswinkel nabij het café).
  • Het omgaan met de rommelige, echte details van lokale bedrijven (prijzen, openingstijden, beoordelingen).

2. De Oplossing: Een "Trainingsgym" Bouwen (LocalSearchBench)

Om dit op te lossen, hebben de onderzoekers van Meituan en verschillende universiteiten een enorme trainingsgrond gebouwd genaamd LocalSearchBench. Zie dit als een gigantisch, realistisch videospel-niveau dat specifiek is ontworpen om te testen hoe goed deze AI-agenten een stad kunnen navigeren.

  • De Database (De Stadskaart): Ze hebben een digitale kaart gemaakt met meer dan 1,3 miljoen echte bedrijven (restaurants, hotels, winkels, etc.) verspreid over 9 grote Chinese steden. Ze hebben deze data opgeschoond, ontbrekende details toegevoegd (zoals openingstijden) en privé-informatie verwijderd zodat het veilig te gebruiken is.
  • De Testvragen (De Missies): Ze stelden niet alleen simpele vragen zoals "Waar is een pizzaplek?" In plaats daarvan hebben ze 900 complexe missies gecreëerd.
    • Simpele Missie: "Vind de hoogst beoordeelde koffiebar nabij People's Square."
    • Complexe Missie: "Ik bezoek een Egyptische tentoonstelling in Shanghai. Daarna heb ik een rustig café nodig om te ontspannen en een gemakswinkel voor snacks. Vind een route waarbij beide zich in hetzelfde metrostation bevinden."

3. De Speeltuin: De "Simulatiearena" (LocalPlayground)

Om de AI te testen, hebben ze een simulatiearena gebouwd genaamd LocalPlayground.

  • Stel je voor dat de AI een detective is. Het heeft twee hulpmiddelen: een Local RAG (een supersnelle index van de 1,3 miljoen lokale bedrijven) en een Web Search (om realtime nieuws of evenementen te controleren).
  • De AI moet deze hulpmiddelen stap voor stap gebruiken. Het kan niet zomaar gokken; het moet "denken", zoeken, een aanwijzing vinden, opnieuw zoeken op basis van die aanwijzing, en uiteindelijk het antwoord samenvoegen.

4. De Resultaten: De AI is Nog een Rookeling

De onderzoekers hebben 16 van de slimste AI-modellen ter wereld getest (inclusief grote namen zoals DeepSeek, GPT en Gemini) in deze simulatie. De resultaten waren verrassend:

  • De Score: Zelfs het beste AI-model kreeg slechts 35,6% van de antwoorden correct. Dat is alsolijk een D+ halen voor een toets.
  • De Moeilijkheden:
    • Volledigheid: De AI vergeet vaak delen van de aanvraag (bijv. het vond het café, maar vergat de gemakswinkel).
    • Getrouwheid: De AI "hallucineert" soms (verzint dingen) of beweert dat een bedrijf een beoordeling heeft die het eigenlijk niet heeft.
    • Redeneren: De AI raakt vaak halverwege de keten verdwaald. Als de eerste stap fout was, viel het hele plan in duigen.

5. Waarom Dit Belangrijk Is

Het paper concludeert dat hoewel AI slimmer wordt in algemene kennis, het nog steeds erg onhandig is als het gaat om de praktische details van lokale diensten in de echte wereld.

  • De Kernboodschap: Je kunt niet zomaar een algemene AI nemen en verwachten dat het al een perfecte reisagent of lokale gids is. Het heeft gespecialiseerde training en betere benchmarks nodig (zoals degene die zij hebben gebouwd) om te leren hoe het moet omgaan met de complexiteit van het echte leven, waar geografie, timing en meerdere beperkingen tegelijkertijd van belang zijn.

Kortom: Het paper zegt: "We hebben een zware examen voor AI-agenten gebouwd om te zien of ze een complexe stadsplanning kunnen aan. Ze zijn gezakt voor het examen, wat bewijst dat we nog een lange weg te gaan hebben voordat AI echt een betrouwbare lokale gids kan zijn."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →