LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
यह शोध पत्र LocalSearchBench प्रस्तुत करता है, जो स्थानीय जीवन सेवाओं के जटिल और संदिग्ध डोमेन में एजेंटिक सर्च (agentic search) का मूल्यांकन करने के लिए पहला व्यापक बेंचमार्क और एकीकृत वातावरण है, जो यह प्रकट करता है कि अत्याधुनिक बड़े रीजनिंग मॉडल भी वास्तविक दुनिया के परिदृश्यों में मल्टी-हॉप रीजनिंग (multi-hop reasoning), पूर्णता और निष्ठा (faithfulness) में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित लाइब्रेरियन (पुस्तकालयाध्यक्ष) से शहर में एक बेहतरीन दिन बिताने की योजना बनाने में मदद मांग रहे हैं। आप केवल किताबों की सूची नहीं चाहते; आप एक जटिल यात्रा कार्यक्रम चाहते हैं: "मुझे बोर्ड गेम खेलने के लिए एक जगह ढूंढ कर दें, फिर पास में ही रात के खाने के लिए एक रेस्टोरेंट, और अंत में एक कराओके स्पॉट, जो शंघाई में एक-दूसरे के पैदल चलने योग्य दूरी के भीतर हो।"
यह बिल्कुल वही चुनौती है जिसे LocalSearchBench नामक पेपर हल करता है। यहाँ शोधकर्ताओं ने क्या किया है, इसका एक सरल विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।
1. समस्या: "स्मार्ट" लाइब्रेरियन रास्ता भटक जाता है
हाल के वर्षों में, हमने AI "एजेंट्स" (जैसे कि सुपर-स्मार्ट लाइब्रेरियन) बनाए हैं जो इंटरनेट खोज सकते हैं, कई वेबसाइटों को पढ़ सकते हैं और कठिन सवालों के जवाब देने के लिए कड़ियों को जोड़ सकते हैं। उदाहरण के लिए, वे यह पता लगा सकते हैं कि उसी वर्ष में जिस रॉकेट ने उड़ान भरी थी, उसी वर्ष में किस निर्देशक ने ऑस्कर विजेता फिल्म निर्देशित की थी।
हालाँकि, ये AI एजेंट सामान्य ज्ञान (trivia) में तो माहिर हैं लेकिन लोकल लाइफ सर्विसेज (स्थानीय जीवन सेवाओं) में बहुत खराब हैं। यदि आप उनसे किसी विशिष्ट मेट्रो स्टेशन के पास एक विशिष्ट प्रकार के कॉफी शॉप के बारे में पूछते हैं जो एक विशिष्ट समय पर खुला हो, तो वे अक्सर भ्रमित हो जाते हैं। उन्हें निम्नलिखित चीजों में कठिनाई होती है:
- यह समझने में कि "पास में" का अर्थ केवल "उसी शहर में" नहीं, बल्कि पैदल चलने योग्य दूरी है।
- कई चरणों को एक साथ जोड़ने में (जैसे: संग्रहालय खोजें संग्रहालय के पास एक कैफे खोजें कैफे के पास एक सुविधा स्टोर/कन्वीनिएंस स्टोर खोजें)।
- स्थानीय व्यवसायों के वास्तविक, अव्यवस्थित विवरणों (कीमत, समय, रेटिंग) को संभालने में।
2. समाधान: एक "ट्रेनिंग जिम" बनाना (LocalSearchBench)
इसे ठीक करने के लिए, Meituan और कई विश्वविद्यालयों के शोधकर्ताओं ने LocalSearchBench नामक एक विशाल प्रशिक्षण मैदान बनाया। इसे एक विशाल, यथार्थवादी वीडियो गेम लेवल के रूप में समझें जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि ये AI एजेंट शहर में नेविगेट करने में कितने अच्छे हैं।
- डेटाबेस (शहर का नक्शा): उन्होंने 9 प्रमुख चीनी शहरों में 1.3 मिलियन वास्तविक व्यवसायों (रेस्टोरेंट, होटल, दुकानें आदि) वाला एक डिजिटल मानचित्र बनाया। उन्होंने इस डेटा को साफ किया, गायब विवरण (जैसे खुलने का समय) जोड़े, और निजी जानकारी को हटा दिया ताकि यह उपयोग के लिए सुरक्षित रहे।
- परीक्षण प्रश्न (मिशन): उन्होंने केवल "पिज्जा की दुकान कहाँ है?" जैसे सरल प्रश्न नहीं पूछे। इसके बजाय, उन्होंने 900 जटिल मिशन बनाए।
- सरल मिशन: "पीपुल्स स्क्वायर के पास सबसे अधिक रेटिंग वाला कॉफी शॉप खोजें।"
- जटिल मिशन: "मैं शंघाई में एक मिस्र की प्रदर्शनी देख रहा हूँ। उसके बाद, मुझे आराम करने के लिए एक शांत कैफे और स्नैक्स के लिए एक सुविधा स्टोर चाहिए। मेरे लिए एक ऐसा मार्ग खोजें जहाँ दोनों एक ही मेट्रो स्टेशन के अंदर हों।"
3. खेल का मैदान: "सिमुलेशन एरिना" (LocalPlayground)
AI को टेस्ट करने के लिए, उन्होंने LocalPlayground नामक एक सिमुलेशन एरिना बनाया।
- कल्पना कीजिए कि AI एक जासूस है। उसके पास दो उपकरण हैं: एक Local RAG (1.3 मिलियन स्थानीय व्यवसायों का एक सुपर-फास्ट इंडेक्स) और एक Web Search (वास्तविक समय की खबरों या घटनाओं की जांच करने के लिए)।
- AI को इन उपकरणों का उपयोग चरण-दर-चरण करना होगा। वह केवल अनुमान नहीं लगा सकता; उसे "सोचना" होगा, खोजना होगा, एक सुराग ढूंढना होगा, उस सुराग के आधार पर फिर से खोजना होगा, और अंत में उत्तर को जोड़ना होगा।
4. परिणाम: AI अभी भी एक नौसिखिया है
शोधकर्ताओं ने 16 दुनिया के सबसे स्मार्ट AI मॉडल्स (DeepSeek, GPT और Gemini जैसे बड़े नामों सहित) को इस सिमुलेशन में टेस्ट किया। परिणाम आश्चर्यजनक थे:
- स्कोर: सबसे अच्छा AI मॉडल भी केवल 35.6% उत्तर सही दे पाया। यह एक टेस्ट में D+ ग्रेड लाने जैसा है।
- संघर्ष के क्षेत्र:
- पूर्णता (Completeness): AI अक्सर अनुरोध के हिस्सों को भूल जाता था (जैसे, उसने कैफे तो ढूंढ लिया लेकिन सुविधा स्टोर को भूल गया)।
- विश्वसनीयता (Faithfulness): AI कभी-कभी "हैलुसिनेट" (भ्रमित होकर मनगढ़ंत बातें बनाना) करता था या दावा करता था कि किसी व्यवसाय की रेटिंग वह नहीं थी जो वास्तव में है।
- तर्क (Reasoning): AI अक्सर श्रृंखला के बीच में ही खो जाता था। यदि पहला चरण गलत होता, तो पूरी योजना विफल हो जाती।
5. यह क्यों महत्वपूर्ण है
पेपर यह निष्कर्ष निकालता है कि जबकि AI सामान्य ज्ञान में स्मार्ट हो रहा है, यह वास्तविक दुनिया की स्थानीय सेवाओं के बारीक विवरणों के मामले में अभी भी बहुत अनाड़ी है।
- मुख्य बात: आप केवल एक सामान्य AI लेकर यह उम्मीद नहीं कर सकते कि वह एक आदर्श ट्रैवल एजेंट या स्थानीय गाइड बन जाएगा। इसे विशेष प्रशिक्षण और बेहतर बेंचमार्क (जैसे कि जो उन्होंने बनाया है) की आवश्यकता है ताकि यह सीखने के लिए कि वास्तविक जीवन की जटिलताओं को कैसे संभाला जाए, जहाँ भूगोल, समय और कई बाधाएं एक साथ मायने रखती हैं।
संक्षेप में: पेपर कहता है, "हमने AI एजेंटों के लिए एक कठिन परीक्षा बनाई है यह देखने के लिए कि क्या वे वास्तविक जीवन की शहर नियोजन को संभाल सकते हैं। वे इस परीक्षा में विफल रहे, जो यह साबित करता है कि AI के वास्तव में एक विश्वसनीय स्थानीय गाइड बनने में अभी लंबा रास्ता तय करना बाकी है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।