← नवीनतम पेपर
🤖 AI

AgentSearchBench: A Benchmark for AI Agent Search in the Wild

AgentSearchBench एक बड़े पैमाने का बेंचमार्क है जिसे एजेंट खोज को रिट्रीवल (retrieval) और रीरैंकिंग (reranking) की समस्या के रूप में औपचारिक रूप देकर एजेंट डिस्कवरी का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि पारंपरिक सिमेंटिक समानता (semantic similarity) वास्तविक प्रदर्शन का पूर्वानुमान लगाने में विफल रहती है और उपयुक्त एजेंटों को खोजने के लिए निष्पादन-आधारित संकेतों (execution-based signals) को शामिल करना आवश्यक है।

मूल लेखक: Bin Wu, Arastun Mammadli, Xiaoyu Zhang, Emine Yilmaz

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Bin Wu, Arastun Mammadli, Xiaoyu Zhang, Emine Yilmaz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अनंत शॉपिंग मॉल के बीच में खड़े हैं। यह मॉल केवल कपड़े या इलेक्ट्रॉनिक्स ही नहीं बेचता; यह "डिजिटल वर्कर्स" (AI एजेंट्स) बेचता है।

कुछ वर्कर्स कोडिंग में विशेषज्ञ हैं, कुछ मास्टर शेफ हैं, और अन्य पेशेवर ट्रैवल प्लानर हैं। समस्या यह है कि उनके पास लगभग 10,000 वर्कर्स हैं और उन सभी के ब्रोशर (विवरण) बहुत भ्रमित करने वाले हैं। एक वर्कर का ब्रोशर कहता है, "मैं तर्क (logic) का उस्ताद हूँ," जबकि दूसरे का कहता है, "मैं जटिल गणित की समस्याओं को हल कर सकता हूँ।" आप किसी से "टोक्यो की 3-दिवसीय यात्रा व्यवस्थित करने" के लिए कहना चाहते हैं, लेकिन आपको पता ही नहीं है कि कौन सा वर्कर वास्तव में इसे कर सकता है और कौन सा सिर्फ कागज़ पर अच्छा दिखता है

यह पेपर AgentSearchBench पेश करता है—एक हाई-टेक "टेस्टिंग लैब" जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है।

मुख्य समस्या: "रेज़्यूमे बनाम वास्तविकता" का अंतर

AI की दुनिया में, एक एजेंट जो कहता है कि वह क्या कर सकता है (उसका विवरण) और वह वास्तव में क्या करता है (उसका प्रदर्शन), उसके बीच एक बड़ा अंतर है।

इसे एक पर्सनल ट्रेनर को उसके इंस्टाग्राम प्रोफाइल के आधार पर काम पर रखने जैसा समझें।

  • विवरण (सिमेंटिक समानता): आप जिम के कपड़ों में किसी की फोटो देखते हैं जिसमें "स्ट्रेंथ ट्रेनिंग" के बारे में कैप्शन लिखा होता है। आप सोचते हैं, "परफेक्ट, वे मुझे वजन उठाने में मदद कर सकते हैं!"
  • वास्तविकता (निष्पादन): आप जिम पहुँचते हैं, और पता चलता है कि उन्हें केवल योग करना आता है।

पारंपरिक सर्च इंजन कीवर्ड्स को खोजते हैं। यदि आप "फिटनेस" खोजते हैं, तो वे उन सभी को ढूंढ लेते हैं जो "फिटनेस" शब्द का उल्लेख करते हैं। लेकिन AI की दुनिया में, केवल शब्दों का मेल होना काफी नहीं है; आपको क्षमता का मेल होना चाहिए।

AgentSearchBench क्या है?

शोधकर्ताओं ने यह परीक्षण करने के लिए एक विशाल प्लेग्राउंड बनाया कि सर्च इंजन सही AI वर्कर्स को कितनी अच्छी तरह खोज सकते हैं। उन्होंने इसे इस प्रकार किया:

  1. विशाल टैलेंट पूल: उन्होंने वास्तविक प्लेटफार्मों (जैसे GPT स्टोर) से लगभग 10,000 वास्तविक दुनिया के AI एजेंट्स को इकट्ठा किया।
  2. "स्ट्रेस टेस्ट" (एग्जीक्यूशन-ग्राउंडेड): केवल यह जाँचने के बजाय कि क्या एजेंट का विवरण आपके अनुरोध से मेल खाता है, वे वास्तव में एजेंट को काम पर रखते हैं और उनसे काम करवाते हैं। वे एजेंट को एक कार्य देते हैं, उसे पूरा करने की कोशिश करते हुए देखते हैं, और इस आधार पर ग्रेड देते हैं कि उसने वास्तव में कितना अच्छा प्रदर्शन किया।
  3. दो स्तर की कठिनाई:
    • स्पष्ट आदेश (टास्क क्वेरीज़): "इस वेबसाइट को स्क्रैप करने के लिए एक पायथन स्क्रिप्ट लिखें।" (बहुत विशिष्ट)।
    • अस्पष्ट सपना (टास्क विवरण): "मैं अपने बिजनेस वर्कफ़्लो को आधुनिक बनाना चाहता हूँ।" (बहुत व्यापक और धुंधला)।

बड़ी खोज: "ब्रोशर पर भरोसा न करें"

शोधकर्ताओं ने पाया कि वर्तमान के अधिकांश सर्च तरीके वास्तव में काफी खराब हैं। वे "सरफेस मैचिंग" (सतही मिलान) पर बहुत अधिक निर्भर करते हैं—यानी समान शब्दों को खोजना।

उनके प्रयोगों ने दिखाया कि एक एजेंट के पास आपके कार्य के लिए एकदम सटीक विवरण हो सकता है लेकिन वास्तविक कार्य करते समय वह बुरी तरह विफल हो सकता है। इसके विपरीत, एक एजेंट का विवरण अजीब या खराब तरीके से लिखा गया हो सकता है, फिर भी वह एक सुपरस्टार परफॉर्मर साबित हो सकता है।

समाधान: "ट्रायल रन" (प्रोबिंग)

पेपर सही एजेंट खोजने का एक बेहतर तरीका सुझाता है: एग्जीक्यूशन-अवेयर प्रोबिंग (Execution-Aware Probing)

सिर्फ ब्रोशर पढ़ने के बजाय, कल्पना कीजिए कि एक शेफ को काम पर रखने से पहले, आप उनसे यह देखने के लिए "जल्दी से एक अंडा स्कैम्बल करने" के लिए कहते हैं कि क्या उन्हें वास्तव में चूल्हा चलाना आता है। यह "हल्का ट्रायल रन" एक व्यवहार संबंधी संकेत (behavioral signal) प्रदान करता है।

शोधकर्ताओं ने सिद्ध किया कि यदि आप सर्च इंजन को थोड़ा सा "वास्तविक दुनिया का प्रमाण" (यह देखकर कि एजेंट एक छोटे परीक्षण के प्रति कैसे प्रतिक्रिया देता है) देते हैं, तो खोज की गुणवत्ता काफी बढ़ जाती है।

संक्षेप में

AgentSearchBench हमें AI की दुनिया में "शानदार रेज़्यूमे" से मूर्ख बनने से रोकने का एक तरीका है। यह हमें सिखाता है कि सर्वश्रेष्ठ AI सहायकों को खोजने के लिए, हमें केवल उन्हें नहीं देखना चाहिए जो सबसे अच्छा बोलते हैं; हमें उन्हें देखना चाहिए जो सबसे अच्छा काम करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →