Equal Accuracy, Unequal Evidence: Search APIs as Decision Surfaces for Tool-Using Agents
यह शोध पत्र तर्क देता है कि वाणिज्यिक खोज API का मूल्यांकन केवल उत्तर की सटीकता के आधार पर ही नहीं, बल्कि "निर्णय सतहों" (decision surfaces) के रूप में किया जाना चाहिए, जिनके विशिष्ट स्निपेट और रैंकिंग लक्षण एजेंट के रिट्रीवल बजट और अन्वेषण रणनीतियों को महत्वपूर्ण रूप से प्रभावित करते हैं, भले ही अंतिम उत्तर का प्रदर्शन विभिन्न प्रदाताओं के बीच तुलनीय बना रहे।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने वाले जासूस हैं, लेकिन आप अपराध स्थल को खुद नहीं देख सकते। इसके बजाय, आपको एक "सर्च इंजन" पर निर्भर रहना पड़ता है जो आपको इंडेक्स कार्डों का एक ढेर थमा देता है। प्रत्येक कार्ड में एक URL (पता), एक शीर्षक और टेक्स्ट का एक छोटा सा अंश (स्निपेट) होता है। केवल इन कार्डों के आधार पर, आप तय करते हैं: "क्या मेरे पास इसे अभी सुलझाने के लिए पर्याप्त जानकारी है?" या "क्या मुझे उस पते पर जाकर पूरा लेख पढ़ने के लिए अतिरिक्त समय और पैसा खर्च करने की आवश्यकता है?"
यह शोध पत्र इस बारे में है कि उन इंडेक्स कार्डों का डिज़ाइन आपके जासूसी कार्य को कैसे बदल देता है, भले ही आप अंततः समान संख्या में रहस्य सुलझा लें।
बड़ी गलतफहमी
लंबे समय तक, लोगों ने सोचा कि यदि दो सर्च इंजन आपको सही उत्तरों की समान संख्या देते हैं, तो वे मूल रूप से एक ही उपकरण हैं। यह तर्क देना ऐसा है जैसे कि दो अलग-अलग मानचित्रों को समान कहना क्योंकि वे दोनों आपको एक ही गंतव्य तक पहुँचाते हैं। यह यात्रा (सफर) को अनदेखा कर देता है।
लेखक सुझाव देते हैं कि एक सर्च इंजन केवल लिंक की सूची नहीं है; यह एक "डिसीजन सरफेस" (निर्णय सतह) है। यह संकेतों (स्निपेट्स, शीर्षक और रैंकिंग) का विशिष्ट सेट है जो आपके AI एजेंट को एक विकल्प चुनने के लिए मजबूर करता है: रुकें और उत्तर दें, या और गहराई से खोज जारी रखें?
प्रयोग: एक नियंत्रित जासूसी खेल
इसका परीक्षण करने के लिए, शोधकर्ताओं ने एक सख्त खेल तैयार किया। उन्होंने जासूस (एक AI एजेंट), नियम और उपकरण—सब कुछ स्थिर रखा। उन्होंने केवल बदलने के लिए सर्च इंजन प्रदाता को बदला जो कार्ड बांट रहा था। उन्होंने तीन का परीक्षण किया: Brave, Tavily, और Firecrawl।
उन्होंने 100 बहुत कठिन प्रश्न पूछे (SEALQA-HARD नामक एक डेटासेट से)। यहाँ एक मोड़ है: तीनों सर्च इंजन ने लगभग समान संख्या में (25, 25, और 26 में से 100 बार) अंतिम उत्तर सही दिया। यदि आप केवल स्कोरबोर्ड को देखते, तो आप सोचते कि वे बिल्कुल समान हैं।
लेकिन जब शोधकर्ताओं ने इस बात की जांच की कि जासूस वास्तव में कैसे काम कर रहा था, तो कहानी पूरी तरह बदल गई।
तीन अलग-अलग "कार्ड डेक"
भले ही अंतिम स्कोर बराबर था, लेकिन प्रत्येक प्रदाता के लिए "साक्ष्य की अर्थव्यवस्था" (एवीडेंस इकोनॉमी) पूरी तरह से अलग थी:
Brave (एक "स्वर्ण-समृद्ध" डेक):
Brave ने ऐसे कार्ड दिए जहाँ उत्तर अक्सर छोटे स्निपेट टेक्स्ट में ही छिपा होता था। जासूस कार्ड को पढ़कर ही स्वर्ण उत्तर देख सकता था। हालाँकि, कार्ड बहुत सहायक होने के कारण, जासूस कभी-कभी बहुत अधिक जानकारी से भ्रमित हो जाता था या उस विशिष्ट कार्ड को मिस कर देता था जो महत्वपूर्ण था।- आंकड़ा: Brave ने प्री-फ़ेच सपोर्ट (पूरा पेज पढ़ने से पहले दिखने वाले सुराग) 30 प्रश्नों पर प्रदान किया।
- पकड़: भले ही सुराग वहां मौजूद थे, एजेंट ने 101 "गोल्ड-सपोर्टिंग" पंक्तियों में से केवल 13 पर तुरंत मामला सुलझाने के लिए उनका उपयोग किया (लगभग 13%)।
Tavily (एक "टॉप-हैवी" डेक):
Tavily अलग था। इसने स्निपेट्स में उतने उत्तर नहीं दिए, लेकिन जब इसके पास सही उत्तर होता था, तो इसने उस कार्ड को रैंक 1 (सबसे ऊपर) पर रखा।- आंकड़ा: उन प्रश्नों के लिए जहाँ उत्तर स्निपेट में दृश्यमान था, 34 में से 17 (50%) सबसे ऊपर के स्थान पर थे।
- निहितार्थ: यदि आपके जासूस का नियम है जैसे "हमेशा पहले कार्ड को पढ़ें," तो Tavily एक अत्यंत कुशल साथी है।
Firecrawl (एक "एक्सप्लोरर" डेक):
Firecrawl के कार्डों में सामने ही उत्तर होने की संभावना कम थी। इसने जासूस को अधिक साहसी बनने के लिए मजबूर किया। समान नियमों के तहत, एजेंट ने Firecrawl का उपयोग करते समय अधिक बार "फुल पेज फेच" (पूरा पेज प्राप्त करना) किया।- आंकड़ा: एजेंट ने Firecrawl के साथ 81% प्रश्नों के लिए पेज फेच किए, जबकि Brave के साथ यह 65% था।
- पकड़: इसका मतलब था कि एजेंट ने गहराई से खोज करने के लिए अधिक टोकन (डिजिटल पैसा) और समय खर्च किया, भले ही अंतिम सटीकता समान थी।
"विरोधाभास" का जाल
शोध ने एक डरावनी चीज़ भी पाई: कभी-कभी कार्ड झूठ बोलते थे। शोधकर्ताओं ने मापा कि कितनी बार एक स्निपेट वास्तविक उत्तर के विपरीत था।
- Brave: प्रत्येक 1 सही सुराग के लिए 0.92 विरोधाभास।
- Firecrawl: प्रत्येक 1 सही सुराग के लिए 2.59 विरोधाभास।
इसका मतलब है कि Firecrawl के साथ, जासूस को सच्चाई खोजने से पहले भ्रमित करने वाले या संघर्षपूर्ण शोर (नॉइज़) से गुजरना पड़ा।
निर्णय
शोध पत्र निष्कर्ष निकालता है कि सर्च इंजन चुनना एक गुणवत्ता का नहीं, बल्कि एक नीतिगत निर्णय है।
यदि आप Brave चुनते हैं, तो आपको शुरुआत में बहुत सारी जानकारी मिलती है, लेकिन आपको इसे फ़िल्टर करने के लिए एक रणनीति की आवश्यकता हो सकती है।
यदि आप Tavily चुनते हैं, तो आपको शीर्ष परिणाम पर भरोसा करना चाहिए, क्योंकि अच्छी चीजें वहीं छिपी होती हैं।
यदि आप Firecrawl चुनते हैं, तो आपको गहराई से खुदाई करने के लिए अधिक संसाधन खर्च करने के लिए तैयार रहना चाहिए।
लेखक सुझाव देते हैं कि हम सर्च API को केवल "लिस्ट बनाने वाले" के रूप में देखना बंद करें और उन्हें "डिसीजन सरफेस" के रूप में मानना शुरू करें। सही चुनाव इस बात पर निर्भर करता है कि आपका एजेंट कैसे कार्य करने के लिए प्रोग्राम किया गया है। "एक ही आकार सबके लिए उपयुक्त" (वन-साइज़-फिट्स-ऑल) वाला दृष्टिकोण काम नहीं करता है क्योंकि, जैसा कि यह अध्ययन बताता है, समान सटीकता बहुत अलग और कभी-कभी बहुत महंगी आंतरिक यात्राओं को छिपा सकती है।
इसलिए, अगली बार जब आप दो AI एजेंटों को एक ही उत्तर देते हुए देखें, तो यह न मानें कि उन्होंने एक ही रास्ता अपनाया है। एक ने शायद पहले ही मानचित्र पर खजाना ढूंढ लिया होगा, जबकि दूसरे को वहां तक पहुँचने के लिए मिट्टी के पूरे पहाड़ को खोदना पड़ा होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।