← नवीनतम पेपर
💻 computer science

Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems

यह शोध पत्र मल्टी-आस्पेक्ट BRIGHT-Pro बेंचमार्क और RTriever-Synth कॉर्पस को पेश करके एजेंटिक सर्च सिस्टम में रीजनिंग-इंटेंसिव रिट्रीवल के लिए वर्तमान मूल्यांकन और प्रशिक्षण की सीमाओं को संबोधित करता है, जो मिलकर RTriever-4B मॉडल के विकास को सक्षम करते हैं जो यथार्थवादी एजेंटिक प्रोटोकॉल के तहत मूल्यांकित किए जाने पर मौजूदा रिट्रीवर्स से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Yilun Zhao, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao, Arman Cohan

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilun Zhao, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao, Arman Cohan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं। पुराने दिनों में, आप शायद एक लाइब्रेरियन से "संदिग्ध के बारे में किताबें" मांग लेते, और वे आपको उस नाम वाली सबसे लोकप्रिय किताब थमा देते। लेकिन आज के रहस्य अधिक कठिन हैं। आपको केवल एक किताब नहीं चाहिए; आपको साक्ष्यों का एक पूरा पोर्टफोलियो (portfolio of evidence) चाहिए: एक गवाह का बयान, एक फॉरेंसिक रिपोर्ट, एक नक्शा और एक टाइमलाइन। यदि आपको केवल गवाह का बयान मिलता है, तो आप मामला सुलझा नहीं पाएंगे, भले ही वह किताब कितनी भी बेहतरीन क्यों न लिखी गई हो।

यह शोध पत्र "लाइब्रेरियन" (सूचना खोजने वाला कंप्यूटर सिस्टम) को अपग्रेड करने के बारे में है ताकि वह इन जटिल, बहु-चरणीय रहस्यों को संभाल सके।

यहाँ उनके काम का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "एक-किताब वाला" लाइब्रेरियन

लेखकों का तर्क है कि वर्तमान खोज प्रणालियाँ उन लाइब्रेरियन की तरह हैं जो एक एकल, प्रासंगिक किताब खोजने में तो माहिर हैं लेकिन एक पूर्ण केस फाइल बनाने में बहुत खराब हैं।

  • पुराना तरीका: यदि आप पूछते हैं, "अंटार्कटिक आइस शीट केवल कुछ किलोमीटर मोटी क्यों है?" तो एक मानक सर्च इंजन बर्फ के प्रवाह (ice flow) के बारे में एक बेहतरीन लेख ढूंढ सकता है। लेकिन इस प्रश्न का सही उत्तर देने के लिए, आपको गुरुत्वाकर्षण, दबाव और पिघलने के बारे में भी लेखों की आवश्यकता होगी।
  • दोष: मौजूदा परीक्षण (benchmarks) केवल यह जांचते हैं कि क्या लाइब्रेरियन ने एक अच्छी किताब ढूंढी। वे यह नहीं जांचते कि क्या लाइब्रेरियन ने पहेली को सुलझाने के लिए आवश्यक सभी अलग-अलग प्रकार के साक्ष्य खोज लिए हैं।
  • एजेंटिक गैप (The Agentic Gap): नए AI "एजेंट्स" (स्मार्ट सहायक) इन समस्याओं को हल करने के लिए खोजते हैं, पढ़ते हैं और फिर से खोजते हैं। लेकिन क्योंकि वे जिन लाइब्रेरियनों का उपयोग करते हैं वे पूरक (complementary) साक्ष्य खोजने में खराब होते हैं, इसलिए एजेंट चक्कर काटने या उत्तर का अनुमान लगाने में अपना समय बर्बाद करते हैं।

2. नया परीक्षण: BRIGHT-PRO ("केस फाइल" परीक्षा)

इसे ठीक करने के लिए, लेखकों ने BRIGHT-PRO नामक एक नया, कठिन परीक्षण बनाया।

  • अपग्रेड: केवल AI को एक प्रश्न और एक "सही" उत्तर देने के बजाय, उन्होंने उन्हें एक प्रश्न और एक बहु-भाग चेकलिस्ट (जिसे "रीज़निंग एस्पेक्ट्स" कहा जाता है) दी।
    • उदाहरण: आइस शीट वाले प्रश्न के लिए, चेकलिस्ट कह सकती है: "आपको गुरुत्वाकर्षण (30% महत्व), दबाव (30%), और पिघलना (20%) के बारे में साक्ष्य खोजने होंगे।"
  • ट्विस्ट: उन्होंने AI का दो तरीकों से भी परीक्षण किया:
    1. स्टैटिक (Static): "यहाँ 10 किताबों की एक सूची है। इनमें से कौन सी अच्छी हैं?" (पुराना तरीका)।
    2. एजेंटिक (Agentic): "जाओ, किताबें खुद ढूंढो, उन्हें पढ़ो और रहस्य को सुलझाओ।" (वास्तविक दुनिया का तरीका)।
  • परिणाम: उन्होंने पाया कि एक लाइब्रेरियन जो "स्टैटिक" परीक्षण में बहुत अच्छा दिखता है, वह अक्सर "एजेंटिक" परीक्षण में विफल हो जाता है। वे सबसे लोकप्रिय किताब तो ढूंढ सकते हैं लेकिन मामले को पूरा करने के लिए आवश्यक महत्वपूर्ण, कम स्पष्ट साक्ष्य को छोड़ सकते हैं।

3. नया प्रशिक्षण: RTriever-Synth ("सिम्युलेटेड डिटेक्टिव" स्कूल)

लेखकों को एहसास हुआ कि वे केवल लाइब्रेरियनों का परीक्षण नहीं कर सकते; उन्हें उन्हें बेहतर तरीके से प्रशिक्षित करना होगा। उन्होंने RTriever-Synth नामक एक सिंथेटिक प्रशिक्षण मैदान बनाया।

  • विधि: केवल AI को "प्रश्न -> एक सही उत्तर" दिखाने के बजाय, उन्होंने इसे एक संतुलित पोर्टफोलियो बनाना सिखाया।
    • उन्होंने एक जटिल प्रश्न लिया, उसे उसके "एस्पेक्ट्स" (चेकलिस्ट आइटम) में विभाजित किया, और प्रत्येक पहलू के लिए एक विशिष्ट "पॉजिटिव" दस्तावेज़ तैयार किया।
    • उन्होंने "हार्ड नेगेटिव्स" (hard negatives) भी बनाए—ऐसे दस्तावेज़ जो दिखने में बिल्कुल सही उत्तर जैसे लगते हैं लेकिन उनमें एक महत्वपूर्ण हिस्सा गायब होता है (जैसे कि एक नक्शा जो गलत महाद्वीप दिखाता है)।
  • लक्ष्य: यह AI को यह सीखने के लिए मजबूर करता है: "केवल एक प्रासंगिक दस्तावेज़ न खोजें; दस्तावेज़ों का एक सही मिश्रण खोजें जो प्रश्न के हर कोण को कवर करे।"

4. परिणाम: एक स्मार्ट जासूस

उन्होंने इस पद्धति का उपयोग करके RTriever-4B नामक एक नया मॉडल प्रशिक्षित किया और अन्य शीर्ष खोज प्रणालियों के विरुद्ध इसका परीक्षण किया।

  • आश्चर्य: पुराने "स्टैटिक" परीक्षणों में, RTriever-4B अच्छा था लेकिन सबसे सर्वश्रेष्ठ नहीं। हालांकि, "एजेंटिक" (वास्तविक दुनिया के) परीक्षणों में, यह चमक उठा।
  • क्यों? क्योंकि इसने पूर्ण "पोर्टफोलियो" साक्ष्य मिलने पर ही खोजना बंद करना सीख लिया था।
    • अच्छे रिट्रीवर्स (Retrievers): मुख्य साक्ष्य जल्दी ढूंढ लेते थे, जिससे AI एजेंट को रहस्य को जल्दी और सटीक रूप से सुलझाने में मदद मिली।
    • बुरे रिट्रीवर्स: एक ही विषय पर अटक जाते थे (जैसे केवल "बर्फ के प्रवाह" को देखना और "दबाव" को अनदेखा करना), जिससे AI अनुमान लगाने या अंतहीन खोज करने के लिए मजबूर हो जाता था।
  • "BM25" ट्विस्ट: दिलचस्प बात यह है कि एक बहुत पुराना, सरल खोज तरीका (BM25) "एजेंटिक" सेटिंग में काफी अच्छा प्रदर्शन करता है। क्यों? क्योंकि AI एजेंट ने बहुत विशिष्ट फॉलो-अप प्रश्न पूछना सीख लिया था जो पुराने तरीके की कमजोरियों को ठीक कर देते थे। यह कुछ ऐसा है जिसे पुराने परीक्षण पूरी तरह से मिस कर देते।

सारांश

इस शोध पत्र को एक ऐसे लाइब्रेरियन को काम पर रखने से एक शोध सहायक को काम पर रखने के रूप में देखें जो सबसे लोकप्रिय किताब नहीं, बल्कि एक पूर्ण केस फाइल बनाता है।

  • BRIGHT-PRO नया, कठिन परीक्षण है जो यह जांचता है कि क्या आपके पास पूरी फाइल है, न कि केवल एक पन्ना।
  • RTriever वह नया सहायक है जिसे विशेष रूप से वह पूर्ण फाइल एकत्र करने के लिए प्रशिक्षित किया गया है।
  • सीख: गहरे शोध करने वाले स्मार्ट AI एजेंट बनाने के लिए, हमें सर्च इंजन को इस आधार पर आंकना बंद करना होगा कि वे एक एकल "हिट" कितनी अच्छी तरह पाते हैं, और इसके बजाय इस आधार पर आंकना शुरू करना होगा कि वे साक्ष्यों का एक पूर्ण, संतुलित सेट कितनी अच्छी तरह एकत्र करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →