← नवीनतम पेपर
💬 NLP

Revisiting Text Ranking in Deep Research

यह शोध पत्र BrowseComp-Plus डेटासेट पर रिट्रीवल यूनिट्स, पाइपलाइन कॉन्फ़िगरेशन और क्वेरी विशेषताओं का विश्लेषण करके डीप रिसर्च में टेक्स्ट रैंकिंग विधियों की प्रभावशीलता की जांच करता है, जिससे यह पता चलता है कि विशिष्ट रिट्राइवर प्रकार और पैसेज-लेवल यूनिट्स अच्छा प्रदर्शन करते हैं, साथ ही यह क्वेरी मिसमैच को कम करने के लिए एक क्वेरी-टू-क्वेश्चन विधि का प्रस्ताव भी देता है।

मूल लेखक: Chuan Meng, Litu Ou, Sean MacAvaney, Jeff Dalton

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chuan Meng, Litu Ou, Sean MacAvaney, Jeff Dalton

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रिसर्च असिस्टेंट (एक AI एजेंट) को काम पर रख रहे हैं ताकि वह एक बहुत ही कठिन सवाल का जवाब ढूंढ सके, जैसे कि "2020 में किस फुटबॉल मैच में स्टैंड्स में ठीक 61,880 लोग मौजूद थे?"

इसे हल करने के लिए, आपका असिस्टेंट केवल अनुमान नहीं लगा सकता; उसे इंटरनेट पर जाना होगा, लेख पढ़ने होंगे, जो उसने पाया है उस पर विचार करना होगा और फिर से खोजना होगा। इस प्रक्रिया को डीप रिसर्च (Deep Research) कहा जाता है।

यह पेपर उस रिसर्च असिस्टेंट के इंजन का निरीक्षण करने वाले एक मैकेनिक की तरह है। विशेष रूप से, लेखक यह समझना चाहते थे कि इसका "टेक्स्ट रैंकिंग" (text ranking) वाला हिस्सा कैसे काम करता है। टेक्स्ट रैंकिंग वह टूल है जिसका उपयोग असिस्टेंट यह तय करने के लिए करता है कि कौन से खोज परिणाम (search results) सबसे महत्वपूर्ण हैं जिन्हें पढ़ना चाहिए।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "ब्लैक बॉक्स" का रहस्य

पहले, अधिकांश शोधकर्ता इन AI असिस्टेंट्स को एक "ब्लैक बॉक्स" सर्च इंजन (जैसे कि एक मानक Google API) का उपयोग करने देते थे। उन्हें यह नहीं पता था कि इंजन परिणामों को कैसे चुन रहा था। लेखक खुद इन अलग-अलग सर्च इंजनों का परीक्षण करना चाहते थे ताकि यह देख सकें कि वास्तव में कौन से सबसे अच्छा काम करते हैं।

2. पहली खोज: "अध्याय" बनाम "पूरी किताबें"

लेखकों ने AI को जानकारी देने के दो तरीके आजमाए:

  • डॉक्यूमेंट लेवल (Document Level): AI को पूरा वेब पेज देना (पूरी किताब)।
  • पैसेज लेवल (Passage Level): AI को केवल वह विशिष्ट पैराग्राफ या खंड देना जो काम का है (विशिष्ट अध्याय)।

निष्कर्ष: AI को केवल पैसेजेस (अध्याय) देना बहुत बेहतर रहा।

  • क्यों? AI असिस्टेंट्स की एक सीमित "याददाश्त" (जिसे कॉन्टेक्स्ट विंडो कहा जाता है) होती है। यदि आप उन्हें पूरी किताबें खिलाते हैं, तो वे जल्दी ही अपनी मेमोरी भर लेते हैं और उन्हें खोजना बंद करना पड़ता है। यदि आप उन्हें केवल प्रासंगिक पैराग्राफ देते हैं, तो वे अपनी मेमोरी में अधिक जानकारी फिट कर सकते हैं, अधिक प्रश्न पूछ सकते हैं, और उत्तर अधिक सटीकता से पा सकते हैं।
  • उपमा: यह एक पहेली सुलझाने जैसा है। यदि आप मेज पर 1,000 टुकड़ों का पूरा डिब्बा खाली कर देते हैं, तो आप अभिभूत हो जाते हैं। यदि आप केवल AI को वे 10 टुकड़े देते हैं जो वास्तव में आपस में फिट बैठते हैं, तो वह पहेली को तेज़ी से सुलझा लेता है।

3. दूसरी खोज: "कीवर्ड" बनाम "निबंध" का बेमेल होना

लेखकों ने देखा कि AI एजेंट कैसे खोज करते हैं, इसमें कुछ अजीब बात थी।

  • इंसान कैसे खोज करते हैं: हम आमतौर पर स्वाभाविक प्रश्न टाइप करते हैं, जैसे, "उस खेल में कौन जीता जहाँ उपस्थिति 61,880 थी?"
  • AI एजेंट कैसे खोज करते हैं: एजेंट पुराने जमाने के सर्च इंजन की तरह व्यवहार करते हैं। वे छोटे, कीवर्ड-प्रधान स्ट्रिंग्स टाइप करते हैं जैसे: "61,880" "football" "attendance"

निष्कर्ष:

  • पुराने तरीके के टूल्स जीत गए: क्योंकि AI एजेंट कीवर्ड का उपयोग करके खोज करते हैं, इसलिए BM25 नामक पुराना सर्च टूल (जो सटीक शब्दों को मिलाने में बहुत अच्छा है) अधिकांश मामलों में आधुनिक AI-आधारित खोज उपकरणों से बेहतर प्रदर्शन कर गया।
  • बेमेल होना (The Mismatch): फैंसी AI खोज उपकरण प्राकृतिक भाषा के प्रश्नों (निबंधों) पर प्रशिक्षित थे। जब एजेंट ने कीवर्ड वाले स्ट्रिंग्स दिए, तो AI टूल्स भ्रमित हो गए और उनका प्रदर्शन खराब रहा। यह एक कवि से किराने की सूची लिखने के लिए कहने जैसा था; वे लिखना जानते हैं, लेकिन कार्य के लिए प्रारूप गलत है।

4. तीसरी खोज: "संपादक" (Re-ranking)

एक बार जब सर्च टूल परिणामों की एक सूची ढूंढ लेता है, तो एक दूसरा टूल जिसे री-रैंकर (Re-ranker) कहा जाता है, एक संपादक की तरह काम करता है। वह सूची को देखता है और कहता है, "वास्तव में, यह वाला सबसे महत्वपूर्ण है, इसे ऊपर ले जाओ।"

निष्कर्ष:

  • संपादक अनिवार्य हैं: री-रैंकर का उपयोग करने से परिणामों में काफी सुधार हुआ। इसने AI को सही उत्तर तेजी से खोजने और कम खोज प्रयासों के साथ खोजने में मदद की।
  • गहरा संपादन मदद करता है: संपादक ने जितनी गहराई से जांच की (ऊपर चुनने से पहले कितने परिणामों की जांच की), परिणाम उतने ही बेहतर हुए।
  • "तर्क करने वाला" संपादक काम नहीं आया: एक विशिष्ट संपादक को यह "सोचने" और "तर्क" करने के लिए डिज़ाइन किया गया था कि कोई परिणाम क्यों अच्छा है। हालाँकि, क्योंकि खोज क्वेरी इतनी छोटी और कीवर्ड-प्रधान थी, यह "तर्क करने वाला" संपादक अक्सर भ्रमित हो गया और गलतियाँ करने लगा। यह एक जासूस की तरह था जो बिना किसी सुराग के मामला सुलझाने की कोशिश कर रहा है; अतिरिक्त सोचिंग (reasoning) ने मदद नहीं की क्योंकि इनपुट बहुत बिखरा हुआ था।

5. समाधान: "अनुवादक" (Q2Q)

इस समस्या को ठीक करने के लिए कि AI के कीवर्ड खोजों ने फैंसी AI टूल्स को भ्रमित कर दिया, लेखकों ने एक ट्रांसलेटर (Translator) बनाया।

  • यह कैसे काम करता है: इससे पहले कि सर्च टूल उत्तरों की तलाश करे, ट्रांसलेटर AI के कीवर्ड स्ट्रिंग (जैसे, "61,880" "football") को एक स्वाभाविक प्रश्न (जैसे, "किस फुटबॉल मैच में उपस्थिति 61,880 थी?") में बदल देता है।
  • परिणाम: इस साधारण अनुवाद ने फैंसी AI खोज उपकरणों को फिर से बहुत बेहतर तरीके से काम करने में सक्षम बना दिया। इसने एजेंट के पूछने के तरीके और टूल्स के सीखने के तरीके के बीच के अंतर को पाट दिया।

"मैकेनिक" की रिपोर्ट का सारांश

  1. AI को पूरी किताबें न खिलाएं; उसे विशिष्ट पैराग्राफ (पैसेजेस) दें ताकि वह अभिभूत न हो।
  2. पुराने जमाने का कीवर्ड मिलान (BM25) इन एजेंटों के लिए आश्चर्यजनक रूप से शक्तिशाली है क्योंकि वे कीवर्ड मशीन की तरह खोज करते हैं।
  3. एक "संपादक" (Re-ranker) सबसे अच्छे परिणामों को चुनने के लिए महत्वपूर्ण है।
  4. यदि आप फैंसी AI खोज उपकरणों का उपयोग करते हैं, तो आपको पहले एजेंट के कीवर्ड खोजों को स्वाभाविक प्रश्नों में अनुवादित करना होगा, अन्यथा टूल्स भ्रमित हो जाएंगे।

पेपर यह निष्कर्ष निकालता है कि हालांकि AI एजेंट शक्तिशाली हैं, वे प्रभावी ढंग से काम करने के लिए अभी भी इन स्थापित, कभी-कभी पुराने तरीकों पर बहुत अधिक निर्भर करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →