← नवीनतम पेपर
💬 NLP

DS@GT at TREC TOT 2025: Bridging Vague Recollection with Fusion Retrieval and Learned Reranking

DS@GT सिस्टम हाइब्रिड और टॉपिक-अवेयर डेंस रिट्रीवल को जेमिनी-2.5-फ्लैश रीरैंकर के साथ फ्यूज करने वाले एक दो-चरणीय रिट्रीवल फ्रेमवर्क का उपयोग करके TREC टिप-ऑफ-द-टंग टास्क को संबोधित करता है, जिससे टेस्ट सेट पर 0.66 का रिकॉल प्राप्त होता है।

मूल लेखक: Wenxin Zhou, Ritesh Mehta, Anthony Miyaguchi

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenxin Zhou, Ritesh Mehta, Anthony Miyaguchi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सालों पहले देखी गई एक विशिष्ट फिल्म को याद करने की कोशिश कर रहे हैं। आपको उसका शीर्षक, अभिनेता या निर्देशक याद नहीं आ रहा है। लेकिन आपको कथानक (plot) याद है: "यह वह साइंस-फिक्शन फिल्म थी जहाँ मुख्य पात्र एक रोबोट है जिसे एक इंसान से प्यार हो जाता है, और वे एक अंतरिक्ष यान पर रहते हैं जो एक विशाल डोनट जैसा दिखता है।"

यह "टिप-ऑफ-द-टंग" (ToIT - जुबान पर आना) समस्या है। आपके पास एहसास और विवरण है, लेकिन नाम नहीं है। पारंपरिक खोज इंजन (search engines) केवल सटीक शब्दों को खोजने वाले पुस्तकालयाध्यक्षों की तरह होते हैं। यदि आप "रोबोट लव डोनट स्पेसशिप" पूछते हैं, तो वे भ्रमित हो सकते हैं क्योंकि उस फिल्म का वास्तविक नाम द आयरन जायंट या स्टार ट्रेक हो सकता है।

आपके द्वारा साझा किया गया पेपर बताता है कि जॉर्जिया टेक (DS@GT) की एक टीम ने TREC 2025 प्रतियोगिता के लिए इस सटीक समस्या को हल करने के लिए एक सुपर-स्मार्ट सर्च सिस्टम बनाया। यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल रूप में कुछ उपमाओं (analogies) के साथ।

मुख्य विचार: एक दो-चरणीय जासूसी एजेंसी (A Two-Stage Detective Agency)

केवल एक सर्च इंजन के बजाय, टीम ने एक दो-चरणीय जासूसी एजेंसी बनाई।

चरण 1: "चौड़ा जाल" (रिट्रीवल/खोज)

सबसे पहले, सिस्टम संभावित उम्मीदवारों को पकड़ने के लिए एक बहुत ही चौड़ा जाल डालता है। वे केवल एक विधि पर निर्भर नहीं रहते; वे एक साथ काम करने वाले तीन अलग-अलग "जासूसों" का उपयोग करते हैं:

  1. कीवर्ड जासूस (स्पार्स/BM25): यह पुराना स्कूल वाला लाइब्रेरियन है। यह सटीक शब्द मिलान देखता है। यदि आप "रोबोट" कहते हैं, तो यह उन दस्तावेजों को ढूंढता है जिनमें "रोबोट" शब्द है।
  2. सिमेंटिक जासूस (डेंस/BGE-M3): यह जासूस शब्दों के बजाय अर्थ को समझता है। यदि आप "मेटल मैन" कहते हैं, तो यह जानता है कि यह "रोबोट" के समान है, भले ही वहां "रोबोट" शब्द न हो।
  3. क्रिएटिव जासूस (LLM रिट्रीवल): यह एक AI है जो आपके अस्पष्ट विवरण को पढ़ता है और सीधे शीर्षक का अनुमान लगाता है। यह एक दोस्त से पूछने जैसा है, "हे, इस विवरण से कौन सी फिल्म मेल खाती है?" और वह चिल्लाकर कहता है, "क्या यह द आयरन जायंट है?"

"राउंड-रॉबिन" विलय (Merge):
एक जासूस से विजेता चुनने के बजाय, वे एक राउंड-रॉबिन रणनीति का उपयोग करते हैं। कल्पना कीजिए कि तीन लोग ताश की गड्डी में से सबसे अच्छा कार्ड चुनने के लिए बारी-बारी से काम कर रहे हैं।

  • जासूस A कार्ड नंबर #1 चुनता है।
  • जासूस B कार्ड नंबर #1 चुनता है।
  • जासूस C कार्ड नंबर #1 चुनता है।
  • फिर वे A के पास वापस जाते हैं कार्ड नंबर #2 के लिए, और इसी तरह।
    यह सुनिश्चित करता है कि यदि एक जासूस उत्तर चूक जाता है, तो दूसरे उसे पकड़ लें। उन्होंने एक विशेष "टॉपिक मैप" भी बनाया (लाइब्रेरी को 24 अलग-अलग कमरों में विभाजित करना) ताकि सर्च "कुकिंग" सेक्शन में समय बर्बाद न करे जब आप "मूवीज़" ढूंढ रहे हों।

चरण 2: "विशेषज्ञ न्यायाधीश" (रीरैंकिंग)

अब, सिस्टम के पास संभावित उत्तरों का एक बड़ा ढेर है (शायद 1,000 उम्मीदवार)। इसे सबसे ऊपर एक सही उत्तर ढूंढना है। यहीं पर रीरैंकर (Reranker) आता है। उन्होंने दो प्रकार के न्यायाधीशों का परीक्षण किया:

  1. सीखा हुआ न्यायाधीश (LambdaMART): यह एक कंप्यूटर मॉडल है जिसे हजारों नकली "टिप-ऑफ-द-टंग" प्रश्नों पर प्रशिक्षित किया गया है। यह संकेतों को देखता है जैसे:

    • कोई पेज कितना लोकप्रिय है? (PageRank)
    • कितने लोगों ने इसे देखा है? (Pageviews)
    • प्रारंभिक खोज कितनी अच्छी तरह मेल खाती है?
    • उपमा: यह एक अनुभवी संपादक की तरह है जो पैटर्न के आधार पर जानता है कि कौन से लेख आमतौर पर सही उत्तर होते हैं।
  2. AI न्यायाधीश (LLM रीरैंकर): यह एक शक्तिशाली AI (जैसे जेमिनी) है जो शीर्ष उम्मीदवारों के पूर्ण टेक्स्ट और आपके प्रश्न को पढ़ता है, और फिर निर्णय लेता है, "हाँ, यह निश्चित रूप से वही है।"

    • उपमा: यह एक मूवी क्रिटिक को काम पर रखने जैसा है जो वास्तव में क्लिप देखता है और कहता है, "यही वह है जिसके बारे में आप सोच रहे हैं!"

गुप्त नुस्खा: अभ्यास प्रश्न बनाना

इन सिस्टमों को प्रशिक्षित करने के लिए सबसे बड़ी बाधा यह है कि सीखने के लिए पर्याप्त वास्तविक "टिप-ऑफ-द-टंग" प्रश्न नहीं हैं।

  • समाधान: टीम ने AI का उपयोग करके 5,000 नकली प्रश्न बनाए। उन्होंने AI को कहा: "मान लो कि तुम किसी प्रसिद्ध व्यक्ति का नाम भूल गए हो। उनका अस्पष्ट वर्णन करो, लेकिन सुनिश्चित करो कि तुम एक वास्तविक व्यक्ति का वर्णन कर रहे हो।"
  • इसने सिस्टम को अभ्यास करने के लिए एक विशाल जिम दिया, जिससे वास्तविक मानवीय प्रश्नों का सामना करते समय यह बहुत अधिक तेज हो गया।

परिणाम: कौन जीता?

टीम ने अपने सिस्टम के कई संस्करण प्रस्तुत किए। विजेता एक संयोजन था:

  1. चौड़ा जाल: कीवर्ड, सिमेंटिक और क्रिएटिव जासूसों का विलय।
  2. AI न्यायाधीश: अंतिम छंटनी करने के लिए शक्तिशाली जेमिनी (Gemini) मॉडल का उपयोग।

परिणाम:

  • उनके सिस्टम ने 66% बार (रिकॉल) सही उत्तर शीर्ष 1,000 परिणामों में पाया।
  • यह केवल एक विधि का उपयोग करने की तुलना में बहुत बेहतर था। उदाहरण के लिए, "कीवर्ड जासूस" अकेले उनमें से अधिकांश को मिस कर देता।

यह क्यों मायने रखता है

यह पेपर दिखाता है कि जब आप कुछ ऐसा खोजने की कोशिश कर रहे होते हैं जिसे आप पूरी तरह से याद नहीं कर पा रहे हैं, तो खोजने के विभिन्न तरीकों को मिलाना केवल एक तरीके पर भरोसा करने से बेहतर होता है।

  • कीवर्ड सटीक मिलान पकड़ते हैं।
  • अर्थ (Meaning) अवधारणाओं को पकड़ते हैं।
  • AI अंतर्ज्ञान (intuition) को पकड़ता है।
  • रीरैंकिंग यह सुनिश्चित करती है कि सबसे अच्छा मिलान सबसे ऊपर हो।

यह एक रहस्य सुलझाने के लिए एक अकेले व्यक्ति के बजाय विशेषज्ञों की एक टीम रखने जैसा है। इन विधियों को जोड़कर, सिस्टम आपकी धुंधली याद और सटीक उत्तर के बीच के अंतर को पाट देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →