uva-irlab-conv at SemEval-2026 Task 8: Multi-Turn RAG with Learned Sparse Retrieval and Listwise Reranking
यह शोध पत्र SemEval-2026 टास्क 8 के लिए uva-irlab-conv सिस्टम प्रस्तुत करता है, जो विविध डोमेन और अनुत्तरित प्रश्नों को प्रभावी ढंग से संभालने के लिए सीखा गया स्पार्स रिट्रीवल (learned sparse retrieval) के साथ LLM-आधारित संवादात्मक क्वेरी रीराइटिंग (conversational query rewriting) और लिस्टवाइज रीरैंकिंग (listwise reranking) को संयोजित करने वाली एक मल्टी-टर्न रिट्रीवल-ऑगमेंटेड जनरेशन पाइपलाइन का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल पुस्तकालय में विशिष्ट जानकारी खोजने की कोशिश कर रहे हैं, लेकिन आप केवल एक प्रश्न नहीं पूछ रहे हैं; आप एक लाइब्रेरियन के साथ एक लंबी, बातचीत कर रहे हैं। कभी आप कहते हैं, "CEO कौन है?" और अगले ही मिनट आप कहते हैं, "उनका पता क्या है?" दूसरा प्रश्न पहले वाले के बिना अर्थहीन है। यही मल्टी-टर्न रिट्रीवल एंड क्वेश्चन अनसरिंग (Multi-Turn Retrieval and Question Answering) की चुनौती है।
आपके द्वारा साझा किया गया पेपर बताता है कि यूनिवर्सिटी ऑफ एम्स्टर्डम की एक टीम (जिसे uva-irlab-conv कहा जाता है) ने इस लाइब्रेरियन की तरह काम करने के लिए एक स्मार्ट सिस्टम बनाया है। उन्होंने एक प्रतियोगिता SemEval-2026 Task 8 में भाग लिया ताकि यह देखा जा सके कि उनका सिस्टम वित्त (finance), क्लाउड कंप्यूटिंग, सरकार और विकिपीडिया जैसे चार बहुत अलग विषयों पर इन बातचीतों को कितनी अच्छी तरह संभाल सकता है।
यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता है, सरल उपमाओं (analogies) के माध्यम से समझाया गया है:
1. अनुवादक (क्वेरी रीराइटिंग - Query Rewriting)
समस्या: इंसान शॉर्टकट में बात करते हैं। यदि आप पूछते हैं, "CEO कौन है?" और फिर पूछते हैं, "उसकी उम्र क्या है?", तो कंप्यूटर को नहीं पता कि "वह" कौन है।
समाधान: सिस्टम के पास एक "अनुवादक" (एक AI) है जो पूरी बातचीत के इतिहास को सुनता है। लाइब्रेरी में जाने से पहले, वह आपके अंतिम प्रश्न को एक पूर्ण, स्वतंत्र वाक्य में फिर से लिख देता है।
- उपमा: यह एक ऐसे अनुवादक की तरह है जो आपको "मुझे नीला वाला चाहिए" कहते हुए सुनता है, और फिर दुकानदार के लिए इसे बदलकर "मुझे उस रैक से नीला शर्ट चाहिए जिसे हम अभी देख रहे थे" के रूप में लिख देता है।
2. तेज़ स्काउट (लर्नड स्पार्स रिट्रीवल - Learned Sparse Retrieval)
समस्या: पुस्तकालय में लाखों दस्तावेज़ हैं। आप उन सभी को पढ़ नहीं सकते।
समाधान: सिस्टम एक "तेज़ स्काउट" का उपयोग करता है जिसे LION-SP कहा जाता है। यह एक विशेष प्रकार का सर्च इंजन है जो शब्दों के अर्थ और उपयोग किए गए सटीक शब्दों दोनों को समझने में अच्छा है। इसे इस तरह डिज़ाइन किया गया है कि यह विषय बदलने पर भी (जैसे वित्त से सरकार तक) अच्छी तरह काम कर सके।
- उपमा: एक स्काउट की कल्पना करें जो एक विशाल जंगल में दौड़ता है। हर पेड़ को पढ़ने के बजाय, वे विशिष्ट कीवर्ड्स और अवधारणाओं को तेज़ी से स्कैन करते हैं, और मुख्य कार्यालय में वापस लाने के लिए सबसे आशाजनक 1,000 पत्तों (दस्तावेजों) को चुन लेते हैं।
3. विशेषज्ञ जज (रीरैंकिंग - Reranking)
समस्या: स्काउट 1,000 पत्ते लेकर आया है, लेकिन आपको केवल सर्वश्रेष्ठ 10 की आवश्यकता है।
समाधान: सिस्टम दो-चरणीय निर्णय प्रक्रिया का उपयोग करता है:
- चरण A (पॉइंटवाइज - Pointwise): एक AI प्रत्येक पत्ते को एक-एक करके देखता है और उसे एक स्कोर देता है। यह सूची को शीर्ष 20 तक सीमित कर देता है।
- चरण B (लिस्टवाइज - Listwise): एक अत्यंत बुद्धिमान AI (GPT-4.1) पूरी बातचीत को याद रखते हुए, शीर्ष 20 पत्तों को एक साथ देखता है। यह उन्हें एक-दूसरे के विरुद्ध तुलना करता है ताकि एकदम सही क्रम तय किया जा सके।
- उपमा: पहले एक कोच चयन प्रक्रिया (tryout) से शीर्ष 20 खिलाड़ियों को चुनता है। फिर, एक हेड कोच उन 20 खिलाड़ियों को एक साथ अभ्यास (scrimmage) करते हुए देखता है ताकि अंतिम शुरुआती लाइनअप तय किया जा सके, जिससे यह सुनिश्चित हो सके कि वे खेल के संदर्भ में एक साथ अच्छा प्रदर्शन करें।
4. कहानीकार (रिस्पॉन्स जनरेशन - Response Generation)
समस्या: अब आपके पास शीर्ष 10 दस्तावेज़ हैं। आपको एक स्पष्ट उत्तर की आवश्यकता है।
समाधान: सिस्टम शीर्ष 5 दस्तावेज़ों और पूरी बातचीत के इतिहास को लेता है और एक शक्तिशाली AI को अंतिम उत्तर लिखने के लिए कहता है।
- उपमा: एक लेखक आपके संवाद की पूरी कहानी और शीर्ष 5 शोध नोट्स के साथ बैठता है और आपके लिए एक संक्षिप्त, सटीक सारांश लिखता है।
उन्होंने कैसा प्रदर्शन किया?
टीम ने प्रतियोगिता में तीन अलग-अलग चुनौतियों में भाग लिया:
- दस्तावेजों को खोजना (Task A): उन्होंने अद्भुत प्रदर्शन किया, और 38 टीमों में से दूसरे स्थान पर रहे। उनका सिस्टम सही दस्तावेजों को खोजने में बहुत अच्छा था, यहाँ तक कि वित्त जैसे कठिन विषयों में भी।
- परफेक्ट दस्तावेजों के साथ उत्तर देना (Task B): उन्हें जजों द्वारा "सही" दस्तावेज़ दिए गए थे और उनसे उत्तर लिखने के लिए कहा गया था। उन्होंने ठीक-ठाक प्रदर्शन किया, लेकिन सर्वश्रेष्ठ नहीं।
- अपने स्वयं के खोज परिणामों के साथ उत्तर देना (Task C): उन्होंने अपने स्वयं के खोज परिणामों का उपयोग करके उत्तर लिखे। वे 29 टीमों में से 20वें स्थान पर रहे।
मुख्य निष्कर्ष:
पेपर एक विशिष्ट ट्रेड-ऑफ (trade-off) को उजागर करता है। उनका सिस्टम सही जानकारी खोजने (retrieval) में उत्कृष्ट था। हालाँकि, जब बात अंतिम उत्तर लिखने की आई, तो उन्हें उन प्रश्नों के साथ संघर्ष करना पड़ा जिनका उत्तर नहीं दिया जा सकता था (जैसे "गुप्त पासवर्ड क्या है?" जब पासवर्ड दस्तावेजों में मौजूद नहीं है)।
लेखक नोट करते हैं कि उनका सिस्टम बहुत "वफादार" (faithful) है, जिसका अर्थ है कि यदि जानकारी वहां नहीं है तो यह शायद ही कभी मनगढ़ंत बातें बनाता है (hallucinates)। हालाँकि, क्योंकि उन्होंने सिस्टम को स्पष्ट रूप से यह प्रोग्राम नहीं किया था कि जानकारी गायब होने पर "मुझे नहीं पता" कहना चाहिए, इसलिए कभी-कभी इसने उन प्रश्नों का उत्तर देने की कोशिश की जिन्हें यह पूरी तरह से नहीं समझा सकता था, जिससे इसके जनरेशन टास्क के स्कोर में कमी आई।
संक्षेप में: उन्होंने AI विशेषज्ञों की एक टीम बनाई है (एक अनुवादक, एक स्काउट, एक जज और एक लेखक) जो जटिल बातचीत को संभालने के लिए मिलकर काम करती है। वे पुस्तकालय में सही किताबें खोजने में माहिर हैं, लेकिन वे अभी भी यह सीखने की प्रक्रिया में हैं कि कब यह स्वीकार करना है कि किसी किताब में उत्तर मौजूद ही नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।