← नवीनतम पेपर
💬 NLP

Multi-Faceted Self-Consistent Preference Alignment for Query Rewriting in Conversational Search

यह शोध पत्र MSPA-CQR प्रस्तुत करता है, जो एक नवीन संवादात्मक क्वेरी पुनर्लेखन (conversational query rewriting) ढांचा है, जो बहु-आयामी प्राथमिकता डेटा का निर्माण करके और पुनर्प्राप्ति (retrieval) एवं प्रतिक्रिया निर्माण (response generation) फीडबैक के साथ पुनर्लेखन को संरेखित करने के लिए प्रीफिक्स-निर्देशित प्रत्यक्ष प्राथमिकता अनुकूलन (prefix-guided direct preference optimization) का उपयोग करके प्रदर्शन को बढ़ाता है।

मूल लेखक: Zhiyu Cao, Peifeng Li, Qiaoming Zhu

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiyu Cao, Peifeng Li, Qiaoming Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़ी शाब्दिक (literal) समझ रखने वाले लाइब्रेरियन से बात कर रहे हैं। आप किसी विशिष्ट विषय, जैसे कि किसी प्रसिद्ध गायक के इतिहास के बारे में उनसे लंबी बातचीत कर रहे हैं।

समस्या:
बातचीत के बीच में, आप पूछते हैं, "वह गाना कब रिलीज़ हुआ था?"

क्योंकि लाइब्रेरियन केवल उस एक वाक्य को सुनता है और पिछले 10 मिनट की बातचीत को याद नहीं रखता, इसलिए वह भ्रमित हो जाता है। उसे नहीं पता कि आप किस गाने की बात कर रहे हैं। वह किसी दूसरे कलाकार के गाने के बारे में कोई किताब निकाल सकता है, या वह कह सकता है, "मुझे नहीं पता कि आप किस गाने की बात कर रहे हैं।"

यही कन्वर्सेशनल सर्च (Conversational Search) की मूल समस्या है। कंप्यूटर चीज़ें खोजने में बहुत अच्छे होते हैं, लेकिन वे चैट के संदर्भ (context) को याद रखने में बहुत खराब होते हैं।

पुराना समाधान:
पिछली विधियों ने कंप्यूटर को यह सिखाने की कोशिश की कि वे आपके प्रश्न को खोजने से पहले एक पूर्ण वाक्य में कैसे "पुनर्लिखित" (rewrite) करें।

  • आपका प्रश्न: "वह गाना कब रिलीज़ हुआ था?"
  • पुराना पुनर्लेखन: "Cat Power का गाना 'Ruin' कब रिलीज़ हुआ था?"

इससे मदद तो मिली, लेकिन यह एक ऐसे अनुवादक की तरह था जो केवल एक बोली जानता हो। उन्होंने वाक्य को इंसानों के लिए स्पष्ट बनाया, लेकिन यह हमेशा सर्च इंजन के लिए एकदम सही नहीं होता था। कभी-कभी पुनर्लेखन बहुत लंबा होता था, कभी इसमें कोई महत्वपूर्ण कीवर्ड छूट जाता था, और कभी यह सही उत्तर खोजने में मदद नहीं करता था।

नया समाधान: MSPA-CQR (एक "तीन-सिर वाला कोच")
लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे MSPA-CQR कहा जाता है। केवल एक पुनर्लेखन के बजाय, कल्पना करें कि आपके पास तीन अलग-अलग विशेषज्ञ कोच हैं जो आपके प्रश्न को सर्च इंजन के पास भेजने से पहले उसे बेहतर बनाने के लिए मिलकर काम करते हैं।

यहाँ बताया गया है कि वे कैसे काम करते हैं, एक स्पोर्ट्स टीम के उदाहरण का उपयोग करते हुए:

1. "ग्रामर कोच" (पुनर्लेखन प्राथमिकता - Rewriting Preference)

  • लक्ष्य: यह सुनिश्चित करना कि वाक्य अपने आप में अर्थपूर्ण हो।
  • उदाहरण: यह कोच एक सख्त संपादक की तरह है। वे कहते हैं, "आप सिर्फ 'वह गाना' नहीं कह सकते। आपको कहना होगा 'Cat Power का गाना Ruin', ताकि जो भी इसे पढ़ रहा हो उसे पता चले कि आपका क्या मतलब है, भले ही वे उस समय कमरे में मौजूद न रहे हों।"
  • परिणाम: एक स्पष्ट, पूर्ण वाक्य।

2. "स्काउट" (रिट्रीवल प्राथमिकता - Retrieval Preference)

  • लक्ष्य: सर्च इंजन को ठीक वही कीवर्ड देना जिनकी उसे फ़ाइल खोजने के लिए आवश्यकता है।
  • उदाहरण: यह कोच एक स्काउट की तरह है जो एक विशाल स्टेडियम में एक विशिष्ट खिलाड़ी की तलाश कर रहा है। वे कहते हैं, "मुझे लंबी कहानी मत दो! बस जर्सी नंबर और टीम का नाम दो। सारा फालतू विवरण हटा दो ताकि सर्च इंजन विचलित न हो।"
  • परिणाम: एक छोटा, प्रभावशाली क्वेरी जो सबसे महत्वपूर्ण कीवर्ड से भरा हो।

3. "उत्तर कुंजी" (रिस्पॉन्स प्राथमिकता - Response Preference)

  • लक्ष्य: यह सुनिश्चित करना कि खोज परिणाम वास्तव में एक अच्छा उत्तर प्रदान करें।
  • उदाहरण: यह कोच एक शिक्षक की तरह है जो उत्तर कुंजी की जाँच कर रहा है। वे कहते हैं, "यदि हम इसके लिए खोज करते हैं, तो क्या मिलने वाला दस्तावेज़ वास्तव में रिलीज़ की तारीख बताएगा? यदि खोज से ऐसी जीवनी आती है जिसमें तारीख का उल्लेख नहीं है, तो हमें प्रश्न को थोड़ा बदलना होगा ताकि सर्च इंजन उस विशिष्ट पैराग्राफ को ढूँढ सके जिसकी हमें आवश्यकता है।"
  • परिणाम: एक ऐसी क्वेरी जो उस विशिष्ट दस्तावेज़ को निकालने के लिए डिज़ाइन की गई है जिसमें उत्तर मौजूद है।

वे मिलकर कैसे काम करते हैं (जादू)

अतीत में, शोधकर्ताओं ने इनमें से केवल एक कोच को चुनने की कोशिश की थी। लेकिन यह पेपर दिखाता है कि तीनों की आवश्यकता है

सिस्टम आपके प्रश्न के कई संस्करण बनाता है। फिर, यह एक चतुर "स्व-जाँच" (self-check) विधि का उपयोग करता है (जैसे एक छात्र अपना होमवर्क खुद ग्रेड करता है) यह देखने के लिए कि कौन सा संस्करण ग्रामर कोच के लिए सबसे अच्छा है, कौन सा स्काउट के लिए सबसे अच्छा है, और कौन सा उत्तर कुंजी के लिए सबसे अच्छा है।

अंत में, यह तीनों के सबसे अच्छे हिस्सों को मिला देता है। यह ग्रामर कोच की स्पष्टता, स्काउट के कीवर्ड और शिक्षक के उत्तर-केंद्रित दृष्टिकोण को लेता है, और उन्हें एक "सुपर क्वेरी" (Super Query) में विलीन कर देता है।

यह क्यों महत्वपूर्ण है

  • किसी इंसान की ज़रूरत नहीं: पुरानी विधियों के लिए इंसानों द्वारा सटीक उदाहरण लिखना आवश्यक था, जो धीमा और महंगा था। यह सिस्टम इन तीन कोचों का अनुकरण करके खुद को सिखाता है।
  • बेहतर उत्तर: क्योंकि सर्च इंजन को एक "सुपर क्वेरी" मिलती है, इसलिए वह सही दस्तावेज़ बहुत तेज़ी से खोज लेता है।
  • हर जगह काम करता है: चाहे आप पॉप संस्कृति, इतिहास या विज्ञान के बारे में पूछ रहे हों, यह सिस्टम यह सुनिश्चित करने के लिए अनुकूलित होता है कि कंप्यूटर आपके शब्दों को नहीं, बल्कि आपके प्रश्न के इरादे (intent) को समझे।

संक्षेप में: कंप्यूटर से यह अनुमान लगाने के बजाय कि आपका क्या मतलब है, यह सिस्टम विशेषज्ञों की एक टीम की तरह कार्य करता है जो आपके प्रश्न को कंप्यूटर के समझने योग्य एक आदर्श रूप में फिर से लिखता है, जिससे यह सुनिश्चित होता है कि आपको हर बार सही उत्तर मिले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →