← नवीनतम पेपर
💬 NLP

Rethinking On-policy Optimization for Query Augmentation

यह शोध पत्र प्रॉम्प्टिंग-आधारित और सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग)-आधारित क्वेरी ऑग्मेंटेशन की व्यवस्थित रूप से तुलना करता है, जो यह प्रकट करता है कि सरल प्रशिक्षण-मुक्त विधियाँ अक्सर जटिल आरएल (RL) दृष्टिकोणों के बराबर होती हैं, और फलस्वरूप एक नवीन हाइब्रिड विधि प्रस्तावित करता है जिसे ऑन-पॉलिसी स्यूडो-डॉक्यूमेंट क्वेरी एक्सपेंशन (OPQE) कहा जाता है, जो बेहतर रिट्रीवल प्रदर्शन प्राप्त करने के लिए प्रॉम्प्टिंग के लचीलेपन को आरएल के लक्षित अनुकूलन के साथ सहक्रियात्मक रूप से जोड़ता है।

मूल लेखक: Zhichao Xu, Shengyao Zhuang, Xueguang Ma, Bingsen Chen, Yijun Tian, Fengran Mo, Jie Cao, Vivek Srikumar

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhichao Xu, Shengyao Zhuang, Xueguang Ma, Bingsen Chen, Yijun Tian, Fengran Mo, Jie Cao, Vivek Srikumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप घास के एक विशाल ढेर में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं। कंप्यूटर की दुनिया में, यह "सुई" वह उत्तर है जिसकी आपको आवश्यकता है, और "घास का ढेर" इंटरनेट या दस्तावेजों का एक विशाल डेटाबेस है। वह उपकरण जिसका उपयोग आप इसे खोजने के लिए करते हैं, उसे रिट्रीवर (Retriever) कहा जाता है।

कभी-कभी समस्या यह नहीं होती कि घास का ढेर बहुत बड़ा है; बल्कि समस्या यह होती है कि आपकी सुई का विवरण (आपका क्वेरी/Query) बहुत अस्पष्ट है। यदि आप वास्तव में "एजिलिटी प्रतियोगिताओं के लिए गोल्डन रिट्रीवर को प्रशिक्षित करने" के बारे में जानना चाहते हैं, तो "मुझे कुत्तों के बारे में कुछ ढूंढ कर दो" एक खराब क्वेरी है।

यह पेपर कंप्यूटर को बेहतर विवरण (क्वेरी) लिखना सिखाने के बारे में है ताकि वे सही जानकारी तेजी से खोज सकें। लेखकों ने कंप्यूटर को यह कौशल सिखाने के दो मुख्य तरीकों की तुलना की और फिर एक तीसरा, बेहतर तरीका ईजाद किया।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. सिखाने के दो पुराने तरीके

तरीका A: "स्मार्ट अनुमान" (प्रॉम्प्टिंग/Prompting)

  • उपमा: कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल) से मदद मांगते हैं। आप कहते हैं, "मुझे डॉग ट्रेनिंग पर जानकारी चाहिए।" लाइब्रेरियन केवल आपके शब्दों को दोहराता नहीं है; वे डॉग ट्रेनिंग पर एक पूरा काल्पनिक लेख सोचते हैं और कहते हैं, "यहाँ एक नकली लेख है जो आपके प्रश्न का उत्तर देता है। लाइब्रेरी में खोजने के लिए इस टेक्स्ट का उपयोग करें।"
  • यह कैसे काम करता है: कंप्यूटर जो पहले से जानता है उसके आधार पर एक "नकली दस्तावेज़" (fake document) बनाता है, और उसका उपयोग खोजने के लिए करता है।
  • पक्ष (Pros): यह मुफ्त है, तेज़ है, और इसके लिए किसी प्रशिक्षण की आवश्यकता नहीं है। आप बस बुद्धिमान लाइब्रेरियन से पूछ लेते हैं।
  • विपक्ष (Cons): कभी-कभी लाइब्रेरियन बहुत अधिक बातें करने लगता है या ऐसे अजीब शब्द जोड़ देता है जो सर्च इंजन को भ्रमित कर सकते हैं।

तरीका B: "ड्रिल सार्जेंट" (रीइन्फोर्समेंट लर्निंग / RL)

  • उपमा: कल्पना कीजिए कि आप एक छात्र को काम पर रखते हैं और उसे एक ट्रेनिंग कैंप में डालते हैं। हर बार जब वह एक क्वेरी लिखता है, तो आप उसे लाइब्रेरी में भेजते हैं। यदि वह सुई ढूंढ लेता है, तो आप उसे एक गोल्ड स्टार (पुरस्कार) देते हैं। यदि वह असफल रहता है, तो आप उसे थम्स डाउन (निराशा) देते हैं। हजारों प्रयासों के बाद, छात्र ठीक से सीख जाता है कि गोल्ड स्टार पाने के लिए चीजों को कैसे लिखा जाए।
  • यह कैसे काम करता है: कंप्यूटर ट्रायल और एरर (परीक्षण और त्रुटि) के माध्यम से सीखता है, जिसे विशेष रूप से सर्च मेट्रिक्स पर उच्च स्कोर प्राप्त करने के लिए ट्यून किया गया है।
  • पक्ष (Pros): यह एक विशिष्ट प्रकार के सर्च में मास्टर बन सकता है।
  • विपक्ष (Cons): इसमें बहुत लंबा समय लगता है, बिजली (कंप्यूट) में बहुत खर्च होता है, और छात्र केवल उस विशिष्ट लाइब्रेरी के लिए अच्छा हो सकता है। यदि आप उन्हें एक नई लाइब्रेरी में ले जाते हैं, तो वे सब कुछ भूल सकते हैं।

2. एक बड़ा आश्चर्य

लेखकों ने इन दोनों की तुलना करने के लिए एक बड़ा प्रयोग चलाया। वे देखना चाहते थे कि क्या महंगा "ड्रिल सार्जेंट" तरीका वास्तव में पैसे के लायक है।

परिणाम: कई मामलों में, "स्मार्ट अनुमान" (तरीका A) "ड्रिल सार्जेंट" (तरीका B) के समान ही अच्छा था, या उससे भी बेहतर था।

  • क्यों? क्योंकि "स्मार्ट अनुमान" एक अत्यंत शक्तिशाली, प्री-ट्रेन्ड दिमाग का उपयोग करता है जो पहले से ही बहुत कुछ जानता है। "ड्रिल सार्जेंट" एक छोटे दिमाग को शून्य से सिखाने की कोशिश करता है, जो कठिन काम है और अक्सर इसका लाभ नहीं मिलता जब तक कि कार्य बहुत विशिष्ट न हो।

सबक: कभी-कभी, बस एक स्मार्ट AI से "एक उत्तर की कल्पना करने" के लिए कहना, एक छोटे AI को "खोजना सीखने" के लिए हफ्तों तक प्रशिक्षित करने से बेहतर होता है।

3. नया हाइब्रिड: "दोनों दुनियाओं का सर्वश्रेष्ठ" (OPQE)

लेखकों को एहसास हुआ कि उन्हें चुनाव करने की आवश्यकता नहीं है। उन्होंने एक नया तरीका बनाया जिसे OPQE (ऑन-पॉलिसी स्यूडो-डॉक्यूमेंट क्वेरी एक्सपेंशन) कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप "ड्रिल सार्जेंट" ट्रेनिंग कैंप लेते हैं, लेकिन छात्र को केवल एक छोटा, प्रभावशाली वाक्य (पुनर्लिखित क्वेरी) लिखने के बजाय, आप उसे वह नकली लेख (स्यूडो-डॉक्यूमेंट) लिखना सिखाते हैं जो लाइब्रेरियन लिखेगा।
  • यह कैसे काम करता है:
    1. कंप्यूटर "स्मार्ट गेस" क्षमता के साथ शुरू करता है (वह एक अच्छा नकली लेख लिखना जानता है)।
    2. फिर, यह सबसे अच्छे खोज परिणाम प्राप्त करने के लिए उस लेख को कैसे लिखा जाए, इसे फाइन-ट्यून करने के लिए "ड्रिल सार्जेंट" (रीइन्फोर्समेंट लर्निंग) का उपयोग करता है।
  • जादू: यह बुद्धिमान लाइब्रेरियन के समृद्ध ज्ञान और ड्रिल सार्जेंट के लक्षित अनुशासन को जोड़ता है।

अंतिम निर्णय

  • यदि आपके पास एक शक्तिशाली AI है: बस इसे खोजने में मदद के लिए एक "नकली दस्तावेज़" उत्पन्न करने के लिए कहें। यह सस्ता है और बहुत अच्छा काम करता है।
  • यदि आप सर्वोत्तम प्रदर्शन चाहते हैं: नया OPQE तरीका उपयोग करें। यह AI को उन "नकली दस्तावेज़ों" को उत्पन्न करने के लिए प्रशिक्षित करता है लेकिन उन्हें विशेष रूप से सर्च इंजन के स्कोरिंग सिस्टम को हराने के लिए अनुकूलित करता है।

संक्षेप में: यह पेपर साबित करता है कि आपको हमेशा एक रोबोट को सर्च एक्सपर्ट बनने के लिए महीनों तक प्रशिक्षित करने की आवश्यकता नहीं होती है। कभी-कभी, बस एक स्मार्ट रोबोट से "जवाब होने का नाटक करने" के लिए कहना बेहतर काम करता है। और यदि आप वास्तव में जीतना चाहते हैं, तो रोबोट को "जवाब होने का नाटक करने" के लिए सिखाएं और जब भी वह इसे सही ढंग से करे, उसे एक गोल्ड स्टार दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →