← नवीनतम पेपर
💬 NLP

FrugalRAG: Less is More in RL Finetuning for Multi-Hop Question Answering

FrugalRAG एक दो-चरणीय फाइनट्यूनिंग फ्रेमवर्क है जो प्रश्न की कठिनाई के आधार पर रिट्रीवल स्टेप्स को अनुकूल रूप से छाँटने (प्रून) के लिए सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) का लाभ उठाता है, जिससे काफी कम प्रशिक्षण उदाहरणों और कम कम्प्यूटेशनल लागत के साथ मल्टी-हॉप QA में अत्याधुनिक दक्षता और सटीकता प्राप्त होती है।

मूल लेखक: Abhinav Java, Srivathsan Koundinyan, Nagarajan Natarajan, Amit Sharma

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhinav Java, Srivathsan Koundinyan, Nagarajan Natarajan, Amit Sharma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल रहस्य सुलझाने की कोशिश कर रहे हैं, जैसे कि "फिल्म द एक्ट्रेस के पटकथा लेखक (screenwriter) का जीवनसाथी कौन है?"

पुराने दिनों में, आपके पास एक बहुत ही स्मार्ट लेकिन थोड़े आलसी सहायक (एक मानक AI) होता। आप उनसे उत्तर खोजने के लिए कहते। वे जल्दी हार मान सकते थे, या वे लाइब्रेरी में बेतरतीब सवाल चिल्लाकर अपनी ऊर्जा और समय बर्बाद कर सकते थे।

अन्य शोधकर्ताओं ने अपने सहायकों को रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करके प्रशिक्षित करने की कोशिश की—एक ऐसी विधि जहाँ सहायक को तभी "गोल्ड स्टार" मिलता है जब वह पूरे पहेली को हल कर लेता है। समस्या यह थी कि सहायक गोल्ड स्टार पाने के लिए इतना जुनूनी हो गया कि उसने बहुत अधिक सवाल पूछना शुरू कर दिया, जिससे बजट खत्म होने लगा, या वह भ्रमित होकर बहुत जल्दी रुक गया। यह एक कुत्ते को गेंद लाने के लिए प्रशिक्षित करने जैसा था, जहाँ उसे केवल तभी पुरस्कृत किया जाता है जब वह ठीक वही गेंद लाता है, लेकिन उसे यह नहीं सिखाया गया कि कब दौड़ना बंद करना है।

FrugalRAG इस डिटेक्टिव सहायक को प्रशिक्षित करने का एक नया, स्मार्ट तरीका है। लेखक इसे "Frugal" (किफायती) कहते हैं क्योंकि यह AI को उसके खोज प्रयासों में मितव्ययी (thrifty) होना सिखाता है।

यहाँ बताया गया है कि उन्होंने इसे दो सरल चरणों में कैसे किया:

चरण 1: "वाइल्ड एक्सप्लोरर" (सुपरवाइज्ड लर्निंग)

सबसे पहले, उन्होंने समय बचाने की चिंता नहीं की। उन्होंने AI से कहा: "बेखौफ होकर जाओ! जितने भी सवाल तुम सोच सकते हो, वे सब पूछो ताकि तुम्हें हर एक सुराग मिल सके। इस बात की परवाह मत करो कि इसमें कितना समय लगता है; बस यह सुनिश्चित करो कि तुम्हारे पास सारा सबूत मौजूद हो।"

  • उपमा: कल्पना कीजिए कि एक छात्र एक अभ्यास परीक्षा दे रहा है जहाँ उसे किताब में से हर उत्तर ढूँढने की अनुमति है। वह सवालों की एक विशाल सूची लिखता है और सभी उत्तर खोज लेता है। वह अभी कुशल नहीं है, लेकिन वह जानता है कि एक "परफेक्ट" जांच कैसी दिखती है।
  • परिणाम: AI यह सीख जाता है कि अच्छे सवाल कैसे पूछे जाते हैं और सही दस्तावेज़ कैसे खोजे जाते हैं।

चरण 2: "स्मार्ट मैनेजर" (रीइन्फोर्समेंट लर्निंग)

अब, वे उस "वाइल्ड एक्सप्लोरर" को एक नया नियम सिखाते हैं: "तुम्हें अभी भी सही सुराग खोजने होंगे, लेकिन तुम्हें यह भी सीखना होगा कि पर्याप्त जानकारी मिलते ही रुक जाना है। यदि तुम उत्तर मिलने के बाद भी खोज जारी रखते हो, तो तुम्हें दंड (penalty) मिलेगा। यदि तुम बहुत जल्दी रुक जाते हैं और कोई सुराग छूट जाता है, तो भी तुम्हें दंड मिलेगा।"

  • उपमा: यह उस छात्र के लिए एक प्रोजेक्ट मैनेजर को काम पर रखने जैसा है। मैनेजर कहता है, "ठीक है, तुमने पटकथा लेखक का नाम ढूंढ लिया है। क्या तुम्हें उनके जीवनसाथी का नाम खोजने के लिए और खोजना चाहिए? हाँ। ठीक है, तुमने जीवनसाथी का नाम ढूंढ लिया। क्या तुम्हें उनके कुत्ते का नाम खोजने के लिए और खोजना चाहिए? नहीं! वहीं रुक जाओ और अंतिम रिपोर्ट लिखो।"
  • जादू: AI प्रश्न की कठिनाई को आंकना सीख जाता है।
    • आसान प्रश्न: "फ्रांस की राजधानी क्या है?" -> AI 1 सवाल पूछता है, उत्तर पाता है, और तुरंत रुक जाता है।
    • कठिन प्रश्न: "फिल्म... के पटकथा लेखक का जीवनसाथी कौन है?" -> AI समझ जाता है कि यह सुरागों की एक श्रृंखला है। वह सवाल 1 पूछता है, फिर सवाल 2, फिर सवाल 3, और तभी रुकता है।

यह एक बड़ी बात क्यों है?

  1. यह एक "डेटा डाइट" है: अन्य अधिकांश AI विधियों को यह सीखने के लिए 1,00,000 उदाहरणों की आवश्यकता होती है। FrugalRAG ने केवल 1,000 उदाहरणों के साथ वही कौशल सीख लिया। यह 10,000 घंटों के ड्राइविंग वीडियो देखने के बजाय 100 घंटों के ड्राइविंग वीडियो देखकर गाड़ी चलाना सीखने जैसा है।
  2. यह पैसा और समय बचाता है: सटीक रूप से काम पूरा होने पर रुककर, यह AI अन्य तरीकों की तुलना में लगभग आधे सर्च क्वेरीज़ का उपयोग करता है। वास्तविक दुनिया में, हर सर्च की एक कीमत और समय लगता है। FrugalRAG सही उत्तर प्राप्त करते हुए भी उस लागत को आधा कर देता है।
  3. यह अनुकूलनीय (Adaptable) है: यदि आप इसे एक सरल प्रश्न देते हैं, तो यह समय बर्बाद नहीं करता है। यदि आप इसे एक डरावना कठिन प्रश्न देते हैं, तो यह गहराई तक जाने को जानता है। यह एक रोबोट नहीं है जो एक निश्चित स्क्रिप्ट का पालन करता है; यह एक जासूस है जो अपनी बुद्धि का उपयोग करता है।

निष्कर्ष

यह पेपर दिखाता है कि आपको AI को "स्मार्टर" बनाने के लिए उसे अधिक सवाल पूछने की आवश्यकता नहीं है। इसके बजाय, आपको उसे यह सिखाने की आवश्यकता है कि कब रुकना है

FrugalRAG वह AI है जो जानता है कि एक त्वरित तथ्य-जांच (fact-check) और एक गहरी जांच के बीच क्या अंतर है, जो सबसे कठिन रहस्यों को सुलझाते हुए आपका समय और पैसा बचाता है। यह साबित करता है कि कभी-कभी, कम ही अधिक है (less is more)

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →