← नवीनतम पेपर
💬 NLP

UR2^2: Unify RAG and Reasoning through Reinforcement Learning

UR2^2 एक सामान्य सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक कठिनाई-जागरूक पाठ्यक्रम (difficulty-aware curriculum) और एक हाइब्रिड ज्ञान एक्सेस रणनीति का उपयोग करके विविध डोमेन में रिट्रीवल (retrieval) और रीजनिंग (reasoning) को गतिशील रूप से समन्वित करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) और जटिल तर्क को एकीकृत करता है।

मूल लेखक: Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu

प्रकाशित 2026-04-27
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उच्च-दांव वाली परीक्षा (high-stakes exam) दे रहे हैं। आपके पास समस्याओं को हल करने के दो तरीके हैं: या तो आप अपनी बौद्धिक शक्ति (अपनी आंतरिक तर्कशक्ति और विवेक) पर भरोसा कर सकते हैं, या आप एक पाठ्यपुस्तक (बाहरी ज्ञान/RAG) का उपयोग कर सकते हैं।

अधिकांश AI मॉडल एक "गोल्डिलॉक्स" (Goldilocks) समस्या से जूझते हैं:

  1. आलसी छात्र: वे हर चीज़ के लिए पाठ्यपुस्तक का उपयोग करते हैं, यहाँ तक कि 2+22+2 जैसे सरल गणित के लिए भी, जिससे समय बर्बाद होता है और उनकी आलोचनात्मक रूप से सोचने की क्षमता कम हो जाती है।
  2. अति-आत्मविश्वासी छात्र: वे तब भी पाठ्यपुस्तक देखने से इनकार कर देते हैं जब वे स्पष्ट रूप से फंस चुके होते हैं, जिससे वे आत्मविश्वास के साथ गलत तथ्य बताते हैं।

त्सिंहुआ विश्वविद्यालय के शोधकर्ताओं ने UR2 बनाया है, जो एक फ्रेमवर्क है जो AI को "परफेक्ट स्टूडेंट" बनना सिखाता है। उन्होंने इसे इन तीन चतुर रणनीतियों का उपयोग करके किया है:

1. "स्मार्ट समरी" (हाइलाइटिंग विधि)

कल्पना कीजिए कि जब भी आप कोई पाठ्यपुस्तक खोलते हैं, तो आपके सामने 500 पन्नों का घना और बिखरा हुआ टेक्स्ट होता है। आप अभिभूत हो जाएंगे!

AI को पूरे बिखरे हुए विकिपीडिया लेख पढ़ने के लिए मजबूर करने के बजाय, UR2 एक "मिनी-असिस्टेंट" का उपयोग करता है जो पहले उन लेखों को पढ़ता है। यह असिस्टेंट एक "चीट शीट" बनाता है—तथ्यों का एक छोटा, अत्यधिक प्रासंगिक सारांश जिसकी AI को वास्तव में आवश्यकता है। यह AI को अप्रासंगिक जानकारी के "झाड़ियों में खो जाने" से रोकता है और उसका ध्यान वास्तविक समस्या पर केंद्रित रखता है।

2. "डिफिकल्टी-अवेयर करिकुलम" (लेवल-अप विधि)

आप एक छोटे बच्चे को कैलकुलस नहीं सिखाएंगे, और न ही किसी पीएचडी छात्र को कलरिंग बुक देंगे।

UR2 एक स्मार्ट ट्रेनिंग शेड्यूल का उपयोग करता है।

  • आसान सवालों के लिए: AI को बताया जाता है, "केवल अपने दिमाग का उपयोग करें।" यह इसकी आंतरिक तर्कशक्ति की मांसपेशियों को मजबूत रखता है।
  • कठिन सवालों के लिए: AI को बताया जाता है, "अब पाठ्यपुस्तक का उपयोग करना ठीक है।"

इस तरह से प्रशिक्षित करके, AI सीखता है कि कब सोचना है और कब खोजना है। यह न तो "एक ऐसा सर्च इंजन बनता है जो सोच नहीं सकता", और न ही "एक ऐसा विचारक बनता है जो खोज नहीं सकता"।

3. "टू-स्टेप ट्रेनिंग" (कोच और प्रो)

एक साथ दोनों चीजें करने के लिए AI को प्रशिक्षित करना, साइकिल चलाना सीखने के साथ-साथ जगलिंग (juggle) सीखने जैसा है। यह बहुत अधिक है!

UR2 प्रशिक्षण को दो चरणों में विभाजित करता है:

  • चरण 1 (उपकरणों को सीखना): AI को विशेष रूप से सर्च टूल का उपयोग करने के तरीके पर कोचिंग दी जाती है। इसे अच्छे और स्पष्ट प्रश्न पूछने के लिए "पॉइंट्स" मिलते हैं, भले ही अभी तक यह सही उत्तर तक न पहुँचा हो। यह एक कोच की तरह है जो खिलाड़ी को सही ढंग से बल्ला घुमाना सिखा रहा है।
  • चरण 2 (गेम जीतना): एक बार जब AI उपकरणों का उपयोग करना जान जाता है, तो ध्यान सही उत्तर प्राप्त करने पर केंद्रित हो जाता है। अब, "पॉइंट्स" सटीकता के लिए दिए जाते हैं।

परिणाम?

शोधकर्ताओं ने गणित, चिकित्सा और सामान्य ज्ञान पर इसका परीक्षण किया। परिणाम एक "सुपर स्टूडेंट" था। यहाँ तक कि छोटे, कुशल AI मॉडल (जैसे 7B संस्करण) भी GPT-4o-mini जैसे विशाल, महंगे "मस्तिष्क" के लगभग बराबर प्रदर्शन करने लगे।

संक्षेप में: UR2 AI को केवल अधिक जानना ही नहीं, बल्कि यह भी सिखाता है कि वह जो जानता है उसका उपयोग कैसे करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →