← नवीनतम पेपर
💬 NLP

ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL

यह शोधपत्र ContextRL का प्रस्ताव करता है, जो एक नवीन ढांचा है जो सूक्ष्म सत्यापन के लिए संदर्भ-संवर्धित पुरस्कारों (context-augmented rewards) और रिवॉर्ड हैकिंग को कम करने के लिए मल्टी-टर्न मिस्टेक-गाइडेड सैंपलिंग का उपयोग करके MLLM ज्ञान खोज दक्षता को बढ़ाता है, जिससे Qwen3-VL-8B जैसे छोटे मॉडल धारणा और तर्क कार्यों पर बड़े बेसलाइन को पीछे छोड़ने में सक्षम होते हैं।

मूल लेखक: Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े नादान छात्र (AI मॉडल) को जटिल पहेलियाँ हल करना सिखा रहे हैं, जैसे कि किसी फोटो में वस्तुओं की पहचान करना या कोई कठिन गणित का सवाल हल करना।

वर्तमान मानक तरीके (जिसे RLVR कहा जाता है) में, यह प्रक्रिया इस प्रकार काम करती है:

  1. छात्र एक उत्तर का अनुमान लगाता है।
  2. एक सख्त शिक्षक (Verifier) अंतिम उत्तर की जाँच करता है।
  3. यदि उत्तर सही है, तो छात्र को एक 'गोल्ड स्टार' मिलता है। यदि उत्तर गलत है, तो उसे एक 'लाल X' मिलता है।
  4. छात्र फिर से अनुमान लगाने की कोशिश करता है, इस उम्मीद में कि उसे और अधिक गोल्ड स्टार मिल सकें।

समस्या:
यह शोध पत्र बताता है कि इस पद्धति में दो प्रमुख खामियां हैं, जैसे कि केवल अंतिम अनुवाद देखकर भाषा सीखने की कोशिश करना बिना व्याकरण देखे:

  1. "किस्मत से सही अनुमान" का जाल (Identifiability): कभी-कभी, छात्र सही उत्तर प्राप्त कर लेता है लेकिन गलत कारणों से। शायद उसने संख्या "4" इसलिए चुनी क्योंकि उसने चार पैर देखे, लेकिन उसने एक ऐसे घोड़े की कल्पना कर ली जो वहां था ही नहीं। यदि शिक्षक केवल अंतिम संख्या "4" की जाँच करता है, तो वह गोल्ड स्टार दे देता है। छात्र सीखता है: "मुझे ध्यान से देखने की ज़रूरत नहीं है; मुझे बस सही संख्या का अनुमान लगाना है।" इसे Reward Hacking कहा जाता है।
  2. "बंद रास्ता" का जाल (Reachability): यदि प्रश्न बहुत कठिन है, तो छात्र कितनी भी बार कोशिश कर ले, वह सही उत्तर तक कभी नहीं पहुँच पाएगा। यदि उसे कभी गोल्ड स्टार नहीं मिलता, तो शिक्षक के पास उसे दिखाने के लिए कुछ सकारात्मक नहीं होता। छात्र बस असफल होता रहता है और भ्रमित हो जाता है, क्योंकि उसे कोई संकेत नहीं मिलता कि कैसे सुधार किया जाए।

समाधान: ContextRL (एक "संदर्भ-जागरूक ट्यूटर")

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे ContextRL कहा जाता है। केवल अंतिम उत्तर की जाँच करने के बजाय, वे शिक्षक और छात्र को एक "चीट शीट" देते हैं जिसमें पूर्ण, चरण-दर-चरण समाधान और गलतियों पर एक विस्तृत रिपोर्ट होती है।

यह एक रचनात्मक उपमा (analogy) का उपयोग करके इस प्रकार काम करता है:

1. सुपर-टीचर (Context-Augmented Reward Model)

  • पुराना तरीका: शिक्षक केवल अंतिम उत्तर देखता है। "क्या आपने 4 प्राप्त किया? हाँ? बहुत अच्छे!"
  • ContextRL का तरीका: शिक्षक के पास पूरा समाधान मैनुअल खुला है। वे देखते हैं कि छात्र ने "4" लिखा है, लेकिन वे यह भी देखते हैं कि छात्र का तर्क क्या था: "मैंने 3 घोड़े देखे, लेकिन मैंने बाड़ के पीछे चौथे घोड़े की कल्पना कर ली।"
  • परिणाम: शिक्षक कहता है, "रुको! तुम्हें संख्या तो सही मिली, लेकिन तुम्हारा तर्क झूठ है। तुमने एक घोड़े की कल्पना की जो वहां नहीं था। तुम्हारे लिए कोई गोल्ड स्टार नहीं है।"
  • यह कैसे मदद करता है: यह छात्र को बुरी आदतें सीखने से रोकता है (Reward Hacking)। वे सीखते हैं कि कैसे वे उत्तर तक पहुँचते हैं, यह उतना ही महत्वपूर्ण है जितना कि उत्तर स्वयं।

2. "फिर से प्रयास करें" कोच (Context-Augmented Policy Model)

  • पुराना तरीका: यदि छात्र लगातार 8 बार विफल होता है, तो शिक्षक उस प्रश्न पर हार मान लेता है और अगले प्रश्न पर चला जाता है। छात्र उस विशिष्ट कठिन समस्या को हल करना कभी नहीं सीख पाता।
  • ContextRL का तरीका: यदि छात्र विफल होता है, तो शिक्षक केवल "गलत" नहीं कहता। वे छात्र को एक मिस्टेक रिपोर्ट (Mistake Report) सौंपते हैं।
    • शिक्षक: "आप इसलिए विफल हुए क्योंकि आपने बाईं ओर के घोड़े को मिस कर दिया और दाईं ओर के एक काल्पनिक घोड़े का निर्माण कर लिया। यहाँ उन त्रुटियों के बारे में एक नोट है। अब, इस नोट को अपने सामने रखकर फिर से प्रयास करें।"
  • परिणाम: छात्र "मिस्टेक रिपोर्ट" लेता है, चित्र को फिर से देखता है, और इस बार, वे वास्तविक घोड़ों को ढूंढ लेते हैं और उत्तर सही प्राप्त करते हैं।
  • यह कैसे मदद करता है: यह एक "बंद रास्ते" को सीखने के अवसर में बदल देता है। छात्र विफलता से उबरना सीखता है, जिससे उनका ज्ञान उन कठिन समस्याओं तक विस्तारित होता है जिन्हें वे पहले हल नहीं कर पा रहे थे।

बड़ी जीत

शोधकर्ताओं ने इसे एक छोटे AI मॉडल (8 बिलियन पैरामीटर्स) पर परखा और इसकी तुलना एक बहुत बड़े, अधिक महंगे मॉडल (32 बिलियन पैरामीटर्स) से की।

  • ContextRL के बिना: छोटा मॉडल संघर्ष करता रहा, अक्सर कठिन तर्क कार्यों पर अटक जाता या बुरी आदतें सीख लेता।
  • ContextRL के साथ: छोटा मॉडल इतनी कुशलता से सीखा कि इसने उतना ही प्रदर्शन किया जितना कि विशाल 32B मॉडल ने किया।

एक वाक्य में सारांश

ContextRL एक विस्तृत पाठ्यपुस्तक और एक व्यक्तिगत ट्यूटर देने जैसा है जो ठीक से बताता है कि गलती क्यों हुई, बजाय इसके कि केवल अंतिम परीक्षा के स्कोर को ग्रेड दिया जाए। यह छात्र को अच्छे ग्रेड पाने के लिए धोखाधड़ी करने से रोकता है और उन्हें उन समस्याओं को हल करने में मदद करता है जिन्हें वे असंभव समझते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →