← नवीनतम पेपर
💬 NLP

Context-Aware RL for Agentic and Multimodal LLMs

यह शोध पत्र ContextRL का प्रस्ताव करता है, जो एक संदर्भ-जागरूक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो केवल अंतिम उत्तर पर्यवेक्षण पर निर्भर रहने के बजाय, एक अप्रत्यक्ष सहायक उद्देश्य के माध्यम से अत्यधिक समान युग्मों में से सही संदर्भ चुनने के लिए मॉडलों को प्रशिक्षित करके, LLMs में दीर्घ-अवधि तर्क और बहुविध (multimodal) प्रदर्शन में सुधार करता है।

मूल लेखक: Peiyang Xu, Bangzheng Li, Sijia Liu, Karthik R. Narasimhan, Pramod Viswanath, Prateek Mittal, Xingyu Fu

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peiyang Xu, Bangzheng Li, Sijia Liu, Karthik R. Narasimhan, Pramod Viswanath, Prateek Mittal, Xingyu Fu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास सबूतों की फाइलों का एक विशाल ढेर (जिसे "कॉन्टेक्स्ट" कहा जाता है) है और आपको एक विशिष्ट प्रश्न का उत्तर देना है। समस्या यह है कि अधिकांश आधुनिक एआई (AI) जासूस उत्तर देने में तो माहिर होते हैं, लेकिन वे यह बताने में अक्सर विफल रहते हैं कि उनके पास मौजूद फाइलों के ढेर में ठीक किस पन्ने पर वह सबूत है जो उन्हें सही साबित करता है। वे भाग्य से या किसी पैटर्न को याद रखकर सही उत्तर तो दे सकते हैं, लेकिन वे आपको वह "स्मोकिंग गन" (ठोस सबूत) नहीं दिखा सकते जो उनके दावे को पुख्ता करे।

यह शोध पत्र, जिसका शीर्षक "Context-Aware RL for Agentic and Multimodal LLMs" है, इस समस्या को ठीक करने के लिए CONTEXT-RL नामक एक नई प्रशिक्षण विधि पेश करता है। यह एआई मॉडल को न केवल यह सिखाता है कि क्या उत्तर देना है, बल्कि यह भी सिखाता है कि अपने उत्तर को सही ठहराने के लिए सबूतों में कहाँ देखना है।

यहाँ बताया गया है कि यह कैसे काम करता है, रोजमर्रा के उदाहरणों का उपयोग करते हुए:

1. समस्या: "अनुमान लगाने वाला" जासूस

लेखकों ने देखा कि बहुत बुद्धिमान एआई मॉडल भी अक्सर "कॉन्टेक्स्ट अनअवेयरनेस" (संदर्भ के प्रति अनभिज्ञता) से ग्रस्त होते हैं।

  • कोडिंग में: कल्पना कीजिए कि एक एआई कंप्यूटर प्रोग्राम को ठीक कर रहा है। वह निर्देशों की एक लंबी सूची (कॉन्टेक्स्ट) देखता है। वह i नाम के एक वेरिएबल को हटाने का निर्णय लेता है। लेकिन यदि उसने कॉन्टेक्स्ट को ध्यान से देखा होता, तो वह देख पाता कि i का उपयोग कोड में आगे भी किया गया है। क्योंकि उसने अपना निर्णय कोड की उस विशिष्ट पंक्ति के आधार पर नहीं लिया, इसलिए उसने प्रोग्राम को खराब कर दिया।
  • इमेज (चित्र) में: कल्पना कीजिए कि एक एआई एक ग्राफ देख रहा है। उसे एक विशिष्ट संख्या पढ़नी है। वह "2" का अनुमान लगा सकता है क्योंकि यह एक सामान्य संख्या है, भले ही ग्राफ स्पष्ट रूप से "3" दिखा रहा हो। उसने उस सूक्ष्म दृश्य विवरण को मिस कर दिया जो उसके ठीक सामने था।

उन्होंने इस परीक्षण को एक प्रश्न, एक उत्तर और दो बहुत समान कहानियों (कॉन्टेक्स्ट) को दिखाकर किया: एक कहानी उत्तर का समर्थन करती थी, और दूसरी एक "नकली" कहानी थी जो लगभग वैसी ही दिखती थी लेकिन उसमें उत्तर का समर्थन नहीं था। आश्चर्यजनक रूप से, कई स्मार्ट ओपन-सोर्स मॉडल अंतर नहीं कर सके और गलत कहानी चुनते समय लगभग उतना ही असफल रहे जितना कि वे केवल तुक्का लगाते।

2. समाधान: "अंतर पहचानो" खेल

इसे ठीक करने के लिए, लेखकों ने CONTEXT-RL नामक एक नया प्रशिक्षण खेल बनाया।

केवल यह बताने के बजाय कि, "आपने उत्तर सही दिया, यह आपका इनाम है," उन्होंने एक दूसरा, अधिक सख्त नियम जोड़ा: "आपको सही सबूत वाली फाइल की ओर भी इशारा करना होगा।"

  • सेटअप: एआई को एक प्रश्न और एक उत्तर दिया जाता है। फिर, उसे दो लगभग एक जैसी "दुनियाओं" (कॉन्टेक्स्ट) को दिखाया जाता है।
    • दुनिया A: इसमें वह विशिष्ट सुराग शामिल है जो उत्तर को सही साबित करता है।
    • दुनिया B: यह लगभग वैसी ही दिखती है, लेकिन सुराग गायब है या बदल गया है, जिससे उत्तर गलत हो जाता है।
  • लक्ष्य: एआई को न केवल समस्या को हल करने के लिए बोनस इनाम मिलता है, बल्कि उत्तर का समर्थन करने वाले सही कॉन्टेक्स्ट यानी दुनिया A की पहचान करने के लिए भी इनाम मिलता है।

यह एक शिक्षक द्वारा छात्र को गणित का सवाल देने जैसा है। एक सामान्य शिक्षक कहता है, "अच्छा काम किया, तुम्हारा उत्तर 5 है।" CONTEXT-RL वाला शिक्षक कहता है, "अच्छा काम किया, लेकिन मुझे यह भी दिखाओ कि तुमने फॉर्मूला खोजने के लिए किताब की किस सटीक पंक्ति का उपयोग किया। यदि तुम इसकी ओर इशारा नहीं कर सकते, तो इसका मतलब है कि तुम वास्तव में इसे समझे नहीं हो।"

3. उन्होंने प्रशिक्षण डेटा कैसे बनाया

इस खेल को सिखाने के लिए, उन्हें हजारों "अंतर पहचानो" पहेलियाँ बनानी पड़ीं:

  • कोडिंग एजेंटों के लिए: उन्होंने वास्तविक दुनिया के कोडिंग कार्यों को लिया और कोडिंग हिस्ट्री के ऐसे जोड़े बनाए जो लगभग एक जैसे थे, सिवाय कोड में एक बहुत छोटे और महत्वपूर्ण अंतर के। उन्होंने वास्तविक कोड परिवर्तनों को छिपा दिया ताकि एआई केवल अंतिम सुधार को पढ़कर नकल न कर सके; उसे प्रक्रिया को समझना ही था।
  • इमेज (चित्रों) के लिए: उन्होंने फोटो एडिट करने के लिए एआई टूल्स का उपयोग किया। उदाहरण के लिए, उन्होंने एक चार्ट की तस्वीर ली और उसमें एक नंबर को थोड़ा बदल दिया जिससे उत्तर एक सवाल के लिए "हाँ" से बदलकर "नहीं" हो गया। उन्होंने यह सुनिश्चित किया कि बाकी चित्र बिल्कुल वैसा ही दिखे, जिससे एआई को उस विशिष्ट विवरण को देखने के लिए मजबूर होना पड़ा।

4. परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने इस पद्धति का परीक्षण दो प्रकार के कार्यों पर किया:

  1. लॉन्ग-होरिज़न कोडिंग: एजेंट जिन्हें कई चरणों में कोड लिखना होता है।
  2. मल्टीमॉडल रीजनिंग: एजेंट जिन्हें छवियों को देखकर प्रश्नों के उत्तर देने होते हैं।

निष्कर्ष स्पष्ट थे:

  • बेहतर प्रदर्शन: CONTEXT-RL के साथ प्रशिक्षित मॉडल कठिन बेंचमार्क पर मानक तरीकों वाले मॉडलों की तुलना में काफी बेहतर स्कोर प्राप्त करते हैं।
  • असली मंत्र: लेखकों ने सिद्ध किया कि सुधार केवल अधिक डेटा होने से नहीं आया। उन्होंने मानक प्रशिक्षण विधियों का उपयोग करके उसी "अंतर पहचानो" डेटा को मॉडलों को खिलाने की कोशिश की, लेकिन वह काम नहीं किया (या चीजें और खराब हो गईं)। जादू इस विशिष्ट तरीके में था जिससे उन्होंने मॉडल को सही कॉन्टेक्स्ट चुनने के लिए प्रशिक्षित किया।

निष्कर्ष (Takeaway)

मानक एआई प्रशिक्षण को एक छात्र को अंतिम उत्तर कुंजी (Answer Key) रटने के लिए सिखाने के रूप में सोचें। CONTEXT-RL छात्र को एक ऐसा जासूस बनना सिखाता है जो जानता है कि एक अस्त-व्यस्त कमरे में सबूत कैसे खोजे जाते हैं। यह केवल सही उत्तर नहीं चाहता; यह मांग करता है कि उत्तर दिए गए विशिष्ट विवरणों पर आधारित हो, जिससे एआई अधिक विश्वसनीय बनता है और जटिल या सूक्ष्म कॉन्टेक्स्ट होने पर गलती करने की संभावना कम हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →