From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में वेरीफिएबल रिवार्ड्स के साथ रीइन्फोर्समेंट लर्निंग (RLVR) के लिए एक नवीन दो-चरणीय, टोकन-स्तरीय एंट्रॉपी अनुकूलन ढांचे का प्रस्ताव करता है जो एंट्रॉपी के अधिकतमकरण से न्यूनतमकरण की ओर गतिशील रूप से संक्रमण करता है, जो शोर वाले लेबल पर ओवरफिटिंग को प्रभावी ढंग से रोकता है और विविध मॉडलों एवं कार्यों में बेहतर प्रदर्शन प्राप्त करने के लिए रिवॉर्ड सिग्नल की विश्वसनीयता को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।
बड़ी तस्वीर: एक शोर भरे कमरे में रोबोट को सिखाना
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन रोबोट (एक AI मॉडल) को शहर में रास्ता खोजने का प्रशिक्षण दे रहे हैं। आप चाहते हैं कि वह विशिष्ट गंतव्यों तक पहुँचने के लिए सबसे अच्छे रास्तों को सीखे।
समस्या:
वास्तविक दुनिया में, आपके पास कोई सटीक नक्शा नहीं होता। इसके बजाय, आपके पास दिशा-निर्देश देने वाले स्थानीय लोगों का एक समूह है, लेकिन उनमें से आधे झूठ बोल रहे हैं, और बाकी आधे बस अनुमान लगा रहे हैं। यह "नॉइज़ी डेटा" (Noisy Data) है।
यदि आप केवल रोबोट को यह कहते हैं, "वहाँ जाओ जहाँ बहुमत कहता है," तो वह भ्रमित हो सकता है या गलत रास्ता सीख सकता है क्योंकि झूठे लोग बहुत शोर मचा रहे हैं। यदि आप उसे "बहुत आत्मविश्वासी होने" के लिए कहते हैं, तो वह किसी झूठे की बात मानकर जिद कर सकता है और दुर्घटना का शिकार हो सकता है। यदि आप उसे "सब कुछ आज़माते रहने" के लिए कहते हैं, तो वह वास्तव में सही तरीका कभी नहीं सीख पाएगा और बस बिना किसी दिशा के भटकता रहेगा।
समाधान:
शोधकर्ताओं ने एक दो-चरणीय प्रशिक्षण विधि (Two-Stage Training Method) प्रस्तावित की है। इसे रोबोट के लिए दो-सेमेस्टर वाले कोर्स के रूप में समझें:
- सेमेस्टर 1: "वाइल्ड एक्सप्लोरर" (Wild Explorer) चरण।
- सेमेस्टर 2: "फोकस्ड एक्सपर्ट" (Focused Expert) चरण।
चरण 1: "वाइल्ड एक्सप्लोरर" (अधिकतम अराजकता/Maximizing Chaos)
लक्ष्य: अभी शांत मत बैठो। सब कुछ आज़माओ!
उपमा:
कल्पना कीजिए कि रोबोट एक विशाल भूलभुलैया (maze) में है जिसमें कई डेड एंड्स (गलत उत्तर/गलत लेबल) हैं।
- मानक AI (Standard AI): तुरंत बाहर निकलने का रास्ता खोजने की कोशिश करता है। यदि कोई झूठा कहता है "बाएँ मुड़ो," तो रोब la बाएँ मुड़ जाता है। यदि वह किसी दीवार की ओर ले जाता है, तो वह वहीं फंस जाता है।
- इस पेपर की विधि: रोबोट को कहा जाता है, "अव्यवस्थित बनो! भ्रमित रहो! हर एक रास्ता आज़माओ, यहाँ तक कि अजीब रास्तों को भी!"
तकनीकी शब्दों में, यह एन्ट्रॉपी मैक्सिमाइजेशन (Entropy Maximization) है। AI को अनिश्चित होने और कई अलग-अलग, विविध उत्तर उत्पन्न करने के लिए प्रोत्साहित किया जाता है।
- क्यों? क्योंकि यदि AI 10 अलग-अलग रास्ते आज़माता है, और उनमें से 9 उसे डेड एंड (क्योंकि लेबल गलत थे) की ओर ले जाते हैं, लेकिन 1 उसे खजाने तक ले जाता है, तो AI अंतर देख सकता है। यह रोबोट को बहुत जल्दी किसी गलत उत्तर पर "लॉक इन" होने से रोकता है। यह उत्तरों के समूह को विविध बनाए रखता है ताकि AI समझ सके कि वास्तव में कौन सा अच्छा है।
चरण 2: "फोकस्ड एक्सपर्ट" (अराजकता को कम करना/Reducing Chaos)
लक्ष्य: अब जब आपने सब कुछ आज़मा लिया है, तो विजेता को चुनें और आत्मविश्वासी बनें।
उपमा:
रोबोट ने पहले सेमेस्टर में भूलभुलैया में भटकने में समय बिताया है। उसने देखा है कि "बाएँ मुड़ना" आमतौर पर एक दीवार की ओर ले जाता है, लेकिन "दाएँ मुड़ना" खजाने की ओर ले जाता है।
- बदलाव: अब शिक्षक कहता है, "अनुमान लगाना बंद करो! सही रास्ते के बारे में 100% निश्चित हो जाओ। शोर (noise) को अनदेखा करो।"
तकनीकी शब्दों में, यह एन्ट्रॉपी मिनिमाइजेशन (Entropy Minimization) है। AI को बहुत निश्चित होने और रैंडम, अजीब उत्तर देना बंद करने के लिए प्रोत्साहित किया जाता है। यह चरण 1 में सीखी गई चीज़ों को समेकित करता है और सही व्यवहार पर टिक जाता है।
यह "दो-चरणीय" ट्रिक क्यों काम करती है
यह पेपर तर्क देता है कि अधिकांश पिछली विधियों ने एक गलती की थी क्योंकि उन्होंने इनमें से केवल एक ही चीज़ की:
- केवल "आत्मविश्वासी बनो" (एन्ट्रॉपी मिनिमाइजेशन): रोबोट बहुत जल्दी आत्मविश्वासी हो जाता है। वह एक झूठे को "उत्तर की ओर जाओ" कहते हुए सुनता है, आत्मविश्वासी हो जाता है, और खाई में गिर जाता है। वह वापस नहीं लौट पाता क्योंकि उसने अन्वेषण (exploration) करना बंद कर दिया था।
- केवल "अव्यवस्थित बनो" (एन्ट्रॉपी मैक्सिमाइजेशन): रोबोट हमेशा भटकता रहता है। वह सही उत्तर पर भरोसा करना कभी नहीं सीख पाता क्योंकि वह रैंडम चीजें करने में बहुत व्यस्त रहता है। वह काम कभी पूरा नहीं कर पाता।
जादुई स्विच (The Magic Switch):
शोधकर्ताओं ने पाया कि आपको "अव्यवस्थित" से "आत्मविश्वासी" होने के बीच सही समय पर बदलना (switch) होगा।
- प्रशिक्षण के दौरान शुरुआत में: रोबोट को अव्यवस्थित रखें (Exploration) ताकि वह झूठ बोलने वालों के बहकावे में न आए।
- प्रशिक्षण के अंत में: रोबोट को आत्मविश्वासी बनाएं (Exploitation) ताकि वह वास्तव में कौशल सीख सके।
वास्तविक दुनिया के परिणाम
शोधकर्ताओं ने इन AI मॉडलों पर परीक्षण किया जो छवियों को देखते हैं (जैसे कंप्यूटर स्क्रीन पर बटन ढूंढना या बिल्ली की एक विशिष्ट नस्ल की पहचान करना)।
- परीक्षण: उन्होंने AI को ऐसा प्रशिक्षण डेटा दिया जहाँ 50% से 100% लेबल गलत (पूरी तरह से नॉइजी) थे।
- परिणाम:
- मानक AI विधियाँ विफल हो गईं या भ्रमित हो गईं।
- "दो-चरणीय" AI ने शोर को अनदेखा करना, अपने "अव्यवस्थित" चरण के माध्यम से सच्चाई को समझना और फिर एक "आत्मविश्वासी विशेषज्ञ" बनना सीख लिया।
- इसने अन्य सभी विधियों की तुलना में काफी बेहतर प्रदर्शन किया, यहाँ तक कि तब भी जब प्रशिक्षण डेटा बहुत खराब था।
एक वाक्य में सारांश
जब डेटा झूठ से भरा हो, तो AI को सिखाने के लिए, पहले आप उसे सब कुछ आज़माने के लिए मजबूर करते हैं (ताकि वह धोखा न खाए), और फिर आप उसे सबसे अच्छा उत्तर चुनने के लिए मजबूर करते हैं (ताकि वह वास्तव में सीख सके), बजाय इसके कि पहले दिन से ही पूर्ण होने की कोशिश की जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।