Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
यह शोध पत्र एक RL-आधारित रीराइटिंग एजेंट का प्रस्ताव करता है जो विविधता और कार्य निरंतरता को बनाए रखते हुए मॉडल के प्राकृतिक जनरेशन वितरण के साथ डाउनस्ट्रीम प्रशिक्षण डेटा को संरेखित करने के लिए एक डेटा-रीराइटिंग नीति को अनुकूलित करता है, जिससे सुपरवाइज्ड फाइन-ट्यूनिंग के दौरान कैटास्ट्रोफिक फॉरगेटिंग को कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
बड़ी समस्या: AI का "कल्चर शॉक" (Culture Shock)
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली और दुनिया देख चुका शेफ है (लार्ज लैंग्वेज मॉडल या LLM) जिसने दुनिया भर के लाखों व्यंजन बनाए हैं। वे सामान्य खाना बनाने में माहिर हैं।
अब, आप चाहते हैं कि यह शेफ किसी एक विशिष्ट प्रकार के व्यंजन में विशेषज्ञता हासिल करे, जैसे कि "स्पाइसी सिचुआन नूडल्स" (यह डाउनस्ट्रीम टास्क है)। उन्हें सिखाने के लिए, आप उन्हें एक सख्त, पुराने ज़माने के मास्टर शेफ (एक्सपर्ट डेटा) द्वारा लिखे गए रेसिपी कार्डों का एक ढेर देते हैं।
समस्या:
मास्टर शेफ की रेसिपी एक बहुत ही विशिष्ट, कठोर और औपचारिक शैली में लिखी गई है जिसे AI शेफ ने पहले कभी नहीं देखा है। जब AI शेफ इन नई रेसिपीज़ को सीखने की कोशिश करता है, तो वह भ्रमित हो जाता है। वह अपनी पुरानी, सामान्य कुकिंग स्टाइल को उन नए, कठोर निर्देशों में फिट करने की कोशिश करता है।
इसका परिणाम क्या होता है?
- वह नया व्यंजन ठीक से नहीं सीख पाता क्योंकि निर्देश उसे "परदेसी" या अजीब लगते हैं।
- वह बाकी सब कुछ बनाना भूल जाता है। वह इस नए, अजीब स्टाइल के प्रति इतना जुनूनी हो जाता है कि वह एक साधारण सैंडविच या क्लासिक सूप बनाना भी भूल जाता है। इसे कैटास्ट्रोफिक फॉरगेटिंग (Catastrophic Forgetting) कहा जाता है।
तकनीकी शब्दों में, नए डेटा की "शैली" उस शैली से मेल नहीं खाती जो AI स्वाभाविक रूप से उत्तर देने के लिए उपयोग करता है। यह बेमेल स्थिति ट्रेनिंग को अस्थिर कर देती है।
पुराना समाधान: "रेसिपी को फिर से लिखना" (लेकिन खराब तरीके से)
शोधकर्ताओं ने महसूस किया: "यदि रेसिपी बहुत अजीब हैं, तो AI को सिखाने से पहले उन्हें AI की स्वाभाविक शैली जैसा दिखने के लिए फिर से लिख दें।"
पिछले तरीकों ने इसे एक फिक्स्ड टेम्पलेट (जैसे खाली स्थान भरने वाला फॉर्म) देकर करने की कोशिश की।
- एनालॉजी (उपमा): कल्पना कीजिए कि आप AI को कह रहे हैं, "इस रेसिपी को लें और इसे केवल इन तीन वाक्य शुरू करने वाले शब्दों का उपयोग करके फिर से लिखें।"
- दोष: इससे सभी पुन: लिखित रेसिपी रोबोटिक और एक जैसी लगने लगीं। यह ऐसा था जैसे हर व्यंजन को एक प्लास्टिक के मॉडल की तरह बनाने के लिए मजबूर किया गया हो। AI ने फॉर्मेट तो सीखा लेकिन स्वाद नहीं, और वह अपने पुराने कौशल भी भूल गया क्योंकि "पुन: लिखित" रेसिपी अभी भी स्वाभाविक नहीं लग रही थीं।
नया समाधान: "RL रीराइटिंग एजेंट" (RL Rewriting Agent)
यह पेपर एक स्मार्ट तरीका प्रस्तावित करता है। एक कठोर टेम्पलेट के बजाय, उन्होंने एक विशेषज्ञ AI एडिटर (रीराइटिंग एजेंट) बनाया।
इस एजेंट को एक ऐसे टैलेंट स्काउट के रूप में सोचें जो जानता है कि मुख्य शेफ कैसे सोचता और बोलता है। इसका काम मास्टर शेफ की कठोर रेसिपी को ऐसी शैली में फिर से लिखना है जिसे मुख्य शेफ पसंद करता है, जबकि निर्देशों की शुद्धता बनी रहे।
यहाँ एजेंट तीन सरल नियमों (रिवॉर्ड्स) का उपयोग करके कैसे काम करता है, बताया गया है:
1. "सत्य" का द्वार (टास्क कंसिस्टेंसी)
- नियम: "आपको उत्तर नहीं बदलना है।"
- एनालॉजी: यदि मूल रेसिपी कहती है "2 अंडे डालें," तो पुन: लिखित रेसिपी "3 अंडे डालें" नहीं कह सकती। यदि एजेंट गणित या तर्क में गलती करता है, तो उसे जीरो स्कोर मिलता है और उसे बाहर कर दिया जाता है। यह एक सख्त गेट है; कोई धोखाधड़ी नहीं चलेगी।
2. "प्राकृतिक प्रवाह" स्कोर (डिस्ट्रीब्यूशन अलाइनमेंट)
- नियम: "इसे इस तरह से फिर से लिखें कि यह वैसा लगे जैसा शेफ स्वाभाविक रूप से कहेगा।"
- एनालॉजी: एजेंट चेक करता है: "क्या यह वाक्य एक मानव शेफ की तरह लग रहा है, या यह एक रोबोट की तरह लग रहा है जो मैनुअल पढ़ रहा है?" यह उन बदलावों को रिवॉर्ड देता है जो स्वाभाविक रूप से बहते हैं, ठीक वैसे ही जैसे शेफ की पसंदीदा शैली होती है। यह सुनिश्चित करता है कि सीखने के दौरान शेफ को "कल्चर शॉक" न लगे।
3. "विविधता" बोनस (डाइवर्सिटी)
- नियम: "हर रेसिपी को एक जैसा न बनाएं।"
- एनालॉजी: यदि एजेंट 10 रेसिपी को फिर से लिखता है, तो वे सभी "सबसे पहले, एक कटोरा लें" से शुरू नहीं होनी चाहिए। उनमें अलग-अलग संरचनाएं और वाक्यांश होने चाहिए। यह शेफ को ऊबने या एक ही ढर्रे में फंसने से रोकता है (जिसे मोड कोलैप्स कहा जाता है)।
उन्होंने एजेंट को कैसे प्रशिक्षित किया (द गेम)
उन्होंने केवल एजेंट को यह नहीं बताया कि क्या करना है; उन्होंने इसे सीखने के लिए एक खेल खेलने दिया।
- उन्होंने रीइन्फोर्समेंट लर्निंग (RL) नामक विधि का उपयोग किया।
- एजेंट ने रेसिपी को फिर से लिखने का प्रयास किया।
- यदि पुन: लेखन सही था (उत्तर सही रखा), प्राकृतिक था (शेफ जैसा लगा), और विविध था (रोबोटिक नहीं लगा), तो उसे गोल्ड स्टार (रिवॉर्ड) मिला।
- यदि वह इनमें से किसी में भी विफल रहा, तो उसे कोई अंक नहीं मिला।
- समय के साथ, एजेंट ने सही संतुलन सीखा: "मैं इसे कैसे फिर से लिखूँ ताकि यह सही हो, स्वाभाविक लगे और उबाऊ न हो?"
परिणाम: एक खुश शेफ
जब उन्होंने इस एजेंट का उपयोग प्रशिक्षण डेटा तैयार करने के लिए किया:
- शेफ ने नए सिचुआन नूडल्स को पूरी तरह से सीखा (नए कार्य पर उच्च प्रदर्शन)।
- शेफ को सैंडविच और सूप बनाना भी याद रहा (कोई कैटास्ट्रफिक फॉरगेटिंग नहीं)।
- ट्रेनिंग अधिक सहज और तेज़ थी क्योंकि रेसिपी अंततः शेफ के दिमाग के साथ "क्लिक" कर गईं।
एक वाक्य में सारांश
एक स्मार्ट AI को कठोर और अप्राकृतिक निर्देशों से सीखने के लिए मजबूर करने के बजाय (जिससे वह सब कुछ भूल जाता है), यह पेपर एक स्मार्ट "एडिटर AI" को उन निर्देशों को एक प्राकृतिक और विविध शैली में फिर से लिखने के लिए सिखाता है जिसे मुख्य AI पहले से ही पसंद करता है, जिससे वह अपने पुराने कौशल को खोए बिना नए कौशल सीख सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।