← नवीनतम पेपर
💬 NLP

Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT

यह शोध पत्र एक RL-आधारित रीराइटिंग एजेंट का प्रस्ताव करता है जो विविधता और कार्य निरंतरता को बनाए रखते हुए मॉडल के प्राकृतिक जनरेशन वितरण के साथ डाउनस्ट्रीम प्रशिक्षण डेटा को संरेखित करने के लिए एक डेटा-रीराइटिंग नीति को अनुकूलित करता है, जिससे सुपरवाइज्ड फाइन-ट्यूनिंग के दौरान कैटास्ट्रोफिक फॉरगेटिंग को कम किया जा सके।

मूल लेखक: Jiacheng Wang, Ping Jian, Zhen Yang, Zirong Chen, Keren Liao, Zhongbin Guo

प्रकाशित 2026-02-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiacheng Wang, Ping Jian, Zhen Yang, Zirong Chen, Keren Liao, Zhongbin Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: AI का "कल्चर शॉक" (Culture Shock)

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली और दुनिया देख चुका शेफ है (लार्ज लैंग्वेज मॉडल या LLM) जिसने दुनिया भर के लाखों व्यंजन बनाए हैं। वे सामान्य खाना बनाने में माहिर हैं।

अब, आप चाहते हैं कि यह शेफ किसी एक विशिष्ट प्रकार के व्यंजन में विशेषज्ञता हासिल करे, जैसे कि "स्पाइसी सिचुआन नूडल्स" (यह डाउनस्ट्रीम टास्क है)। उन्हें सिखाने के लिए, आप उन्हें एक सख्त, पुराने ज़माने के मास्टर शेफ (एक्सपर्ट डेटा) द्वारा लिखे गए रेसिपी कार्डों का एक ढेर देते हैं।

समस्या:
मास्टर शेफ की रेसिपी एक बहुत ही विशिष्ट, कठोर और औपचारिक शैली में लिखी गई है जिसे AI शेफ ने पहले कभी नहीं देखा है। जब AI शेफ इन नई रेसिपीज़ को सीखने की कोशिश करता है, तो वह भ्रमित हो जाता है। वह अपनी पुरानी, सामान्य कुकिंग स्टाइल को उन नए, कठोर निर्देशों में फिट करने की कोशिश करता है।

इसका परिणाम क्या होता है?

  1. वह नया व्यंजन ठीक से नहीं सीख पाता क्योंकि निर्देश उसे "परदेसी" या अजीब लगते हैं।
  2. वह बाकी सब कुछ बनाना भूल जाता है। वह इस नए, अजीब स्टाइल के प्रति इतना जुनूनी हो जाता है कि वह एक साधारण सैंडविच या क्लासिक सूप बनाना भी भूल जाता है। इसे कैटास्ट्रोफिक फॉरगेटिंग (Catastrophic Forgetting) कहा जाता है।

तकनीकी शब्दों में, नए डेटा की "शैली" उस शैली से मेल नहीं खाती जो AI स्वाभाविक रूप से उत्तर देने के लिए उपयोग करता है। यह बेमेल स्थिति ट्रेनिंग को अस्थिर कर देती है।


पुराना समाधान: "रेसिपी को फिर से लिखना" (लेकिन खराब तरीके से)

शोधकर्ताओं ने महसूस किया: "यदि रेसिपी बहुत अजीब हैं, तो AI को सिखाने से पहले उन्हें AI की स्वाभाविक शैली जैसा दिखने के लिए फिर से लिख दें।"

पिछले तरीकों ने इसे एक फिक्स्ड टेम्पलेट (जैसे खाली स्थान भरने वाला फॉर्म) देकर करने की कोशिश की।

  • एनालॉजी (उपमा): कल्पना कीजिए कि आप AI को कह रहे हैं, "इस रेसिपी को लें और इसे केवल इन तीन वाक्य शुरू करने वाले शब्दों का उपयोग करके फिर से लिखें।"
  • दोष: इससे सभी पुन: लिखित रेसिपी रोबोटिक और एक जैसी लगने लगीं। यह ऐसा था जैसे हर व्यंजन को एक प्लास्टिक के मॉडल की तरह बनाने के लिए मजबूर किया गया हो। AI ने फॉर्मेट तो सीखा लेकिन स्वाद नहीं, और वह अपने पुराने कौशल भी भूल गया क्योंकि "पुन: लिखित" रेसिपी अभी भी स्वाभाविक नहीं लग रही थीं।

नया समाधान: "RL रीराइटिंग एजेंट" (RL Rewriting Agent)

यह पेपर एक स्मार्ट तरीका प्रस्तावित करता है। एक कठोर टेम्पलेट के बजाय, उन्होंने एक विशेषज्ञ AI एडिटर (रीराइटिंग एजेंट) बनाया।

इस एजेंट को एक ऐसे टैलेंट स्काउट के रूप में सोचें जो जानता है कि मुख्य शेफ कैसे सोचता और बोलता है। इसका काम मास्टर शेफ की कठोर रेसिपी को ऐसी शैली में फिर से लिखना है जिसे मुख्य शेफ पसंद करता है, जबकि निर्देशों की शुद्धता बनी रहे।

यहाँ एजेंट तीन सरल नियमों (रिवॉर्ड्स) का उपयोग करके कैसे काम करता है, बताया गया है:

1. "सत्य" का द्वार (टास्क कंसिस्टेंसी)

  • नियम: "आपको उत्तर नहीं बदलना है।"
  • एनालॉजी: यदि मूल रेसिपी कहती है "2 अंडे डालें," तो पुन: लिखित रेसिपी "3 अंडे डालें" नहीं कह सकती। यदि एजेंट गणित या तर्क में गलती करता है, तो उसे जीरो स्कोर मिलता है और उसे बाहर कर दिया जाता है। यह एक सख्त गेट है; कोई धोखाधड़ी नहीं चलेगी।

2. "प्राकृतिक प्रवाह" स्कोर (डिस्ट्रीब्यूशन अलाइनमेंट)

  • नियम: "इसे इस तरह से फिर से लिखें कि यह वैसा लगे जैसा शेफ स्वाभाविक रूप से कहेगा।"
  • एनालॉजी: एजेंट चेक करता है: "क्या यह वाक्य एक मानव शेफ की तरह लग रहा है, या यह एक रोबोट की तरह लग रहा है जो मैनुअल पढ़ रहा है?" यह उन बदलावों को रिवॉर्ड देता है जो स्वाभाविक रूप से बहते हैं, ठीक वैसे ही जैसे शेफ की पसंदीदा शैली होती है। यह सुनिश्चित करता है कि सीखने के दौरान शेफ को "कल्चर शॉक" न लगे।

3. "विविधता" बोनस (डाइवर्सिटी)

  • नियम: "हर रेसिपी को एक जैसा न बनाएं।"
  • एनालॉजी: यदि एजेंट 10 रेसिपी को फिर से लिखता है, तो वे सभी "सबसे पहले, एक कटोरा लें" से शुरू नहीं होनी चाहिए। उनमें अलग-अलग संरचनाएं और वाक्यांश होने चाहिए। यह शेफ को ऊबने या एक ही ढर्रे में फंसने से रोकता है (जिसे मोड कोलैप्स कहा जाता है)।

उन्होंने एजेंट को कैसे प्रशिक्षित किया (द गेम)

उन्होंने केवल एजेंट को यह नहीं बताया कि क्या करना है; उन्होंने इसे सीखने के लिए एक खेल खेलने दिया।

  • उन्होंने रीइन्फोर्समेंट लर्निंग (RL) नामक विधि का उपयोग किया।
  • एजेंट ने रेसिपी को फिर से लिखने का प्रयास किया।
  • यदि पुन: लेखन सही था (उत्तर सही रखा), प्राकृतिक था (शेफ जैसा लगा), और विविध था (रोबोटिक नहीं लगा), तो उसे गोल्ड स्टार (रिवॉर्ड) मिला।
  • यदि वह इनमें से किसी में भी विफल रहा, तो उसे कोई अंक नहीं मिला।
  • समय के साथ, एजेंट ने सही संतुलन सीखा: "मैं इसे कैसे फिर से लिखूँ ताकि यह सही हो, स्वाभाविक लगे और उबाऊ न हो?"

परिणाम: एक खुश शेफ

जब उन्होंने इस एजेंट का उपयोग प्रशिक्षण डेटा तैयार करने के लिए किया:

  1. शेफ ने नए सिचुआन नूडल्स को पूरी तरह से सीखा (नए कार्य पर उच्च प्रदर्शन)।
  2. शेफ को सैंडविच और सूप बनाना भी याद रहा (कोई कैटास्ट्रफिक फॉरगेटिंग नहीं)।
  3. ट्रेनिंग अधिक सहज और तेज़ थी क्योंकि रेसिपी अंततः शेफ के दिमाग के साथ "क्लिक" कर गईं।

एक वाक्य में सारांश

एक स्मार्ट AI को कठोर और अप्राकृतिक निर्देशों से सीखने के लिए मजबूर करने के बजाय (जिससे वह सब कुछ भूल जाता है), यह पेपर एक स्मार्ट "एडिटर AI" को उन निर्देशों को एक प्राकृतिक और विविध शैली में फिर से लिखने के लिए सिखाता है जिसे मुख्य AI पहले से ही पसंद करता है, जिससे वह अपने पुराने कौशल को खोए बिना नए कौशल सीख सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →