← नवीनतम पेपर
🤖 machine learning

GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training

यह शोधपत्र GAC का प्रस्ताव करता है, जो एक शोर-जागरूक अनुकूलन मिश्रण नियंत्रक (noise-aware adaptive mixing controller) है, जो ग्रेडिएंट विचरण (gradient variance) और सिग्नल असहमति (signal disagreement) के वास्तविक समय के अनुमानों के आधार पर सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण शिक्षण (reinforcement learning) के बीच संतुलन को गतिशील रूप से समायोजित करता है, जिससे न्यूनतम ओवरहेड के साथ विभिन्न डोमेन में हाइब्रिड पोस्ट-ट्रेनिंग प्रदर्शन में सुधार होता है।

मूल लेखक: Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल) को मददगार, ईमानदार और समस्याओं को हल करने में कुशल बनाने के लिए प्रशिक्षित कर रहे हैं। इसे करने के लिए, आप आमतौर पर इसे दो अलग-अलग तरीकों से सिखाते हैं:

  1. "पाठ्यपुस्तक" विधि (SFT): आप इसे सवालों के जवाब देने के हजारों आदर्श उदाहरण दिखाते हैं। यह एक छात्र द्वारा पाठ्यपुस्तक रटने जैसा है। यह सुरक्षित और स्थिर है, लेकिन रोबोट खुद सोचना सीखने के बजाय केवल किताब की नकल करना शुरू कर सकता है।
  2. "प्रयास और त्रुटि" विधि (RL): आप रोबोट को खुद समस्याओं को हल करने देते हैं और जब वह सही करता है तो उसे एक "गोल्ड स्टार" (पुरस्कार) देते हैं। यह उसे रचनात्मक होने और नए समाधान खोजने में मदद करता है, लेकिन यह जोखिम भरा है। रोबोट भ्रमित हो सकता है, बेतरतीब ढंग से अनुमान लगाना शुरू कर सकता है, या अधिक गोल्ड स्टार पाने के लिए सिस्टम को "धोखा" देने की कोशिश कर सकता है।

समस्या:
आमतौर पर, शोधकर्ता इन दोनों तरीकों को एक निश्चित रेसिपी (नियम) का उपयोग करके मिलाते हैं। वे कह सकते हैं, "पहले 100 दिनों के लिए, 50% पाठ्यपुस्तक और 50% प्रयास-और-त्रुटि का उपयोग करें।" यह तर्क देता है कि यह एक कार चलाने जैसा है जिसका क्रूज कंट्रोल एक ही गति पर अटक गया है। कभी-कभी सड़क चिकनी होती है (पाठ्यपुस्तक अच्छी तरह काम कर रही होती है), और कभी-कभी रास्ता बर्फीला होता है (प्रयास-और-त्रुटि शोर भरा और अराजक होता है)। एक निश्चित रेसिपी इन बदलावों के अनुकूल नहीं हो सकती है, जिससे रोबोट या तो किताब की नकल करने में फंस सकता है या भ्रम की दीवार से टकरा सकता है।

समाधान: GAC (एक "स्मार्ट को-पायलट")
लेखकों ने एक नया सिस्टम बनाया है जिसे GAC (गाइडेड एडेप्टिव कंट्रोलर) कहा जाता है। इसे एक स्मार्ट को-पायलट के रूप में समझें जो रोबोट शिक्षक के बगल में बैठा है। एक निश्चित रेसिपी के बजाय, यह को-पायलट लगातार कक्षा में "शोर" या "अराजकता" की जांच करता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. शोर को सुनना (एक "स्टैटिक" मीटर)

कल्पना कीजिए कि आप एक रेडियो स्टेशन सुनने की कोशिश कर रहे हैं।

  • SFT (पाठ्यपुस्तक) एक स्पष्ट, मजबूत सिग्नल की तरह है।
  • RL (प्रयास और त्रुटि) बहुत अधिक स्टैटिक (शोर) और हस्तक्षेप वाले स्टेशन की तरह है।

GAC के पास एक विशेष मीटर है जो किसी भी समय प्रयास-और-त्रुटि विधि से आने वाले "स्टैटिक" (शोर) को मापता है।

  • यदि स्टैटिक कम है: को-पायलट कहता है, "ठीक है, चलो रोबोट को नए करतब सीखने के लिए अधिक प्रयास-और-त्रुटि करने देते हैं!"
  • यदि स्टैटिक अधिक है: को-पायलट कहता, "ओह, बहुत अधिक अराजकता! चलो वापस पाठ्यपुस्तक पर चलते हैं ताकि रोबोट को जमीन से जुड़ा रखा जा सके।"

2. "मिक्सिंग नॉब" (अनुकूली भारण)

पेपर एक गणितीय सूत्र (समीकरण 3) पेश करता है जो एक स्मार्ट मिक्सिंग नॉब की तरह काम करता है।

  • पुराने तरीके केवल एक टाइमर के आधार पर नॉब घुमाते थे (जैसे, "1 घंटे के बाद इसे कम करें")।
  • GAC नॉब को वास्तव में अभी क्या हो रहा है उसके आधार पर घुमाता है। यदि रोबط पुरस्कारों से भ्रमित हो रहा है, तो नॉब स्वचालित रूप से "पाठ्यपुस्तक" की आवाज़ बढ़ा देता है ताकि उसे शांत किया जा सके। यदि रोबोट बहुत अच्छा कर रहा है, तो नॉब "प्रयास-और-त्रुटि" की आवाज़ बढ़ा देता है ताकि वह अन्वेषण कर सके।

3. "शॉक एब्जॉर्बर" (स्थिरता)

पेपर नोट करता है कि यदि आप केवल शोर में हर छोटे बदलाव पर तुरंत प्रतिक्रिया करते हैं, तो रोबोट को 'व्हिपलैश' (झटका) लग सकता है (बहुत तेज़ी से आगे-पीछे बदलना)। इसलिए, GAC शॉक एब्जॉर्बर जोड़ता है:

  • स्मूथिंग (सुगमता): यह अचानक उछाल नहीं बनाता; यह समय के साथ नॉब के बदलावों को सहजता से चलाता है।
  • स्पीड लिमिट (गति सीमा): यह नॉब के घूमने की गति पर एक सीमा लगाता है, जिससे यह रोका जा सके कि यदि शोर एक सेकंड के लिए बढ़ जाता है तो रोबोट घबरा न जाए।
  • एक सुरक्षा जाल: यह एक "बैकअप प्लान" (एक शेड्यूल) रखता है ताकि यदि शोर मीटर भ्रमित हो जाए, तो भी रोबोट कभी खो न जाए।

जब उन्होंने इसे आज़माया तो क्या हुआ?

शोधकर्ताओं ने विभिन्न आकार के रोबोटों (1.5B से 14B मॉडल तक) और गणित, कोडिंग और विज्ञान जैसे कठिन कार्यों पर इसका परीक्षण किया।

  • बेहतर स्कोर: GAC के साथ प्रशिक्षित रोबोटों ने गणित और तर्क परीक्षणों पर काफी उच्च स्कोर प्राप्त किए (पिछले सर्वोत्तम तरीकों से लगभग 3-4% बेहतर)।
  • कम भ्रम: रोबोट पुरस्कारों के कारण "नशे में" नहीं हुए। उन्होंने अधिक गोल्ड स्टार पाने के लिए अविश्वसनीय रूप से लंबे, निरर्थक उत्तर लिखना शुरू नहीं किया (एक समस्या जिसे "रिवॉर्ड हैकिंग" कहा जाता है)।
  • सुचारू यात्रा: प्रशिक्षण प्रक्रिया बहुत अधिक स्थिर थी। सिस्टम में "शोर" लगभग 30% कम हो गया, जिसका अर्थ है कि रोबोट बिना क्रैश हुए अधिक कुशलता से सीख सका।
  • सस्ता संचालन: सबसे अच्छी बात? इस स्मार्ट को-पायलट को चलाने की लागत लगभग कुछ भी नहीं है (1% से कम अतिरिक्त कंप्यूटर समय)। यह उस डेटा का उपयोग करता है जो रोबोट पहले से ही बना रहा है, इसलिए इसे अतिरिक्त काम की आवश्यकता नहीं है।

निचोड़

पेपर का दावा है कि एक ऐसा सिस्टम बनाकर जो शोर को सुनता है और वास्तविक समय में "उदाहरणों को याद करने" और "पुरस्कारों से सीखने" के बीच के मिश्रण को समायोजित करता है, हम स्मार्ट, अधिक स्थिर AI सहायक प्रशिक्षित कर सकते हैं। यह एक टूटे हुए क्रूज कंट्रोल वाली कार चलाने और एक कुशल ड्राइवर के बीच का अंतर है जो जानता है कि सड़क की स्थिति के आधार पर कब गति बढ़ानी है और कब ब्रेक लगाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →