← नवीनतम पेपर
🤖 machine learning

Rotation-Preserving Supervised Fine-Tuning

यह शोध पत्र रोटेशन-प्रिजर्विंग सुपरवाइज्ड फाइन-ट्यूनिंग (RPSFT) का प्रस्ताव करता है, जो एक कुशल विधि है कि प्रीट्रेंड वेट्स के प्रोजेक्टेड टॉप-kk सिंगुलर-वेक्टर ब्लॉक्स में होने वाले परिवर्तनों को दंडित करती है ताकि आउट-ऑफ-डोमेन सामान्यीकरण (generalization) में सुधार किया जा सके और हेसियन (Hessian) या फिशर (Fisher) सूचना की कम्प्यूटेशनल लागत के बिना प्रीट्रेंड रिप्रेजेंटेशन्स को संरक्षित किया जा सके।

मूल लेखक: Hangzhan Jin, Tianwei Ni, Lu Li, Pierre-Luc Bacon, Mohammad Hamdaqa, Doina Precup

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hangzhan Jin, Tianwei Ni, Lu Li, Pierre-Luc Bacon, Mohammad Hamdaqa, Doina Precup

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "रोटेशन-प्रिजर्विंग सुपरवाइज्ड फाइन-ट्यूनिंग" (RPSFT) पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

बड़ी समस्या: "अति-विशेषज्ञ" (Over-Specialized) छात्र

कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक बहुत ही बुद्धिमान छात्र है जिसने अपने "प्री-ट्रेनिंग" चरण के दौरान लाइब्रेरी की लगभग हर किताब पढ़ी है। वे सामान्य ज्ञान, सुरक्षा और दुनिया के बारे में तर्क करने में बहुत अच्छे हैं।

अब, आप इस छात्र को एक गणित विशेषज्ञ (math expert) बनाना चाहते हैं। आप उन्हें अध्ययन करने के लिए गणित के सवालों का एक ढेर देते हैं (इसे सुपरवाइज्ड फाइन-ट्यूनिंग या SFT कहा जाता है)।

  • अच्छी खबर: छात्र गणित में बहुत अच्छा हो जाता है।
  • बुरी खबर: गणित के सूत्रों को याद करने की प्रक्रिया में, छात्र यह भूलने लगता है कि विनम्र ईमेल कैसे लिखा जाए, सुरक्षा संबंधी सवालों के जवाब कैसे दिए जाएं, या सामान्य विषयों पर तर्क कैसे किया जाए। वे गणित में इतने विशेषज्ञ हो गए हैं कि उन्होंने अपनी "सामान्य" क्षमता खो दी है।

पेपर में लेखक इसे "भूलना" (forgetting) कहते हैं। उन्होंने पाया कि जब मॉडल गणित सीखता है, तो उसके मस्तिष्क का आंतरिक "कंपास" (विशेष रूप से, इसकी गणितीय संरचना में सबसे महत्वपूर्ण दिशाएं) बेतहाशा घूमने (rotate) लगता है। यह ऐसा है जैसे छात्र का मस्तिष्क नए गणित में फिट होने के लिए शारीरिक रूप से मुड़ जाता है, और ऐसा करने में, यह उन पुराने कनेक्शनों को तोड़ देता है जो उनके सामान्य ज्ञान को थामे हुए थे।

समाधान: RPSFT (एक "एंकरयुक्त" अध्ययन पद्धति)

लेखक एक नई अध्ययन पद्धति प्रस्तावित करते हैं जिसे रोटेशन-प्रिजर्विंग सुपरवाइज्ड फाइन-ट्यूनिंग (RPSFT) कहा जाता है।

मॉडल के मस्तिष्क को हजारों आपस में जुड़े गियरों से बनी एक विशाल, जटिल 3D मूर्ति के रूप में सोचें।

  1. "प्रमुख" गियर (Dominant Gears): इनमें से कुछ गियर बहुत बड़े हैं और मॉडल की सामान्य बुद्धिमत्ता का 90% भार उठाते हैं।
  2. "मुक्त" गियर (Free Gears): अन्य छोटे गियर विशिष्ट विवरणों को संभालते हैं।

मानक प्रशिक्षण (Standard SFT): जब आप मॉडल को सामान्य रूप से प्रशिक्षित करते हैं, तो आप सभी गियरों को गणित की समस्याओं को हल करने के लिए अपनी इच्छानुसार घूमने और बदलने की अनुमति देते हैं। बड़े गियर इतना घूम जाते हैं कि पूरी मूर्ति अपना मूल आकार खो देती है।

RPSF ट्रेनिंग: लेखक कहते हैं, "आइए बड़े, महत्वपूर्ण गियरों पर एक लॉक (lock) लगा दें।"

  • वे उन सबसे महत्वपूर्ण "गियर्स" (टॉप सिंगुलर वेक्टर्स) की पहचान करते हैं जो मॉडल के सामान्य ज्ञान को थामे रखते हैं।
  • वे प्रशिक्षण में एक विशेष नियम जोड़ते हैं: "आप गणित सीख सकते हैं और छोटे, मुक्त गियर्स को जितना चाहें उतना घुमा सकते हैं, लेकिन आपको बड़े, लॉक किए गए गियर्स को घुमाने की अनुमति नहीं है।"
  • यदि प्रशिक्षण उन बड़े गियर्स को घुमाने की कोशिश करता है, तो सिस्टम वापस धक्का देता है, जैसे कोई स्प्रिंग उन्हें उनकी मूल स्थिति में वापस लाने की कोशिश कर रहा हो।

यह क्यों काम करता है ("फिशर" कनेक्शन)

पेपर बताता है कि ये "बड़े गियर" वास्तव में मस्तिष्क के वे हिस्से हैं जो भूलने के प्रति सबसे अधिक संवेदनशील हैं। लेखकों ने एक चतुर शॉर्टकट खोजा: यह पता लगाने के लिए कि कौन से हिस्से संवेदनशील हैं, अत्यधिक महंगी और जटिल गणना करने के बजाय (जिसमें बहुत अधिक कंप्यूटर पावर लगती), उन्होंने बस सबसे बड़े गर्स (टॉप सिंगुलर वेक्टर्स) को देखा।

यह सच है कि इन सबसे बड़े गियर्स की रक्षा करना मॉडल की याददाश्त की रक्षा करने के लिए एक सटीक और सस्ता तरीका है। यह यह कहने जैसा है कि, "यदि मैं घर की नींव की रक्षा करता हूँ, तो मुझे यह जानने के लिए हर एक ईंट की जाँच करने की आवश्यकता नहीं है कि घर गिर जाएगा या नहीं।"

परिणाम: दोनों तरफ की सर्वश्रेष्ठ खूबियां

लेखकों ने विभिन्न मॉडलों (जैसे Llama और Qwen) पर गणित के डेटा का उपयोग करके इसका परीक्षण किया। यहाँ क्या हुआ:

  1. गणित कौशल: RPSFT मॉडल ने मानक मॉडलों की तरह ही गणित सीखा।
  2. सामान्य कौशल: मानक मॉडलों के विपरीत, RPSFT मॉडल ने अपने सामान्य ज्ञान, सुरक्षा और तर्क कौशल को नहीं भुलाया। वे "संतुलित" रहे।
  3. भविकी ट्रेनिंग: क्योंकि RPSFT मॉडल ने अपने मस्तिष्क की संरचना को अधिक स्थिर रखा, इसलिए यह प्रशिक्षण के अगले चरण (Reinforcement Learning) के लिए एक बेहतर शुरुआती बिंदु भी था, जिससे और भी बेहतर अंतिम परिणाम मिले।

सारांश उपमा

कल्पना कीजिए कि आप एक नया जिम (गणित कार्य) जोड़ने के लिए घर का नवीनीकरण कर रहे हैं।

  • मानक SFT: आप जिम बनाने के लिए दीवारों को गिरा देते हैं और नींव को हिला देते हैं। अब आपके पास एक शानदार जिम है, लेकिन आपका किचन और लिविंग रूम बर्बाद हो गया है।
  • RPSFT: आप फर्नीचर को व्यवस्थित करके और नए कमरे जोड़कर जिम बनाते हैं, लेकिन आप नींव और भार वहन करने वाली दीवारों को एंकर (स्थापित) कर देते हैं ताकि वे हिल न सकें। आपको एक शानदार जिम मिलता है, और आपका किचन और लिविंग रूम बिल्कुल वैसा ही रहता है जैसा वह था।

पेपर का दावा है कि गणित प्रशिक्षण के दौरान मॉडल के मस्तिष्क के सबसे महत्वपूर्ण हिस्सों को केवल "एंकर" करके, हम इसे यह भुलाए बिना कि वह कौन है, नए कौशल सिखा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →