← नवीनतम पेपर
💬 NLP

LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

यह शोध पत्र LP-SFT का प्रस्ताव करता है, जो एक सुपरवाइज्ड फाइन-ट्यूनिंग विधि है जो एक स्थानीय रूप से सामान्यीकृत KL डाइवर्जेंस के माध्यम से गैर-लक्ष्य टोकन (non-target tokens) के बीच प्रीट्रेन्ड मॉडल की अंतर्निहित मल्टीमॉडल एंट्रॉपी संरचना को संरक्षित करती है, जिससे पूर्व-मौजूदा क्षमताओं और सैंपलिंग विविधता के क्षरण को कम करते हुए डाउनस्ट्रीम प्रदर्शन में सुधार होता है।

मूल लेखक: Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

प्रकाशित 2026-07-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली, सुशिक्षित रोबोट को निर्देश मानना सिखा रहे हैं। इस रोबोट ने पहले ही इंटरनेट की लगभग सब कुछ पढ़ ली है, जिससे उसने भाषा की लय, गणित के तर्क और कोड की संरचना को सीख लिया है। सीखने के इस प्रारंभिक चरण को "प्रीट्रेनिंग" (pretraining) कहा जाता है। अब, आप उसे एक विशिष्ट कार्य सिखाना चाहते हैं, जैसे गणित की समस्याओं को हल करना या कंप्यूटर कोड लिखना। आप उसे सही उत्तरों के उदाहरण दिखाते हैं, और रोबोट उन उदाहरणों से मेल खाने के लिए अपने मस्तिष्क को समायोजित करता है। इस प्रक्रिया को "सुपरवाइज्ड फाइन-ट्यूनिंग" (SFT) कहा जाता है।

हालाँकि, इसमें एक पेच है। जब रोबोट उस नए काम में उत्तम बनने के लिए सीख जाता है, तो वह कभी-कभी एक अच्छा सामान्य वार्ताकार बने रहना भूल जाता है। वह उस एक "सही" उत्तर के प्रति इतना जुनूनी हो जाता है जिसे आपने उसे दिखाया था, कि वह वाक्य के समाप्त होने के अन्य सभी दिलचस्प और वैध तरीकों को भूल जाता है। यह एक ऐसे छात्र की तरह है जिसने गणित की समस्या के एक विशिष्ट उत्तर को इतनी अच्छी तरह से रट लिया है कि वह उसके थोड़े से अलग संस्करण को हल नहीं कर पाता, या एक ऐसे लेखक की तरह जो केवल कहानी शुरू करने का एक ही तरीका जानता है। मुख्य प्रश्न इस क्षेत्र में यह है: हम रोबले को उसका पुराना, समृद्ध ज्ञान भुलाए बिना नया काम कैसे सिखा सकते हैं?

यह बिल्कुल वही है जिसे "LP-SFT" पेपर संबोधित करता है। शोधकर्ताओं की एक टीम ने, जो शीर्ष विश्वविद्यालयों के शोधकर्ता हैं, देखा कि इन रोबोटों को सिखाने का मानक तरीका (जिसे "क्रॉस-एंट्रॉपी" कहा जाता है) थोड़ा बहुत ही सीधा और कठोर है। यह रोबोट को बताता है, "केवल इस एक शब्द को देखो जो मैं तुम्हें दिखा रहा हूँ; बाकी सब कुछ अनदेखा करो।" समस्या यह है कि रोबोट के मूल मस्तिष्क में वास्तव में कई संभावित "अच्छे" अगले शब्दों का एक मानचित्र होता है, न कि केवल एक। रोबोट को केवल उस एक लक्ष्य शब्द पर ध्यान केंद्रित करने के लिए मजबूर करके, हम अनजाने में अन्य सभी संभावनाओं के मानचित्र को मिटा देते हैं, जिससे रचनात्मकता का नुकसान होता है और "कैटास्ट्रोफिक फॉरगेटिंग" (catastrophic forgetting) नामक घटना होती है, जहाँ रोबोट उन कौशलों को भूल जाता है जिनका उसने उपयोग किया था।

शोधकर्ताओं ने एक दिलचस्प बात खोजी कि ये रोबोट कैसे सोचते हैं। उन्होंने पाया कि रोबोट का मस्तिष्क केवल एक शब्द नहीं चुनता; यह अक्सर कुछ समान रूप से अच्छे विकल्पों के बीच झूलता रहता है, जिससे एक "मल्टीमॉडल एंट्रॉपी स्ट्रक्चर" (multimodal entropy structure) बनता है। इसे एक चौराहे की तरह समझें। कभी-कभी, रोबोट दो या तीन समान रूप से वैध रास्तों को देखता है। मानक प्रशिक्षण विधि रोबोट को केवल एक रास्ता चुनने और बाकी रास्तों को जलाने के लिए मजबूर करती है, भले ही वे अन्य रास्ते भी पूरी तरह से उचित रहे हों।

इसे ठीक करने के लिए, टीम ने LP-SFT (लोकल-प्रिजर्विंग सुपरवाइज्ड फाइन-ट्यूनिंग) नामक एक नई विधि प्रस्तावित की। रोबोट को केवल "यह शब्द चुनो!" चिल्लाने के बजाय, LP-SFT कहता है, "इस शब्द को चुनो, लेकिन कृपया उन अन्य तीन या चार शब्दों को न भूलना जो काफी अच्छे भी थे।"

यह कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए: कल्पना कीजिए कि आप एक कुत्ते को एक विशिष्ट गेंद लाने का प्रशिक्षण दे रहे हैं। मानक विधि यह है कि आप कुत्ते को केवल तभी पुरस्कृत करते हैं जब वह वही सटीक गेंद लेकर आता है और बाकी सब कुछ अनदेखा कर देते हैं। अंततः, कुत्ता अन्य खिलौनों को खोजना ही बंद कर सकता है। LP-SFT ऐसा है जैसे कहना, "मेरे लिए लाल गेंद लाओ (लक्ष्य), लेकिन साथ ही, यह भी याद रखो कि नीली और हरी गेंद भी खेलने के लिए मजेदार थीं।" यह विधि उन शीर्ष 10 सबसे संभावित शब्दों का एक छोटा "सुरक्षित क्षेत्र" (safe zone) बनाती है जिन्हें रोबोट चुन सकता था। यह उस एक शब्द को हटा देता है जिसे आप उसे सिखा रहे हैं (ताकि वह भ्रमित न हो) और फिर रोबोट को शेष नौ शब्दों की सापेक्ष लोकप्रियता को पहले की तरह ही बनाए रखने के लिए धीरे से प्रेरित करता है।

इस दृष्टिकोण के परिणाम काफी उत्साहजनक हैं। जब शोधकर्ताओं ने विभिन्न मॉडलों (जैसे Qwen और Llama) और कार्यों (गणित, कोडिंग और सामान्य चैट) पर LP-SFT का परीक्षण किया, तो उन्होंने पाया कि यह पुराने तरीकों की तुलना में बेहतर काम करता है। LP-SFT के साथ प्रशिक्षित रोबोट न केवल उस विशिष्ट कार्य में अच्छे थे जो उन्हें सिखाया गया था (गणित और कोडिंग परीक्षणों पर उच्च स्कोर प्राप्त करना), बल्कि उन्होंने अपनी विविधता और रचनात्मकता की क्षमता को भी बनाए रखा। वे पुराने तरीकों की तुलना में अपना सामान्य ज्ञान उतना नहीं भूले। वास्तव में, इस विधि ने एकल उत्तर सही होने और विविध समाधानों की एक विस्तृत श्रृंखला उपलब्ध रखने के बीच सबसे अच्छा संतुलन हासिल किया।

पेपर सुझाव देता है कि रोबोट की संभावनाओं के मूल "मानचित्र" का सम्मान करके, हम उसे उसका मस्तिष्क खराब किए बिना नए कौशल सिखा सकते हैं। यह हमें याद दिलाता है कि कभी-कभी, मशीन को पूर्ण बनाने के लिए, आपको उसे थोड़ी अनिश्चितता बनाए रखने देना चाहिए। शोधकर्ता दिखाते हैं कि यह "लोकल प्रिजर्वेशन" रोबोट को एक उबाऊ, एक-रेखीय सोच में ढहने से रोकने में मदद करता है, जिससे वह स्मार्ट, लचीला और आगे आने वाली किसी भी चीज़ के लिए तैयार रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →