← नवीनतम पेपर
🤖 machine learning

Loss Smoothing for Stable Adaptation Under Distribution Shift

यह शोध पत्र "लॉस स्मूथिंग" (loss smoothing) का प्रस्ताव करता है, जो वितरण बदलाव (distribution shift) के तहत क्रमिक अनुकूलन को सक्षम करने के लिए स्रोत और लक्ष्य उद्देश्यों के बीच इंटरपोलेशन करता है, जिससे उपयोगी विशेषताओं को संरक्षित किया जा सके और फाइन-ट्यूनिंग एवं सुदृढीकरण लर्निंग (reinforcement learning) जैसे विविध कार्यों में प्रदर्शन में निरंतर सुधार किया जा सके।

मूल लेखक: Darshan Patil, Ekaterina Lobacheva, Razvan Pascanu, Sarath Chandar

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Darshan Patil, Ekaterina Lobacheva, Razvan Pascanu, Sarath Chandar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जिसने एक क्लासिक फ्रांसीसी रेसिपी को सिद्ध करने में वर्षों बिताए हैं। आप जानते हैं कि सामग्री, समय और ताप को ठीक से कैसे संभालना है। अब, कोई आपसे एक बिल्कुल अलग व्यंजन, जैसे कि एक तीखा थाई करी बनाने के लिए कहता है।

पुराना तरीका (द "हार्ड स्विच"):
पारंपरिक मशीन लर्निंग में, जब कार्यों को बदलने का समय आता है, तो शेफ को बताया जाता है कि वे तुरंत अपनी फ्रांसीसी कुकबुक फेंक दें, जो कुछ भी उन्होंने फ्रांसीसी खाना पकाने के बारे में सीखा था उसे भूल जाएं, और केवल नए निर्देशों का उपयोग करके थाई रेसिपी को शुरू से सीखना शुरू करें। वे अपने चाकू चलाने के कौशल (काटने की बुनियादी क्षमता) को रख सकते हैं, लेकिन उन्हें तुरंत अपनी फ्रांसीसी तकनीकों को अनलर्न (unlearn) करने के लिए मजबूर किया जाता है। यह अचानक परिवर्तन अक्सर शेफ को घबराहट में डाल देता है, जिससे वे नया व्यंजन खराब कर देते हैं, और वह मूल्यवान मसल मेमोरी (muscle memory) भी खो देते हैं जो उन्होंने बनाई थी। पेपर की शब्दावली में, यह एक "अचानक संक्रमण" (abrupt transition) है जो उपयोगी विशेषताओं को विकृत कर देता है।

नया तरीका (लॉस स्मूथिंग - Loss Smoothing):
लेखक इस "ब्लेंडिंग" विचार के रूप में एक अधिक कोमल दृष्टिकोण प्रस्तावित करते हैं जिसे लॉस स्मूथिंग कहा जाता है। नई थाई रेसिपी आने पर फ्रांसीसी कुकबुक को तुरंत फेंक देने के बजाय, वे एक संक्रमण अवधि (transition period) का सुझाव देते हैं।

  1. द ब्लेंड (मिश्रण): नए कार्य की शुरुआत में, शेफ एक "मिश्रित" निर्देश का पालन करते हैं। वे 90% नए थाई निर्देशों और 10% पुरानी फ्रांसीसी तकनीकों का उपयोग करते हैं।
  2. द फेड (मंद होना): जैसे-जैसे वे खाना बनाना जारी रखते हैं, रेसिपी धीरे-धीरे बदलती है। यह 80% थाई / 20% फ्रांसीसी, फिर 50/50, और अंत में 100% थाई हो जाती है।
  3. द रिजल्ट (परिणाम): क्योंकि शेफ को अचानक और झटकेदार बदलाव का सामना नहीं करना पड़ा, इसलिए वे अपने उपयोगी चाकू चलाने के कौशल और सामान्य खाना पकाने की अंतर्दृष्टि को बनाए रख सके, जबकि वे नए स्वादों के अनुकूल होने में सक्षम रहे। पुराने ज्ञान ने एक सुरक्षा जाल (safety net) के रूप में कार्य किया, जिससे शेफ को नई शैली सीखते समय बड़ी गलतियाँ करने से रोका जा सका।

इस पेपर ने वास्तव में क्या पाया

शोधकर्ताओं ने इस "ब्लेंडिंग" विचार का परीक्षण चार अलग-अलग वास्तविक दुनिया के परिदृश्यों में किया, जो एक शेफ की तरह है जो विभिन्न नए व्यंजनों को आज़माने की कोशिश कर रहा है:

  • वीडियो गेम AI (रिनफोर्समेंट लर्निंग): कल्पना कीजिए कि एक AI को पुराने, रिकॉर्ड किए गए डेटा (ऑफलाइन) का उपयोग करके एक गेम खेलने के लिए प्रशिक्षित किया गया है। जब वह वास्तविक विरोधियों के खिलाफ लाइव खेलने लगता है (ऑनलाइन), तो वह अक्सर भ्रमित हो जाता है। "हार्ड स्विच" उसे उन सुरक्षित रणनीतियों को भुला देता है जो उसने रिकॉर्डिंग से सीखी थीं। लॉस स्मूथिंग ने AI को उन सुरक्षित रणनीतियों को बनाए रखने में मदद की जबकि वह जोखिम लेने के लिए धीरे-धीरे सीख रहा था, जिससे AntMaze और HalfCheetah जैसे खेलों में बेहतर स्कोर प्राप्त हुआ।
  • लैंग्वेज मॉडल्स (LLMs): बड़े लैंग्वेज मॉडल्स को पहले इंटरनेट के विशाल टेक्स्ट मिश्रण (प्रीट्रेनिंग) पर प्रशिक्षित किया जाता है। फिर, उन्हें विशिष्ट निर्देशों का पालन करने के लिए "फाइन-ट्यून" किया जाता है। कभी-कभी, यदि मॉडल को इंटरनेट डेटा पर बहुत अधिक प्रशिक्षित किया गया है, तो वह "भंगुर" (brittle) हो जाता है और निर्देशों का पालन करने के लिए कहा जाने पर टूट जाता है। पेपर ने पाया कि लॉस स्मूथिंग (इंटरनेट टेक्स्ट से निर्देशों की ओर धीरे-धीरे बदलाव) ने इस टूटने को रोका, जिससे मॉडल अपने सामान्य ज्ञान को खोए बिना स्मार्ट और सहायक बना रहा।
  • नए कार्य सीखना (कंटीन्यूअल लर्निंग): यदि एक रोबोट बिल्लियों को पहचानना, फिर कुत्तों को, फिर पक्षियों को पहचानना सीखता है, तो एक हार्ड स्विच अक्सर उसे बिल्लियों को भुला देता है। लॉस स्मूथिंग ने रोबोट को कुत्तों को सीखते समय बिल्लियों को याद रखने में मदद की, जिससे वह "भूलने" (forgetting) की प्रक्रिया कम हुई जो आमतौर पर होती है।
  • विज़न मॉडल्स: एक मॉडल को छवियों के एक सेट (जैसे ImageNet) पर प्रशिक्षित करने के बाद उसे दूसरे सेट (जैसे DomainNet) के अनुकूल बनाने के दौरान, स्मूथ ट्रांजिशन ने मॉडल को वस्तुओं को पहचानने की अपनी क्षमता बनाए रखने में मदद की जबकि वह छवियों की नई शैली को सीख रहा था।

मुख्य निष्कर्ष

पेपर तर्क देता है कि आप एक पुराने कार्य से नए कार्य में कैसे संक्रमण करते हैं, यह नए कार्य के उतना ही महत्वपूर्ण है जितना कि वह नया कार्य स्वयं है।

  • समस्या: सीधे एक नए उद्देश्य में कूदना ब्रेक लगाने और फिर एक ही समय में एक्सीलेटर को पूरी ताकत से दबाने जैसा है। यह सिस्टम को झटका देता है।
  • समाधान: लॉस स्मूथिंग एक्सीलेटर से पैर हटाकर धीरे से छोड़ने और फिर नए पेडल को धीरे से दबाने जैसा है। यह पुराने प्रशिक्षण के उपयोगी हिस्सों को तब तक जीवित रखता है जब तक कि वे मॉडल को नए कार्य में मार्गदर्शन कर सकें, और फिर वे धीरे-धीरे फीके पड़ जाते हैं ताकि मॉडल विशेषज्ञता हासिल कर सके।

लेखक निष्कर्ष निकालते हैं कि यह सरल तकनीक—पुराने लक्ष्य और नए लक्ष्य के बीच इंटरपोलेशन (interpolation) करना—मॉडल्स को अधिक स्थिर बनाता है, सीखने के दौरान "टूटने" की संभावना कम करता है, और चाहे वे रोबोट हों, लैंग्वेज मॉडल्स हों, या इमेज क्लासिफायर हों, उन्हें नई स्थितियों के अनुकूल बनाने में आम तौर पर बेहतर बनाता है।

महत्वपूर्ण नोट: पेपर सख्ती से इन मॉडल्स को प्रशिक्षित करने की मैकेनिक्स पर केंद्रित है। यह दावा नहीं करता है कि यह विधि बीमारियों का इलाज करेगी, शेयर बाजार की भविष्यवाणी करेगी, या उनके द्वारा परीक्षण किए गए प्रशिक्षण परिदृश्यों (फाइन-ट्यूनिंग, रिनफोर्समेंट लर्निंग और कंटीन्यूअल लर्निंग) के अलावा किसी विशिष्ट भविष्य के अनुप्रयोगों में उपयोग की जाएगी। इसकी "जादुई शक्ति" पूरी तरह से इस बात में है कि कैसे लर्निंग प्रोसेस को स्मूथ किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →