← नवीनतम पेपर
💬 NLP

Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives

यह शोध पत्र डायनेमिक एंट्रॉपी फाइन-ट्यूनिंग (DEFT) प्रस्तुत करता है, जो एक पैरामीटर-मुक्त उद्देश्य है जो प्लास्टिकिटी-स्टेबिलिटी द्वंद्व को हल करने और मॉडल के प्रदर्शन में सुधार करने के लिए भविष्य कहनेवाला अनिश्चितता (predictive uncertainty) के आधार पर ग्रेडिएंट ट्रस्ट को गतिशील रूप से नियंत्रित करके SFT को सामान्यीकृत एंट्रॉपी लक्ष्यों के साथ एकीकृत करता है।

मूल लेखक: Zecheng Wang, Deyuan Liu, Chunshan Li, Yupeng Zhang, Zhengyun Zhao, Dianhui Chu, Bingning Wang, Dianbo Sui

प्रकाशित 2026-02-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zecheng Wang, Deyuan Liu, Chunshan Li, Yupeng Zhang, Zhengyun Zhao, Dianhui Chu, Bingning Wang, Dianbo Sui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बुद्धिमान लेकिन थोड़े ज़िद्दी छात्र (AI) को एक नए प्रकार की पहेली को हल करना सिखा रहे हैं। आपके पास सही उत्तरों वाली एक पाठ्यपुस्तक (ट्रेनिंग डेटा) है, और आप चाहते हैं कि छात्र इससे सीखे।

लंबे समय तक, इस छात्र को सिखाने का मानक तरीका नेगेटिव लॉग-लाइक्लीहुड (NLL) था। सोचिए कि NLL एक ऐसे शिक्षक की तरह है जो छात्र को हर बार चिल्लाकर डांटता है जब वह गलत होता है, चाहे उसके गलत होने का कारण कुछ भी हो।

  • यदि छात्र बेतरतीब ढंग से अनुमान लगा रहा था और गलत हुआ, तो शिक्षक ज़ोर से चिल्लाता है। (अच्छा! छात्र को यह नई चीज़ सीखने की ज़रूरत है।)
  • यदि छात्र 99% आश्वस्त था कि वह सही है, लेकिन पाठ्यपुस्तक में कुछ और लिखा था, तो शिक्षक फिर भी उतनी ही ज़ोर से चिल्लाता है। (बुरा! शायद पाठ्यपुस्तक में कोई गलती है, या छात्र वास्तव में एक बेहतर नियम जानता है। यहाँ चिल्लाना छात्र को भ्रमित कर सकता है और उसे वह सब भुला सकता है जो वह पहले से जानता था।)

यह "एक ही आकार के लिए सभी" (one-size-fits-all) वाला चिल्लाना दो समस्याएँ पैदा करता है:

  1. शोर का बढ़ना (Noise Amplification): छात्र किताब के खराब उदाहरणों से भ्रमित हो जाता है।
  2. अति-सुधार (Over-correction): वह अपने अंतर्ज्ञान (gut feeling) पर भरोसा करना छोड़ देता है, भले ही वह आमतौर पर सही होता है।

इस शोध पत्र के लेखक, DEFT (डायनामिक एंट्रॉपी फाइन-ट्यूनिंग), एक स्मार्ट तरीका प्रस्तावित करते हैं। वे कहते हैं, "ग्रेडिएंट्स को अपना प्रभाव अर्जित करना चाहिए" (Gradients Must Earn Their Influence)। यह कैसे काम करता है, इसके कुछ रोज़मर्रा के उदाहरण यहाँ दिए गए हैं:

1. "ट्रस्ट गेट" (विश्वास द्वार) की अवधारणा

कल्पना कीजिए कि छात्र के मस्तिष्क में एक ट्रस्ट गेट है। यह द्वार तय करता है कि शिक्षक के सुधार को कितना महत्व दिया जाए।

  • मानक NLL: गेट हमेशा पूरी तरह खुला रहता है। शिक्षक की आवाज़ हमेशा तेज़ होती है, भले ही छात्र उस विषय पर पहले से ही विशेषज्ञ हो।
  • DEFT: गेट स्मार्ट है। यह इस आधार पर खुलता या बंद होता है कि छात्र अभी कितना आत्मविश्वासी महसूस कर रहा है।

2. सीखने के दो मोड

शोध पत्र बताता है कि छात्र को संचालन के दो अलग-अलग मोड की आवश्यकता है, और DEFT स्वचालित रूप से उनके बीच स्विच करता है:

  • मोड A: "एक्सप्लोरर" (जब छात्र भ्रमित हो)

    • परिदृश्य: छात्र एक ऐसी पहेली देखता है जो उसने पहले कभी नहीं देखी है। वह केवल अनुमान लगा रहा है, और उसका आत्मविश्वास कम है।
    • DEFT की कार्रवाई: ट्रस्ट गेट पूरी तरह से खुल जाता है। शिक्षक का सुधार स्पष्ट रूप से सुनाई देता है। छात्र कहता है, "ठीक है, मुझे यह नहीं पता, मैं किताब की बात सुनूँगा और इसे सीखूँगा।"
    • उपमा: एक स्पंज की तरह जो पानी सोखता है। जब आप खाली (अनिश्चित) होते हैं, तो आप सब कुछ सोख लेते हैं।
  • मोड B: "रिफाइनर" (जब छात्र आत्मविश्वासी हो)

    • परिदृश्य: छात्र एक गणित की समस्या हल कर रहा है जो उसने हज़ार बार की है। वह 99% सुनिश्चित है कि उत्तर सही है, लेकिन किताब कुछ थोड़ा अलग कहती है।
    • DEFT की कार्रवाई: ट्रस्ट गेट संकुचित (narrow) हो जाता है। शिक्षक की आवाज़ को धीमा करके फुसफुसाहट में बदल दिया जाता है। छात्र सोचता है, "मुझे पूरा यकीन है कि मैं सही हूँ। अगर किताब असहमत है, तो शायद किताब गलत है, या मुझे बस एक हल्के से संकेत की ज़रूरत है, न कि एक बड़े धक्के की।"
    • उपमा: एक मूर्तिकार की तरह जो मूर्ति को पॉलिश करता है। आप मूर्ति पर हथौड़े से प्रहार नहीं करते (ज़ोरदार सुधार); आप एक बारीक छेनी का उपयोग करते हैं (कोमल शोधन) ताकि उसे पूर्ण बनाया जा सके।

3. जादुई तत्व: "केली ट्रांसफॉर्म" (Cayley Transform)

यह शोध पत्र इस गेट को बिना किसी मानवीय निर्देश के स्वचालित रूप से कैसे बदलता है? इसके लिए वे केली ट्रांसफॉर्म नामक एक गणितीय ट्रिक का उपयोग करते हैं।

इसे छात्र के मस्तिष्क का थर्मामीटर मानिए।

  • यह पूछने के बजाय कि, "क्या आप भ्रमित हैं?" (जिसे मापना कठिन है), थर्मामीटर छात्र के पूरे मस्तिष्क के तापमान (उनकी समग्र अनिश्चितता/एंट्रॉपी) को मापता है।
  • यदि मस्तिष्क "गर्म" है (अराजक, अनिश्चित, उच्च एंट्रॉपी), तो थर्मामीटर सीखने के लिए गेट खोल देता है।
  • यदि मस्तिष्क "ठंडा" है (शांत, केंद्रित, कम एंट्रॉपी), तो थर्मामीटर जो पहले से सीखा गया है उसे सुरक्षित रखने के लिए गेट को बंद कर देता है।

यह थर्मामीटर सुचारू रूप से चलता है। यह केवल "ऑन" या "ऑफ" के रूप में स्विच नहीं करता। यह जैसे-जैसे छात्र कार्य में बेहतर होता जाता है, "एक्सप्लोरर" से "रिफाइनर" की ओर सहजता से बढ़ता है।

4. यह क्यों महत्वपूर्ण है (परिणाम)

इस शोध पत्र का परीक्षण विभिन्न प्रकार के कार्यों पर विभिन्न AI मॉडलों (जैसे LLaMA और Qwen) पर किया गया:

  • कठिन नए कार्य: जब AI को कुछ बिल्कुल नया सीखना था, तो DEFT ने इसे तेज़ी से सीखने में मदद की क्योंकि इसने कठिन हिस्सों को नज़रअंदाज़ नहीं किया।
  • विशेषज्ञ कार्य: जब AI किसी चीज़ में पहले से ही अच्छा था (जैसे गणित), तो DEFT ने इसके कौशल को "भूलने" या शोर वाले डेटा से भ्रमित होने से बचाया।
  • बीच का बिंदु (Sweet Spot): जहाँ AI हर चीज़ में "ठीक-ठाक" है, वहाँ DEFT ने नई चीज़ें सीखने और पुराने कौशल बनाए रखने के बीच एक बेहतरीन संतुलन बनाया, जो अन्य सभी तरीकों से बेहतर रहा।

सारांश

DEFT एक बुद्धिमान गुरु की तरह है जो जानता है कि छात्र को कब ज़ोर देना है और कब उन्हें अपने अंतर्ज्ञान पर भरोसा करने देना है।

  • पुराना तरीका: "तुम गलत हो! इसे तुरंत ठीक करो!" (भले ही आप सही थे)।
  • DEFT का तरीका: "आप अनिश्चित लग रहे हैं? यहाँ, मैं आपको यह नई चीज़ सीखने में मदद करता हूँ। लेकिन आप आत्मविश्वासी लग रहे हैं? ठीक है, मैं आपको बस एक छोटा सा सुझाव दूँगा, ताकि आप जो पहले से जानते हैं उसे भूल न जाएँ।"

AI को उसके अपने आत्मविश्वास के आधार पर यह तय करने की अनुमति देकर कि उसे शिक्षक पर कितना भरोसा करना है, यह शोध पत्र खोजने (exploring) और मौजूदा कौशल का उपयोग करने (exploiting) के बीच एक बेहतर संतुलन प्राप्त करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →