← नवीनतम पेपर
📊 statistics

InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting

InfoSFT एक सिद्धांत-आधारित टोकन-वेटिंग स्कीम है जो सुपरवाइज्ड फाइन-ट्यूनिंग के लिए है, जो विविध कार्यों में सामान्यीकरण (जनरलाइजेशन) में सुधार करने और मानक SFT एवं मौजूदा शमन विधियों की तुलना में मॉडल की पूर्व-मौजूद क्षमताओं को बेहतर ढंग से संरक्षित करने के लिए अधिकतम सूचनात्मक, मध्यम-विश्वास वाले टोकन पर सीखने के संकेतों को केंद्रित करती है।

मूल लेखक: Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: रोबोट को नई तरकीबें सिखाना

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) है जिसने दुनिया के बारे में पहले से ही बहुत कुछ सीख लिया है। अब, आप उसे कोई विशिष्ट नया कौशल सिखाना चाहते हैं, जैसे जटिल गणित की समस्याओं को हल करना या कंप्यूटर कोड लिखना। आप इसे विशेषज्ञों द्वारा किए गए कार्यों के उदाहरण दिखाकर करते हैं। इस प्रक्रिया को सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) कहा जाता है।

हालाँकि, यह शोध पत्र (पेपर) इस बात पर एक समस्या बताता है कि हम इसे करने के मानक तरीके के साथ क्या गलत कर रहे हैं। यह एक ऐसे शिक्षक की तरह है जो एक छात्र को पाठ्यपुस्तक के हर एक उदाहरण को रटने के लिए मजबूर करता है, चाहे वह कितना भी आसान या कठिन क्यों न हो।

समस्या: "एक ही आकार सबके लिए" वाला जाल (The "One-Size-Fits-All" Trap)

यह पेपर मानक दृष्टिकोण के साथ दो मुख्य समस्याओं की पहचान करता है:

  1. ओवरफिटिंग (तोते वाला प्रभाव - The Parrot Effect): रोबोट हर एक उदाहरण को पूरी तरह से याद करने की कोशिश करता है, यहाँ तक कि उन उदाहरणों को भी जो उसके समझने के लिए बहुत अजीब या असंभावित हैं। यह उस छात्र की तरह है जो गणित के सवाल की सटीक शब्दावली को रट लेता है लेकिन उसके पीछे के तर्क (logic) को नहीं समझता, इसलिए जब संख्याएँ बदल जाती हैं, तो वह असफल हो जाता है।
  2. कैटास्ट्रोफिक फॉरगेटिंग (भूलने की बीमारी का प्रभाव - The Amnesia Effect): इन नई, कठिन तरकीबों को सीखने की कोशिश में, रोबोट अनजाने में उन चीजों को "भूल" जाता है जिन्हें वह पहले से अच्छी तरह जानता था। यह उस शेफ की तरह है जो एक नई, शानदार रेसिपी सीखने की कोशिश में, पानी उबालना या प्याज काटना भूल जाता है।

पुराने समाधान: बहुत अधिक या बहुत कम

पिछले तरीकों ने कठिन उदाहरणों (उन उदाहरणों जिन्हें रोबट असंभव मानता है) को बाहर निकालकर इसे ठीक करने की कोशिश की।

  • उपमा (Analogy): कल्पना कीजिए कि एक शिक्षक केवल छात्र को उन समस्याओं पर अभ्यास करने देता है जिन्हें वह पहले से ही आसानी से हल कर सकता है।
  • परिणाम: छात्र बहुत आत्मविश्वासी और स्थिर हो जाता है, लेकिन वह कभी कुछ नया नहीं सीख पाता क्योंकि उसने उन कठिन अवधारणाओं के साथ संघर्ष नहीं किया जिनकी उसे महारत हासिल करने की आवश्यकता थी।

नया समाधान: InfoSFT (एक "गोल्डिलॉक्स" शिक्षक)

लेखक InfoSFT नामक एक नई विधि प्रस्तावित करते हैं। सभी उदाहरणों के साथ एक जैसा व्यवहार करने या कठिन उदाहरणों को अनदेखा करने के बजाय, InfoSFT एक बुद्धिमान शिक्षक की तरह कार्य करता है जो जानता है कि छात्र को कितना धक्का देना है।

मुख्य विचार: आत्मविश्वास का "स्वीट स्पॉट" (The "Sweet Spot" of Confidence)
InfoSFT हर उस शब्द के लिए अलग-अलग "वेट्स" (महत्व स्कोर) निर्धारित करता है जिसे रोबोट उत्पन्न करता है, इस आधार पर कि रोबोट उस शब्द के बारे में कितना आश्वस्त है:

  • बहुत आसान (उच्च आत्मविश्वास): यदि रोबोट किसी शब्द (जैसे "the" या "is") के बारे में पहले से ही 99% सुनिश्चित है, तो InfoSFT कहता है, "तुम यह पहले से जानते हो; इस पर समय बर्बाद करना बंद करो।" यह इन शब्दों को शून्य वेट (zero weight) देता है।
  • बहुत कठिन (शून्य आत्मविश्वास): यदि रोबोट पूरी तरह से खो गया है और शब्द अत्यंत असंभावित है, तो InfoSFT कहता है, "यह अभी बहुत भ्रमित करने वाला है; हम इसे अभी के लिए छोड़ देंगे ताकि तुम्हारा दिमाग खराब न हो जाए।" यह इन शब्दों को बहुत कम वेट (very low weight) देता है।
  • बिल्कुल सही (मध्यम आत्मविश्वास): यदि रोबोट अनिश्चित है लेकिन उसके पास एक अच्छा अनुमान है (शायद 50-80% आत्मविश्वास), तो InfoSFT कहता है, "यह सीखने का सही क्षण है! यहाँ ध्यान केंद्रित करो!" यह इन शब्दों को सबसे अधिक वेट (highest weight) देता है।

उपमा (Analogy):
साइकिल चलाना सीखने के बारे में सोचें।

  • मानक SFT एक सपाट फुटपाथ पर आपको चलाने के लिए मजबूर करने (बहुत आसान) और फिर अचानक आपको तूफान में फेंक देने (बहुत कठिन) जैसा है। या तो आप ऊब जाएंगे या दुर्घटनाग्रस्त हो जाएंगे।
  • InfoSFT एक कोच की तरह है जो आपको एक हल्की ढलान पर रखता है। आप डगमगा रहे हैं और अनिश्चित हैं (मध्यम आत्मविश्वास), इसलिए आप सबसे अधिक सीखते हैं। यदि ढलान बहुत खड़ी है, तो कोच आपको रोक देता है। यदि जमीन समतल है, तो कोच आपको बिना प्रयास के जाने देता है।

यह बेहतर क्यों काम करता है

शोध पत्र दिखाता है कि इन "मध्यम-आत्मविश्वास" वाले क्षणों पर ध्यान केंद्रित करके, रोबط पहले की तुलना में बहुत तेज़ी से और बेहतर तरीके से नए व्यवहार (जैसे गणित या कोडिंग) सीखता है।

  1. बेहतर सामान्यीकरण (Better Generalization): रोबोट कार्य के तर्क (logic) को सीखता है, न कि केवल विशिष्ट उदाहरणों को। वह उन नई समस्याओं को हल कर सकता है जिन्हें उसने पहले नहीं देखा है।
  2. कम विस्मृति (Less Amnesia): क्योंकि रोबोट को अजीब उदाहरणों को याद करने के लिए अपने पूरे व्यक्तित्व को नाटकीय रूप से बदलने के लिए मजबूर नहीं किया जाता है, इसलिए वह अपने मूल कौशल (जैसे सुरक्षा और सामान्य बातचीत) को बरकरार रखता है।

"एक-लाइन" का जादू

लेखक इस बात पर जोर देते हैं कि यह कोई बड़ा बदलाव नहीं है। यह उस गणित में एक छोटा सा सुधार है जिसका उपयोग रोबोट को प्रशिक्षित करने के लिए किया जाता है। यह केवल उस फॉर्मूले में बदलाव है जो यह तय करता है कि प्रत्येक शब्द पर कितना ध्यान दिया जाए। यह एक स्टीरियो पर वॉल्यूम नॉब बदलने जैसा है: सभी गानों को एक ही वॉल्यूम पर बजाने के बजाय, आप उन गानों की आवाज़ बढ़ाते हैं जिन्हें आपको सुनने की ज़रूरत है और उन्हें कम कर देते हैं जिन्हें आप पहले से जानते हैं।

सारांश

InfoSFT एआई (AI) को सिखाने का एक स्मार्ट तरीका है। यह एआई को आसान चीजों को रटने और असंभव चीजों से भ्रमित होने से रोकता है। इसके बजाय, यह अपनी सारी ऊर्जा उन "बिल्कुल सही" क्षणों पर केंद्रित करता है जहाँ वास्तव में सीखना होता है। यह एआई को अपने पुराने कौशल को भूले बिना नए कौशल में महारत हासिल करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →