← नवीनतम पेपर
💻 computer science

SSA: Improving Performance With a Better Scoring Function

यह शोध पत्र स्केल्ड साइन्ड एवरेजिंग (SSA) का प्रस्ताव करता है, जो एक नवीन अटेंशन स्कोरिंग फंक्शन है जो इन-कॉन्टेक्स्ट लर्निंग में वितरण बदलावों (distribution shifts) के तहत सामान्यीकरण विफलताओं को संबोधित करने के लिए सॉफ्टमैक्स (Softmax) को प्रतिस्थापित करता है, और विभिन्न एनएलपी (NLP) बेंचमार्क और आर्किटेक्चर पर महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

मूल लेखक: Omar Naim, Swarnadeep Bhar, Jérôme Bolte, Nicholas Asher

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Omar Naim, Swarnadeep Bhar, Jérôme Bolte, Nicholas Asher

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "SSA: एक बेहतर स्कोरिंग फंक्शन के साथ प्रदर्शन में सुधार" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "ज़ोर से चिल्लाने वाला प्रभाव" (The "Loud Voice" Effect)

एक कक्षा की कल्पना करें जहाँ एक शिक्षक (AI) बोर्ड पर लिखे गए उदाहरणों को देखकर एक नियम सीखने की कोशिश कर रहा है। आमतौर पर, शिक्षक पैटर्न को समझने के लिए सभी उदाहरणों पर समान रूप से ध्यान देता है।

हालाँकि, शोध बताते हैं कि ये AI मॉडल वर्तमान में जिस तरह से "ध्यान देते" (pay attention) हैं, उसमें एक बड़ी खामी है। वे Softmax नामक एक स्कोरिंग सिस्टम का उपयोग करते हैं। आप Softmax को एक बहुत ही संवेदनशील वॉल्यूम नॉब (आवाज़ नियंत्रित करने वाला बटन) की तरह समझ सकते हैं। यदि कमरे में कोई एक छात्र अचानक चिल्लाने लगे (एक ऐसी संख्या जो दूसरों की तुलना में बहुत बड़ी या छोटी हो), तो वॉल्यूम नॉब इतनी तेज़ी से ऊपर चला जाता है कि शिक्षक केवल उसी एक चिल्लाते हुए छात्र को सुन पाता है। शिक्षक शांत छात्रों को पूरी तरह से अनदेखा कर देता है, भले ही उन शांत छात्रों के पास पहेली सुलझाने के लिए ज़रूरी सुराग हों।

शोधकर्ताओं ने पाया कि जब AI मॉडल ऐसे डेटा का सामना करते हैं जो उनके प्रशिक्षण (training) से थोड़ा अलग है (जैसे कि एक असामान्य रूप से बड़ी संख्या), तो यह "चिल्लाने" वाला प्रभाव उन्हें विफल कर देता है। वे पूरी तस्वीर देखना बंद कर देते हैं और एक ही सबसे तेज़ संख्या पर जुनूनी होकर ध्यान केंद्रित करने लगते हैं, जिससे गलत उत्तर मिलते हैं।

समाधान: एक नया वॉल्यूम नॉब (SSA)

इसे ठीक करने के लिए, लेखकों ने Scaled Signed Averaging (SSA) नामक एक नया स्कोरिंग फंक्शन बनाया।

यदि Softmax एक संवेदनशील वॉल्यूम नॉब है जो चिल्लाने से बिगड़ जाता है, तो SSA एक स्मार्ट साउंड इंजीनियर की तरह है।

  • जब कोई "चिल्लाने वाली" संख्या आती है, तो SSA वॉल्यूम को 100% तक नहीं बढ़ाता है। इसके बजाय, यह कहता है, "ठीक है, वह संख्या बड़ी है, लेकिन आइए हम दूसरों को अनदेखा न करें।"
  • यह वॉल्यूम को संतुलित रखता है। यह AI को तेज़ संख्या और शांत संख्याएं, दोनों को एक साथ सुनने की अनुमति देता है।
  • यह AI को एक आउटलायर (outlier) से विचलित होने के बजाय पूरे संदर्भ से जानकारी को जोड़ने में मदद करता है।

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने यह देखने के लिए कि क्या उनका नया तरीका पुराने से बेहतर काम करता है, दो विशिष्ट "परीक्षाएँ" आयोजित कीं।

  1. "हर कोई बनाम कुछ" टेस्ट (The "Every vs. Some" Test):

    • कार्य: AI को संख्याओं की एक सूची देखनी थी और यह तय करना था कि क्या हर संख्या धनात्मक (positive) है, या कुछ संख्याएँ धनात्मक हैं।
    • जाल (The Trap): उन्होंने AI को सामान्य संख्याओं वाली सूचियाँ दीं, और फिर एक विशाल संख्या (जैसे 70) वाली सूचियाँ दीं जो छोटी संख्याओं के बीच मिली हुई थी।
    • परिणाम: पुराने AI (Softmax) ने उस 70 को देखा, विचलित हो गया, और कहा, "सब कुछ धनात्मक है!" क्योंकि वह केवल 70 को सुन रहा था। नए AI (SSA) ने पूरी सूची को देखा, ऋणात्मक (negative) संख्याओं को देखा, और सही उत्तर दिया।
  2. "गणितीय पैटर्न" टेस्ट (The "Math Pattern" Test):

    • कार्य: AI को कुछ उदाहरणों के आधार पर एक गणितीय समीकरण (जैसे y=2x+1y = 2x + 1) के पीछे के नियम का अनुमान लगाना था।
    • **जाल (The Trap):ately, उन्होंने AI का परीक्षण उन संख्याओं के साथ किया जिन्हें उसने पहले कभी नहीं देखा था (बहुत बड़ी या बहुत छोटी संख्याएँ)।
    • परिणाम: पुराना AI अजीब संख्याओं से भ्रमित हो गया और पैटर्न खोजने में विफल रहा। नए AI (SSA) ने अजीब संख्याओं को कुशलता से संभाला और सही पैटर्न ढूंढना जारी रखा।

क्या यह वास्तविक भाषा पर काम करता है?

शोधकर्ताओं ने केवल गणितीय पहेलियों तक ही खुद को सीमित नहीं रखा। उन्होंने यह देखने के लिए कि क्या यह नया "साउंड इंजीनियर" भाषा के साथ मदद करता है, वास्तविक टेक्स्ट (जैसे किताबें और वेबसाइटें) पर AI मॉडल को प्रशिक्षित किया।

  • डिकोडर मॉडल (कहानियाँ सुनाने वाले - Decoder Models): उन्होंने एक मॉडल बनाया जो टेक्स्ट लिखता है। नया मॉडल (SSA) पुराने मॉडल की तुलना में कम गलतियाँ करता था और कठिन या असामान्य वाक्यों को पढ़ते समय टेक्स्ट को बेहतर समझता था।
  • एनकोडर मॉडल (समझने वाले - Encoder Models): उन्होंने व्याकरण (grammar) को समझने के लिए डिज़ाइन किए गए एक मॉडल का परीक्षण किया (जैसे होमवर्क चेक करने वाला छात्र)। नया मॉडल पुराने मॉडल की तुलना में व्याकरण के नियमों को पहचानने में बेहतर था, जैसे कि कर्ता (subject) को क्रिया (verb) के साथ मिलाना या सर्वनाम (pronoun) को समझना।

निचोड़ (The Bottom Line)

पेपर का दावा है कि AI में वर्तमान "अटेंशन" मैकेनिज्म (Softmax) चरम मानों (extreme values) से बहुत आसानी से विचलित हो जाता है, जिससे असामान्य होने पर AI विफल हो जाता है। इस मैकेनिज्म को अपने नए SSA तरीके से बदलकर, AI बहुत अधिक मजबूत (robust) हो जाता है। यह अपने ध्यान को संतुलित करना सीखता है, सूचना के पूरे समूह को देखता है, न कि केवल एक सबसे तेज़ हिस्से पर ध्यान केंद्रित करता है।

मुख्य बात: पेपर यह साबित करता है कि AI के काम करने के तरीके (स्कोरिंग फंक्शन) को बदलना ही उसे स्मार्ट और अधिक विश्वसनीय बनाने के लिए पर्याप्त है, बिना AI को बड़ा बनाए या उसे अधिक डेटा पर प्रशिक्षित किए। यह एक सॉफ्टवेयर अपग्रेड है, हार्डवेयर नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →