← नवीनतम पेपर
🤖 machine learning

Is Data Shapley Not Better than Random in Data Selection? Ask NASH

यह शोध पत्र NASH को प्रस्तुत करता है, जो एक नवीन डेटा चयन ढांचा (framework) है जो लक्ष्य उपयोगिता फलनों (target utility functions) को शापले-सूचनात्मक घटकों (Shapley-informative components) में विभाजित करता है और उच्च-गुणवत्ता वाले प्रशिक्षण उपसमुच्चयों को निरंतर और कुशलतापूर्वक चुनने के लिए उन्हें गैर-रैखिक रूप से एकत्रित करता है, जिससे मानक डेटा शापले विधियों की उन सीमाओं को दूर किया जा सके जो अक्सर यादृच्छिक चयन (random selection) से बेहतर प्रदर्शन नहीं करती हैं।

मूल लेखक: Xiao Tian, Jue Fan, Rachael Hwee Ling Sim, Zixuan Wang, Nancy F. Chen, Bryan Kian Hsiang Low

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiao Tian, Jue Fan, Rachael Hwee Ling Sim, Zixuan Wang, Nancy F. Chen, Bryan Kian Hsiang Low

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक बेहतरीन सूप बनाने की कोशिश कर रहे हैं। आपके पास सामग्रियों से भरा एक विशाल भंडार (आपका ट्रेनिंग डेटा) है, लेकिन आपके पास अपने बर्तन में केवल एक छोटी, विशिष्ट मात्रा रखने की ही जगह है (आपका सीमित बजट या स्टोरेज)। आपका लक्ष्य उन बेहतरीन सामग्रियों का एक मुट्ठी भर चयन करना है जिससे सूप का स्वाद लाजवाब हो जाए।

लंबे समय से, डेटा वैज्ञानिक यह तय करने के लिए एक विधि का उपयोग करते आए हैं कि कौन सी सामग्रियां चुननी हैं, जिसे डेटा शापली (Data Shapley) कहा जाता है। डेटा शापली को एक "निष्पक्षता स्कोर" (fairness score) की तरह समझें। यह गणना करने की कोशिश करता है कि हर एक सामग्री, अन्य सभी संभावित संयोजनों के साथ मिलकर, अंतिम स्वाद में कितना योगदान देती है। सिद्धांत यह है: "यदि कोई सामग्री अच्छी है, तो उसका स्कोर अधिक होगा, इसलिए आइए बस उच्चतम स्कोर वाली शीर्ष 10 सामग्रियों को चुन लें।"

समस्या: "टॉप 10" का जाल
यह शोध पत्र तर्क देता है कि यह "टॉप 10" वाला दृष्टिकोण अक्सर विफल हो जाता है। कभी-कभी, जिन सामग्रियों का स्कोर सबसे अधिक होता है, वे वास्तव में सबसे अच्छा सूप नहीं बनातीं; वास्तव में, वे रैंडम तरीके से सामग्रियों को चुनने से भी बेहतर नहीं होतीं।

क्यों? क्योंकि "स्कोर" (डेटा शापली) एक साथ बहुत कुछ करने की कोशिश कर रहा है।

  • "स्विस आर्मी नाइफ" वाला दोष: कल्पना कीजिए कि आपके पास एक चाकू है जो मांस काटने के लिए तो बहुत अच्छा है लेकिन सब्जियां काटने के लिए बहुत खराब है। यदि आप केवल चाकू के कुल स्कोर को देखते हैं, तो वह एक उच्च श्रेणी का उपकरण लग सकता है। लेकिन यदि आपके सूप को बहुत सारी सब्जियों की आवश्यकता है, तो वह चाकू बेकार है।
  • शोध पत्र का अंतर्दृष्टि (Insight): सूप का "स्वाद" (वैलिडेशन एक्यूरेसी) कई अलग-अलग "भूमिकाओं" (मांस काटना, सब्जियां काटना, मसाला डालना) पर निर्भर करता है। एक एकल समग्र स्कोर इन विशिष्ट शक्तियों को छिपा देता है। शोध पत्र दिखाता है कि डेटा शापली अक्सर बहुत सारे "मांस काटने वाले" चुन लेता है और "सब्जी काटने वालों" को अनदेखा कर देता है, जिसके परिणामस्वरूप एक खराब सूप बनता है।

समाधान: NASH से मिलिए
लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे NASH (नॉन-लीनियर एग्रीगेशन ऑफ शापली-इनफॉर्मेटिव कंपोनेंट्स) कहा जाता है। यह कैसे काम करता है, इसके लिए एक रचनात्मक उपमा देखें:

  1. इसे टुकड़ों में तोड़ें (Decomposition): यह पूछने के बजाय कि, "यह सामग्री पूरे सूप के लिए कितनी अच्छी है?" NASH पूछता है, "यह सामग्री केवल मांस के लिए कितनी अच्छी है? यह केवल सब्जियों के लिए कितनी अच्छी है? यह केवल मसाले के लिए कितनी अच्छी है?"

    • शोध पत्र सिद्ध करता है कि जब आप इन छोटे, विशिष्ट भूमिकाओं (जैसे किसी एक विशिष्ट सब्जी के स्वाद की भविष्यवाणी करना) को देखते हैं, तो डेटा शापली स्कोर बहुत सटीक और विश्वसनीय हो जाता है। ये "शापली-इनफॉर्मेटिव कंपोनेंट्स" हैं।
  2. समझदारी से मिश्रण करें (Non-Linear Aggregation): अब, NASH के पास हर भूमिका के लिए हर सामग्री का एक स्कोर है। लेकिन यह उन्हें बस जोड़ नहीं देता (जो कि पुराने, त्रुटिपूर्ण "टॉप 10" सूची जैसा होगा)।

    • इसके बजाय, यह एक स्मार्ट मिक्सिंग रणनीति का उपयोग करता है। इसे एक ऐसे शेफ की तरह समझें जिसे एहसास होता है: "मेरे पास बहुत सारे मांस काटने वाले हैं, लेकिन मैं सब्जी काटने वालों के लिए बेताब हूँ।"
    • NASH उन सामग्रियों को प्राथमिकता देता है जो कमियों को पूरा करती हैं। यदि सूप में पहले से ही बेहतरीन मांस कवरेज है, तो NASH और अधिक मांस काटने वालों को चुनने के बजाय रुक जाता है और सब्जी काटने वालों की तलाश शुरू कर देता है, भले ही उन सब्जी काटने वालों का "कुल" स्कोर थोड़ा कम रहा हो। यह सुनिश्चित करने के लिए कि सूप को एक संतुलित, पूर्ण स्वाद मिले, यह एक गणितीय "वक्र" (non-linear) नियम का उपयोग करता है।

परिणाम
लेख-पत्र ने इसका परीक्षण कई अलग-अलग "रेसिपी" (डेटासेट) और "कुकिंग स्टाइल" (मॉडल) पर किया, सरल गणितीय समस्याओं से लेकर जटिल AI भाषा मॉडल तक।

  • पुराना तरीका: मानक डेटा शापली विधि अक्सर रैंडम तरीके से चुनने से बेहतर प्रदर्शन नहीं करती थी।
  • NASH तरीका: समस्याओं को विशिष्ट भूमिकाओं में तोड़कर और उन्हें स्मार्ट तरीके से फिर से मिलाकर, NASH ने लगातार बेहतर सामग्रियां चुनीं, जिससे पुराने तरीके की तुलना में बहुत बेहतर (उच्च मॉडल एक्यूरेसी) सूप तैयार हुआ, और इसमें अतिरिक्त समय या लागत भी लगभग न के बराबर लगी।

संक्षेप में
यह शोध पत्र कहता है: "अपने डेटा के केवल समग्र लोकप्रियता स्कोर पर भरोसा न करें। समस्या को विशिष्ट कार्यों में तोड़ें, देखें कि आपके वर्तमान डेटा में कहाँ कमी है, और उन कमियों को भरने के लिए एक स्मार्ट, नॉन-लीनियर नियम का उपयोग करें। ऐसा करने से ही आप सबसे अच्छा डेटा चयन प्राप्त कर सकते हैं।"

शोध पत्र के मुख्य निष्कर्ष:

  • डेटा शापली टूटा हुआ नहीं है; बस इसका उपयोग गलत तरीके से किया जा रहा है (अंधाधुंध शीर्ष स्कोर चुनकर)।
  • जटिल लक्ष्य (जैसे "अच्छा सूप") सरल हिस्सों से बने होते हैं (अच्छा मांस, अच्छी सब्जियां)। डेटा शापली इन सरल हिस्सों पर बहुत अच्छा काम करता है।
  • NASH एक नया फ्रेमवर्क है जो बेहतर संपूर्ण बनाने के लिए इन सरल हिस्सों का उपयोग करता है, यह सुनिश्चित करता है कि आप केवल समान सामग्रियां ही न चुनें, बल्कि एक संतुलित, उच्च-गुणवत्ता वाला समूह चुनें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →