← नवीनतम पेपर
🤖 machine learning

Generalized Priority-Aware Shapley Value

यह शोध पत्र 'जनरलाइज्ड प्रायोरिटी-अवेयर शापली वैल्यू' (GPASV) प्रस्तुत करता है, जो एक नवीन मूल्यांकन विधि है जो क्रम उल्लंघन को प्रतिबंधित करने के बजाय दंडित करके शापली वैल्यू को अनिश्चित निर्देशित भारित प्राथमिकता ग्राफों तक विस्तारित करती है, जिससे चक्रीय LLM एंसेम्बल प्राथमिकताओं जैसे जटिल वास्तविक दुनिया के परिदृश्यों में सुदृढ़ मूल्यांकन सक्षम होता है।

मूल लेखक: Kiljae Lee, Ziqi Liu, Weijing Tang, Yuan Zhang

प्रकाशित 2026-05-15
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kiljae Lee, Ziqi Liu, Weijing Tang, Yuan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पॉटलक डिनर (potluck dinner) आयोजित कर रहे हैं जहाँ हर कोई एक व्यंजन लेकर आता है, और आप यह पता लगाना चाहते हैं कि अंतिम भोजन के स्वादिष्ट होने का सबसे अधिक श्रेय किसे जाता है। मशीन लर्निंग की दुनिया में, इसे वैल्यूएशन (valuation) कहा जाता है: यह समझना कि प्रत्येक डेटा पॉइंट, फीचर या मॉडल ने अंतिम परिणाम में कितना योगदान दिया।

दशकों से, इस काम के लिए मानक उपकरण शापली वैल्यू (Shapley Value) रहा है। इसे एक निष्पक्ष रेफरी की तरह समझें जो मेहमानों के आने के क्रम को चुनने के लिए यादृच्छिक (randomly) रूप से लोगों को चुनता है। यदि आप जल्दी आते हैं, तो हो सकता है कि आपको कम सामग्रियों के साथ खाना बनाना पड़े; यदि आप देर से आते हैं, तो आपके पास काम करने के लिए बहुत कुछ हो सकता है। रेफरी यह गणना करता है कि आपके आने से भोजन में कितना सुधार होता है।

हालाँकि, पुराने रेफरी की एक कमी है: वे मान लेते हैं कि सभी समान हैं, जब तक कि कोई सख्त, अटूट नियम यह न कहे कि "व्यक्ति A को व्यक्ति B से पहले आना ही चाहिए।"

समस्या: वास्तविक जीवन अव्यवस्थित है

वास्तविक दुनिया में, प्राथमिकताएं केवल ब्लैक-एंड-व्हाइट "अनिवार्यताएं" नहीं होती हैं। वे अक्सर ऐसी होती हैं:

  1. चक्रीय (Cyclic): दोस्तों के एक समूह में, एलिस शायद बॉब के खाना पकाने को चार्ली से बेहतर मानती है, बॉब शायद चार्ली को डेव से बेहतर मानता है, लेकिन डेव शायद एलिस को बॉब से बेहतर पसंद करता है। यह एक लूप (loop) है। पुराना रेफरी एक घेरे में फंस जाता है और निर्णय नहीं ले पाता।
  2. भारित (Weighted): कभी-कभी, यह नियम कि "एलिस को बॉब से पहले आना चाहिए" बहुत मजबूत होता है (जैसे कि एक कानून), लेकिन अन्य बार यह केवल एक सुझाव (जैसे कि एक पसंद) होता है। पुराना रेफरी सभी नियमों को पूर्ण कानून मानता है, और प्राथमिकताओं की ताकत को अनदेखा कर देता है।
  3. सॉफ्ट (Soft): कभी-कभी, हम कुछ लोगों पर अधिक भरोसा करते हैं या जानते हैं कि उन्हें काम पर रखने की लागत कम है। पुराना रेफरी बिना सख्त नियमों को तोड़े इस "सॉफ्ट" भरोसे को कैसे शामिल किया जाए, यह नहीं जानता।

समाधान: "जनरलाइज्ड प्रायोरिटी-अवेयर शापली वैल्यू" (GPASV)

इस शोध पत्र के लेखकों ने एक नया, सुपर-स्मार्ट रेफरी बनाया है जिसे GPASV कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग करें:

1. "सॉफ्ट पेनल्टी" सिस्टम (चक्रों और भार को संभालना)

कल्प la कल्पना कीजिए कि पुराना रेफरी किसी भी बैठने की व्यवस्था को खारिज कर देता जहाँ नियमों का थोड़ा सा भी उल्लंघन होता। GPASV अधिक लचीला है।

  • उपमा: एक सख्त "प्रवेश निषेध" (No Entry) साइन के बजाय, GPASV एक स्पीड बम्प (speed bump) का उपयोग करता है। यदि आप मेहमानों को ऐसे क्रम में व्यवस्थित करते हैं जो किसी पसंद का उल्लंघन करता है (उदाहरण के लिए, "बॉस" को "इंटर्न" के बाद रखना), तो आपको प्रतिबंधित नहीं किया जाता है। इसके बजाय, आपको एक "पेनल्टी स्कोर" मिलता है।
  • यह कैसे काम करता है: आप जितनी अधिक किसी प्राथमिकता का उल्लंघन करते हैं, पेनल्टी उतनी ही अधिक होती है। रेफरी अभी भी इन व्यवस्थाओं पर विचार करता है, लेकिन उनके चुने जाने की संभावना कम होती है। यह सिस्टम को बिना फंसे चक्रों (पसंद के लूप) और भारित प्राथमिकताओं (मजबूत बनाम कमजोर नियम) को संभालने की अनुमति देता है।

2. "ट्रस्ट स्कोर" (सॉफ्ट प्रायोरिटी)

GPASV मेहमानों के बारे में आपकी "सॉफ्ट" भावनाओं को भी सुनता है।

  • उपमा: कल्पना कीजिए कि आपके पास मेहमानों की एक सूची है, और आपके पास प्रत्येक के लिए एक "ट्रस्ट स्कोर" है। शायद आप एक अजनबी की तुलना में अपनी दादी के खाना पकाने पर अधिक भरोसा करते हैं, भले ही अजनबी तकनीकी रूप रूप से "बेहतर" खाना बनाने में सक्षम हो।
  • यह कैसे काम करता है: GPASV इन "सॉफ्ट" भावनाओं को सख्त नियमों (स्पीड बम्प्स) के साथ मिलाता है। यह एक संतुलित दृष्टिकोण बनाता है जहाँ एक अत्यधिक विश्वसनीय अतिथि को लाइनअप में बेहतर स्थान मिल सकता है, भले ही वह एक मामूली नियम का थोड़ा उल्लंघन करता हो।

3. "स्वीपिंग" डायग्नोस्टिक (डायल)

GPASV की सबसे शानदार विशेषताओं में से एक यह है कि यह आपको केवल एक उत्तर नहीं देता। यह आपको एक डायल (dial) देता है।

  • उपमा: एक रेडियो डायल की कल्पना करें। एक तरफ, आपके पास "केवल सख्त नियम" (Hard Priority) हैं। दूसरी ओर, आपके पास "केवल शुद्ध विश्वास/पसंद" (Soft Priority) है।
  • यह कैसे काम करता है: लेखक दिखाते हैं कि आप यह देखने के लिए इस डायल को घुमा सकते हैं कि क्रेडिट कैसे बदलता है। यदि आप डायल को "सख्त नियमों" की ओर घुमाते हैं, तो परिणाम एक तरह के होते हैं। यदि आप इसे "विश्वास" की ओर घुमाते हैं, तो परिणाम पूरी तरह से बदल जाते हैं। यह साबित करता है कि एक एकल "सही" उत्तर नहीं है; उत्तर इस पर निर्भर करता है कि आप नियमों को विश्वास के मुकाबले कितना महत्व देते हैं।

वास्तविक दुनिया का परीक्षण: चैटबॉट एरिना (Chatbot Arena)

यह काम करता है, यह साबित करने के लिए, लेखकों ने इसे LLMs (लार्ज लैंग्वेज मॉडल्स) पर परीक्षण किया, विशेष रूप से "चैटबॉट एरिना" के डेटा का उपयोग करके, जहाँ मनुष्य वोट देते हैं कि कौन सा AI चैटबॉट बेहतर है।

  • स्थिति: मानव वोट अक्सर लूप बनाते हैं (AI A, B को हराता है, B, C को हराता है, लेकिन C, A को हराता है)। पुराने तरीके इसे संभाल नहीं सके।
  • प्रयोग: उन्होंने AI मॉडल्स को पॉटलक के "मेहमानों" के रूप में माना। उनके पास दो प्रकार की प्राथमिकताएं थीं:
    1. हार्ड प्रायोरिटी: जिसे वास्तव में मनुष्यों ने वोट दिया (वोटों की संख्या)।
    2. सॉफ्ट प्रायोरिटी: क्या AI "ओपन सोर्स" (मुफ्त) है या "पेड" (महंगा) है।
  • परिणाम: उन्होंने पाया कि वैल्यूएशन (मूल्यांकन) का "विजेता" नाटकीय रूप से बदल जाता है, यह इस बात पर निर्भर करता है कि वे अपने डायल को कैसे घुमाते हैं।
    • यदि वे केवल मानव वोटों पर ध्यान केंद्रित करते हैं, तो महंगे, पेड मॉडल (जैसे GPT-4) हावी रहते हैं।
    • यदि वे "ओपन सोर्स" प्राथमिकता पर ध्यान केंद्रित करते हैं, तो मुफ्त मॉडल शीर्ष पर पहुँच जाते हैं।
    • सबक: आप केवल एक "Calculate Value" बटन दबाकर एक एकल सत्य प्राप्त नहीं कर सकते। आपको यह तय करना होगा कि आप मानव वोटों को अपने स्वयं के विचारों (जैसे ओपन सोर्स का समर्थन करना) के मुकाबले कितना वजन देना चाहते हैं। GPASV इस ट्रेड-ऑफ को दृश्यमान और समायोज्य बनाता है।

सारांश

यह शोध पत्र पेश करता है कि GPASV, एक नया गणितीय उपकरण है जो पुराने तरीकों के दोषों को ठीक करता है:

  1. यह प्राथमिकताओं में लूप्स (चक्रों) को संभालने की अनुमति देता है बजाय इसके कि वह फंस जाए।
  2. यह प्राथमिकताओं की ताकत (भार) का सम्मान करता है बजाय इसके कि वह उन सभी को पूर्ण कानून माने।
  3. यह इन्हें व्यक्तिगत ट्रस्ट स्कोर (सॉफ्ट प्रायोरिटी) के साथ जोड़ता है।
  4. यह उपयोगकर्ताओं को दिखाता है कि अंतिम "स्कोर" इस बात पर निर्भर करता है कि वे इन विभिन्न कारकों को कैसे संतुलित करते हैं, न कि यह कि यह एक एकल, निश्चित संख्या है।

यह एक कठोर, नियम-बद्ध रेफरी से एक लचीले, बुद्धिमान मध्यस्थ में अपग्रेड करने जैसा है जो समझता है कि वास्तविक जीवन की प्राथमिकताएं अव्यवस्थित, भारित और कभी-कभी चक्रीय होती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →