← नवीनतम पेपर
🤖 AI

STABLEVAL: Disagreement-Aware and Stable Evaluation of AI Systems

यह शोधपत्र STABLEVAL को प्रस्तुत करता है, जो एक असहमति-जागरूक मूल्यांकन ढांचा है जो स्थिर, अनिश्चितता-जागरूक सिस्टम रैंकिंग उत्पन्न करने के लिए अंतर्निहित आइटम शुद्धता और एनोटेटर-विशिष्ट भ्रम पैटर्न को मॉडल करता है, जो पारंपरिक बहुमत मत एकत्रीकरण विधियों में निहित भंगुरता और पूर्वाग्रह को संबोधित करता है।

मूल लेखक: Akash Bonagiri, Gerard Janno Anderias, Saee Patil, Angelina Lai, Devang Borkar, Gezheng Kang, Ishant Gandhi, Setareh Rafatirad, Houman Homayoun

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Akash Bonagiri, Gerard Janno Anderias, Saee Patil, Angelina Lai, Devang Borkar, Gezheng Kang, Ishant Gandhi, Setareh Rafatirad, Houman Homayoun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह तय करने की कोशिश कर रहे हैं कि छह अलग-अलग शेफ में से कौन सबसे अच्छा सूप बनाता है। आप 65 फूड क्रिटिक्स (खाद्य समीक्षकों) से सूप चखने और उन्हें रेटिंग देने के लिए कहते हैं।

पुराना तरीका (बहुमत का वोट - Majority Vote):
अतीत में, शोधकर्ता केवल वोटों की गिनती करते थे। यदि 33 क्रिटिक्स कहते हैं "शेफ A का सूप अच्छा है" और 32 कहते हैं "शेफ A का सूप बुरा है," तो शेफ A को "अच्छा" रेटिंग मिलती है। उन 32 "बुरे" वोटों को अनदेखा कर दिया जाता है।

  • समस्या: यह नाजुक है। यदि केवल एक क्रिटिक अपना मन बदल लेता है या यदि आप अगले दौर के लिए 65 क्रिटिक्स का एक अलग समूह चुनते हैं, तो विजेता बदल सकता है। यह सभी क्रिटिक्स को समान रूप से पूर्ण मानता है, भले ही कुछ जाने-माने रूप से सख्त हों, कुछ बहुत दयालु हों, या कुछ बस अंदाज़ा लगा रहे हों। यह इस बात की बारीकियों को फेंक देता है कि लोग असहमत क्यों थे।

नया तरीका (STABLEVAL):
इस पेपर के लेखक, STABLEVAL कहते हैं: "केवल वोटों को मत गिनिए; मतदाताओं को समझें।"

वे एक ऐसा सिस्टम प्रस्तावित करते हैं जो एक साधारण वोट-काउंटर के बजाय एक स्मार्ट जासूस की तरह काम करता है। यह कैसे काम करता है, इसके लिए कुछ उपमाएँ दी गई हैं:

1. "कन्फ्यूजन मैट्रिक्स" (जासूस का प्रोफाइल)

यह मानने के बजाय कि हर क्रिटिक परफेक्ट है, STABLEVAL प्रत्येक का एक प्रोफाइल बनाता है।

  • सख्त क्रिटिक: शायद क्रिटिक नंबर 5 हमेशा सोचता है कि सूप बहुत नमकीन है, भले ही वह ठीक हो। STABLEVAL सीखता है, "आह, क्रिटिक नंबर 5 एक सख्त जज है; मैं उनके 'बुरा' वोट को कम महत्व दूँगा।"
  • लापरवाह क्रिटिक: शायद क्रिटिक नंबर 10 हर चीज़ के लिए "अच्छा" चुन लेता है। STABLEVAL सीखता है, "क्रिटिक नंबर 10 ध्यान नहीं दे रहा है; मैं उनकी राय को अनदेखा कर दूँगा।"
  • भ्रमित आइटम: कभी-कभी कोई सूप बस अजीब रूप से अस्पष्ट होता है। STABLEVAL महसूस करता है, "यह विशेष सूप का कटोरा परखने में कठिन है," और एक एकल "अच्छा" या "बुरा" लेबल थोपने के बजाय, यह कहता है, "इस बात की 60% संभावना है कि यह अच्छा है और 40% संभावना है कि यह बुरा है।"

2. "सॉफ्ट स्कोर" बनाम "हार्ड लेबल"

  • पुराना तरीका (हार्ड लेबल): सूप या तो "अच्छा" (1) है या "बुरा" (0) है। यह एक बाइनरी स्विच है।
  • STABLEVAL (सॉफ्ट स्कोर): सूप को "0.65" का "क्रेडिट स्कोर" मिलता है। यह स्वीकार करता है कि हालांकि सूप "अच्छे" की ओर झुक रहा है, फिर भी इसमें कुछ अनिश्चितता है। यह अनिश्चितता को जीवित रखता है बजाय इसके कि उसे एक एकल संख्या में कुचल दिया जाए।

3. "स्टेबिलिटी टेस्ट" (द शफल)

पेपर सफलता को मापने का एक नया तरीका पेश करता है जिसे रैंकिंग स्टेबिलिटी (Ranking Stability) कहा जाता है।
कल्पना कीजिए कि आपके पास ताश की एक गड्डी है जो आपके क्रिटिक्स का प्रतिनिधित्व करती है।

  • बहुमत का वोट (Majority Vote): यदि आप गड्डी को फेंट देते हैं और कुछ कार्ड (क्रिटिक्स) निकाल देते हैं, तो शेफ का क्रम पूरी तरह से बदल सकता है। रैंकिंग अस्थिर है, जैसे ताश का घर।
  • STABLEVAL: क्योंकि यह प्रत्येक क्रिटिक की विश्वसनीयता को समझता है, यदि आप गड्डी को फेंटते हैं और कुछ कार्ड हटा देते हैं, तो शेफ का क्रम वही रहता है। रैंकिंग स्थिर है, जैसे पत्थर की एक ठोस मूर्ति।

उन्होंने क्या पाया

शोधकर्ताओं ने वास्तविक दुनिया के डेटा (जैसे AI चैटबॉट्स और मेडिकल सारांशों को जज करना) और बनाए गए परिदृश्यों (जिनमें "परेशान करने वाले" क्रिटिक्स थे) पर इसका परीक्षण किया।

  • "डीनोइजिंग" का जाल (The "Denoising" Trap): उन्होंने "Dawid-Skene" नामक एक पुराने तरीके के साथ इसकी तुलना की। वह पुराना तरीका "सच्चा उत्तर" (जैसे अपराध सुलझाते हुए जासूस) पहचानने में बहुत अच्छा है। हालांकि, पेपर में पाया गया कि केवल "सच्चा उत्तर" जानने का मतलब यह नहीं है कि आपको शेफ की एक स्थिर रैंकिंग प्राप्त होगी। आप सत्य जान सकते हैं लेकिन फिर भी आपकी रैंकिंग ऐसी हो सकती है जो बदलती रहती है।
  • विजेता: STABLEVAL ने हमेशा "सच्चा" लेबल पूरी तरह से नहीं पहचाना, लेकिन इसने बहुत अधिक सुसंगत रैंकिंग प्रदान की। जब क्रिटिक्स के बीच बहुत अधिक असहमति थी (जो जटिल कार्यों जैसे AI सुरक्षा या मेडिकल सारांशों में अक्सर होता है), तब STABLEVAL ने लीडरबोर्ड को स्थिर रखा, जबकि पुराने तरीकों ने रैंकिंग को बेकाबू तरीके से उछाल दिया।

मुख्य निष्कर्ष (The Bottom Line)

पेपर का तर्क है कि AI मूल्यांकन में, असहमति केवल शोर नहीं है जिसे हटाया जाना चाहिए; बल्कि यह एक संकेत है जिसे समझा जाना चाहिए।

यदि आप जानना चाहते हैं कि कौन सा AI वास्तव में बेहतर है, तो आपको केवल बहुमत के वोट पर निर्भर नहीं रहना चाहिए। आपको एक ऐसा सिस्टम बनाना चाहिए जो जानता हो कि कौन से जज विश्वसनीय हैं, कौन से आइटम पेचीदा हैं, और कितनी अनिश्चितता मौजूद है। यह सुनिश्चित करता है कि जब आप कहते हैं, "AI मॉडल A, AI मॉडल B से बेहतर है," तो आप केवल इसलिए नहीं कह रहे हैं क्योंकि आपको उस दिन जजों का एक विशिष्ट समूह मिला था। आप यह कह रहे हैं क्योंकि परिणाम स्थिर (stable) है, चाहे आप किसी से भी पूछें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →