← नवीनतम पेपर
💻 computer science

Explanation Quality Assessment as Ranking with Listwise Rewards

यह शोध पत्र व्याख्या गुणवत्ता मूल्यांकन को एक रैंकिंग समस्या के रूप में पुनर्गठित करता है, जिसमें लिस्टवाइज (listwise) और पेयरवाइज (pairwise) उद्देश्यों का उपयोग करके उम्मीदवार व्याख्याओं के बीच अंतर करने के लिए रिवॉर्ड मॉडल को प्रशिक्षित किया जाता है, जो यह प्रदर्शित करता है कि ऐसे दृष्टिकोण स्कोर पृथक्करण में रिग्रेशन (regression) से बेहतर प्रदर्शन करते हैं, डेटा विशेषताओं के प्रति सुदृढ़ता प्रदान करते हैं, उच्च-गुणवत्ता वाले डेटा के साथ छोटे मॉडलों को बड़े मॉडलों के बराबर लाने में सक्षम बनाते हैं, और वहां स्थिर पॉलिसी ऑप्टिमाइज़ेशन सुनिश्चित करते हैं जहाँ रिग्रेशन-आधारित रिवॉर्ड विफल हो जाते हैं।

मूल लेखक: Thomas Bailleux, Tanmoy Mukherjee, Emmanuel Lonca, Pierre Marquis, Zied Bouraoui

प्रकाशित 2026-04-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thomas Bailleux, Tanmoy Mukherjee, Emmanuel Lonca, Pierre Marquis, Zied Bouraoui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

मुख्य विचार: अनुमान लगाना बंद करें, रैंकिंग करना शुरू करें

कल्पना कीजिए कि आप निबंधों के एक ढेर को ग्रेड दे रहे हैं एक शिक्षक हैं। कुछ शानदार हैं, कुछ ठीक-ठाक हैं, कुछ भ्रमित करने वाले हैं, और कुछ बेतुके हैं।

पुराना तरीका (जनरेशन/रिग्रेशन):
आज के अधिकांश AI मॉडल एक सख्त परीक्षक की तरह काम करने की कोशिश करते हैं जो हर निबंध को एक एकल संख्या देता है, जैसे कि 100 में से एक स्कोर। समस्या यह है कि AI भ्रमित हो जाता है। वह एक शानदार निबंध को 50.2 और एक बहुत खराब निबंध को 49.8 दे सकता है। AI के लिए, ये दोनों निबंध लगभग एक जैसे ही हैं। जब AI इससे सीखने की कोशिश करता है, तो यह एक तूफान में फुसफुसाहट सुनने की कोशिश करने जैसा है—सिग्नल इतना कमजोर है कि "अच्छे" और "बुरे" के बीच अंतर करना असंभव है।

नया तरीका (रैंकिंग):
यह शोध पत्र एक अलग दृष्टिकोण का सुझाव देता है। AI से यह पूछने के बजाय कि, "यह निबंध कितना अच्छा है?" (जिससे वे भ्रमित करने वाली संख्याएँ पैदा होती हैं), हम पूछते हैं, "क्या यह निबंध उस निबंध से बेहतर है?"

हम AI को एक ही प्रश्न के लिए पाँच निबंधों की एक सूची देते हैं:

  1. गोल्ड (Gold): पूर्ण मानव-लिखित उत्तर।
  2. गुड (Good): एक ठोस उत्तर।
  3. फेयर (Fair): एक औसत दर्जे का उत्तर।
  4. पुअर (Poor): एक गलत उत्तर।
  5. नॉनसेंस (Nonsense): बकवास या अर्थहीन।

हम AI को इन निबंधों के क्रम (order) को सीखना सिखाते हैं। वह सीखता है कि गोल्ड > गुड > फेयर > पुअर > नॉनसेंस है। सटीक संख्या के बजाय क्रम पर ध्यान केंद्रित करके, AI एक बहुत स्पष्ट तस्वीर बनाता है कि "गुणवत्ता" कैसी दिखती है।

समस्या: "स्कोर कंप्रेशन" का जाल

लेखकों ने पाया कि AI को आमतौर पर स्पष्टीकरण (explanations) का मूल्यांकन करने के लिए कैसे सिखाया जाता है, उसमें एक बड़ी खामी है। वे इसे "स्कोर कंप्रion" (Score Compression) कहते हैं।

इसे एक टूटे हुए थर्मामीटर की तरह समझें। यदि तापमान वास्तव में 100°F (गर्म) या 0°F (ठंडा) है, तो एक टूटा हुआ थर्मामीटर दोनों को 50°F दिखा सकता है। क्योंकि AI अपने सभी स्कोर को एक बहुत ही संकीर्ण सीमा में सिकोड़ देता है, इसलिए वह एक बेहतरीन स्पष्टीकरण और एक बुरे स्पष्टीकरण के बीच अंतर नहीं कर पाता है।

जब AI इन मामूली अंतरों का उपयोग खुद को सुधारने के लिए करने की कोशिश करता है (एक प्रक्रिया जिसे PPO कहा जाता है, जो एक छात्र द्वारा शिक्षक के फीडबैक को सुनकर बेहतर होने की कोशिश करने जैसा है), तो फीडबैक इतना कमजोर होता है कि छात्र भ्रमित हो जाता है और सीखना बंद कर देता है।

समाधान: लिस्टवाइज रिवॉर्ड्स (Listwise Rewards)

यह शोध पत्र रैंकिंग मॉडल्स (विशेष रूप से ListNet, RankNet और LambdaRank जिन्हें इस्तेमाल किया जाता है) का उपयोग करने का प्रस्ताव देता है।

  • उपमा (Analogy): एक स्पोर्ट्स कोच की कल्पना करें।
    • रिग्रेशन (पुराना तरीका): कोच कहता है, "आपने 10.5 सेकंड की दौड़ लगाई।" (लेकिन स्टॉपवॉच टूटी हुई है और सबके लिए 10.5 ही दिखा रही है)।
    • पेयरवाइज (मध्यम तरीका): कोच कहता है, "तुम बॉब से तेज़ थे।" (बेहतर है, लेकिन केवल दो लोगों की तुलना करता है)।
    • लिस्टवाइज (नया तरीका): कोच पूरी टीम को देखता है और कहता है, "यहाँ सटीक क्रम है: तुम पहले हो, बॉब दूसरे स्थान पर है, सारा तीसरे स्थान पर है।"

शोध पत्र में पाया गया कि ListNet ("पूरी टीम" वाला दृष्टिकोण) सबसे अच्छा था। इसने स्कोर को स्पष्ट रूप से फैलाए रखा, ताकि AI स्पष्ट रूप से देख सके कि एक "गोल्ड" स्पष्टीकरण और एक "नॉनसेंस" स्पष्टीकरण के बीच क्या अंतर है। इसने AI को सीखने के लिए एक मजबूत, स्पष्ट सिग्नल दिया।

मुख्य निष्कर्ष (सरल अंग्रेजी में)

  1. डेटा आकार से अधिक महत्वपूर्ण है:
    लेखकों ने बहुत छोटे (110 मिलियन पैरामीटर्स) से लेकर बहुत बड़े (7 बिलियन पैरामीटर्स) AI मॉडल का परीक्षण किया। आश्चर्यजनक रूप से, जब उन्होंने अपने नए "ग्रेड किए गए" डेटा (5-स्तरीय गुणवत्ता सूची) का उपयोग किया, तो छोटे मॉडल भी बड़े मॉडलों के समान ही प्रदर्शन करने लगे

    • सीख: यह बड़े दिमाग के बारे में नहीं है; यह बेहतर प्रशिक्षण सामग्री के बारे में है।
  2. काम के लिए सही उपकरण:
    सभी रैंकिंग तरीके एक जैसे नहीं होते।

    • यदि आपका डेटा बहुत साफ और स्पष्ट रूप से अलग (जैसे अलग ग्रेड A, B, C) है, तो ListNet सबसे अच्छा काम करता है।
    • यदि आपका डेटा अव्यवस्थित या शोर वाला (जैसे वास्तविक मानवीय तर्क जहाँ लोग असहमत होते हैं) है, तो Pairwise तरीके (एक बार में दो की तुलना करना) अधिक मजबूत होते हैं।
  3. यह सीखने के लिए वास्तव में काम करता है:
    जब उन्होंने बेहतर स्पष्टीकरण उत्पन्न करने के लिए AI को सिखाने हेतु इन रैंकिंग स्कोर का उपयोग किया (PPO विधि का उपयोग करके), तो AI तेजी से और स्थिरता से सीखा। जब उन्होंने पुराने "कंप्रेस्ड स्कोर" वाले तरीके का उपयोग किया, तो AI कुछ भी सीखने में विफल रहा।

उन्होंने डेटा कैसे बनाया

इसे काम करने के योग्य बनाने के लिए, वे मौजूदा डेटासेट का उपयोग नहीं कर सकते थे क्योंकि उन डेटासेट में आमतौर पर प्रत्येक प्रश्न के लिए केवल एक ही "सही" उत्तर होता है। यदि केवल एक ही चीज़ है जिसे रैंक किया जाना है, तो आप चीज़ों को रैंक कैसे कर सकते हैं?

इसलिए, उन्होंने एक ग्रेड किया गया डेटासेट (Graded Dataset) बनाया:

  • उन्होंने वास्तविक मानव उत्तरों (Gold) को लिया।
  • उन्होंने कंप्यूटर टेम्पलेट्स का उपयोग करके उन उत्तरों के "गुड," "फेयर," "पुअर," और "नॉनसेंस" संस्करण स्वचालित रूप से बनाए।
  • उन्होंने इसमें थोड़ा सा "ओवरलैप" (अस्पष्टता) जोड़ा ताकि AI को यह तय करने के लिए वास्तव में सोचना पड़े कि एक "गुड" उत्तर "फेयर" उत्तर से बेहतर है या नहीं, बिल्कुल वैसे ही जैसे एक इंसान करेगा।

निचोड़ (The Bottom Line)

यह शोध पत्र तर्क देता है कि हमें स्पष्टीकरण की गुणवत्ता को एक साधारण गणितीय समस्या (एक एकल स्कोर देना) के रूप में मानना बंद कर देना चाहिए और इसे एक रैंकिंग समस्या (चीजों को सबसे अच्छे से सबसे बुरे के क्रम में रखना) के रूप में देखना शुरू करना चाहिए।

ऐसा करके, उन्होंने AI प्रशिक्षण में एक टूटे हुए फीडबैक लूप को ठीक किया। उन्होंने दिखाया कि सही प्रकार के डेटा और सही रैंकिंग पद्धति के साथ, यहाँ तक कि छोटे, कुशल AI मॉडल भी महान स्पष्टीकरणों और घटिया स्पष्टीकरणों के बीच अंतर करना सीख सकते हैं, जिससे AI अधिक स्मार्ट और विश्वसनीय बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →