← नवीनतम पेपर
🤖 machine learning

Calibrated Preference Learning: The Case of Label Ranking

यह शोध पत्र संभाव्य लेबल रैंकिंग (probabilistic label ranking) के लिए अंशांकन अवधारणाओं (calibration concepts) के एक पदानुक्रम को औपचारिक रूप से स्थापित करता है, यह प्रदर्शित करता है कि मौजूदा मॉडलों में अक्सर इस अंशांकन का अभाव होता है, और यह दर्शाता है कि अंशांकन मानक सटीकता से परे रिवॉर्ड मॉडलों (reward models) के लिए एक विशिष्ट और मूल्यवान गुणवत्ता मीट्रिक के रूप में कार्य करता है।

मूल लेखक: Santo M. A. R. Thies, Viktor Bengs, Timo Kaufmann, Sebastian J. Vollmer, Eyke Hüllermeier

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Santo M. A. R. Thies, Viktor Bengs, Timo Kaufmann, Sebastian J. Vollmer, Eyke Hüllermeier

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मौसम विज्ञानी हैं। यदि आप कहते हैं कि बारिश की 70% संभावना है और आपके उस पूर्वानुमान वाले दिनों में से ठीक 70% दिनों में बारिश होती है, तो आप कैलिब्रेटेड (calibrated) हैं। आपका आत्मविश्वास वास्तविकता से मेल खाता है। यदि यह केवल 30% समय होता है, तो आप अति-आत्मविश्वासी और अविश्वसनीय हैं।

यह शोध पत्र उसी विचार को एक विशिष्ट प्रकार की AI समस्या पर लागू करने के बारे में है जिसे लेबल रैंकिंग (Label Ranking) कहा जाता है।

समस्या: रैंकिंग बनाम अनुमान लगाना

आमतौर पर, AI मॉडल सरल विकल्पों में अच्छे होते हैं: "क्या यह बिल्ली है या कुत्ता?" या "क्या बारिश होगी?" लेकिन लेबल रैंकिंग में, AI को चीजों की एक पूरी सूची को क्रमबद्ध करना होता है।

  • उदाहरण: कल्पना कीजिए कि आपके पास पाँच फिल्में हैं। AI केवल सबसे अच्छी फिल्म नहीं चुनता; इसे पूरा क्रम भी बताना होता है: फिल्म A पहली है, फिल्म B दूसरी है, फिल्म C तीसरी है, और इसी तरह।

यह शोध पत्र तर्क देता है कि जबकि हम यह जांचने में सक्षम हैं कि क्या कोई AI एक एकल विजेता चुनने में अच्छा है, हमने अभी तक यह नहीं पता लगाया है कि क्या वह सही स्तर के आत्मविश्वास के साथ पूरी सूची की भविष्यवाणी करने में अच्छा है।

"नाइव" (Naive) गलती

इसे हल करने का एक तरीका यह है कि प्रत्येक संभावित सूची को एक अलग श्रेणी माना जाए। यदि आपके पास 5 फिल्में हैं, तो 120 संभावित क्रम (5 x 4 x 3 x 2 x 1) हैं। आप इसे 120 अलग-अलग बक्सों वाले खेल की तरह मान सकते हैं।

  • द खामी: यह समुद्र तट पर रेत के हर एक कण को गिनने की कोशिश करने जैसा है ताकि यह जांचा जा सके कि आपके पास सही मात्रा है या नहीं। यह गणनात्मक रूप से असंभव है।
  • लुप्त कड़ी: यह संरचना (structure) को भी अनदेखा करता है। यदि AI आश्वस्त है कि फिल्म A, फिल्म B से बेहतर है, तो यह मायने रखना चाहिए भले ही वह सूची के बाकी हिस्सों को गलत कर दे। "नाइव" तरीका इन छोटी, उपयोगी सुरागों को छोड़ देता है।

"कैलिब्रेशन" का एक पदानुक्रम (Hierarchy)

लेखक एक नया ढांचा प्रस्तावित करते हैं जिसमें जाँच के विभिन्न स्तर हैं, जैसे कि मानचित्र पर ज़ूम इन और ज़ूम आउट करना:

  1. फुल-रैंक कैलिब्रेशन (पूरा मानचित्र): AI प्रत्येक संभव क्रम की संभावना की भविष्यवाणी करता है। यदि वह कहता है कि क्रम X की 10% संभावना है, तो क्रम X को 10% बार होना चाहिए। यह सबसे कठिन मानक है।
  2. सब-रैंकिंग कैलिब्रेशन (ज़ूम इन): हम केवल छोटे हिस्सों पर ध्यान केंद्रित करते हैं। उदाहरण के लिए, "क्या AI इस बात पर आश्वस्त है कि फिल्म A, फिल्म B से बेहतर है?" शोध पत्र दिखाता है कि पूरे मानचित्र में अच्छा होने का मतलब यह स्वतः सिद्ध नहीं है कि आप ज़ूम किए गए छोटे हिस्सों में भी अच्छे होंगे, और न ही इसका उल्टा।
  3. टॉप-K कैलिब्रेशन (हेडलाइंस): अक्सर, हमें केवल शीर्ष 3 या शीर्ष 5 वस्तुओं की ही आवश्यकता होती है। "क्या AI आश्वस्त है कि फिल्म A शीर्ष 3 में है?" यह एक अलग प्रकार की जाँच है जो अन्य दो द्वारा स्वतः गारंटीकृत नहीं है।

बड़ी खोज: लेखकों ने गणितीय रूप से सिद्ध किया है कि ये स्वतंत्र हैं। आप एक ऐसा AI रख सकते हैं जो शीर्ष 3 फिल्मों की भविष्यवाणी करने में उत्तम है लेकिन पूरी सूची की भविष्यवाणी करने में बहुत खराब है। आप एक ऐसा AI रख सकते हैं जो पूरी सूची के लिए बेहतरीन है लेकिन विशिष्ट जोड़ों (pairs) को लेकर भ्रमित है। ये अलग-अलग कौशल हैं।

वास्तविक दुनिया के परीक्षण: "मूवी" और "पॉलिटिक्स" परीक्षा

शोधकर्ताओं ने लोकप्रिय AI मॉडलों (जैसे प्लैकेट-लूस और मैलोज़) का वास्तविक डेटा पर परीक्षण किया, जैसे कि:

  • फिल्में: 15 अलग-अलग फिल्मों को रैंक करना।
  • राजनीति: उपयोगकर्ता की प्राथमिकताओं के आधार पर 6 राजनीतिक दलों को रैंक करना।

परिणाम:

  • इनमें से अधिकांश लोकप्रिय मॉडल खराब तरीके से कैलिब्रेटेड थे। वे अक्सर अति-आत्मविश्वासी या कम आत्मविश्वासी थे।
  • एक मॉडल शीर्ष 2 फिल्मों की भविष्यवाणी करने में बहुत अच्छा हो सकता है लेकिन सूची के बाकी हिस्सों के बारे में पूरी तरह से गलत हो सकता है।
  • उन्होंने उन मॉडलों का भी परीक्षण किया जिनका उपयोग RLHF (मानवीय फीडबैक से सुदृढीकरण सीखना) में किया जाता है, जो बड़े भाषा मॉडलों (जैसे कि जिससे आप अभी बात कर रहे हैं) को सहायक और सुरक्षित बनाने के लिए उपयोग की जाने वाली तकनीक है। उन्होंने पाया कि यहाँ भी, कैलिब्रेशन केवल "सही" उत्तर देने से एक अलग गुण है। एक मॉडल सटीक हो सकता है लेकिन फिर भी उसका आत्मविश्वास "असंतुलित" हो सकता है।

यह क्यों महत्वपूर्ण है

कैलिब्रेशन को AI का ईमानदारी मीटर समझें।

  • यदि एक AI कहता है, "मुझे 99% यकीन है कि यह सबसे अच्छी फिल्म है," लेकिन यह केवल 50% बार सही होता है, तो वह आपसे झूठ बोल रहा है (या कहें कि वह भ्रमित है)।
  • यदि एक AI कहता है, "मुझे केवल 50% यकीन है," लेकिन वह 99% बार सही होता है, तो वह बहुत विनम्र बन रहा है।

शोध पत्र निष्कर्ष निकालता है कि हमें रैंकिंग कार्यों के लिए विशेष रूप से इस "ईमानदारी" को मापने के लिए नए उपकरणों की आवश्यकता है। हम केवल पुराने उपकरणों का उपयोग नहीं कर सकते जो सरल "हाँ/नहीं" प्रश्नों के लिए डिज़ाइन किए गए हैं। इन विभिन्न स्तरों के कैलिब्रेशन (पूर्ण सूची बनाम शीर्ष आइटम बनाम जोड़े) को समझकर, हम ऐसे AI सिस्टम बना सकते हैं जो न केवल सही उत्तर देते हैं बल्कि हमें यह भी बताते हैं कि वे कितने सुनिश्चित हैं, और वह भी एक ऐसे तरीके से जो वास्तव में वास्तविकता से मेल खाता हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →