← नवीनतम पेपर
🤖 machine learning

Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning

यह योगदान PROSPER\texttt{PROSPER} को प्रस्तुत करता है, जो बिना स्केलिंग के मल्टी-ऑब्जेक्टिव प्रेफरेंसेस को फाइन-ट्यून करने में इंट्रान्ज़िटिव प्रेफरेंसेस (intransitive preferences) को संबोधित करने के लिए मैक्सिमम-एन्ट्रॉपी ब्लैकवेल विनर (Maximum-Entropy Blackwell Winner) की गेम-थ्योरेटिक अवधारणा पर आधारित एक प्रमाणित रूप से कुशल एल्गोरिदम है, जो मल्टी-ऑब्जेक्टिव इवैल्यूएशन फीडबैक का उपयोग करके लार्ज लैंग्वेज मॉडल्स पर बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक आदर्श कहानी लिखना सिखाने की कोशिश कर रहे हैं। आपके पास एक "जज" (एक अन्य AI) है जो रोबोट की कहानियों को पढ़ता है और फीडबैक देता है। सामान्यतः, हम जज से एक एकल स्कोर देने के लिए कहते हैं, जैसे कि "10 में से 8"।
लेकिन, यहाँ एक समस्या है: जज अक्सर भ्रमित हो जाता है। वह कह सकता है कि कहानी A, कहानी B से बेहतर है, और कहानी B, कहानी C से बेहतर है, लेकिन फिर अजीब तरह से कहता है कि कहानी C, कहानी A से बेहतर है।

इसे इंट्राट्रांसिटिविटी (या एक चक्र/cycle) कहा जाता है। यह रॉक, पेपर, सिज़र्स के खेल जैसा है: रॉक, सिज़र्स को हराता है, सिज़र्स, पेपर को हराता है, लेकिन पेपर, रॉक को हराता है। यहाँ कोई एक एकल "सर्वश्रेष्ठ" चाल नहीं है। जब ऐसा होता है, तो रोबोट भ्रमित हो जाता है क्योंकि उसे नहीं पता कि किस दिशा में सीखना है।

यह लेख एक नई विधि पेश करता है जिससे रोबोट को तब भी सीखना सिखाया जा सके जब जज असंगत हो और नियम जटिल हों।

समस्या: भ्रमित जज और "स्केलर" का जाल

सामान्यतः, एक जज जिसे एक कहानी के कई पहलुओं (जैसे: क्या यह मज़ेदार है? क्या यह सुरक्षित है? क्या यह तथ्यों पर आधारित है?) का मूल्यांकन करना होता है, वह इन सभी मूल्यांकनों को एक एकल संख्या में संकुचित करने की कोशिश करता है। लेखक इसे स्केलेराइजेशन (Scalarization) कहते हैं।

  • उपमा: कल्पना कीजिए कि आप एक छात्र का मूल्यांकन कर रहे हैं। आपको गणित, कला और दौड़ने में उसका ग्रेड देना है। यदि आप बस इन सबको एक एकल "कुल स्कोर" में जोड़ देते हैं, तो आप इस बात को नज़रअंदाज़ कर सकते हैं कि छात्र गणित में जीनियस है लेकिन कला में बहुत खराब है। जब जज इन सबको एक संख्या में मिलाने की कोशिश करता है, तो ये भ्रमित करने वाले चक्र (A > B > C > A) अक्सर उत्पन्न होते हैं क्योंकि वह एक वर्गाकार चीज़ को गोल छेद में फिट करने की कोशिश कर रहा होता है।

समाधान: "मैक्सिमम एंट्रॉपी ब्लैकवेल विनर"

लेखक एक नई विधि प्रस्तावित करते हैं जिससे सबसे अच्छे रोबोट स्ट्रैटेजी (रणनीति) को खोजा जा सके, जिसे वे मैक्सिमम एंट्रॉपी ब्लैकवेल विनर (आइए इसे "सुपर-एडेप्टिव रोबोट" कहें) कहते हैं।

यह पूछने के बजाय कि: "कौन सी कहानी वास्तव में सबसे अच्छी है?" (जो शायद मौजूद भी न हो), वे पूछते हैं: "कौन सी रोबोट रणनीति सबसे कठिन है जिसे हराना, चाहे आज जज किसी भी विशिष्ट नियम पर ध्यान केंद्रित करे?"

  • उपमा: एक शतरंज खिलाड़ी की कल्पना करें जो किसी विशिष्ट ओपनिंग मूव में सर्वश्रेष्ठ होने की कोशिश नहीं करता है। इसके बजाय, वह इस तरह से खेलता है कि वह कभी बुरी तरह हार न जाए, चाहे प्रतिद्वंद्वी बाएं, दाएं या केंद्र पर हमला करे। वह उस किसी भी कमजोरी के प्रति मजबूत (robust) है जिसका प्रतिद्वंद्वी फायदा उठा सकता है। यह "सुपर-एडेप्टिव रोबोट" वह है जो सबसे खराब स्थिति (worst-case scenario) में भी सबसे अधिक बार जीतता है।

एल्गोरिदम: PROSPER

इस "सुपर-एडेप्टिव" रोबोट को वास्तव में प्रशिक्षित करने के लिए, लेखकों ने PROSPER नामक एक एल्गोरिदम विकसित किया है।

  • पुराना तरीका: सामान्यतः, एक रोबोट को कई जजों को संभालने के लिए सिखाने हेतु, एक विशाल, अराजक खेल का अनुकरण करना पड़ता है जहाँ रोबोट एक "विलेन" के खिलाफ खेलता है जो उसे धोखा देने की कोशिश कर रहा हो। यह धीमा और गणनात्मक रूप से गहन (computationally intensive) है।
  • PROSPER का तरीका: लेखकों ने एक गणितीय ट्रिक खोजी। उन्होंने महसूस किया कि एक विलेन के साथ जटिल खेल खेलने के बजाय, वे केवल एक सरल रिग्रेशन (एक प्रकार का गणितीय समायोजन) का उपयोग करके रोबोट को सिखा सकते हैं।
  • उपमा: इसे इस तरह सोचें: आपको पंच मारने से बचने के लिए कैसे लड़ना है, यह सिखाने के लिए एक स्पैरिंग पार्टनर को आपके चेहरे पर मुक्के मारने के लिए काम पर रखने के बजाय (जो कठिन और खतरनाक है), आप बस मुक्कों का एक वीडियो देखते हैं और गणितीय रूप से पैटर्न को सीखते हैं। PROSPмER रोबोट को जटिल युद्ध का अनुकरण किए बिना सीधे जज के फीडबैक से सीखने की अनुमति देता है। यह एक मल्टीप्लेयर गेम को एक साधारण होमवर्क असाइनमेंट में बदल देता है।

उन्होंने क्या किया और क्या पाया

टीम ने परीक्षण किया कि LLMs (लार्ज लैंग्वेज मॉडल्स) पर एक डेटासेट का उपयोग करके जहाँ जज चेकलिस्ट (रूब्रिक्स) के आधार पर उत्तरों का मूल्यांकन करता है।

  1. रियलिटी चेक: उन्होंने पुष्टि की कि एक AI जज, जब कई अलग-अलग मानदंडों (जैसे सुरक्षा, शैली और तथ्य) को अलग-अलग जांचने के लिए कहा जाता है, तो वह अभी भी भ्रमित हो जाता है और चक्र (cycles) बनाता है। मानदंडों को अलग करने से थोड़ा मदद मिलती है लेकिन यह समस्या को पूरी तरह से हल नहीं करता है।
  2. परिणाम: जब उन्होंने रोबोट को प्रशिक्षित करने के लिए PROSPER का उपयोग किया, तो रोबोट निर्देशों का पालन करने और स्वाभाविक रूप से बातचीत करने में पुराने तरीकों से प्रशिक्षित रोबोटों की तुलना में बहुत बेहतर हो गया।
  3. प्रमाण: उन्होंने प्रशिक्षित रोबोट (3 बिलियन और 7 बिलियन पैरामीटर्स के साथ) जारी किए और दिखाया कि वे निर्देशों का पालन करने और सामान्य बातचीत के मानक परीक्षणों पर सभी अन्य तरीकों से बेहतर प्रदर्शन करते हैं।

सारांश

संक्षेप में: जब AI जज असंगत होते हैं और इस बारे में भ्रमित होते हैं कि एक "अच्छा" उत्तर क्या है, तो मानक प्रशिक्षण विधियाँ विफल हो जाती हैं। यह लेख कहता है: "एक पूर्ण उत्तर खोजने की कोशिश न करें। इसके बजाय, ऐसी रणनीति खोजें जो जज की किसी भी भ्रमित करने वाली प्राथमिकताओं को संभालने के लिए पर्याप्त मजबूत (robust) हो।" उन्होंने PROSPER नामक एक उपकरण विकसित किया है जो एक जटिल गेम-थ्योरेटिक समस्या को एक सरल गणितीय समस्या में बदलकर इसे कुशलतापूर्वक पूरा करता है, जिससे अधिक स्मार्ट और विश्वसनीय AI मॉडल मिलते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →