Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning
यह योगदान को प्रस्तुत करता है, जो बिना स्केलिंग के मल्टी-ऑब्जेक्टिव प्रेफरेंसेस को फाइन-ट्यून करने में इंट्रान्ज़िटिव प्रेफरेंसेस (intransitive preferences) को संबोधित करने के लिए मैक्सिमम-एन्ट्रॉपी ब्लैकवेल विनर (Maximum-Entropy Blackwell Winner) की गेम-थ्योरेटिक अवधारणा पर आधारित एक प्रमाणित रूप से कुशल एल्गोरिदम है, जो मल्टी-ऑब्जेक्टिव इवैल्यूएशन फीडबैक का उपयोग करके लार्ज लैंग्वेज मॉडल्स पर बेहतर प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक आदर्श कहानी लिखना सिखाने की कोशिश कर रहे हैं। आपके पास एक "जज" (एक अन्य AI) है जो रोबोट की कहानियों को पढ़ता है और फीडबैक देता है। सामान्यतः, हम जज से एक एकल स्कोर देने के लिए कहते हैं, जैसे कि "10 में से 8"।
लेकिन, यहाँ एक समस्या है: जज अक्सर भ्रमित हो जाता है। वह कह सकता है कि कहानी A, कहानी B से बेहतर है, और कहानी B, कहानी C से बेहतर है, लेकिन फिर अजीब तरह से कहता है कि कहानी C, कहानी A से बेहतर है।
इसे इंट्राट्रांसिटिविटी (या एक चक्र/cycle) कहा जाता है। यह रॉक, पेपर, सिज़र्स के खेल जैसा है: रॉक, सिज़र्स को हराता है, सिज़र्स, पेपर को हराता है, लेकिन पेपर, रॉक को हराता है। यहाँ कोई एक एकल "सर्वश्रेष्ठ" चाल नहीं है। जब ऐसा होता है, तो रोबोट भ्रमित हो जाता है क्योंकि उसे नहीं पता कि किस दिशा में सीखना है।
यह लेख एक नई विधि पेश करता है जिससे रोबोट को तब भी सीखना सिखाया जा सके जब जज असंगत हो और नियम जटिल हों।
समस्या: भ्रमित जज और "स्केलर" का जाल
सामान्यतः, एक जज जिसे एक कहानी के कई पहलुओं (जैसे: क्या यह मज़ेदार है? क्या यह सुरक्षित है? क्या यह तथ्यों पर आधारित है?) का मूल्यांकन करना होता है, वह इन सभी मूल्यांकनों को एक एकल संख्या में संकुचित करने की कोशिश करता है। लेखक इसे स्केलेराइजेशन (Scalarization) कहते हैं।
- उपमा: कल्पना कीजिए कि आप एक छात्र का मूल्यांकन कर रहे हैं। आपको गणित, कला और दौड़ने में उसका ग्रेड देना है। यदि आप बस इन सबको एक एकल "कुल स्कोर" में जोड़ देते हैं, तो आप इस बात को नज़रअंदाज़ कर सकते हैं कि छात्र गणित में जीनियस है लेकिन कला में बहुत खराब है। जब जज इन सबको एक संख्या में मिलाने की कोशिश करता है, तो ये भ्रमित करने वाले चक्र (A > B > C > A) अक्सर उत्पन्न होते हैं क्योंकि वह एक वर्गाकार चीज़ को गोल छेद में फिट करने की कोशिश कर रहा होता है।
समाधान: "मैक्सिमम एंट्रॉपी ब्लैकवेल विनर"
लेखक एक नई विधि प्रस्तावित करते हैं जिससे सबसे अच्छे रोबोट स्ट्रैटेजी (रणनीति) को खोजा जा सके, जिसे वे मैक्सिमम एंट्रॉपी ब्लैकवेल विनर (आइए इसे "सुपर-एडेप्टिव रोबोट" कहें) कहते हैं।
यह पूछने के बजाय कि: "कौन सी कहानी वास्तव में सबसे अच्छी है?" (जो शायद मौजूद भी न हो), वे पूछते हैं: "कौन सी रोबोट रणनीति सबसे कठिन है जिसे हराना, चाहे आज जज किसी भी विशिष्ट नियम पर ध्यान केंद्रित करे?"
- उपमा: एक शतरंज खिलाड़ी की कल्पना करें जो किसी विशिष्ट ओपनिंग मूव में सर्वश्रेष्ठ होने की कोशिश नहीं करता है। इसके बजाय, वह इस तरह से खेलता है कि वह कभी बुरी तरह हार न जाए, चाहे प्रतिद्वंद्वी बाएं, दाएं या केंद्र पर हमला करे। वह उस किसी भी कमजोरी के प्रति मजबूत (robust) है जिसका प्रतिद्वंद्वी फायदा उठा सकता है। यह "सुपर-एडेप्टिव रोबोट" वह है जो सबसे खराब स्थिति (worst-case scenario) में भी सबसे अधिक बार जीतता है।
एल्गोरिदम: PROSPER
इस "सुपर-एडेप्टिव" रोबोट को वास्तव में प्रशिक्षित करने के लिए, लेखकों ने PROSPER नामक एक एल्गोरिदम विकसित किया है।
- पुराना तरीका: सामान्यतः, एक रोबोट को कई जजों को संभालने के लिए सिखाने हेतु, एक विशाल, अराजक खेल का अनुकरण करना पड़ता है जहाँ रोबोट एक "विलेन" के खिलाफ खेलता है जो उसे धोखा देने की कोशिश कर रहा हो। यह धीमा और गणनात्मक रूप से गहन (computationally intensive) है।
- PROSPER का तरीका: लेखकों ने एक गणितीय ट्रिक खोजी। उन्होंने महसूस किया कि एक विलेन के साथ जटिल खेल खेलने के बजाय, वे केवल एक सरल रिग्रेशन (एक प्रकार का गणितीय समायोजन) का उपयोग करके रोबोट को सिखा सकते हैं।
- उपमा: इसे इस तरह सोचें: आपको पंच मारने से बचने के लिए कैसे लड़ना है, यह सिखाने के लिए एक स्पैरिंग पार्टनर को आपके चेहरे पर मुक्के मारने के लिए काम पर रखने के बजाय (जो कठिन और खतरनाक है), आप बस मुक्कों का एक वीडियो देखते हैं और गणितीय रूप से पैटर्न को सीखते हैं। PROSPмER रोबोट को जटिल युद्ध का अनुकरण किए बिना सीधे जज के फीडबैक से सीखने की अनुमति देता है। यह एक मल्टीप्लेयर गेम को एक साधारण होमवर्क असाइनमेंट में बदल देता है।
उन्होंने क्या किया और क्या पाया
टीम ने परीक्षण किया कि LLMs (लार्ज लैंग्वेज मॉडल्स) पर एक डेटासेट का उपयोग करके जहाँ जज चेकलिस्ट (रूब्रिक्स) के आधार पर उत्तरों का मूल्यांकन करता है।
- रियलिटी चेक: उन्होंने पुष्टि की कि एक AI जज, जब कई अलग-अलग मानदंडों (जैसे सुरक्षा, शैली और तथ्य) को अलग-अलग जांचने के लिए कहा जाता है, तो वह अभी भी भ्रमित हो जाता है और चक्र (cycles) बनाता है। मानदंडों को अलग करने से थोड़ा मदद मिलती है लेकिन यह समस्या को पूरी तरह से हल नहीं करता है।
- परिणाम: जब उन्होंने रोबोट को प्रशिक्षित करने के लिए PROSPER का उपयोग किया, तो रोबोट निर्देशों का पालन करने और स्वाभाविक रूप से बातचीत करने में पुराने तरीकों से प्रशिक्षित रोबोटों की तुलना में बहुत बेहतर हो गया।
- प्रमाण: उन्होंने प्रशिक्षित रोबोट (3 बिलियन और 7 बिलियन पैरामीटर्स के साथ) जारी किए और दिखाया कि वे निर्देशों का पालन करने और सामान्य बातचीत के मानक परीक्षणों पर सभी अन्य तरीकों से बेहतर प्रदर्शन करते हैं।
सारांश
संक्षेप में: जब AI जज असंगत होते हैं और इस बारे में भ्रमित होते हैं कि एक "अच्छा" उत्तर क्या है, तो मानक प्रशिक्षण विधियाँ विफल हो जाती हैं। यह लेख कहता है: "एक पूर्ण उत्तर खोजने की कोशिश न करें। इसके बजाय, ऐसी रणनीति खोजें जो जज की किसी भी भ्रमित करने वाली प्राथमिकताओं को संभालने के लिए पर्याप्त मजबूत (robust) हो।" उन्होंने PROSPER नामक एक उपकरण विकसित किया है जो एक जटिल गेम-थ्योरेटिक समस्या को एक सरल गणितीय समस्या में बदलकर इसे कुशलतापूर्वक पूरा करता है, जिससे अधिक स्मार्ट और विश्वसनीय AI मॉडल मिलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।