From Classification to Ranking: Enhancing LLM Reasoning Capabilities for MBTI Personality Detection
यह शोध पत्र एक नवीन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो MBTI व्यक्तित्व पहचान को वर्गीकरण के बजाय एक रैंकिंग कार्य के रूप में पुनर्गठित करता है, जिसमें मौजूदा प्रॉम्प्ट-आधारित विधियों की सीमाओं को दूर करने और अत्याधुनिक प्रदर्शन प्राप्त करने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और एक विशेष रिवॉर्ड फंक्शन के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) का उपयोग किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने किसी मित्र के सोशल मीडिया पोस्ट पढ़कर उनके व्यक्तित्व के प्रकार (जैसे कि प्रसिद्ध MBTI: अंतर्मुखी बनाम बहिर्मुखी, विचारक बनाम संवेदनशील, आदि) का अनुमान लगाने की कोशिश कर रहे हैं।
पुराना तरीका: "बहुविकल्पीय" जाल
पहले, कंप्यूटर इस समस्या को एक सख्त बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) की तरह हल करने की कोशिश करते थे। वे एक पोस्ट देखते और पूछते, "क्या यह व्यक्ति अंतर्मुखी है या बहिर्मुखी?" फिर वे पूछते, "क्या यह व्यक्ति विचारक है या संवेदनशील?" वे इन चार प्रश्नों को पूरी तरह से अलग, असंबंधित गणितीय समस्याओं के रूप में देखते थे।
समस्या क्या थी? मानव व्यक्तित्व अलग-थलग स्विचों का समूह नहीं है। यह एक जटिल रेसिपी की तरह है जहाँ सामग्रियाँ आपस में क्रिया करती हैं। यदि आप एक सामग्री (जैसे "सोचना") को बदलते हैं, तो यह अन्य सामग्रियों (जैसे "महसूस करना") के स्वाद को भी बदल देता है। पुराना "बहुविकल्पीय" तरीका इन सूक्ष्म संबंधों को नहीं देख पाया, जिससे भ्रमित और गलत अनुमान लगे। साथ भी, ये सिस्टम इस बात पर बहुत अधिक निर्भर थे कि मनुष्य बहुत विशिष्ट निर्देश (प्रॉम्प्ट्स) लिखें, जो धीमा और महंगा था।
नया तरीका: "टैलेंट शो" रैंकिंग
इस शोध पत्र के लेखकों ने, PerDet-R1, व्यक्तित्व पहचान को एक क्विज़ की तरह देखना बंद करने और इसे एक टैलेंट शो की तरह मानने का निर्णय लिया।
यह पूछने के बजाय कि, "क्या यह व्यक्ति INTJ है?", वे AI से कहते हैं: "यहाँ सभी 16 संभावित व्यक्तित्व प्रकार दिए गए हैं। कृपया इन पोस्टों के आधार पर उन्हें 'सबसे संभावित' से 'सबसे कम संभावित' के क्रम में रैंक करें।"
यह बदलाव सब कुछ बदल देता है। यह AI को व्यक्तित्वों की आपस में तुलना करने के लिए मजबूर करता है, यह समझने के लिए कि एक "INTJ" केवल "अंतर्मुखी + सहज" नहीं है, बल्कि एक विशिष्ट संयोजन है जो एक "ENTJ" से अलग महसूस होता है।
उन्होंने AI को कैसे सिखाया (दो-चरणीय प्रशिक्षण)
इसे सफल बनाने के लिए, उन्होंने दो चरणों वाली प्रशिक्षण प्रक्रिया का उपयोग किया, जो एक नए कौशल को सीखने वाले छात्र के समान है:
चरण 1: "शैडोइंग" का पाठ (सुपरवाइज्ड फाइन-ट्यूनिंग)
कल्पना कीजिए कि एक मास्टर शेफ (एक बहुत ही स्मार्ट AI जिसे Qwen-plus कहा जाता है) एक जूनियर शेफ (वह मॉडल जिसे वे प्रशिक्षित कर रहे हैं) को सिखा रहा है। मास्टर शेफ एक सोशल मीडिया पोस्ट देखता है और एक विस्तृत "विचार प्रक्रिया" लिखता है कि क्यों एक निश्चित व्यक्तित्व प्रकार सबसे उपयुक्त है, फिर शीर्ष 3 अनुमानों को क्रम में सूचीबद्ध करता है।
जूनियर शेफ इसे देखता है, तर्क को सीखता है, और इसी तरह की सूचियाँ लिखने का अभ्यास करता है। यह AI को एक ठोस आधार देता है और उसे अनुमान लगाने से पहले "सोचना" सिखाता है।चरण 2: "कोच की सीटी" (रीइन्फोर्समेंट लर्निंग)
अब जूनियर शेफ अपने दम पर खाना बनाना शुरू करता है। हर बार जब वह व्यक्तित्व प्रकारों की एक सूची बनाता है, तो एक "कोच" (एक विशेष स्कोरिंग प्रणाली) उसके काम की जाँच करता है।
- पुराना कोच: केवल "सही" या "गलत" कहता था।
- नया कोच (GRPO): एक परिष्कृत स्कोरिंग प्रणाली का उपयोग करता है जिसे NDCG कहा जाता है। यह कोच केवल इस बात की परवाह नहीं करता कि सही उत्तर सूची में है या नहीं; उसे इस बात की परवाह है कि वह कहाँ है।
- यदि सही व्यक्तित्व नंबर #1 पर है, तो शेफ को भारी बोनस मिलता है।
- यदि वह नंबर #3 पर है, तो शेफ को छोटा बोनस मिलता है।
- यदि वह शीर्ष 3 में नहीं है, तो उसे शून्य मिलता है।
- ट्विस्ट: कोच यह भी जाँचता है कि क्या पहला अनुमान सच्चाई के "करीब" है, भले ही वह सटीक न हो। यह AI को केवल रैंडम अनुमान लगाकर नकल करने से रोकता है।
यह क्यों महत्वपूर्ण है
कार्य को एक वर्गीकरण खेल के बजाय एक रैंकिंग गेम में बदलकर, AI ने व्यक्तित्व के सूक्ष्म "स्वादों" को समझना सीख लिया। इसने व्यक्तित्व को चार अलग-अलग बक्सों के रूप में देखना बंद कर दिया और इसे एक एकल, जटिल प्रोफाइल के रूप में देखना शुरू कर दिया।
परिणाम
जब उन्होंने वास्तविक सोशल मीडिया डेटा (PersonalityCafe और Reddit जैसे मंचों से) पर इस नई पद्धति का परीक्षण किया, तो इसने हर उस पद्धति को पछाड़ दिया जिसे उन्होंने आज़माया था। यह सटीक व्यक्तित्व प्रकार का अनुमान लगाने में बेहतर था और अधिक महत्वपूर्ण बात यह है कि यह समान प्रकारों के बीच के सूक्ष्म अंतर को समझने में बहुत बेहतर था।
संक्षेप में
शोध पत्र कहता है: "AI को केवल एक बॉक्स चुनने के लिए कहना बंद करें। इसके बजाय, इसे एक जज बनने के लिए सिखाएं जो सभी बॉक्सों को सबसे अच्छे से सबसे खराब के क्रम में रैंक करता है। यह AI को मानव व्यक्तित्व की अव्यवस्थित, परस्पर जुड़ी वास्तविकता को पहले की तुलना में बहुत बेहतर तरीके से समझने में मदद करता है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।