← नवीनतम पेपर
💬 NLP

From Classification to Ranking: Enhancing LLM Reasoning Capabilities for MBTI Personality Detection

यह शोध पत्र एक नवीन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो MBTI व्यक्तित्व पहचान को वर्गीकरण के बजाय एक रैंकिंग कार्य के रूप में पुनर्गठित करता है, जिसमें मौजूदा प्रॉम्प्ट-आधारित विधियों की सीमाओं को दूर करने और अत्याधुनिक प्रदर्शन प्राप्त करने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और एक विशेष रिवॉर्ड फंक्शन के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) का उपयोग किया गया है।

मूल लेखक: Yuan Cao, Feixiang Liu, Xinyue Wang, Yihan Zhu, Hui Xu, Zheng Wang, Qiang Qiu

प्रकाशित 2026-01-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yuan Cao, Feixiang Liu, Xinyue Wang, Yihan Zhu, Hui Xu, Zheng Wang, Qiang Qiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने किसी मित्र के सोशल मीडिया पोस्ट पढ़कर उनके व्यक्तित्व के प्रकार (जैसे कि प्रसिद्ध MBTI: अंतर्मुखी बनाम बहिर्मुखी, विचारक बनाम संवेदनशील, आदि) का अनुमान लगाने की कोशिश कर रहे हैं।

पुराना तरीका: "बहुविकल्पीय" जाल
पहले, कंप्यूटर इस समस्या को एक सख्त बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) की तरह हल करने की कोशिश करते थे। वे एक पोस्ट देखते और पूछते, "क्या यह व्यक्ति अंतर्मुखी है या बहिर्मुखी?" फिर वे पूछते, "क्या यह व्यक्ति विचारक है या संवेदनशील?" वे इन चार प्रश्नों को पूरी तरह से अलग, असंबंधित गणितीय समस्याओं के रूप में देखते थे।

समस्या क्या थी? मानव व्यक्तित्व अलग-थलग स्विचों का समूह नहीं है। यह एक जटिल रेसिपी की तरह है जहाँ सामग्रियाँ आपस में क्रिया करती हैं। यदि आप एक सामग्री (जैसे "सोचना") को बदलते हैं, तो यह अन्य सामग्रियों (जैसे "महसूस करना") के स्वाद को भी बदल देता है। पुराना "बहुविकल्पीय" तरीका इन सूक्ष्म संबंधों को नहीं देख पाया, जिससे भ्रमित और गलत अनुमान लगे। साथ भी, ये सिस्टम इस बात पर बहुत अधिक निर्भर थे कि मनुष्य बहुत विशिष्ट निर्देश (प्रॉम्प्ट्स) लिखें, जो धीमा और महंगा था।

नया तरीका: "टैलेंट शो" रैंकिंग
इस शोध पत्र के लेखकों ने, PerDet-R1, व्यक्तित्व पहचान को एक क्विज़ की तरह देखना बंद करने और इसे एक टैलेंट शो की तरह मानने का निर्णय लिया।

यह पूछने के बजाय कि, "क्या यह व्यक्ति INTJ है?", वे AI से कहते हैं: "यहाँ सभी 16 संभावित व्यक्तित्व प्रकार दिए गए हैं। कृपया इन पोस्टों के आधार पर उन्हें 'सबसे संभावित' से 'सबसे कम संभावित' के क्रम में रैंक करें।"

यह बदलाव सब कुछ बदल देता है। यह AI को व्यक्तित्वों की आपस में तुलना करने के लिए मजबूर करता है, यह समझने के लिए कि एक "INTJ" केवल "अंतर्मुखी + सहज" नहीं है, बल्कि एक विशिष्ट संयोजन है जो एक "ENTJ" से अलग महसूस होता है।

उन्होंने AI को कैसे सिखाया (दो-चरणीय प्रशिक्षण)
इसे सफल बनाने के लिए, उन्होंने दो चरणों वाली प्रशिक्षण प्रक्रिया का उपयोग किया, जो एक नए कौशल को सीखने वाले छात्र के समान है:

  1. चरण 1: "शैडोइंग" का पाठ (सुपरवाइज्ड फाइन-ट्यूनिंग)
    कल्पना कीजिए कि एक मास्टर शेफ (एक बहुत ही स्मार्ट AI जिसे Qwen-plus कहा जाता है) एक जूनियर शेफ (वह मॉडल जिसे वे प्रशिक्षित कर रहे हैं) को सिखा रहा है। मास्टर शेफ एक सोशल मीडिया पोस्ट देखता है और एक विस्तृत "विचार प्रक्रिया" लिखता है कि क्यों एक निश्चित व्यक्तित्व प्रकार सबसे उपयुक्त है, फिर शीर्ष 3 अनुमानों को क्रम में सूचीबद्ध करता है।
    जूनियर शेफ इसे देखता है, तर्क को सीखता है, और इसी तरह की सूचियाँ लिखने का अभ्यास करता है। यह AI को एक ठोस आधार देता है और उसे अनुमान लगाने से पहले "सोचना" सिखाता है।

  2. चरण 2: "कोच की सीटी" (रीइन्फोर्समेंट लर्निंग)
    अब जूनियर शेफ अपने दम पर खाना बनाना शुरू करता है। हर बार जब वह व्यक्तित्व प्रकारों की एक सूची बनाता है, तो एक "कोच" (एक विशेष स्कोरिंग प्रणाली) उसके काम की जाँच करता है।

  • पुराना कोच: केवल "सही" या "गलत" कहता था।
  • नया कोच (GRPO): एक परिष्कृत स्कोरिंग प्रणाली का उपयोग करता है जिसे NDCG कहा जाता है। यह कोच केवल इस बात की परवाह नहीं करता कि सही उत्तर सूची में है या नहीं; उसे इस बात की परवाह है कि वह कहाँ है।
    • यदि सही व्यक्तित्व नंबर #1 पर है, तो शेफ को भारी बोनस मिलता है।
    • यदि वह नंबर #3 पर है, तो शेफ को छोटा बोनस मिलता है।
    • यदि वह शीर्ष 3 में नहीं है, तो उसे शून्य मिलता है।
  • ट्विस्ट: कोच यह भी जाँचता है कि क्या पहला अनुमान सच्चाई के "करीब" है, भले ही वह सटीक न हो। यह AI को केवल रैंडम अनुमान लगाकर नकल करने से रोकता है।

यह क्यों महत्वपूर्ण है
कार्य को एक वर्गीकरण खेल के बजाय एक रैंकिंग गेम में बदलकर, AI ने व्यक्तित्व के सूक्ष्म "स्वादों" को समझना सीख लिया। इसने व्यक्तित्व को चार अलग-अलग बक्सों के रूप में देखना बंद कर दिया और इसे एक एकल, जटिल प्रोफाइल के रूप में देखना शुरू कर दिया।

परिणाम
जब उन्होंने वास्तविक सोशल मीडिया डेटा (PersonalityCafe और Reddit जैसे मंचों से) पर इस नई पद्धति का परीक्षण किया, तो इसने हर उस पद्धति को पछाड़ दिया जिसे उन्होंने आज़माया था। यह सटीक व्यक्तित्व प्रकार का अनुमान लगाने में बेहतर था और अधिक महत्वपूर्ण बात यह है कि यह समान प्रकारों के बीच के सूक्ष्म अंतर को समझने में बहुत बेहतर था।

संक्षेप में
शोध पत्र कहता है: "AI को केवल एक बॉक्स चुनने के लिए कहना बंद करें। इसके बजाय, इसे एक जज बनने के लिए सिखाएं जो सभी बॉक्सों को सबसे अच्छे से सबसे खराब के क्रम में रैंक करता है। यह AI को मानव व्यक्तित्व की अव्यवस्थित, परस्पर जुड़ी वास्तविकता को पहले की तुलना में बहुत बेहतर तरीके से समझने में मदद करता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →