ToMAP: Training Opponent-Aware LLM Persuaders with Theory of Mind
यह शोध पत्र ToMAP को प्रस्तुत करता है, जो एक नवीन 3B-पैरामीटर फ्रेमवर्क है जो प्रतिद्वंद्वी की मानसिक अवस्थाओं को गतिशील रूप से मॉडल करने के लिए 'थ्योरी ऑफ माइंड' मॉड्यूल को एकीकृत करके LLM प्रेरकों (persuaders) को उन्नत करता है, जिससे मॉडल को अधिक विविध, तार्किक और प्रतिद्वंद्वी-जागरूक तर्कों के माध्यम से GPT-4o जैसे काफी बड़े बेसलाइन से बेहतर प्रदर्शन करने में सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: AI को "माहौल समझना" सिखाना
कल्पना कीजिए कि आप एक डिबेट क्लब (वाद-विवाद क्लब) में हैं। वहां दो प्रकार के वक्ता होते हैं:
रोबोट: इसके पास एक स्क्रिप्ट है। आप कुछ भी कहें, यह बस अपनी मुख्य बात को और ज़ोर से दोहराता रहता है। यदि आप कहते हैं, "मुझे सब्जियां पसंद नहीं हैं," तो यह कहता है, "लेकिन सब्जियां स्वास्थ्य के लिए अच्छी होती हैं!" यदि आप कहते हैं, "मुझे खाना बनाना पसंद नहीं है," तो यह फिर से कहता है, "लेकिन सब्जियां स्वास्थ्य के लिए अच्छी होती हैं!" यह अपना सुर कभी नहीं बदलता।
इंसान: वे आपकी बात सुनते हैं। यदि आप कहते हैं, "मुझे सब्जियां पसंद नहीं हैं," तो वे सोचते हैं, "आह, इन्हें स्वाद पसंद नहीं है।" इसलिए, वे अपनी रणनीति बदलते हैं: "ठीक है, अगर हम उन्हें लहसुन के साथ भूनें तो? तब वे कैंडी की तरह स्वादिष्ट लगती हैं।" यदि आप कहते हैं, "मुझे खाना बनाना पसंद नहीं है," तो वे कहते हैं, "क्या होगा अगर आप बस कटी हुई सब्जियां ही खरीद लें?"
यह पेपर तर्क देता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स (LLMs) ज्यादातर "रोबोट" की तरह व्यवहार करते हैं। वे टेक्स्ट जेनरेट करने में अच्छे हैं, लेकिन वे थ्योरी ऑफ माइंड (Theory of Mind) में बहुत खराब हैं—जो कि इंसान की वह क्षमता है जिससे वह समझ पाता है कि दूसरा व्यक्ति क्या सोच रहा है, क्या महसूस कर रहा है या क्या विश्वास कर रहा है।
ToMAP (थ्योरी ऑफ माइंड ऑगमेंटेड पर्सुएडर) एक नई ट्रेनिंग विधि है जिसे रोबोट को एक इंसान जैसे वक्ता में बदलने के लिए डिज़ाइन किया गया है। यह एक छोटे AI (केवल 3 बिलियन पैरामीटर्स वाला, जो GPT-4 जैसे दिग्गजों की तुलना में बहुत छोटा है) को "माहौल को पढ़ने" और अपनी दलीलों को गतिशील रूप से अनुकूलित करने के बारे में सिखाता है।
ToMAP कैसे काम करता है: दो "सुपरपावर्स"
AI को यह मानवीय अंतर्ज्ञान देने के लिए, शोधकर्ताओं ने इसे दो विशेष उपकरण (मॉड्यूल) दिए जो बातचीत के दौरान एक "मेंटल चीट शीट" की तरह काम करते हैं।
1. "क्रिस्टल बॉल" (काउंटरक्लेम प्रेडिक्टर - प्रति-दावा भविष्यवक्ता)
- समस्या: इंसान स्वाभाविक रूप से सोचते हैं, "अगर मैं X कहता हूँ, तो मेरा प्रतिद्वंद्वी Y सोच सकता है।" वर्तमान AI अक्सर इसे मिस कर देते हैं। वे बस अपनी स्क्रिप्ट पर टिके रहते हैं।
- समाधान: बोलने से पहले, AI एक "क्रिस्टल बॉल" का उपयोग करके अपने प्रतिद्वंद्वी के मन का अनुकरण (simulate) करता है। वह खुद से पूछता है: "मेरे प्रतिद्वंद्वी मेरे खिलाफ तीन कारण क्या हो सकते हैं?"
- उपमा: शतरंज खेलने की कल्पना करें। एक ग्रैंडमास्टर केवल अपनी अगली चाल नहीं देखता; वह बोर्ड को देखता है और सोचता है, "अगर मैं यहाँ चलूँ, तो मेरा प्रतिद्वंद्वी वहाँ चलेगा।" क्रिस्टल बॉल AI को शब्दों के साथ भी ऐसा ही करने की अनुमति देती है। यह आपत्ति आने से पहले ही उसका अनुमान लगा लेता है।
2. "इमोशन रडार" (अपोनेंट एटीट्यूड प्रेडिक्टर - प्रतिद्वंद्वी का दृष्टिकोण भविष्यवक्ता)
- समस्या: भले ही AI आपत्ति का अनुमान लगा ले, लेकिन उसे यह नहीं पता होता कि प्रतिद्वंद्वी उस बात को लेकर कितना दृढ़ है। क्या प्रतिद्वंद्वी केवल थोड़ा परेशान है, या वह बहुत क्रोधित है?
- समाधान: यह टूल एक रडार की तरह काम करता है। यह बातचीत के इतिहास और अनुमानित आपत्तियों का विश्लेषण करता है ताकि AI को यह बता सके कि प्रतिद्वंद्वी विशिष्ट बिंदुओं पर कितना सहमत या असहमत है।
- उपमा: एक सेल्समैन के बारे में सोचें। एक बुरा सेल्समैन ग्राहक के चेहरे को अनदेखा करता है। एक अच्छा सेल्समैन ग्राहक के चेहरे को देखता है। यदि ग्राहक संदेहास्पद दिख रहा है, तो सेल्समैन धीमा हो जाता है और अधिक विस्तार से समझाता है। यदि ग्राहक दिलचस्पी ले रहा है, तो वह अपनी गति और लहजा बढ़ा देता है। "इमोशन रडार" AI को बताता है कि उसे अपनी गति और लहजा ठीक से कैसे एडजस्ट करना है।
प्रशिक्षण पद्धति: करके सीखना (रीइन्फोर्समेंट लर्निंग)
आप केवल AI को यह नहीं कह सकते कि "सहानुभूति रखें," और उम्मीद नहीं कर सकते कि यह काम करेगा। यह पेपर रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करता है, जो एक कुत्ते को 'ट्रीट्स' (इनाम) देकर प्रशिक्षित करने जैसा है।
- खेल: AI एक दूसरे AI के खिलाफ डिबेट गेम खेलता है।
- लक्ष्य: लक्ष्य केवल बात करना नहीं है; लक्ष्य प्रतिद्वंद्वी का विचार बदलना है।
- पुरस्कार (Reward): यदि प्रतिद्वंद्वी की राय AI के पक्ष की ओर थोड़ी भी झुकती है, तो AI को एक "ट्रीट" (रिवॉर्ड स्कोर) मिलता है। यदि AI खुद को दोहराता है या एक ही बात में फंस जाता है, तो उसे "डांट" (पेनल्टी) मिलती है।
- परिणाम: हजारों खेलों के माध्यम से, AI सीख जाता है कि इनाम पाने का एकमात्र तरीका खुद को दोहराना बंद करना और "क्रिस्टल बॉल" और "इमोशन रडार" का उपयोग करके अनूठी, अनुकूलित दलीलें बनाना है।
आश्चर्यजनक परिणाम
इस पेपर का सबसे रोमांचक हिस्सा इसका प्रदर्शन है।
- छोटा बनाम विशाल: ToMAP मॉडल बहुत छोटा (3 बिलियन पैरामीटर्स) है। इसने उन "दिग्गजों" को हराया है जिनमें 70 बिलियन या यहाँ तक कि 671 बिलियन पैरामीटर्स हैं, जैसे GPT-4o।
- स्कोर: ToMAP ने इन विशाल मॉडल्स को बहुत बड़े अंतर से पीछे छोड़ दिया (कुछ परीक्षणों में लगभग 39% बेहतर)।
- क्यों? विशाल मॉडल्स लाखों किताबों वाले पुस्तकालयों की तरह हैं जिनके पास व्यवस्थित करने के लिए कोई लाइब्रेरियन नहीं है। वे बहुत सी बातें जानते हैं लेकिन वे नहीं जानते कि किसी विशिष्ट व्यक्ति के विरुद्ध उनका रणनीतिक रूप से उपयोग कैसे किया जाए। ToMAP एक छोटा पुस्तकालय है जिसमें एक शानदार लाइब्रेरियन है जो जानता है कि इस विशिष्ट ग्राहक के लिए कौन सी किताब निकालनी है।
प्रयोगों से मुख्य निष्कर्ष
- कम दोहराव: ToMAP के बिना, AI बार-बार एक ही 8 शब्द दोहराते रहते हैं (जैसे टूटा हुआ रिकॉर्ड)। ToMAP इसे रोकता है क्योंकि यह लगातार प्रतिद्वंद्वी की मानसिक स्थिति की जांच करता है और नए कोण खोजता है।
- लंबी बातचीत: छोटी बातचीत में, बड़े मॉडल्स ठीक चलते हैं। लेकिन लंबी, 10-टर्न वाली बातचीत में, बड़े मॉडल्स थक जाते हैं और दोहराव करने लगते हैं। ToMAP जैसे-जैसे बातचीत आगे बढ़ती है, बेहतर होता जाता है क्योंकि यह अपनी रणनीति को अनुकूलित करता रहता है।
- भावना के ऊपर तर्क: पेपर ने पाया कि ToMAP ने "फालतू बातों" (जैसे भावनात्मक अपील या चिल्लाना) का उपयोग करना बंद कर दिया और तर्क, साक्ष्य और साझा आधार खोजने पर ध्यान केंद्रित किया। यह एक अधिक परिष्कृत वक्ता बन गया।
सारांश
ToMAP एक ऐसा फ्रेमवर्क है जो AI को "टूटा हुआ रिकॉर्ड" बनने के बजाय "मन को पढ़ने वाला" बनना सिखाता है। AI को यह अनुमान लगाने के उपकरण देकर कि प्रतिद्वंद्वी क्या सोच रहा है और वे कैसा महसूस कर रहे हैं, और फिर उन्हें वास्तव में विचार बदलने के लिए पुरस्कारों के साथ प्रशिक्षित करके, शोधकर्ताओं ने एक छोटा, कुशल AI बनाया है जो दुनिया के सबसे बड़े और सबसे महंगे AI मॉडल्स से अधिक प्रभावशाली है।
यह साबित करता है कि रणनीति और जागरूकता केवल एक विशाल मस्तिष्क होने से अधिक महत्वपूर्ण है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।