Infusing Theory of Mind into Socially Intelligent LLM Agents
यह शोध पत्र ToMA को प्रस्तुत करता है, जो संवाद लुकअहेड (dialogue lookahead) के माध्यम से स्पष्ट रूप से उपयोगी मानसिक अवस्थाओं को उत्पन्न करने के लिए प्रशिक्षित एक संवाद एजेंट है, जो यह प्रदर्शित करता है कि 'थ्योरी ऑफ माइंड' (Theory of Mind) को एकीकृत करना सामाजिक अंतःक्रियाओं में LLMs की रणनीतिक तर्क क्षमता, लक्ष्य प्राप्ति और संबंध रखरखाव को महत्वपूर्ण रूप से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक पार्टी में हैं, और आप अपने दोस्त को मनाने की कोशिश कर रहे हैं कि वह आपके साथ एक ही कंबल साझा करे क्योंकि बाहर बहुत ठंड है।
यदि आप एक मानक AI चैटबॉट हैं, तो यह केवल कह सकता है, "ठंड है। कृपया कंबल साझा करें।" यह तार्किक है, लेकिन इसमें सामाजिक समझ (social savvy) की कमी है। यह वास्तव में यह नहीं समझ पाता कि आपका दोस्त भी ठंड महसूस कर रहा है, डरा हुआ है, या शायद दोषी महसूस कर रहा है। यह केवल शब्दों को प्रोसेस करता है।
यह शोध पत्र AI को एक बेहतर वार्ताकार बनने का तरीका सिखाने का एक नया तरीका पेश करता है। वे इसे TOMA (थ्योरी ऑफ माइंड एजेंट) कहते हैं। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:
1. समस्या: "अंधा" रोबोट
अधिकांश AI एजेंट उन अभिनेताओं की तरह होते हैं जो केवल अपनी लाइनें पढ़ते हैं। वे जानते हैं कि उन्हें क्या कहना है, लेकिन वे वास्तव में यह नहीं सोचते कि दूसरा व्यक्ति क्या सोच रहा है, क्या महसूस कर रहा है, या क्या योजना बना रहा है।
- परिणाम: वे अक्सर सामाजिक कार्यों में विफल हो जाते हैं। वे बहुत अधिक ज़ोरदार, बहुत रूखे, या बस बात का सार समझने में चूक सकते हैं, जिससे बातचीत खराब हो जाती है।
2. समाधान: "मन पढ़ने वाला" प्रशिक्षण
शोधकर्ताओं ने AI को थ्योरी ऑफ माइंड (ToM) सिखाना चाहा। मानवीय शब्दों में, यह समझने की क्षमता है कि अन्य लोगों के अपने विचार, विश्वास और इच्छाएं होती हैं जो आपसे अलग होती हैं।
इसे एक शतरंज के खिलाड़ी की तरह समझें।
- एक नौसिखिया शतरंज खिलाड़ी केवल यह सोचता है, "अगर मैं यहाँ अपना प्यादा चलता हूँ, तो मैं जीत जाता हूँ।"
- एक ग्रैंडमास्टर सोचता है, "अगर मैं यहाँ अपना प्यादा चलता हूँ, तो मेरा प्रतिद्वंद्वी खतरे में महसूस करेगा, इसलिए वह अपने घोड़े से बचाव करने के लिए नाइट चलाएगा, जिससे मेरे लिए एक जाल खुलेगा।"
TOMA AI को बातचीत का ग्रैंडमास्टर बनाना सिखाता है। बोलने से पहले, यह रुकता है और खुद से पूछता है:
- मेरा दोस्त इस समय क्या सोच रहा है? (जैसे, "वह सोच रहा है कि मैं लालची हूँ।")
- वह क्या चाहता है? (जैसे, "वह भी गर्म रहना चाहता है, लेकिन वह एक अच्छा दोस्त भी बने रहना चाहता है।")
- यदि मैं X कहता हूँ, तो उसकी प्रतिक्रिया क्या होगी?
3. गुप्त मंत्र: "सिमुलेशन लैब"
आप AI को यह कैसे सिखाते हैं? आप इसे केवल यह नहीं बताते कि "अच्छे बनो।" आप एक सिमुलेशन लैब बनाते हैं।
कल्पना कीजिए कि AI रिहर्सल रूम में एक अभिनेता है।
- स्क्रिप्ट: AI को एक परिदृश्य दिया जाता है (जैसे, "ठंड में कैंपिंग कर रहे दो दोस्त")।
- रिहर्सल: केवल एक लाइन बोलने के बजाय, AI उन कई वर्ज़न को तैयार करता है जो वह बोल सकता है।
- वर्जन A: "मुझे कंबल दो!" (आक्रामक)
- वर्जन B: "मुझे ठंड लग रही है, क्या हम साझा कर सकते हैं?" (सीधा)
- वर्जन C: "मैं जानता हूँ कि तुम्हें भी ठंड लग रही है, लेकिन अगर हम साझा करते हैं, तो हम दोनों पर्याप्त गर्म रह पाएंगे ताकि सो सकें।" (रणनीतिक)
- क्रिस्टल बॉल (भविष्य देखना): प्रत्येक वर्ज़न के लिए, AI बातचीत के बाकी हिस्से का सिमुलेशन करता है। वह कल्पना करता है: "यदि मैं वर्जन C कहता हूँ, तो मेरा दोस्त समझा हुआ महसूस करेगा और साझा करने के लिए सहमत होगा। यदि मैं वर्जन A कहता हूँ, तो वह गुस्सा हो जाएगा और कंबल अपने पास ही रखेगा।"
- स्कोरकार्ड: AI परिणामों की जाँच करता है। किस वर्ज़न ने सबसे अच्छा परिणाम दिया (कंबल साझा करना और दोस्ती बनाए रखना)?
- सबक: AI इन "जीतने वाले" रिहर्सल से सीखता है। वह याद रखता है कि पहले दूसरे व्यक्ति की भावनाओं के बारे में सोचना बेहतर परिणाम की ओर ले जाता है।
4. परिणाम: रोबोट से राजनयिक तक
जब उन्होंने इस नए "मन-पढ़ने वाले" AI (TOMA) का मानक AI मॉडलों के मुकाबले परीक्षण किया:
- बेहतर लक्ष्य: यह अपने लक्ष्यों (जैसे कंबल साझा करना प्राप्त करना) को प्राप्त करने में बहुत बेहतर था।
- बेहतर संबंध: इसने केवल जीत हासिल नहीं की; इसने दूसरे व्यक्ति को इसे पसंद भी कराया। इसने अपनी बात मनवाने के लिए रिश्तों को खराब नहीं किया।
- दीर्घकालिक सोच: मानक AI अक्सर कुछ चरणों के बाद हार मान लेता है या एक ही गलती दोहराता है। TOMA एक मैराथन धावक की तरह है; यह अपनी रणनीति को समय के साथ बदलता रहता है, यह समझते हुए कि यदि वह शुरुआत में बहुत अधिक दबाव डालता है, तो उसे बाद में अपना दृष्टिकोण नरम करने की आवश्यकता है।
बड़ी तस्वीर
यह शोध पत्र दिखाता है कि AI के लिए वास्तव में "सामाजिक रूप से बुद्धिमान" होने के लिए, केवल प्रश्नों के उत्तर देने में स्मार्ट होना पर्याप्त नहीं है। इसे लोगों को समझने में स्मार्ट होना चाहिए।
AI को रुकने, यह कल्पना करने, कि दूसरा व्यक्ति क्या सोच रहा है, और अपने शब्दों के भविष्य के परिणामों का सिमुलेशन करने की शिक्षा देकर, हम ऐसे एजेंट बना रहे हैं जो केवल हमारे ऊपर बात नहीं करते, बल्कि हमारे साथ बात करते हैं। यह एक वेंडिंग मशीन और एक बरिस्ता (barista) के बीच का अंतर है, जो जानता है कि आपको सोडा पीने से पहले एक गले मिलने (hug) की ज़रूरत है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।