← नवीनतम पेपर
💻 computer science

Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning

यह शोध पत्र HitEmotion को प्रस्तुत करता है, जो एक Theory-of-Mind-आधारित बेंचमार्क और एक संगत ढांचा है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की गहरी भावनात्मक समझ और तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाने के लिए ToM-निर्देशित रीजनिंग चेन्स को TMPO सुदृढीकरण लर्निंग (reinforcement learning) के साथ जोड़ता है।

मूल लेखक: Meng Luo, Bobo Li, Shanqing Xu, Shize Zhang, Qiuchan Chen, Menglu Han, Wenhao Chen, Yanxiang Huang, Hao Fei, Mong-Li Lee, Wynne Hsu

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Meng Luo, Bobo Li, Shanqing Xu, Shize Zhang, Qiuchan Chen, Menglu Han, Wenhao Chen, Yanxiang Huang, Hao Fei, Mong-Li Lee, Wynne Hsu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानवीय भावनाओं को समझना सिखा रहे हैं। वर्तमान में, अधिकांश रोबोट एक उत्कृष्ट लाइब्रेरियन की तरह हैं: वे तेज़ी से एक किताब को स्कैन कर सकते हैं, "दुख" शब्द ढूंढ सकते हैं और आपको बता सकते हैं, "यह पन्ना उदास है।" लेकिन वे वास्तव में यह नहीं समझते कि पात्र क्यों दुखी है, वह क्या सोच रहा है, या क्या वह किसी को धोखा देने के लिए दुख का नाटक कर रहा है। वे सतह को देखते हैं, लेकिन उसके नीचे छिपी कहानी को नहीं देख पाते।

यह शोध पत्र, जिसका शीर्षक "अनवीलिंग द कॉग्निटिव कंपास" (Unveiling the Cognitive Compass) है, यह तर्क देता है कि रोबोट को वास्तव में भावनात्मक रूप से बुद्धिमान बनाने के लिए, हमें उन्हें थ्योरी ऑफ माइंड (ToM) सिखाने की आवश्यकता है।

यहाँ एक सरल विवरण दिया गया है कि लेखकों ने क्या किया है, जिसमें रोजमर्रा के उपमाओं का उपयोग किया गया है:

1. समस्या: रोबोट "भावनात्मक रूप से अंधा" है

अभी, यहाँ तक कि सबसे स्मार्ट AI मॉडल भी नक्शे वाले पर्यटक की तरह हैं जिनके पास दिशा सूचक यंत्र (कम्पास) नहीं है। वे किसी स्थान की ओर इशारा तो कर सकते हैं (जैसे, "वह व्यक्ति रो रहा है"), लेकिन जब उनसे पूछा जाए, "वह क्यों रो रहा है? क्या वह इसलिए रो रहा है क्योंकि वह दुखी है, या इसलिए क्योंकि उसने अभी एक प्याज काटा है? क्या उसके बगल वाला व्यक्ति इस बात से खुश है?" तो वे रास्ता भटक जाते हैं।

लेखकों ने पाया कि वर्तमान AI अक्सर कहानियाँ गढ़ता है (हैलुसिनेशन/भ्रम) या उथले उत्तर देता है क्योंकि इसे यह सिम्युलेट करने के लिए प्रशिक्षित नहीं किया गया है कि दूसरे लोग क्या सोच रहे हैं

2. समाधान: "कॉग्निटिव कंपास" (HitEmotion)

इसे ठीक करने के लिए, टीम ने एक नया परीक्षण मैदान बनाया जिसे HitEmotion कहा जाता है। इसे तीन कठिनाई स्तरों वाला एक वीडियो गेम समझें, जिसे यह परीक्षण करने के लिए डिज़ाइन किया गया है कि एक रोबोट के "भावनात्मक मस्तिष्क" की गहराई कितनी है:

  • स्तर 1: आँखें (अनुभूति/Perception): क्या रोबोट एक उदास चेहरे को देखकर कह सकता है "दुखी"? (आसान। एक सुरक्षा कैमरे की तरह।)
  • स्तर 2: संदर्भ (समझ/Context): क्या रोबोट एक उदास चेहरे को देखकर यह समझ सकता है कि, "ओह, यह व्यक्ति इसलिए उदास है क्योंकि उसके दोस्त ने अभी एक बुरा चुटकुला सुनाया है, लेकिन वह अंदर से वास्तव में हंस रहा है"? (मध्यम। इसके लिए माहौल को समझने की आवश्यकता है।)
  • स्तर 3: मन (तर्क/Reasoning): क्या रोबोट यह पता लगा सकता है कि, "यह व्यक्ति एक बुली (धौंस जमाने वाले) को डराने के लिए गुस्से का नाटक कर रहा है, लेकिन वास्तव में वह डरा हुआ है"? (कठिन। इसके लिए छिपे हुए विचारों, झूठ और जटिल सामाजिक खेलों को समझने की आवश्यकता है।)

परिणाम: जब उन्होंने इस "गेम" पर शीर्ष-स्तरीय AI मॉडल का परीक्षण किया, तो उनमें से अधिकांश स्तर 3 पर विफल हो गए। वे उदासी को पहचानने में तो बहुत अच्छे थे, लेकिन उसके पीछे की कहानी को समझने में बहुत खराब थे।

3. प्रशिक्षण विधि: "मेंटल रिहर्सल" (TMPO)

एक बार जब उन्हें समस्या मिल गई, तो उन्होंने केवल रोबोट को अधिक डेटा नहीं दिया; उन्होंने सोचने के उनके तरीके को बदल दिया। उन्होंने TMPO नामक एक विधि पेश की।

कल्पित कीजिए कि आप एक बच्चे को शतरंज खेलना सिखा रहे हैं।

  • पुराना तरीका: आप बस उन्हें बोर्ड दिखाते हैं और कहते हैं, "एक चाल चलो।" वे अनुमान लगाते हैं।
  • नया तरीका (TMO): आप उन्हें ज़ोर से कहने के लिए मजबूर करते हैं, "मैं सोच रहा हूँ कि मेरा प्रतिद्वंद्वी मेरे राजा को फँसाने की कोशिश कर रहा है, इसलिए मैं अपने प्यादे को यहाँ रखकर उन्हें रोकने के लिए चलूँगा।"

लेखकों ने AI को भी ऐसा ही करने के लिए प्रेरित किया। उन्होंने AI को उत्तर देने से पहले अपना आंतरिक एकालाप (Internal Monologue) (उसकी "विचार प्रक्रिया") लिखने के लिए मजबूर किया।

  • उन्होंने इसे मानसिक अवस्थाओं (Mental States) को ट्रैक करना सिखाया: "व्यक्ति A क्या मानता है? व्यक्ति B का इरादा क्या है?"
  • उन्होंने एक विशेष पुरस्कार प्रणाली (एक वीडियो गेम स्कोर की तरह) का उपयोग किया जो न केवल सही उत्तर के लिए, बल्कि बीच में एक तार्किक, सुसंगत कहानी होने के लिए भी अंक देता था।

4. परिणाम: "तथ्य खोजने वाले" से "सहानुभूति रखने वाले" तक

इस प्रशिक्षण के बाद, AI केवल अनुमान लगाने में बेहतर नहीं हुआ; यह अधिक विश्वसनीय और सुसंगत हो गया।

  • पहले: AI कह सकता था, "व्यक्ति क्रोधित है," क्योंकि वह चिल्ला रहा है।
  • बाद में (TMPO के साथ): AI कहता है, "व्यक्ति चिल्ला रहा है, लेकिन उसका शारीरिक हाव-भाव सहज है, और वह एक दोस्त को देखकर मुस्कुरा रहा है। इसलिए, वह संभवतः मजाकिया है, न कि क्रोधित।"

प्रशिक्षित मॉडल (TMPO) ने सबसे महंगे, क्लोज्ड-सोर्स मॉडलों (जैसे GPT या Gemini के नवीनतम संस्करणों) को भी कठिन कार्यों पर हरा दिया। इसने सिद्ध किया कि यदि आप एक रोबोट को केवल "भावनात्मक तथ्यों" को याद करने के बजाय मानवीय विचारों का अनुकरण (Simulate) करना सिखाते हैं, तो वह बहुत अधिक स्मार्ट हो जाता है।

व्यापक परिदृश्य (The Big Picture)

यह शोध पत्र वास्तविक सहानुभूति रखने वाले AI के निर्माण के लिए एक रोडमैप है।

  • द बेंचमार्क (HitEmotion) वह पैमाना है जिसका उपयोग हम यह मापने के लिए करते हैं कि एक रोबोट केवल "दिखावा" कर रहा है या वास्तव में उसे "समझ" रहा है।
  • द मेथड (TMPO) वह प्रशिक्षण नियमावली है जो रोबोट को दूसरे के जूतों में कदम रखना (दूसरे की स्थिति को समझना) सिखाती है।

संक्षेप में: लेखकों ने AI के मस्तिष्क के लिए एक जिम बनाया, जहाँ वह केवल "खुशी" की शब्दकोश परिभाषा रटने के बजाय, इंसान की तरह दौड़ना, कूदना और सोचना सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →